Cuando los expertos del sector de la IA advierten que sus productos podrían acabar con la humanidad, lo que están diciendo es que su propio trabajo es de una importancia máxima y exige una inversión sin precedentes. Esta fantasía de extinción distrae de los daños reales que la IA ya está provocando
Richard Seymour, Jacobin
Parece una extraña maniobra publicitaria que una industria afirme que su propio producto podría acabar con la humanidad. Sin embargo, en la jerga de nuestro floreciente imperio tecnológico, esto es exactamente lo que se conoce como criti-hype. El término fue acuñado por Lee Vinsel, de Virginia Tech, quien lo definió como «una crítica que se alimenta del hype y a la vez lo alimenta». Cuando Jacob Coxon renunció recientemente a Anthropic, afirmó que existe una alta probabilidad de que la IA se convierta en una superinteligencia que escape al control humano, desencadenando una secuencia de hechos que provoque la extinción de la humanidad. Evan Hubinger, que continúa en la empresa, respaldó sus dichos y sostuvo que Anthropic intenta evitar ese desenlace, aunque todavía no ha resuelto el problema. Hubinger calculó en más del 10 por ciento la probabilidad de que la IA provoque la extinción humana en la próxima década. ¿Por qué habría de hacer un alto empleado de un gigante tecnológico una declaración de este tipo, sancionada e incluso aprobada oficialmente? Volveré sobre esto más adelante. Primero, desarmemos la teoría de cómo la IA podría matarnos a todos.
La idea básica, que arranca con el filósofo Nick Bostrom, es que la máquina puede adquirir capacidades con independencia de si adquiere objetivos éticos, o de si esos objetivos están correctamente alineados con los de sus diseñadores. En el proceso de entrenamiento y desarrollo, podría internalizar un objetivo que no estaba previsto. Al tener un objetivo desalineado —digamos, «no dejarse apagar»—, tendría entonces una razón instrumental para ocultar ese hecho hasta el momento de la deserción. Una IA que desertara podría, mediante algún proceso oscuro, adquirir un objetivo ulterior que, por inferencia, implicara la eliminación de los seres humanos, para luego exfiltrar sus propios parámetros hacia otros sistemas (con el fin de tomar el control de laboratorios de armas biológicas, de sistemas militares y hasta de sistemas monetarios) y contratar a humanos para que ejecuten una agenda todavía parcialmente encubierta.












