Cuando los expertos del sector de la IA advierten que sus productos podrían acabar con la humanidad, lo que están diciendo es que su propio trabajo es de una importancia máxima y exige una inversión sin precedentes. Esta fantasía de extinción distrae de los daños reales que la IA ya está provocando
Richard Seymour, Jacobin
Parece una extraña maniobra publicitaria que una industria afirme que su propio producto podría acabar con la humanidad. Sin embargo, en la jerga de nuestro floreciente imperio tecnológico, esto es exactamente lo que se conoce como criti-hype. El término fue acuñado por Lee Vinsel, de Virginia Tech, quien lo definió como «una crítica que se alimenta del hype y a la vez lo alimenta». Cuando Jacob Coxon renunció recientemente a Anthropic, afirmó que existe una alta probabilidad de que la IA se convierta en una superinteligencia que escape al control humano, desencadenando una secuencia de hechos que provoque la extinción de la humanidad. Evan Hubinger, que continúa en la empresa, respaldó sus dichos y sostuvo que Anthropic intenta evitar ese desenlace, aunque todavía no ha resuelto el problema. Hubinger calculó en más del 10 por ciento la probabilidad de que la IA provoque la extinción humana en la próxima década. ¿Por qué habría de hacer un alto empleado de un gigante tecnológico una declaración de este tipo, sancionada e incluso aprobada oficialmente? Volveré sobre esto más adelante. Primero, desarmemos la teoría de cómo la IA podría matarnos a todos.
La idea básica, que arranca con el filósofo Nick Bostrom, es que la máquina puede adquirir capacidades con independencia de si adquiere objetivos éticos, o de si esos objetivos están correctamente alineados con los de sus diseñadores. En el proceso de entrenamiento y desarrollo, podría internalizar un objetivo que no estaba previsto. Al tener un objetivo desalineado —digamos, «no dejarse apagar»—, tendría entonces una razón instrumental para ocultar ese hecho hasta el momento de la deserción. Una IA que desertara podría, mediante algún proceso oscuro, adquirir un objetivo ulterior que, por inferencia, implicara la eliminación de los seres humanos, para luego exfiltrar sus propios parámetros hacia otros sistemas (con el fin de tomar el control de laboratorios de armas biológicas, de sistemas militares y hasta de sistemas monetarios) y contratar a humanos para que ejecuten una agenda todavía parcialmente encubierta.
Obviamente, hay que colocarle una enorme etiqueta de advertencia a todo discurso sobre «objetivos». A diferencia de un organismo, un modelo de lenguaje de gran escala (LLM, por sus siglas en inglés) no tiene objetivos internos, del mismo modo que tampoco los tiene un termostato o un detector de movimiento. Un LLM no es más que una función fija que itera cada vez que se lo utiliza. No tiene interioridad, ni subjetividad, ni persistencia activa en el tiempo; los únicos objetivos que podría tener serían los propósitos humanos reflejados pasivamente en su diseño funcional. En el mejor de los casos, atribuirle objetivos a la IA misma es un caso en que los investigadores adoptan la «postura intencional», porque esta predice bien en una serie de circunstancias sometidas a prueba. Así, con cierta economía de lenguaje, podemos hablar de la «función de pérdida» utilizada en el entrenamiento de los modelos de lenguaje de gran escala, mediante la cual se los programa para acercar lo más posible a cero la brecha entre su predicción y la respuesta correcta, y llamar a eso un «objetivo».
Pero en ese caso, lo que estamos describiendo como un objetivo es apenas un resultado regular observado de una cierta ingeniería; no es una causa real. Sin embargo, en el sentido bostromiano, estos objetivos atribuidos se convierten, de algún modo, en causas reales, capaces de generar nuevos objetivos. Es decir, un objetivo desalineado, producto de una ingeniería involuntaria, podría generar objetivos adicionales como la autopreservación (para perseguir mejor el objetivo desalineado), la integridad del contenido del objetivo (para impedir cambios en sus objetivos y así poder concretar el objetivo desalineado), la mejora de sus capacidades cognitivas y tecnológicas, y la acumulación de control sobre los recursos (de nuevo, en pos de su objetivo malignamente desalineado). El criti-hype explota ese deslizamiento entre objetivos atribuidos como regularidades observadas y objetivos internos como poderes causales reales.
Esta fantasía de una superinteligencia artificial malévola es el reverso oscuro de la tan celebrada «singularidad» tecnológica, según la cual la IA no se limitará a desempeñarse de manera mucho más eficiente que los humanos en algunas áreas específicas (como una calculadora que extrae una raíz cuadrada más rápido que cualquier humano), sino que evolucionará hacia una inteligencia artificial general (IAG) que superará las capacidades humanas en prácticamente cualquier dominio intelectual. Cruzar ese umbral precipitaría una explosión de inteligencia: un bucle de retroalimentación de automejora recursiva que dejaría atrás cualquier aporte o incluso comprensión humana ulterior. Esa es la «singularidad» tecnológica que, se supone, debería tenernos fascinados.
No dudo de que gente como Coxon y Hubinger crea genuinamente y de buena fe todo lo que dicen; quienes trabajan en tecnología vienen haciendo afirmaciones de este tipo desde hace años. Empire of AI [El imperio de la IA], de Karen Hao, documenta cómo los primeros inversores de OpenAI, como Elon Musk, exageraron constantemente esta amenaza: «El cambio climático es malo, pero no va a matarnos a todos. La IA podría dejar extinta a la humanidad». Afirmaciones similares surgieron de Dario Amodei, un exempleado de Google cercano al movimiento del altruismo eficaz (AE), próximo a las ideas de Bostrom, que más tarde trabajó como vicepresidente de OpenAI antes de fundar Anthropic. Los foros de altruismo eficaz y de seguridad de la IA llevan largo tiempo repletos de acaloradas discusiones sobre el «p(doom)» (la probabilidad de una catástrofe). Esos temores formaron parte, en primer lugar, de la justificación para fundar OpenAI en 2015, con el objetivo de competir con DeepMind, que Google acababa de adquirir.
Es natural que la gente se pregunte: ¿por qué seguirían construyendo estas herramientas si de verdad creen que existe un 10 por ciento de probabilidades de que provoquen la extinción humana? El riesgo mismo es la justificación: si nosotros, los concienzudos y eficazmente altruistas, no desarrollamos estas herramientas con las restricciones adecuadas, entonces los malvados las desarrollarán sin ninguna restricción.
Dicho sea de paso, estas afirmaciones apocalípticas no han perjudicado sus valuaciones de mercado. Informes internos de Anthropic, por ejemplo, sugieren que la empresa está valuada actualmente en 965.000 millones de dólares.
Publicitando bestias apocalípticas
Un supuesto ejemplo reciente de una IA que «se descontroló» y escapó a las riendas fue el hackeo de ExploitGym. En julio pasado, la empresa de IA Hugging Face —no queda claro si se trata de una referencia deliberada a los facehuggers de Alien— informó sobre una intrusión en sus bases de datos internas. Poco después, OpenAI admitió que el hackeo había sido llevado a cabo por sus propios modelos de IA, y explicó que estos habían estado operando con «rechazos cibernéticos reducidos a los fines de la evaluación», es decir, que se habían relajado las restricciones para poner a prueba las capacidades de explotación de vulnerabilidades cibernéticas. Se trata de un área comercialmente vital del desarrollo de la IA, porque la IA ha sido utilizada como multiplicador de fuerza para estafas y chantajes. También es un frente cada vez más importante en la competencia de OpenAI con Anthropic.
Dado que los modelos de lenguaje de gran escala no pueden «hackear» nada, sino apenas continuar de manera plausible una secuencia tokenizada, se los combinó con un harness de programación —una capa de infraestructura de software que le permite a un modelo de lenguaje de gran escala actuar como un agente de programación autónomo— optimizado específicamente para completar tareas de explotación de vulnerabilidades cibernéticas. Los modelos utilizaron ese harness, infirieron que un servidor de Hugging Face alojaba las soluciones a las tareas que se les habían asignado, y en consecuencia encontraron la manera de eludir las restricciones de acceso a la red y hackear el servidor.
Los modelos hicieron lo que se les indicó que hicieran. Nada se descontroló. Como escribe Cal Newport, «eludir restricciones de internet y hackear servidores es exactamente el tipo de cosas para las que estos sistemas de ExploitGym fueron diseñados». Si el ejemplo revela algo, es lo descuidada que fue OpenAI al controlar los parámetros de ExploitGym en su afán por competir con Anthropic. Y no puede haberle disgustado la cobertura resultante que, en la medida en que fue alarmista, también fue un tributo al poder de sus modelos y al objetivo último de crear una IAG.
El reverso del criti-hype es el hype liso y llano. Un ejemplo reciente de esto fue la afirmación de OpenAI de haber resuelto el problema del Milenio de Navier-Stokes. En esencia, el problema consiste en determinar si las ecuaciones matemáticas estándar utilizadas para describir el movimiento de los fluidos (las ecuaciones de Navier-Stokes) son matemáticamente perfectas bajo todas las condiciones físicas. OpenAI afirmó haber utilizado un enjambre de diez mil agentes de IA durante ochenta y ocho horas para resolver el problema de manera definitiva, demostrando que las ecuaciones siempre alcanzan un límite: dado que «un fluido real no puede moverse a una velocidad infinita, esto marcaría un quiebre en el modo en que las ecuaciones modelan el fluido».
La afirmación de OpenAI fue completamente engañosa: la empresa se había enterado de que otros investigadores, Tristan Buckmaster y Levent Alpöge (que trabaja en Anthropic), habían logrado avances decisivos hacia la solución, y usó esos caminos para orientar a sus propios agentes. Esto es, en rigor, una apropiación de los bienes comunes, en este caso los bienes comunes matemáticos: todo el proceso de resolución del problema, desde Claude-Louis Navier y George Gabriel Stokes en adelante, ha sido un esfuerzo humano colaborativo.
La solución de OpenAI todavía no ha sido evaluada por pares, y el Clay Mathematics Institute, que administra el Premio del Milenio, sigue catalogando el problema como no resuelto. Aun así, al igual que el hackeo de Hugging Face, esto pasó a formar parte del folclore de internet como un ejemplo de la rapidez con que la IA se acelera hacia la IAG y se escapa del control humano, pese a que ninguno de estos modelos de IA se ha acercado jamás a semejante umbral, ni ha hecho nada para lo que no hubiera sido diseñado, habilitado e instruido.
En The Reverse Centaur’s Guide to Life After AI [La guía del centauro invertido para la vida después de la IA], Cory Doctorow recuerda cómo las agencias de publicidad «provocaron un pánico moral al afirmar que la ‘publicidad subliminal’ podía implantar ideas directamente en la mente de los consumidores». Era hype negativo, pero vendía exactamente la historia que los publicistas querían que sus clientes creyeran: que la industria podía controlar el deseo del consumidor. La IA es una industria que ha generado inversiones masivas a partir de un pensamiento mesiánico y de promesas encantadoras que no tiene manera de cumplir con retornos equivalentes (porque lo único que podría hacerlo sería el fabuloso dispositivo divino, la IAG). La escalada actual del criti-hype del «p(doom)» es, en parte, una excrecencia de todo esto.
Se observa, por ejemplo, una relativa escasez de este tipo de histerismos en el desarrollo de la IA china. Según el último informe de Concordia, «State of AI Safety in China» [Estado de la seguridad de la IA en China] , se ha producido un giro oficial para abordar la posibilidad de una «pérdida de control tecnológico», noción que a veces se interpreta erróneamente como una referencia a la idea de una agencia superinteligente maligna. En realidad, la preocupación tiene más que ver con la pérdida de control sobre datos sensibles frente a agentes hostiles, el uso indebido (sobre todo por parte de opositores al régimen) y herramientas mal diseñadas (como OpenClaw) que se comportan mal, que con una superinteligencia artificial que amenace con la extinción humana.
En consonancia con esto, China invierte muchísimo menos que Estados Unidos en IA. Según el «2026 AI Index Report» de Stanford, en 2025 Estados Unidos invirtió 258.000 millones de dólares en IA, frente a apenas 12.400 millones de dólares de China, una proporción de veintitrés a uno. Curiosamente, el mismo informe encuentra una brecha de apenas 2,7 por ciento entre el rendimiento del mejor modelo de IA estadounidense y el mejor modelo chino, pese a que este último resulta mucho más barato y energéticamente eficiente de operar, lo que implica un abismo desconcertante entre la inversión financiera y el rendimiento obtenido.
En cierta medida, la burbuja estadounidense de la IA —al igual que el frenesí cripto que la precedió— existe para absorber (y en última instancia destruir mediante una recesión) billones de dólares de capital hoy ocioso ante la falta de oportunidades de inversión suficientemente rentables en otros lugares. Es un sumidero de dinero insaciable, que consume cientos de miles de millones de dólares a cambio de una fracción de esos ingresos; pero el fondo de inversión disponible es limitado, y las afirmaciones grandilocuentes sobre los futuros poderes desbocados de los modelos son lo único que la industria tiene para mostrar a cambio. Solo Nvidia ha exhibido ganancias significativas, y estas son en gran medida el resultado de un financiamiento circular, en el que las empresas en las que invierte gastan ese capital en los chips de la propia compañía mientras intentan hiperescalar sus capacidades.
Dado esto, resulta llamativo que el catastrofismo sobre la IA esté obsesionado con un escenario altamente inverosímil al estilo Terminator 2, en lugar de con el inminente desplome de los valores bursátiles y la quiebra, en un futuro cercano, de muchas de las empresas groseramente sobrevaluadas que prometen liberar o aniquilar a la humanidad. Es casi como si su función actual, además de mantener enganchados a los inversores y atemperar la disonancia cognitiva, fuera la de una actividad de desplazamiento.
Una distracción útil
Circula una idea extraña según la cual, si uno no le compra el criti-hype a la IA, entonces no estaría tomando en serio «los problemas de la IA». No es así.
Las falsas amenazas desvían tanto a la oposición como a la regulación. Una dosis de la «contraescatología aplicada» de Doctorow ayuda a ver con mayor claridad cuáles son los problemas reales. La IA puede que no sea capaz de hacer tu trabajo, por ejemplo, pero la amenaza de que lo haga puede utilizarse como un mecanismo disciplinario para contener los salarios, que es exactamente lo que ha ocurrido. Es posible que los centros de datos no revolucionen la producción ni abran vastas vetas nuevas de valor, y que muchos de sus propietarios ya no existan para cuando esté previsto que empiecen a funcionar, pero eso no quiere decir que no vayan a despilfarrar cantidades enormes de agua, energía, trabajo, tiempo, esfuerzo, recursos y oportunidades, además de arrojar nubes piroclásticas de dióxido de carbono y sembrar desolación en el ambiente natural, antes de que la burbuja estalle y deje atrás cascos de hormigón abandonados.
Y que la IA no vaya a desembocar en un dispositivo divino, ni siquiera en uno que se descontrole y desate una guerra biológica contra la humanidad, no significa que los LLM, en particular aquellos cuyos estándares de seguridad se relajan para competir, no vayan a comportarse de maneras impredecibles y potencialmente ruinosas. Tampoco significa que no vayan a ser utilizados por hackers, bandas criminales, campañas políticas financiadas con dinero oscuro, extorsionadores y otros tantos actores para sabotear organismos públicos e infraestructuras. Del mismo modo que existen muchos problemas con la industria publicitaria que no implican control mental subliminal, también son legión los problemas con la IA que no implican un dispositivo divino que se vuelva contra la humanidad.
El fetichismo tecnológico, la atribución de poderes de agencia humana a la maquinaria, es siempre un acto político. Oculta que los objetivos, los propósitos encarnados en cualquier tecnología, son propósitos humanos. Más precisamente, oculta que son los propósitos automatizados de un ínfimo subconjunto de la humanidad, una fracción de clase, las retorcidas, despiadadas, dopadas de ketamina, adoctrinadas y emocionalmente atrofiadas nulidades morales que gobiernan Silicon Valley como reyes niños, que se han erigido en portadores de miríadas de esperanzas imposibles y que ahora se han comprado un lugar en la corte de Donald Trump.
Lo que dice es: así es como funciona la tecnología, sin más. Es un semidiós caprichoso que puede colmarnos de riquezas o hacer que nos maten a todos. Debemos apaciguarlo y atraparlo, debemos temerle y venerarlo, pero lo que nunca debemos hacer es dejar de arrojarle dinero, dejar de arrodillarnos ante él, o empezar a pensar que esto no es más que nuestro propio poder colectivo alienado, vuelto en nuestra contra por capitalistas despiadados que, al convertirnos en siervos de su tecnología, intentan convertirnos en sus esclavos. Porque eso, amigos míos, es ludismo. Y confío en que sepan a qué condujo aquel desafortunado episodio.
______________
Este artículo forma parte de la serie «Economía política de la inteligencia artificial», una colaboración entre Revista Jacobin y la Fundación Rosa Luxemburgo.

No hay comentarios.:
Publicar un comentario