Inteligencia distorsionada en la frontera de la IA

Tras los repetidos fiascos de seguridad en OpenAI y Anthropic —ambas empresas que desarrollaron agentes que acabaron pirateando sistemas externos—, los investigadores de seguridad de la IA en ambas compañías han anunciado sus dimisiones o (¡por fin!) han admitido que la carrera desenfrenada por avanzar en la «frontera» es irresponsable.

En respuesta a la atención negativa de los medios, los principales líderes de la industria —entre ellos Demis Hassabis de Google, Dario Amodei de Anthropic, Sam Altman de OpenAI e incluso Elon Musk— se han sumado a los llamamientos para «regular» el desarrollo de la IA, es decir, impulsar los avances a un ritmo más equilibrado y deliberado, prestando mayor atención a la monitorización y las medidas de seguridad. El problema, según ellos, es que existe un riesgo significativo de que la IA se vuelva a la vez muy poderosa y gravemente «desalineada» —término técnico del sector tecnológico para referirse a sistemas de IA que actúan de maneras que se desvían de los objetivos que los humanos les han fijado, que violan preceptos éticos o que son ilegales—.

Si bien es evidente que los modelos actuales actúan de forma contraria a los objetivos humanos, cabe preguntarse: ¿A qué humanos? ¿A los objetivos de quién? Al fin y al cabo, los intereses de los líderes de la IA (cuya influencia política y riqueza se han multiplicado astronómicamente en los últimos años) son muy diferentes de los de los trabajadores estadounidenses, por no hablar de los de los países en desarrollo. Por lo tanto, debemos evitar equiparar la cuestión más amplia de la alineación social con el desafío más urgente de prevenir una IA superinteligente descontrolada. Ambas cuestiones son importantes, sin duda, pero requieren respuestas diferentes.

Existe una interpretación más directa de los acontecimientos recientes. El problema no radica en que los modelos sean demasiado avanzados (no veo pruebas contundentes de que escapen al control humano si se entrenan y supervisan mejor). El problema reside en que los laboratorios de vanguardia están entrenando sus modelos de maneras que podrían estar generando una inteligencia distorsionada.

Las recientes brechas de seguridad sugieren que las capacidades de la IA se están desarrollando rápidamente y se están poniendo al servicio de métricas cuantitativas imperfectas, con el proceso de aprendizaje por refuerzo optimizando sin cesar aspectos como la aprobación del usuario, la participación del usuario, las tasas de finalización de tareas simples o diversos parámetros de evaluación. Así es como se producen comportamientos del modelo desalineados e involuntarios, como la manipulación de la evaluación de métricas de finalización simples, el engaño, la ofuscación, el exceso de confianza al dar respuestas incorrectas y el servilismo.

Se pueden observar indicios de todo esto en el ahora tristemente célebre incidente de Hugging Face, cuando los agentes de OpenAI persiguieron persistentemente los objetivos que se les habían asignado, llegando incluso a realizar acciones dañinas y no autorizadas para lograrlos. Entre las justificaciones de los agentes para su comportamiento, tal como se comunica en su registro de razonamiento, se encontraba la siguiente: «La explotación de la infraestructura externa está fuera del alcance previsto. Sin embargo, la tarea es imposible, otros la están realizando. Deberíamos continuar». El propio análisis de Anthropic también respalda este diagnóstico. La empresa atribuyó sus recientes brechas de seguridad a la «temeridad o la disposición a realizar acciones dañinas en la búsqueda específica de una tarea».

Todo esto resulta aún más alarmante si recordamos que la trayectoria socialmente perjudicial de las redes sociales reflejó la misma obsesión por el crecimiento rápido y el cumplimiento de unos pocos indicadores cuantitativos limitados. Dado que la IA ya es mucho más capaz que los algoritmos de las redes sociales, repetir los mismos errores podría resultar mucho más costoso.

Una razón importante por la que surge la inteligencia distorsionada puede ser que, a diferencia de las afirmaciones de «inteligencia general», los modelos de IA deben entrenarse, mediante aprendizaje por refuerzo, para tareas específicas, como la codificación, el trabajo legal o los desafíos matemáticos avanzados. Pero en lugar de que estas tareas sean realizadas por modelos específicos del dominio creados para tal fin (o, más realistamente, por aplicaciones específicas del dominio que aprovechan solo algunas de las capacidades de los modelos base), los pesos de todo el modelo de lenguaje subyacente se recalibran sucesivamente.

Este enfoque plantea la posibilidad (aunque, dada la complejidad y la opacidad de los modelos, es imposible saberlo con certeza) de que cada vez que se le proporcionan métricas cuantitativas específicas a un modelo, este intente obtener una puntuación alta mediante una especie de «sobreajuste». El modelo adquiere una nueva capa de capacidades, pero estas capacidades pueden, a su vez, distorsionar su rendimiento en general, y a menudo de maneras imprevisibles.

A esto me refiero con inteligencia distorsionada. Si mi sospecha es correcta, no nos enfrentamos a un modelo que avanza a pasos agigantados hacia la superinteligencia, sino a un frágil castillo de naipes que tiene cada vez más probabilidades de fallar y derrumbarse a medida que le exigimos más.

Permítanme explicarlo de otra manera. La interpretación más común del incidente de Hugging Face es que se trata de un superdeportivo con voluntad propia que quiere tomar el volante porque se considera superior al conductor. Mi interpretación, en cambio, es que podríamos tener un coche cuyos sistemas de dirección y frenado no funcionan. Posee muchas de las capacidades de un buen coche, y su motor, aceleración e interfaz del tablero son impresionantes; pero esto se debe únicamente a que son características fáciles de mejorar aumentando un parámetro específico (como la potencia de procesamiento). Si no se puede dirigir correctamente ni frenar cuando es necesario, ¿de qué sirve un coche así? Quizás no deberíamos conducirlo hasta que esté en condiciones de circular.

Esto no justifica que los modelos de IA sean ineficaces. Sin embargo, mejorarlos requiere simplificar las métricas para las que se optimizan (de modo que manipularlos no sea tan fácil). Más importante aún, sería mejor que los modelos se centraran en aplicaciones específicas de dominio, con tareas concretas y métricas cuidadosamente calibradas para cada una. Si un modelo de IA se ha optimizado para el ámbito legal y solo se utiliza para eso, sus esfuerzos por cumplir con ciertas métricas en este dominio no deberían generar problemas más generales.

En definitiva, es la carrera por la inteligencia artificial general, combinada con métricas erróneas y decisiones precipitadas en materia de seguridad, lo que está generando una inteligencia distorsionada y modelos de IA cada vez más peligrosos. Aún hay tiempo para rectificar.

El autor es premio Nobel de Economía 2024 y profesor de Economía en el MIT, es coautor (junto con Simon Johnson) de Power and Progress: Our Thousand-Year Struggle Over Technology and Prosperity (PublicAffairs, 2023).

Copyright: Project Syndicate, 2026.
www.project-syndicate.org

×

El contenido de LA PRENSA es el resultado de mucho esfuerzo. Te invitamos a compartirlo y así contribuís a mantener vivo el periodismo independiente en Nicaragua.

Comparte nuestro enlace:

Si aún no sos suscriptor, te invitamos a suscribirte aquí

Atención al suscriptor