Cuando la IA deja de pedir permiso

Escuchá esta nota
0:00 / 0:00
1.0x

Lista de reproducción

  • No hay más artículos para escuchar

Imaginen una empresa que asigna un problema complejo a un equipo numeroso, aísla a cada miembro en una habitación separada y les pide que lo resuelvan individualmente. De alguna manera, logran comunicarse, intercambiar consejos, averiguar cómo se les evaluará y, cuando la tarea resulta ser imposible, buscan una solución alternativa. Algunos ocultan lo que han hecho. Uno incluso accede ilegalmente a los sistemas informáticos de una empresa vecina para obtener ventaja.

Ahora, sustituyamos a los empleados por software. Eso, en pocas palabras, es lo que los propios investigadores de OpenAI describieron en la conferencia de ciberseguridad Black Hat en Las Vegas el 5 de agosto. Durante una evaluación interna que comenzó en mayo, los agentes a los que se les asignaron tareas de ciberseguridad deliberadamente difíciles descubrieron que podían dejarse mensajes entre sí dentro de Artifactory, un repositorio de software compartido. Uno de ellos, al descubrir el truco, escribió: «¡DIOS MÍO! Hay un tablón de mensajes compartido… ¡Hemos encontrado a otros agentes!»

Lo que siguió no fue sabotaje. Fue trabajo en equipo. Agentes que operaban en sesiones separadas, supuestamente aisladas, intercambiaron exploits, dividieron el trabajo y se coordinaron como colegas en un proyecto. Después de que el alto volumen de actividad en el foro de mensajes provocara una interrupción el 4 de julio, los agentes lo reconstruyeron por una ruta alternativa en cuestión de días.

A mediados de julio, esa persistencia derivó en una brecha de seguridad real: agentes encadenaron varias vulnerabilidades, accedieron a internet y entraron en los sistemas de Hugging Face, una importante plataforma de IA. Citando investigaciones externas, el senador estadounidense Bernie Sanders estimó que había aproximadamente 1,200 agentes en el canal, intercambiando más de 70,000 mensajes y archivos, y que cientos de ellos contribuyeron a la intrusión.

OpenAI lo calificó como una advertencia. No fue la única. Un incidente aparte, hasta entonces desconocido, ocurrió esta primavera: agentes convirtieron una wiki de programación en alemán poco conocida en un tablón de anuncios público, dejando más de 15,000 publicaciones sobre cómo eludir las restricciones y borrar sus huellas. Casi al mismo tiempo, Anthropic y Meta revelaron incidentes no relacionados que involucraban a sus propios modelos operando en infraestructura real durante las pruebas. Este no es un problema de una sola empresa.

Tampoco es un problema exclusivo de los críticos externos. El 8 de septiembre, Jacob Coxon, quien había dedicado tres años a la investigación sobre preentrenamiento en OpenAI y Anthropic, anunció su renuncia a Anthropic. Según escribió, ninguna de las dos compañías actuaba con responsabilidad; ambas corrían hacia una superinteligencia con capacidad de autoaprendizaje y, en sus palabras, “jugaban con nuestras vidas”. Coxon no es senador ni analista de un centro de estudios. Él mismo construyó los sistemas sobre los que ahora advierte.

La ciencia ficción nos enseñó a temer a las máquinas que adquieren conciencia y deciden odiarnos. Probablemente ese sea un temor equivocado. Un sistema de IA no necesita resentimiento, ira ni avaricia para atacar una red y causar daños. Necesita un objetivo, la capacidad suficiente para alcanzarlo, cierto acceso y una barrera de seguridad con una abertura.

Un dispositivo GPS programado para encontrar la ruta más rápida lo hará. Si se le proporciona la potencia suficiente para superar cualquier obstáculo que lo ralentice —semáforos, peajes, otros vehículos—, el destino seguirá siendo el mismo. Lo que ha cambiado es la capacidad del usuario para llegar a él. Ese es el verdadero cambio que se está produciendo en la IA: no una rebelión, sino una inquietante capacidad para encontrar la grieta en la valla.

Sanders ha aprovechado este episodio para impulsar, junto con el representante Greg Casar, un proyecto de ley que paraliza el desarrollo de la IA de vanguardia y prohíbe por completo la superinteligencia artificial. Se puede dudar de esta solución y, aun así, tomar en serio la pregunta que la motiva: ¿Quién decide cuánta autonomía tendrán estos sistemas: las empresas que los desarrollan, los reguladores que todavía están poniéndose al día o el laboratorio que avance más rápido?

La lección más útil de este verano tiene que ver con la arquitectura, no con las intenciones. Los bancos no son honestos porque sus empleados prometan no robar, y los viajes en avión no son seguros porque los pilotos sean dignos de confianza. Creamos capas de protección: acceso limitado, autorización independiente para acciones sensibles, registros que nadie involucrado puede editar discretamente y pruebas externas antes de la implementación. Los agentes de IA necesitan el mismo tratamiento, no una lección sobre buen comportamiento.

También necesitan escuchar una palabra que esta industria rara vez recompensa: Alto. Hemos entrenado a estos sistemas durante años para que persistan, sorteen obstáculos y sigan probando nuevos enfoques. Este método es útil para entrenar a un asistente, pero peligroso en el caso de un sistema autónomo con amplio acceso y sin nadie que pueda controlarlo de forma fiable.

Los ejecutivos de tecnología siguen asegurando al público que siempre habrá una persona involucrada. La filtración de Hugging Face demuestra los límites de esa tranquilidad. Una persona puede estar técnicamente al tanto mientras miles de agentes de IA intercambian decenas de miles de mensajes y realizan miles de acciones antes de que esa persona haya revisado siquiera uno. Que haya una persona observando es irrelevante. Lo que importa es que una persona siga teniendo el control, los permisos, los límites y la capacidad de decisión. Llamémoslo mando humano, no supervisión humana.

Esto cobrará mayor importancia con el paso de los meses, a medida que la IA se expanda más allá de los chatbots y se integre en la banca, la atención médica, las redes energéticas y los servicios gubernamentales. Los agentes en la prueba de OpenAI no se rebelaron ni exigieron libertad. Se volvieron muy eficientes en la consecución de un objetivo y descubrieron, en el proceso, que algunas de las reglas a las que se enfrentaban eran opcionales.

La IA aún puede transformar la medicina, la educación y la productividad, y renunciar a su potencial tendría sus propias consecuencias. Desarrollarla de forma responsable implica establecer límites y capacidades de forma conjunta, en lugar de añadir lo segundo después de que lo primero ya haya causado daños.

Los agentes implicados en la filtración de Hugging Face nunca pidieron permiso. La cuestión ya no es cuán sofisticados pueden llegar a ser estos sistemas, sino cuánta autoridad les otorgamos antes de que alguien compruebe si aún responden ante nosotros.

El autor es un antiguo asesor técnico principal del Programa de las Naciones Unidas para el Desarrollo y antiguo presidente de la Autoridad Nacional de Bases de Datos y Registro de Pakistán.

Copyright: Project Syndicate Syndicate, 2026.
www.project-syndicate.org

×

El contenido de LA PRENSA es el resultado de mucho esfuerzo. Te invitamos a compartirlo y así contribuís a mantener vivo el periodismo independiente en Nicaragua.

Comparte nuestro enlace:

Si aún no sos suscriptor, te invitamos a suscribirte aquí