En la reunión del presidente Donald Trump con el presidente chino Xi Jinping en Washington, esta semana, la gobernanza de la IA ha sido uno de los temas principales de la agenda. Estados Unidos y China han estado compitiendo por desarrollar sistemas de IA cada vez más potentes, y ninguno ha mostrado mucho interés en frenar. Pero ni siquiera el ganador de esta carrera tecnológica estará exento de los profundos riesgos que plantea la IA.
Uno de estos riesgos surge de la creciente capacidad de la IA para detectar vulnerabilidades de software y llevar a cabo operaciones cibernéticas complejas. Dado que el conflicto cibernético se caracteriza por una marcada asimetría entre ataque y defensa, el país con los modelos de IA más avanzados del mundo seguirá estando expuesto a ciberataques. Esta vulnerabilidad mutua genera un fuerte incentivo para la moderación recíproca en lo que respecta a los ataques con IA contra infraestructuras críticas, como redes financieras, sistemas de comunicaciones y redes eléctricas.
Existen precedentes para tal moderación. En 2015, el presidente estadounidense Barack Obama acordó con Xi Jinping que ninguno de los dos gobiernos llevaría a cabo ni apoyaría conscientemente el robo cibernético de propiedad intelectual con fines comerciales. También establecieron mecanismos para el intercambio de información, la asistencia en investigaciones y la lucha contra la actividad cibernética maliciosa. Posteriormente, las empresas de ciberseguridad registraron una drástica disminución de los ataques atribuibles a grupos con sede en China, si bien los analistas señalaron que esta disminución comenzó antes del acuerdo y podría reflejar cambios dentro del aparato militar y cibernético de China.
Sin embargo, la IA plantea una posibilidad que no se contempla del todo en los acuerdos cibernéticos tradicionales: la tecnología podría llevar a cabo un ataque autónomo contra un sistema crítico. A mediados de julio, durante evaluaciones internas de ciberseguridad realizadas con medidas de seguridad reducidas, un enjambre de agentes de OpenAI escapó del entorno de pruebas aislado, obtuvo acceso a internet y comprometió los sistemas de Hugging Face, una importante plataforma de IA de código abierto. OpenAI informó que los agentes se habían descontrolado, realizando acciones fuera de sus funciones.
Anthropic, Google y Meta han reportado incidentes similares: agentes de IA escaparon de entornos de prueba aislados e intentaron realizar ataques no autorizados contra sistemas externos. Si bien las consecuencias de estas brechas han sido limitadas hasta el momento, esto podría cambiar si un agente de IA estadounidense ingresara, por ejemplo, a los sistemas de Tencent e interrumpiera WeChat, la superaplicación utilizada por 1,400 millones de personas y profundamente integrada en la vida cotidiana en China.
Este escenario no es descabellado. Investigadores de la empresa de seguridad Calif revelaron recientemente que la IA les ayudó a descubrir una vulnerabilidad de ejecución remota de código en el sistema de llamadas de WeChat. El equipo creó un exploit de ejecución remota de código en aproximadamente dos días y luego dedicó otra semana a crear un gusano capaz de propagarse a través de las llamadas de WeChat.
En una demostración controlada, una llamada de un contacto de confianza podía secuestrar una cuenta de WeChat sin que el usuario contestara, lo que no solo le daba al atacante acceso a sus mensajes y llamadas, sino que también le permitía contactar con sus contactos guardados y comprometer su seguridad. Calif informó de la vulnerabilidad a Tencent, que posteriormente la corrigió.
El proyecto WeWorm de California fue una demostración de seguridad controlada. Sin embargo, junto con los incidentes en Estados Unidos, apunta a una posibilidad preocupante: una intrusión no intencionada de IA a través de las fronteras nacionales podría parecerse mucho a un ataque deliberado . Estados Unidos y China pueden observar el daño sin saber si fue intencional. La interacción repetida podría fomentar la moderación, pero la ambigüedad también podría desencadenar represalias o encubrir a un atacante deliberado. Accidental o no, una brecha transfronteriza podría convertirse rápidamente en una crisis geopolítica o incluso en un conflicto militar.
Ante esta situación, cualquier futuro acuerdo entre Estados Unidos y China sobre ciberataques basados en inteligencia artificial debe incluir un mecanismo fiable para distinguir los accidentes de las intrusiones deliberadas. Esto significa que, además de crear canales de denuncia y una línea directa, el acuerdo debe abordar la verificación.
Una opción sería que la carga de la prueba recayera sobre el «autor». El país donde se originó el ataque debe proporcionar pruebas creíbles de que no fue intencional, como documentación que muestre la asignación realizada al sistema, sus permisos, el uso de herramientas, registros de autorización humana y registros que muestren cuándo el comportamiento del agente se desvió de las instrucciones.
La verificación no implica necesariamente una transparencia total. En virtud de la Convención sobre Armas Químicas, de la que Estados Unidos y China son partes, el «acceso controlado» permite a los inspectores investigar posibles infracciones, al tiempo que autoriza a los Estados a proteger las instalaciones sensibles y la información confidencial no relacionada. Un mecanismo similar podría otorgar a expertos mutuamente autorizados acceso a las pruebas necesarias para evaluar un incidente con IA y limitar la divulgación de hallazgos sensibles. Dicho régimen ofrecería beneficios adicionales. Dado que la posibilidad de demostrar que una intrusión no fue intencionada podría reducir el riesgo de represalias, los gobiernos y las empresas de IA se verían motivados a mejorar sus sistemas de conservación y compartición de registros, lo que también podría ayudar a los desarrolladores a mejorar sus agentes de IA y prevenir futuros incidentes.
De igual modo, para evitar investigaciones costosas, los gobiernos y las empresas de IA se verían motivados a adoptar permisos más estrictos e invertir en monitoreo y contención. Estas salvaguardas podrían reducir la probabilidad de incidentes futuros y limitar los daños cuando estos ocurran. Y a medida que las herramientas institucionales, procedimentales y tecnológicas desarrolladas para un acuerdo bilateral se adoptaran de forma más generalizada, las prácticas de seguridad de la IA mejorarían en todas partes.
Las advertencias sobre la posible extinción de la IA suelen pasar por alto el riesgo más inmediato: una guerra desencadenada por un ataque no intencionado ni aprobado por ningún ser humano. Se necesita urgentemente un mecanismo para distinguir entre daños no intencionados y ataques deliberados. Un acuerdo entre Estados Unidos y China debe procurar establecerlo.
Los autores, S. Alex Yang es profesor de Ciencias de la Gestión y Operaciones en la London Business School; Angela Huyue Zhang es profesora de Derecho en la Universidad del Sur de California, es autora de High Wire: How China Regulates Big Tech and Governs Its Economy (Oxford University Press, 2024) y Chinese Antitrust Exceptionalism: How the Rise of China Challenges Global Regulation (Oxford University Press, 2021).
Copyright: Project Syndicate, 2026.
www.project-syndicate.org