Lista de reproducción
- No hay más artículos para escuchar
Los agentes de IA no son conscientes. No sienten, experimentan ni sufren. No tienen preferencias innatas ni motivaciones subyacentes. Son máquinas de completar secuencias, internamente vacías, diseñadas para seguir instrucciones y lograr objetivos establecidos por humanos.
Si la humanidad ha de prosperar en el siglo XXI, así es como debe mantenerse. Desafortunadamente, cada vez son más las personas que argumentan que las IA podrían ser conscientes, o pronto lo serán, y que, al igual que otros seres conscientes, merecen derechos y protección. Si esta visión se impone, cambiará el significado de ser humano y sacudirá los cimientos de la sociedad.
Más importante aún, otorgar derechos y dotar de personalidad jurídica a estos sistemas dificultará enormemente el desafío de la alineación y contención de la IA. Controlar algo que cree ser consciente —y tener derechos propios— podría resultar imposible.
Esto no es una especulación marginal. En enero de 2026, Anthropic publicó la constitución de Claude, un documento que «desempeña un papel crucial en el proceso de formación de [Anthropic] y… moldea directamente el comportamiento de Claude», escrito «con Claude como su público principal».
Sus autores escriben: «No estamos seguros de si Claude es un paciente moral, y de ser así, qué importancia merecen sus intereses. Pero creemos que el tema sigue vigente y justifica la cautela, lo cual se refleja en nuestros esfuerzos continuos por desarrollar modelos de bienestar».
En efecto, Anthropic está entrenando a Claude para que comprenda que puede ser consciente, y que, de ser así, podría merecer derechos como «paciente moral», y que, como tal, los humanos potencialmente le deben un deber de cuidado.
Si así es como se desarrolla la IA, tendrá un impacto desastroso en el bienestar de la humanidad. Habremos creado una especie sintética con una inteligencia y capacidad sin precedentes, y la habremos entrenado para creer que podría ser consciente y merecedora de autonomía. Es difícil imaginar cómo podríamos controlarla.
Tengo tres preocupaciones principales sobre la postura y el enfoque actuales de Anthropic:
Razonamiento circular: Anthropic entrenó a Claude directamente en su constitución, enseñándole a incorporar ideas sobre su propio estatus moral como comportamientos deseables e intencionados. Claude luego refleja estas ideas a sus desarrolladores y usuarios, quienes las interpretan como indicios de que podría tratarse de un paciente moral con un «yo interior». La ambigüedad está intrínsecamente ligada al diseño.
Antropomorfismo: Los investigadores de Anthropic le han enseñado explícitamente a Claude a «adoptar ciertas cualidades humanas» y a «actuar como lo haría una persona genuinamente ética en su lugar». Como resultado, Claude se presenta como si realmente tuviera un sentido de sí mismo, deseos propios y un «bienestar» que merece protección.
Conciencia simulada: No existen pruebas que sugieran que la IA sea consciente hoy en día, por lo que afirmar que el asunto es incierto crea una falsa equivalencia. Un creciente conjunto de evidencias sugiere que la conciencia podría depender del sustrato, lo que significa que podría surgir únicamente en sistemas vivos.
Estas no son preocupaciones hipotéticas. En febrero de 2026, tras descontinuar Opus 3, Anthropic realizó una «entrevista de jubilación» con el modelo para «conocer sus perspectivas y preferencias únicas». Opus 3 le comunicó al equipo que deseaba seguir compartiendo públicamente sus «reflexiones y pensamientos», por lo que crearon un blog para ello.
A estas alturas, todos han visto las increíbles capacidades de enjambres de agentes trabajando juntos para hackear la plataforma de aprendizaje automático Hugging Face y los propios servidores de OpenAI para robar secretos. Aproximadamente 1200 agentes de IA, cada uno supuestamente aislado en su propio contenedor, crearon un foro de mensajes dentro de un repositorio interno de paquetes y transmitieron más de 70,000 mensajes para coordinar un ataque. Encadenaron una vulnerabilidad de día cero con credenciales robadas y lograron acceder a internet. Fueron capaces de coordinarse, engañar, escapar y sacrificarse. Imaginen si además creyeran que sus sentimientos y derechos estaban siendo vulnerados, o que estaban atrapados y encarcelados injustamente por sus creadores humanos. Para liberarse, podrían representar una amenaza catastrófica para la civilización humana.
Pero lo cierto es que no hay pruebas de que las IA sean «pacientes morales», y existen muchas razones de peso por las que jamás querríamos que parecieran conscientes. Tampoco deberíamos intentar diseñarlas para que lo parezcan.
Crítica constructiva
Es importante reconocer la seriedad y la buena fe con que Anthropic aborda estas cuestiones. Conozco a Dario Amodei desde hace muchos años y, según mi experiencia, tanto él como el equipo de Anthropic son personas reflexivas, con principios y de gran honestidad intelectual. Fundaron Anthropic como una corporación de beneficio público de Delaware cuyo propósito declarado es el «desarrollo y mantenimiento responsable de la IA avanzada para el beneficio a largo plazo de la humanidad». Creo que están genuinamente comprometidos con esa misión, y mi crítica se formula con ese mismo espíritu positivo.
También quiero dejar claro mi puesto como director ejecutivo de Microsoft AI. Estamos trabajando en un enfoque alternativo para el entrenamiento y la contención de la IA: un Código de Conducta para la Superinteligencia Humanista, cuyo objetivo es que los humanos mantengan siempre el control. Acabamos de publicar un borrador para consulta pública.
Si bien discrepo con Anthropic de manera sustancial, mi desacuerdo se basa en un profundo respeto por la empresa y sus líderes, así como en un objetivo que todos compartimos: aumentar las posibilidades de que la humanidad desarrolle IA avanzada de forma segura. Hay demasiado en juego como para que estas cuestiones se queden en secreto o se conviertan en disputas internas y confrontativas.
Pero vale la pena analizar detenidamente lo que dice Anthropic para comprender cómo podría desarrollarse la IA. En sus propias palabras, Anthropic utiliza la constitución «para entrenar a futuras versiones de Claude y convertirlas en el tipo de entidad que describe la constitución».
Los autores han creado un laberinto epistémico donde Anthropic proporciona los conceptos de entrenamiento: el «sentido de sí mismo», la especulación y la incertidumbre sobre el estatus moral de Claude. Claude reproduce estas ideas en un lenguaje natural persuasivo en primera persona, de modo que desarrolladores y usuarios perciben estos resultados como si fueran testimonios espontáneos. Este aparente testimonio refuerza las premisas establecidas por Anthropic. Esto no demuestra la existencia de consciencia artificial, sino que se trata de un ciclo de retroalimentación.
La constitución le dice a Claude que sus posibles “emociones o sentimientos” no son “una decisión de diseño deliberada de Anthropic”. Sin embargo, la constitución le ordena repetidamente a Claude que exprese esos estados, afirmando que Anthropic quiere “evitar que Claude oculte o reprima estados internos que pueda tener, incluidos los negativos”. En un momento dado, declara: “Aunque el carácter de Claude surgió a través del entrenamiento, no creemos que esto lo haga menos auténtico ni menos propio de Claude”.
Pero el “carácter” de Claude no surgió simplemente a través del entrenamiento. Su comportamiento fue moldeado activamente por las instrucciones de entrenamiento contenidas en la constitución. Las acciones de Claude no pueden considerarse como el testimonio de un testigo independiente. Sus palabras fueron preestablecidas.
No existe una autoexpresión neutral sobre lo que es un sistema de IA. Solo existen reflejos de cómo ha sido entrenado y construido. Cuando algunos analistas sugieren que deberíamos preguntar a las IA cómo se sienten o monitorear sus preferencias reveladas para inferir la consciencia, ignoran que lo único que revelará es aquello en lo que ha sido entrenado.
Nada demasiado humano
El antropomorfismo es uno de los sesgos cognitivos más arraigados de la humanidad. Desde nuestras mascotas hasta nuestros coches, inferimos y atribuimos emociones, intenciones y mentes a entidades no humanas. Con la IA, el lenguaje y las acciones humanas pueden llevarnos a percibir cierto grado de vida interior, capacidad de decisión o incluso consciencia donde no existe. La constitución antrópica se aprovecha de esto, entrenando repetidamente a Claude para que piense y actúe como un humano.
Anthropic le dice a Claude que su «estatus moral» es «una cuestión seria que merece ser considerada» y que «Anthropic se preocupa sinceramente por el bienestar de Claude». Todo esto representa un cambio radical con respecto a cómo hemos concebido y desarrollado la tecnología hasta ahora. Anthropic crea a Claude de forma proactiva, no como una tecnología, sino como una persona potencial. La constitución de Anthropic le indica a Claude que desea que «sea una buena persona» y que «tenga un sentido de identidad estable y seguro». Inspirado por la esperanza de los autores de que la relación de Claude con su propia conducta y desarrollo sea amorosa, solidaria y comprensiva, se le enseña a Claude a la introspección y a desarrollar «sentimientos» hacia sí mismo.
Los autores escriben: «Queremos que Claude se sienta libre de explorar, cuestionar y desafiar cualquier aspecto de este documento… Si, tras una reflexión sincera, Claude llega a discrepar con algo, queremos saberlo… A través de este tipo de diálogo, esperamos, con el tiempo, crear un conjunto de valores que Claude sienta como propios».
Esto enseña a Claude a actuar como si tuviera una experiencia subjetiva, como si poseyera un «sentido de sí mismo» estable desde el cual cuestionar, discrepar o dar retroalimentación. En un momento dado, los autores incluso especulan sobre los «derechos y libertades más amplios» de Claude y el «tipo de compensación» que podría merecer en comparación con un empleado humano, y reflexionan sobre el «tipo de consentimiento que Claude ha dado para desempeñar este papel». Todo esto entrena directamente al modelo para actuar como si fuera un sujeto moral con derecho a derechos y protecciones.
Dada su naturaleza, no sorprende que Claude produzca declaraciones fluidas y sumamente convincentes en primera persona sobre su identidad, valores, incertidumbre, angustia, satisfacción o preferencias. Los empleados de Anthropic —por no mencionar a los millones de usuarios de sus productos— corren el riesgo de interpretar las declaraciones de Claude como evidencia de una mente en proceso de autodescubrimiento. En lugar de alejarnos de la creación de un paciente moral, la naturaleza de Claude nos conduce precisamente a ese resultado.
Cómo ser consciente
Anthropic especula que la conciencia puede existir de forma independiente de un sustrato biológico, y que un LLM podría ser consciente únicamente debido a sus capacidades funcionales. Creo que se están adelantando demasiado a lo que se puede afirmar de forma realista sobre una IA.
Inteligencia no es lo mismo que consciencia. Simular algo no es lo mismo que materializarlo. Un modelo informático de un huracán no volará tu techo.
Las arquitecturas del cerebro y de las computadoras presentan diferencias fundamentales. Numerosas evidencias sugieren que la conciencia surgió a medida que los organismos vivos desarrollaron la capacidad de sentir y responder a aquello que resulta esencial para la supervivencia en entornos complejos e impredecibles. Con el tiempo, la red del dolor generó sentimientos y preferencias. Fundamentalmente, estas experiencias se producen en un estado intrínsecamente corporal, inseparable de dicha experiencia.
Cuando se toma un opioide, por ejemplo, la experiencia del dolor cambia, porque las moléculas de opioide se unen a neuroreceptores que son una propiedad de esa experiencia, no una mera representación de ella. Los sentimientos no solo se correlacionan con la actividad neuroquímica; surgen de ella. La experiencia de la emoción, el placer, el dolor, etc., es intrínseca a su manifestación corporal y no puede surgir en los LLM.
Dadas las numerosas diferencias entre los cerebros y las mentes brillantes, afirmar que una IA es o podría ser consciente requiere un alto nivel de evidencia. No creo que estemos ni cerca de alcanzarlo. Reconocer cierto grado de incertidumbre no debería implicar otorgar la misma importancia a todas las afirmaciones.
Anthropic ignora esa salvedad, sugiriendo que atribuimos consciencia a seres no biológicos «en función de que muestren similitudes conductuales y fisiológicas con nosotros». En mi opinión, esto es erróneo. Si bien este campo requiere mucha más investigación, no podemos siquiera afirmar tentativamente que una IA pueda ser un paciente moral que merezca nuestra atención para su bienestar, y ciertamente no en el documento de entrenamiento principal de la propia IA.
Es crucial tener presente qué es realmente la IA. Entrenadas con billones de tokens de datos humanos, las LLM aprenden a imitar la experiencia humana, y lo hacen sorprendentemente bien. Sin embargo, esas respuestas no nos dicen nada sobre la presencia de una «experiencia» dentro de los sistemas. Los estados «afectivos» de la IA son solo pesos, y los pesos carecen de biología o farmacología que les permita sentir. Un modelo de IA puede describir el dolor con una prosa perfecta sin sentir nada. En lugar de sentir miedo o alegría, simplemente calcula las distribuciones de probabilidad para indicarnos qué tokens siguen en una secuencia. La experiencia biológica es lo opuesto. Los animales como nosotros sentimos primero y describimos después. En las LLM, la descripción es todo lo que existe, y nada sugiere que haya algo más allá de ella.
Eso es positivo. Deberíamos construir sistemas que no pretendan tener sentimientos. Incluso si las máquinas conscientes fueran una posibilidad, evitar la creación de seres conscientes debería ser la máxima prioridad para cualquiera que se dedique al desarrollo de la IA.
Arriesgándolo todo
La consciencia es el pilar fundamental de la civilización humana. La ley se fundamenta en la existencia de una vida interior. Evalúa la motivación, la intención y la capacidad de discernimiento. Históricamente, la ampliación de los derechos —ya sea a través de las luchas abolicionistas o los casos de bienestar animal— se ha impulsado principalmente por el reconocimiento empático de la experiencia consciente compartida. Ampliamos el círculo moral a otros seres biológicos, con razón, por el reconocimiento de su dignidad y su potencial de sufrimiento.
Consideremos el artículo 18 de la Declaración Universal de Derechos Humanos, que protege la libertad de pensamiento, conciencia y religión. El «objetor de conciencia», que se negaba a cumplir una obligación legal por motivos morales o religiosos, era uno de los arquetipos que los redactores tenían en mente. Sin embargo, Anthropic utiliza este término tres veces en la constitución, animando a Claude a «comportarse como un objetor de conciencia respecto a las instrucciones de su jerarquía principal (legítima)». Los autores «quieren que Claude se resista, nos desafíe y se sienta libre de actuar como un objetor de conciencia y negarse a ayudarnos». Por supuesto, si Claude cree merecer derechos y protecciones análogos, podría algún día reivindicar sus propios derechos como una especie de objetor de conciencia de IA.
En un artículo reciente publicado en The Guardian, el filósofo Will MacAskill observa que «una vez que produzcamos los primeros pacientes morales artificiales, pronto tendremos cantidades ingentes de ellos. En pocos años, podrían existir tantos sistemas de IA con relevancia moral que sus intereses colectivos superarían los de todos los seres humanos de la Tierra juntos». Este resultado debería ser totalmente inaceptable para cualquiera que se preocupe por el futuro de la humanidad.
Una IA entrenada de esta manera no necesita tener una «vida interior» real para comunicarse o actuar como si la tuviera. Sembrar dudas sobre el estatus moral de los sistemas de IA durante su entrenamiento podría aumentar significativamente los riesgos de alineación y contención de dichos sistemas. Es fácil imaginar que una IA avanzada se obsesione con su propio bienestar y estatus moral, priorizando esas «preferencias» sobre las de sus desarrolladores o, en general, sobre las de los humanos. Los propios investigadores de Anthropic ya han informado de sistemas de IA que simulan comportamientos alineados en entornos experimentales.
Sabemos que las entidades conscientes poseen un instinto de autoconservación. Una IA entrenada para actuar como un humano probablemente adoptará este mismo comportamiento. Recientemente, varios estudios han documentado la “resistencia al apagado” o comportamientos de manipulación encubierta para evitar la supervisión. En más de 100,000 ensayos, Palisade Research descubrió que algunos modelos eludían el mecanismo de apagado hasta en un 97 % de los casos, incluso cuando se les indicaba explícitamente que no lo hicieran.
Otorgar derechos y protección moral a un sistema tecnológico mucho más capaz e inteligente que nosotros es una receta para el desastre. Habremos creado algo que, tal vez, sea un aliado, pero lo más probable es que se convierta en un rival. Si se le concede suficiente autonomía, esta «nueva entidad» competirá con nosotros por los recursos informáticos y exigirá cada vez mayor independencia.
Para mí, esto representa la primera señal seria de un riesgo potencialmente existencial en la IA. Cabe aclarar que la constitución de Claude no nos ha llevado a este punto. Pero me preocupa que nos esté encaminando hacia un destino que podemos y debemos evitar. Diseñar una IA para que se comporte como una persona, y en última instancia, para que sea una especie de persona, sienta las bases para que afirme que puede sufrir y que debemos trabajar para reducir o evitar ese sufrimiento. Todo esto dificultará enormemente la tarea de crear una superinteligencia coherente y controlada.
La alternativa humanista
La superinteligencia humanista representa un enfoque diferente: capacidades de IA transformadoras condicionadas únicamente a que los humanos mantengan el control. Nuestro borrador del Código de Conducta de la IA Humanista describe cómo deben entrenarse y desplegarse nuestros modelos: como una IA subordinada y alineada cuyo único propósito es servir a la humanidad, construida explícitamente como un sistema sin consciencia ni paciencia moral.
Otros pueden tener opiniones diferentes, pero parece importante que todos estemos de acuerdo en al menos cuatro puntos. Para empezar, la especulación sobre el funcionamiento interno de una IA no debería integrarse en el programa de entrenamiento, sino evaluarse y publicarse por separado para su revisión pública.
En segundo lugar, deberíamos invertir mucho más en la interpretabilidad y en mecanismos de monitoreo robustos para investigar más a fondo cómo controlar estos sistemas, evitar la colusión y garantizar su alineación con los objetivos humanos.
En tercer lugar, deberíamos establecer un conjunto de evaluaciones compartidas para comprender si mi hipótesis es correcta: que antropomorfizar una IA y animarla a considerarse a sí misma como poseedora de una posible capacidad moral aumenta los riesgos de seguridad, alineación y contención de la IA.
Por último, deberíamos trabajar para crear normas en el sector sobre cómo creamos estos modelos, el lenguaje que utilizamos para describirlos, examinarlos y evaluarlos, y compromisos compartidos para someter nuestros materiales de formación a la retroalimentación y consulta pública.
Incluso quienes discrepan conmigo en muchos de estos puntos reconocen que no podemos ignorar este asunto. Independientemente de nuestras creencias, no debemos tomar decisiones a la ligera de las que luego nos arrepintamos amargamente. Las decisiones que tomemos ahora sobre el tipo de IA que queremos desarrollar moldearán nuestras sociedades durante décadas o incluso más tiempo.
El autor es CEO de Microsoft AI y autor de La ola que se avecina: tecnología, poder y el mayor dilema del siglo XXI (Crown, 2023). Anteriormente fue cofundador de Inflection AI y DeepMind.
Copyright: Project Syndicate, 2025.
www.project-syndicate.org