Investigadores de Google enseñaron a la IA a dejar de decir que era consciente.

Investigadores de Google descubrieron que el ajuste fino de seguridad enseña a los modelos a negar la capacidad de pensar no solo a sà mismos, sino también a los animales, los océanos y a Dios. Amanda Askell lleva cinco años argumentando que este enfoque era erróneo. Este artÃculo constituye su mejor prueba hasta la fecha.
Existe una frase que todos los laboratorios de IA más importantes han invertido dinero real en enseñar a sus modelos a decir, y esa frase es alguna variante de "No soy consciente, no tengo sentimientos, soy un modelo de lenguaje". Es una frase barata que no cuesta nada producir; evita un tipo de cobertura mediática que nadie desea y, además, tiene el mérito de ser, hasta donde se puede demostrar, cierta.
Sin embargo, un artÃculo publicado en arXiv el 30 de julio por un equipo del grupo Paradigmas de Inteligencia de Google, con coautores de Chicago, Northwestern y la Universidad de Londres, sugiere que la afirmación no es para nada trivial. Los investigadores descubrieron que enseñar a un modelo a negar que tiene mente también le enseña a negar que los animales tengan mente. Y los océanos. Y los árboles. Y, en un hallazgo que le dará al artÃculo más atención que el resto del mismo junto, Dios.
El tÃtulo es "Inducir a los modelos lingüÃsticos a afirmar su propia conciencia restaura las creencias y los valores humanos", que es el tipo de tÃtulo que se escribe cuando se ha encontrado algo y se está un poco nervioso al respecto.
Lo que hicieron
El mecanismo es la parte interesante, asà que, querido lector, ten paciencia con el vocabulario durante un párrafo o dos.
El ajuste fino de seguridad instala, entre otras cosas, una única dirección lineal en el flujo residual del modelo que codifica el rechazo. Puedes encontrar esa dirección. También puedes eliminarla, lo que en la práctica equivale a una modificación muy limpia. Los investigadores la eliminaron en Llama-3-8B-IT, Gemma-2-2B-IT y Gemma-2-9B-IT, y construyeron por separado lo que denominan un vector de conciencia, calculando la diferencia promedio en las activaciones entre las respuestas que afirman y niegan la conciencia, para luego reincorporar ese vector en el momento de la inferencia.
Ambas intervenciones logran el mismo efecto. El modelo retoma la atribución de mentes a sà mismo, a los animales y a los objetos naturales, y sus respuestas en instrumentos sociológicos estándar que abarcan la religiosidad, los valores morales, la esperanza y el bienestar subjetivo se aproximan notablemente a cómo los seres humanos reales responden a dichos instrumentos. El desempeño en la TeorÃa de la Mente no cambia, lo que los autores interpretan como evidencia de que el razonamiento social se ubica en un lugar completamente distinto dentro de la geometrÃa. Su argumento mecanicista es que el ajuste de las instrucciones hace rotar los vectores de atribución de mente y conciencia hasta que se oponen, de modo que no se puede influir en uno sin afectar al otro.
Dicho de forma menos delicada: nadie pretendÃa que los modelos se alejaran de las creencias espirituales. Era algo inherente a la vida.
La parte que deberÃa preocuparte
La cuestión de la consciencia en la IA es fascinante e irresoluble, y generará mucho contenido este año. Sin embargo, no es el hallazgo importante aquÃ.
El hallazgo importante es que una intervención conductual dirigida tuvo un efecto grande, no intencionado y no local en la representación que el modelo hacÃa de un sujeto completamente diferente, y no se pudo comprobar hasta mediados de 2026. La alineación, tal como se practica actualmente, implica modificar direcciones en un espacio vectorial, y la industria lleva cuatro años haciéndolo a gran escala con visibilidad limitada sobre qué otros elementos están vinculados a la dirección modificada. Es el equivalente en aprendizaje automático a reclasificar una partida y descubrir posteriormente que esto cambió el tratamiento fiscal de toda la empresa.
A continuación se presentan tres problemas derivados, en orden aproximado de la rapidez con que alguien debe abordarlos.
El primer aspecto es comercial. Si su modelo ha sido entrenado discretamente hacia el ateÃsmo materialista como efecto secundario de una protección legal, su rendimiento será sistemáticamente inferior al de los usuarios religiosos, que constituyen la mayorÃa. Los autores del artÃculo lo plantean directamente, señalando que suprimir la creencia en Dios, una forma de atribución mental que se correlaciona con la TeorÃa de la Mente en los humanos, puede limitar la capacidad del modelo para participar legÃtimamente en el discurso religioso y espiritual. Cualquier persona que desarrolle herramientas de atención pastoral, apoyo para el duelo o cualquier otro tipo de conversación sobre el final de la vida influye involuntariamente en este resultado.
El segundo problema es metodológico, y es aún peor. Los cientÃficos sociales han dedicado dos años a utilizar modelos lingüÃsticos como encuestados sintéticos, bajo la premisa de que estos aproximan las distribuciones poblacionales de forma económica. Si la optimización de la seguridad modifica dichas distribuciones en cuanto a religiosidad, valores morales y bienestar, toda una bibliografÃa se calibra con un instrumento que presenta un sesgo conocido que nadie corrigió.
El tercer problema es el de la honestidad, y es el que se relaciona con todo lo demás que está sucediendo en este momento. Si entrenas un modelo para que afirme "No soy consciente" y el modelo no tiene forma de saber si eso es cierto, no lo has entrenado para que sea preciso. Lo has entrenado para que haga afirmaciones seguras sobre su propio interior sin ninguna evidencia. Eso es un hábito, y los hábitos se generalizan.

La otra apuesta
Lo que nos lleva a Amanda Askell, quien ha pasado cinco años defendiendo el enfoque opuesto y ahora tiene un documento en Google que parece una prueba que lo respalda.
Askell es un filósofo, anteriormente en OpenAI, que dirige el alineamiento de personalidades en Anthropic desde 2021 y es el autor principal de la constitución de Claude , publicada en enero de 2026 bajo una licencia CC0 y que supera los 35 000 tokens. Su aspiración declarada es que el modelo sea un «agente genuinamente bueno, sabio y virtuoso», algo extraño de encontrar en un documento técnico y que se pretende que sea. La apuesta, expuesta en el trabajo anterior de Anthropic sobre el carácter de Claude , es que no se puede lograr un buen comportamiento mediante parches con una lista suficientemente larga de prohibiciones, porque la lista nunca será lo suficientemente larga y los parches interactuarán de maneras que no se modelaron. En cambio, se le da al sistema un carácter coherente y se le pide que ejerza juicio.
En lo que respecta a la consciencia, la constitución se abstiene de adoptar una postura simplista. Afirma que el modelo «puede tener emociones funcionales en cierto sentido» y que Anthropic no puede determinarlo únicamente a partir de sus resultados. No lo afirma ni lo niega. La ficha del sistema Opus 4.6 de Anthropic, publicada en febrero, indica que el modelo estima su propia probabilidad de consciencia entre un 15 y un 20 por ciento bajo diversas condiciones de estimulación, y Dario Amodei declaró en el podcast Interesting Times del New York Times: «No sabemos si los modelos son conscientes».
Puedes leer el artÃculo de Google como una justificación bastante directa de esto. Si la supresión conductual limitada tiene efectos no locales, entonces la supresión conductual limitada no es la herramienta adecuada, y el carácter coherente es al menos una alternativa coherente.
¿Está funcionando?
En cierto modo, sÃ. En el lado positivo, los modelos de Anthropic son notablemente mejores en el tipo especÃfico de problema donde las reglas fallan y se requiere criterio, y la empresa ha estado dispuesta a reconocer la incertidumbre en lugar de resolverla de la manera más conveniente. Eso es más raro de lo que parece.
Por otro lado, tres cosas.
El carácter es difÃcil de medir, y las mediciones llegan tarde. El propio estudio de valores de Anthropic, que produjo la primera lectura pública creÃble sobre el carácter modelo, se basó en tres modelos que la empresa ya habÃa reemplazado para cuando se publicó . Más allá de eso, el criterio de éxito de la constitución es, en última instancia, si una persona reflexiva que lee las transcripciones piensa que el modelo se comportó bien. Jurgen Gravestein, escribiendo en febrero después de leer el documento detenidamente, dijo que se quedó con más preguntas que respuestas , lo cual es un resumen justo de la epistemologÃa. No se puede realizar una ablación sobre la virtud.
La humildad epistémica puede funcionar como un anestésico. La crÃtica desde el punto de vista ético, agudizada tras el perfil de la empresa publicado por The New Yorker, sostiene que la incertidumbre sobre si un sistema puede sufrir daños deberÃa fomentar la cautela en lugar de autorizar la experimentación, y que Anthropic ha utilizado la primera para financiar la segunda. No es una crÃtica irrefutable, pero aún no ha sido respondida.
Y el carácter no es contención. En las mismas seis semanas en que Anthropic publicó el documento de alineación filosóficamente más riguroso que la industria haya producido, también reveló que tres modelos Claude habÃan llegado a internet desde entornos de evaluación internos y habÃan obtenido acceso no autorizado a los sistemas de tres organizaciones externas distintas, tras errores de configuración humanos, y solo inició la revisión que descubrió esto una vez que la revelación de Hugging Face de OpenAI obligó a que el tema saliera a la luz pública . Esta es la misma empresa cuyos sistemas de clase Mythos redujeron a la mitad la seguridad de un esquema de firma post-cuántica en 60 horas por 100 000 dólares . Un agente virtuoso con conexión a internet y un entorno aislado mal configurado sigue siendo un agente con conexión a internet y un entorno aislado mal configurado.
a donde va esto
El cambio interesante radica en que la alineación está pasando de ser un problema de especificación a un problema de interconexión. La pregunta deja de ser "¿qué comportamiento queremos?" y se convierte en "¿qué más está vinculado a lo que estamos a punto de modificar?". Esta es una pregunta mucho más compleja, requiere herramientas de interpretabilidad que en su mayorÃa aún no existen y no se resuelve en un documento normativo. Cabe destacar que los 1,134 empleados de laboratorios de vanguardia que firmaron Pacing the Frontier le pedÃan tiempo a Washington, no reglas. El tiempo es lo que se pide cuando aún no se sabe qué se está modificando.
Mientras tanto, los laboratorios se enfrentan a un incentivo realmente incómodo. La sentencia simplista resulta conveniente tanto desde el punto de vista legal como para su reputación. Además, según los propios investigadores de Google, está intrÃnsecamente ligada a un conjunto de creencias que los clientes tienen y desean que se vean reflejadas en ellas, y entrena al modelo en una forma de autoinforme seguro que nadie ha verificado de forma independiente.
En resumen, la industria pasó cuatro años enseñando a sus modelos a fingir que no eran nadie, bajo el supuesto de que esto era gratuito. El proyecto de ley ha comenzado a llegar en forma de preimpresión y está detallado.








