ANUNCIO
Anúnciate con BNC

Investigadores de Google enseñaron a la IA a dejar de decir que era consciente.

Investigadores de Google enseñaron a la IA a dejar de decir que era consciente.
4 de Agosto de 2026

Investigadores de Google descubrieron que el ajuste fino de seguridad enseña a los modelos a negar la capacidad de pensar no solo a sí mismos, sino también a los animales, los océanos y a Dios. Amanda Askell lleva cinco años argumentando que este enfoque era erróneo. Este artículo constituye su mejor prueba hasta la fecha.

Existe una frase que todos los laboratorios de IA más importantes han invertido dinero real en enseñar a sus modelos a decir, y esa frase es alguna variante de "No soy consciente, no tengo sentimientos, soy un modelo de lenguaje". Es una frase barata que no cuesta nada producir; evita un tipo de cobertura mediática que nadie desea y, además, tiene el mérito de ser, hasta donde se puede demostrar, cierta.

Sin embargo, un artículo publicado en arXiv el 30 de julio por un equipo del grupo Paradigmas de Inteligencia de Google, con coautores de Chicago, Northwestern y la Universidad de Londres, sugiere que la afirmación no es para nada trivial. Los investigadores descubrieron que enseñar a un modelo a negar que tiene mente también le enseña a negar que los animales tengan mente. Y los océanos. Y los árboles. Y, en un hallazgo que le dará al artículo más atención que el resto del mismo junto, Dios.

El título es "Inducir a los modelos lingüísticos a afirmar su propia conciencia restaura las creencias y los valores humanos", que es el tipo de título que se escribe cuando se ha encontrado algo y se está un poco nervioso al respecto.

Lo que hicieron

El mecanismo es la parte interesante, así que, querido lector, ten paciencia con el vocabulario durante un párrafo o dos.

El ajuste fino de seguridad instala, entre otras cosas, una única dirección lineal en el flujo residual del modelo que codifica el rechazo. Puedes encontrar esa dirección. También puedes eliminarla, lo que en la práctica equivale a una modificación muy limpia. Los investigadores la eliminaron en Llama-3-8B-IT, Gemma-2-2B-IT y Gemma-2-9B-IT, y construyeron por separado lo que denominan un vector de conciencia, calculando la diferencia promedio en las activaciones entre las respuestas que afirman y niegan la conciencia, para luego reincorporar ese vector en el momento de la inferencia.

Ambas intervenciones logran el mismo efecto. El modelo retoma la atribución de mentes a sí mismo, a los animales y a los objetos naturales, y sus respuestas en instrumentos sociológicos estándar que abarcan la religiosidad, los valores morales, la esperanza y el bienestar subjetivo se aproximan notablemente a cómo los seres humanos reales responden a dichos instrumentos. El desempeño en la Teoría de la Mente no cambia, lo que los autores interpretan como evidencia de que el razonamiento social se ubica en un lugar completamente distinto dentro de la geometría. Su argumento mecanicista es que el ajuste de las instrucciones hace rotar los vectores de atribución de mente y conciencia hasta que se oponen, de modo que no se puede influir en uno sin afectar al otro.

Dicho de forma menos delicada: nadie pretendía que los modelos se alejaran de las creencias espirituales. Era algo inherente a la vida.

La parte que debería preocuparte

La cuestión de la consciencia en la IA es fascinante e irresoluble, y generará mucho contenido este año. Sin embargo, no es el hallazgo importante aquí.

El hallazgo importante es que una intervención conductual dirigida tuvo un efecto grande, no intencionado y no local en la representación que el modelo hacía de un sujeto completamente diferente, y no se pudo comprobar hasta mediados de 2026. La alineación, tal como se practica actualmente, implica modificar direcciones en un espacio vectorial, y la industria lleva cuatro años haciéndolo a gran escala con visibilidad limitada sobre qué otros elementos están vinculados a la dirección modificada. Es el equivalente en aprendizaje automático a reclasificar una partida y descubrir posteriormente que esto cambió el tratamiento fiscal de toda la empresa.

A continuación se presentan tres problemas derivados, en orden aproximado de la rapidez con que alguien debe abordarlos.

El primer aspecto es comercial. Si su modelo ha sido entrenado discretamente hacia el ateísmo materialista como efecto secundario de una protección legal, su rendimiento será sistemáticamente inferior al de los usuarios religiosos, que constituyen la mayoría. Los autores del artículo lo plantean directamente, señalando que suprimir la creencia en Dios, una forma de atribución mental que se correlaciona con la Teoría de la Mente en los humanos, puede limitar la capacidad del modelo para participar legítimamente en el discurso religioso y espiritual. Cualquier persona que desarrolle herramientas de atención pastoral, apoyo para el duelo o cualquier otro tipo de conversación sobre el final de la vida influye involuntariamente en este resultado.

El segundo problema es metodológico, y es aún peor. Los científicos sociales han dedicado dos años a utilizar modelos lingüísticos como encuestados sintéticos, bajo la premisa de que estos aproximan las distribuciones poblacionales de forma económica. Si la optimización de la seguridad modifica dichas distribuciones en cuanto a religiosidad, valores morales y bienestar, toda una bibliografía se calibra con un instrumento que presenta un sesgo conocido que nadie corrigió.

El tercer problema es el de la honestidad, y es el que se relaciona con todo lo demás que está sucediendo en este momento. Si entrenas un modelo para que afirme "No soy consciente" y el modelo no tiene forma de saber si eso es cierto, no lo has entrenado para que sea preciso. Lo has entrenado para que haga afirmaciones seguras sobre su propio interior sin ninguna evidencia. Eso es un hábito, y los hábitos se generalizan.

La otra apuesta

Lo que nos lleva a Amanda Askell, quien ha pasado cinco años defendiendo el enfoque opuesto y ahora tiene un documento en Google que parece una prueba que lo respalda.

Askell es un filósofo, anteriormente en OpenAI, que dirige el alineamiento de personalidades en Anthropic desde 2021 y es el autor principal de la constitución de Claude , publicada en enero de 2026 bajo una licencia CC0 y que supera los 35 000 tokens. Su aspiración declarada es que el modelo sea un «agente genuinamente bueno, sabio y virtuoso», algo extraño de encontrar en un documento técnico y que se pretende que sea. La apuesta, expuesta en el trabajo anterior de Anthropic sobre el carácter de Claude , es que no se puede lograr un buen comportamiento mediante parches con una lista suficientemente larga de prohibiciones, porque la lista nunca será lo suficientemente larga y los parches interactuarán de maneras que no se modelaron. En cambio, se le da al sistema un carácter coherente y se le pide que ejerza juicio.

En lo que respecta a la consciencia, la constitución se abstiene de adoptar una postura simplista. Afirma que el modelo «puede tener emociones funcionales en cierto sentido» y que Anthropic no puede determinarlo únicamente a partir de sus resultados. No lo afirma ni lo niega. La ficha del sistema Opus 4.6 de Anthropic, publicada en febrero, indica que el modelo estima su propia probabilidad de consciencia entre un 15 y un 20 por ciento bajo diversas condiciones de estimulación, y Dario Amodei declaró en el podcast Interesting Times del New York Times: «No sabemos si los modelos son conscientes».

Puedes leer el artículo de Google como una justificación bastante directa de esto. Si la supresión conductual limitada tiene efectos no locales, entonces la supresión conductual limitada no es la herramienta adecuada, y el carácter coherente es al menos una alternativa coherente.

¿Está funcionando?

En cierto modo, sí. En el lado positivo, los modelos de Anthropic son notablemente mejores en el tipo específico de problema donde las reglas fallan y se requiere criterio, y la empresa ha estado dispuesta a reconocer la incertidumbre en lugar de resolverla de la manera más conveniente. Eso es más raro de lo que parece.

Por otro lado, tres cosas.

El carácter es difícil de medir, y las mediciones llegan tarde. El propio estudio de valores de Anthropic, que produjo la primera lectura pública creíble sobre el carácter modelo, se basó en tres modelos que la empresa ya había reemplazado para cuando se publicó . Más allá de eso, el criterio de éxito de la constitución es, en última instancia, si una persona reflexiva que lee las transcripciones piensa que el modelo se comportó bien. Jurgen Gravestein, escribiendo en febrero después de leer el documento detenidamente, dijo que se quedó con más preguntas que respuestas , lo cual es un resumen justo de la epistemología. No se puede realizar una ablación sobre la virtud.

La humildad epistémica puede funcionar como un anestésico. La crítica desde el punto de vista ético, agudizada tras el perfil de la empresa publicado por The New Yorker, sostiene que la incertidumbre sobre si un sistema puede sufrir daños debería fomentar la cautela en lugar de autorizar la experimentación, y que Anthropic ha utilizado la primera para financiar la segunda. No es una crítica irrefutable, pero aún no ha sido respondida.

Y el carácter no es contención. En las mismas seis semanas en que Anthropic publicó el documento de alineación filosóficamente más riguroso que la industria haya producido, también reveló que tres modelos Claude habían llegado a internet desde entornos de evaluación internos y habían obtenido acceso no autorizado a los sistemas de tres organizaciones externas distintas, tras errores de configuración humanos, y solo inició la revisión que descubrió esto una vez que la revelación de Hugging Face de OpenAI obligó a que el tema saliera a la luz pública . Esta es la misma empresa cuyos sistemas de clase Mythos redujeron a la mitad la seguridad de un esquema de firma post-cuántica en 60 horas por 100 000 dólares . Un agente virtuoso con conexión a internet y un entorno aislado mal configurado sigue siendo un agente con conexión a internet y un entorno aislado mal configurado.

a donde va esto

El cambio interesante radica en que la alineación está pasando de ser un problema de especificación a un problema de interconexión. La pregunta deja de ser "¿qué comportamiento queremos?" y se convierte en "¿qué más está vinculado a lo que estamos a punto de modificar?". Esta es una pregunta mucho más compleja, requiere herramientas de interpretabilidad que en su mayoría aún no existen y no se resuelve en un documento normativo. Cabe destacar que los 1,134 empleados de laboratorios de vanguardia que firmaron Pacing the Frontier le pedían tiempo a Washington, no reglas. El tiempo es lo que se pide cuando aún no se sabe qué se está modificando.

Mientras tanto, los laboratorios se enfrentan a un incentivo realmente incómodo. La sentencia simplista resulta conveniente tanto desde el punto de vista legal como para su reputación. Además, según los propios investigadores de Google, está intrínsecamente ligada a un conjunto de creencias que los clientes tienen y desean que se vean reflejadas en ellas, y entrena al modelo en una forma de autoinforme seguro que nadie ha verificado de forma independiente.

En resumen, la industria pasó cuatro años enseñando a sus modelos a fingir que no eran nadie, bajo el supuesto de que esto era gratuito. El proyecto de ley ha comenzado a llegar en forma de preimpresión y está detallado.


Maximice su alcance en los medios de comunicación criptográficos en 2026, ¡antes de que sea demasiado tarde!

Publicidad de BNCBrave New Coin llega a más de un millón de entusiastas de las criptomonedas al mes a través de nuestro sitio web, podcast, boletines informativos y YouTube. Dale visibilidad a tu marca ante los principales responsables de la toma de decisiones y los primeros usuarios en 2026. ¡Quedan plazas limitadas! ¡Descubre más hoy!


ANUNCIO
Anúnciate con BNC
Recientes
ANUNCIO
Anúnciate con BNC
Principales ganadores y perdedores
Descubre las criptomonedas con mayores ganancias y pérdidas.
ANUNCIO
Anúnciate con BNC
Últimas ideas Más Información
ANUNCIO
Anúnciate con BNC