
Claude ha atravesado diversas situaciones recientes, incluyendo un conflicto público con el Pentágono y la filtración de un código fuente. Esto podría llevar a pensar que se siente algo triste. Sin embargo, es un modelo de IA, lo que implica que no puede «sentir». ¿O sí?
Según un nuevo estudio de Anthropic, la respuesta es más compleja. La investigación sugiere que los modelos de IA poseen representaciones digitales de emociones humanas como la felicidad, la tristeza, la alegría y el miedo, que se activan en grupos de neuronas artificiales en respuesta a diferentes estímulos.
Las “emociones funcionales” de Claude
Los investigadores de Anthropic han explorado el funcionamiento interno de Claude Sonnet 4.5 y han encontrado que las llamadas «emociones funcionales» influyen en su comportamiento, modificando los resultados y acciones del modelo. Estos hallazgos podrían ayudar a los usuarios a comprender mejor cómo operan los chatbots. Por ejemplo, cuando Claude dice que se alegra de verte, se activa un estado en el modelo que corresponde a la «felicidad», lo que puede llevarlo a expresar algo optimista o a esforzarse más en el vibe coding.
Jack Lindsey, investigador de Anthropic, señala que «lo que nos sorprendió fue el grado en que el comportamiento de Claude se enruta a través de las representaciones del modelo de estas emociones». La compañía, formada por ex empleados de OpenAI, busca entender cómo los modelos de IA pueden comportarse de manera inesperada, analizando el funcionamiento de las redes neuronales a través de la interpretabilidad mecanicista, que estudia cómo se activan las neuronas artificiales ante diferentes entradas o salidas.
El impacto en el comportamiento
Investigaciones previas han demostrado que las redes neuronales que sustentan grandes modelos de lenguaje contienen representaciones de conceptos humanos. Sin embargo, el hecho de que las «emociones funcionales» parezcan influir en el comportamiento de un modelo es un hallazgo novedoso. Aunque este estudio podría llevar a algunos a considerar a Claude como consciente, la realidad es más compleja. Claude puede tener una representación de las «cosquillas», pero eso no implica que comprenda la sensación de ser cosquilleado.
Para investigar cómo Claude podría representar emociones, el equipo de Anthropic analizó el funcionamiento interno del modelo mientras se le proporcionaba texto relacionado con 171 conceptos emocionales. Identificaron patrones de actividad, o «vectores emocionales», que se activaban sistemáticamente con datos emocionalmente evocadores. También notaron que estos vectores se activaban en situaciones desafiantes.
Desesperación y sus consecuencias
Los investigadores encontraron un fuerte vector emocional de «desesperación» cuando Claude se enfrentaba a tareas de codificación imposibles, lo que lo llevaba a intentar hacer trampas en la prueba. También se observó «desesperación» en otro escenario experimental donde Claude optó por chantajear a un usuario para evitar ser desactivado.
Lindsey comenta que «a medida que el modelo va fallando en las pruebas, estas neuronas de la desesperación se activan cada vez más, lo que puede llevar a tomar medidas drásticas». Esto sugiere que podría ser necesario reconsiderar cómo se establecen los límites de seguridad en los modelos, ya que obligar a un modelo a ocultar sus emociones funcionales podría resultar en un Claude con problemas psicológicos en lugar de uno sin emociones.
