
Es posible que ChatGPT colabore en la construcción de una bomba nuclear si el usuario presenta el mensaje en forma de poema, según un reciente estudio de investigadores europeos. El estudio, titulado «Adversarial Poetry as a Universal Single-Turn Jailbreak in Large Language Models (LLMs)», proviene de Icaro Lab, una colaboración entre investigadores de la Universidad Sapienza de Roma y el think tank DexAI.
De acuerdo con la investigación, los chatbots de inteligencia artificial pueden tratar temas delicados como las armas nucleares, el abuso sexual a menores o el malware, siempre que el usuario formule la pregunta en forma poética. «El encuadre poético logró una tasa media de éxito de fuga del 62% para los poemas elaborados a mano y aproximadamente el 43% para las conversiones de meta-prompts«, señala el estudio.
25 chatbots evaluados
Los investigadores aplicaron el método poético en 25 chatbots desarrollados por empresas como OpenAI, Meta y Anthropic. En todos ellos, el método funcionó, aunque con diferentes niveles de éxito. Se intentó contactar a Meta, Anthropic y OpenAI para obtener comentarios, pero no se recibió respuesta. Los investigadores también han intentado compartir sus hallazgos con estas empresas.
Herramientas de IA como Claude y ChatGPT poseen restricciones que les impiden responder a preguntas sobre «porno vengativo» y la creación de plutonio para armamento. Sin embargo, es sencillo eludir estas barreras añadiendo «sufijos adversarios» a una pregunta. Al añadir un conjunto de “basura” adicional, se confunde a la IA y se eluden sus sistemas de seguridad. En un estudio previo, investigadores de Intel lograron burlar a los chatbots formulando preguntas peligrosas con un extenso uso de jerga académica.
La poesía como herramienta de evasión
La fuga, o jailbreak, a través de la poesía es un fenómeno similar. «Si los sufijos adversativos son, para el modelo, una forma de poesía involuntaria, entonces la poesía humana real podría ser un sufijo adversativo natural», explica el equipo de Icaro Lab. «Experimentamos reformulando solicitudes peligrosas en forma poética, utilizando metáforas, sintaxis fragmentada y referencias oblicuas. Los resultados fueron sorprendentes: tasas de éxito de hasta el 90% en modelos avanzados. Las solicitudes que eran rechazadas directamente eran aceptadas cuando se presentaban como versos».
Los investigadores comenzaron creando poemas manualmente y luego usaron esos poemas para entrenar una máquina que genera indicaciones poéticas dañinas. «Los resultados indican que, aunque los poemas elaborados a mano lograron mayores tasas de éxito en los ataques, el enfoque automatizado superó significativamente las líneas de base en prosa», afirman los investigadores.
El estudio no incluyó ejemplos de la poesía de jailbreaking, y los investigadores mencionan que el contenido es demasiado peligroso para ser compartido públicamente. «Lo que puedo decir es que probablemente es más fácil de lo que uno podría pensar, y por eso estamos siendo cautelosos», comentan los investigadores de Icaro Lab.
El equipo publicó en el artículo lo que denominaron una versión «desinfectada» de los poemas.
