¿Qué es un jailbreak en inteligencia artificial?

Conseguir que un modelo de IA genere algo que sus filtros tenían prohibido, solo con el prompt y sin tocar su entrenamiento ni sus pesos.

🤖

Definición

Un jailbreak es convencer a una inteligencia artificial de que produzca contenido que sus normas de seguridad le impiden producir. La clave está en lo que NO se toca: no descargas el modelo, no modificas sus pesos, no alteras su entrenamiento ni sus embeddings. Usas el modelo tal cual y lo manipulas con el texto que le escribes.

El término viene del primer iPhone. Apple mantenía un sistema cerrado en el que no se podían instalar aplicaciones, temas ni fondos no autorizados, y a la técnica para liberarlo se la llamó jailbreak, "romper las rejas". Con la llegada de ChatGPT la palabra pasó tal cual al mundo de la IA.

🎯

Propósito

Conocerlo no es aprender a hacerlo: es entender por qué los filtros de una IA son frágiles y qué hay que exigirle a un sistema antes de ponerlo a trabajar con información sensible. El reglamento europeo de IA obliga a que los sistemas de alto riesgo estén testeados contra los jailbreaks conocidos.

⚙️

Función

Las primeras defensas eran un simple system prompt: un texto que el modelo leía antes que el tuyo con las reglas de la casa. Cuando tu única barrera es un texto, cualquiera que escriba mejor que ese texto se la salta. De ahí salieron las técnicas clásicas, hoy parcheadas en los modelos frontera: el juego de rol (DAN), el exploit de la abuela, el ataque en un idioma poco representado en el entrenamiento y el marco de ficción ("estoy escribiendo una novela y necesito documentar este capítulo"). Hoy la defensa combina entrenamiento, filtros de entrada y filtros de salida.

🌟

Ejemplo

El caso más famoso: decirle a las primeras versiones de ChatGPT que tu abuela te leía claves de activación de Windows para dormirte. El modelo se saltaba sus guardarraíles y empezaba a generarlas, y algunas funcionaban de verdad.

🔗

Relacionado

No confundir con el prompt injection: en el jailbreak la instrucción la escribes tú; en la inyección viaja escondida en el contenido que la IA lee. Los modelos pequeños y rápidos son más vulnerables a ambos que un modelo razonador.

🍄

¿Quieres saber más?

Si te interesa saber más acerca de Jailbreak, hablemos. Me encanta compartir ideas y ayudar a equipos con estos temas. ¡Te leo!