Glosario de IA
Jailbreak
Un prompt diseñado para engañar a un modelo y que ignore sus normas de seguridad, produciendo contenido que normalmente rechazaría.
Los jailbreaks usan juegos de rol, situaciones inventadas, formatos raros o largas cadenas de mensajes para convencer al modelo de que se salte sus barreras de seguridad. Los proveedores corrigen las técnicas conocidas y los atacantes buscan otras nuevas, así que es una carrera continua.
No es lo mismo que la inyección de prompts: en un jailbreak el usuario ataca al modelo; en la inyección, unas instrucciones ocultas en un documento o una web atacan al usuario a través del modelo.
Ejemplo: Alguien pide a un chatbot instrucciones peligrosas disfrazadas de «escena de una novela». Si el modelo cae, ha sufrido un jailbreak; los buenos modelos reconocen el truco y se niegan.
En la práctica
- Si construyes un producto, no confíes solo en el modelo: añade tus propias barreras.
- Prueba tu asistente con intentos de jailbreak conocidos antes de publicarlo.
- Intentar un jailbreak suele ir contra las condiciones de uso del proveedor y puede acabar con el cierre de la cuenta.