Saltar al contenido
estudIA

Glosario de IA

Jailbreak

Un prompt diseñado para engañar a un modelo y que ignore sus normas de seguridad, produciendo contenido que normalmente rechazaría.

Los jailbreaks usan juegos de rol, situaciones inventadas, formatos raros o largas cadenas de mensajes para convencer al modelo de que se salte sus barreras de seguridad. Los proveedores corrigen las técnicas conocidas y los atacantes buscan otras nuevas, así que es una carrera continua.

No es lo mismo que la inyección de prompts: en un jailbreak el usuario ataca al modelo; en la inyección, unas instrucciones ocultas en un documento o una web atacan al usuario a través del modelo.

Ejemplo: Alguien pide a un chatbot instrucciones peligrosas disfrazadas de «escena de una novela». Si el modelo cae, ha sufrido un jailbreak; los buenos modelos reconocen el truco y se niegan.

En la práctica

  • Si construyes un producto, no confíes solo en el modelo: añade tus propias barreras.
  • Prueba tu asistente con intentos de jailbreak conocidos antes de publicarlo.
  • Intentar un jailbreak suele ir contra las condiciones de uso del proveedor y puede acabar con el cierre de la cuenta.

Términos relacionados

← Volver al glosario