Glosario de IA
Red teaming
Atacar a propósito un sistema de IA, como lo haría un adversario, para encontrar comportamientos peligrosos y fallos de seguridad antes de lanzarlo.
Los equipos rojos intentan que un modelo se porte mal: sacarle información peligrosa, saltarse sus barreras de seguridad, filtrar datos o lograr que un agente haga algo dañino. Lo que encuentran se traduce en correcciones, más entrenamiento y los informes de seguridad que acompañan a cada modelo nuevo.
Combina expertos de la propia empresa, especialistas externos y ataques automáticos generados por otros modelos. En los agentes, se centra sobre todo en la inyección de prompts.
Ejemplo: Antes de lanzar un agente que lee correos, un equipo le envía mensajes con instrucciones ocultas para ver si obedece. Descubren que reenvía un archivo cuando no debería y añaden una confirmación obligatoria.
En la práctica
- Si lanzas un producto con IA, haz tu propio red teaming, aunque sea modesto.
- Prueba los abusos más probables para tu caso, no solo los genéricos.
- Repite las pruebas cada vez que cambies de modelo o de prompt.
