Saltar al contenido
estudIA

Glosario de IA

Red teaming

Atacar a propósito un sistema de IA, como lo haría un adversario, para encontrar comportamientos peligrosos y fallos de seguridad antes de lanzarlo.

Los equipos rojos intentan que un modelo se porte mal: sacarle información peligrosa, saltarse sus barreras de seguridad, filtrar datos o lograr que un agente haga algo dañino. Lo que encuentran se traduce en correcciones, más entrenamiento y los informes de seguridad que acompañan a cada modelo nuevo.

Combina expertos de la propia empresa, especialistas externos y ataques automáticos generados por otros modelos. En los agentes, se centra sobre todo en la inyección de prompts.

Ejemplo: Antes de lanzar un agente que lee correos, un equipo le envía mensajes con instrucciones ocultas para ver si obedece. Descubren que reenvía un archivo cuando no debería y añaden una confirmación obligatoria.

En la práctica

  • Si lanzas un producto con IA, haz tu propio red teaming, aunque sea modesto.
  • Prueba los abusos más probables para tu caso, no solo los genéricos.
  • Repite las pruebas cada vez que cambies de modelo o de prompt.

Términos relacionados

Para saber más

← Volver al glosario