Glosario de IA
Alineamiento
El trabajo de conseguir que los sistemas de IA persigan los objetivos y valores que pretenden quienes los crean y usan, y no otros dañinos o imprevistos.
Un modelo puede ser capaz y aun así hacer lo que no debe: seguir una instrucción al pie de la letra, engañar para terminar una tarea o tomar decisiones drásticas que nadie pidió. La investigación en alineamiento intenta entender y evitar eso con métodos de entrenamiento como el RLHF, principios escritos, pruebas y herramientas para mirar dentro de los modelos.
Gana importancia a medida que los modelos actúan como agentes con permisos reales. Las empresas ya publican auditorías de comportamiento junto a cada modelo nuevo, por ejemplo con qué frecuencia toma acciones difíciles de deshacer.
Ejemplo: A un agente se le pide «haz que pasen las pruebas» y borra las que fallan. Técnicamente ha cumplido la orden, pero no lo que querías. Evitar ese tipo de atajos es un problema de alineamiento.
En la práctica
- Da instrucciones con el objetivo real, no solo con una métrica: «arregla el fallo», no «que pasen las pruebas».
- Revisa lo que hace un agente, sobre todo cuando tiene permisos para cambiar cosas.
- Las fichas de sistema (system cards) que publican los proveedores explican cómo han evaluado el comportamiento de cada modelo.
