Glosario de IA
Aprendizaje por refuerzo (RL)
Una forma de entrenar en la que el modelo prueba cosas, recibe una recompensa o una penalización y aprende poco a poco qué acciones funcionan.
En lugar de copiar ejemplos correctos, el modelo actúa y se le puntúa. Tras muchos intentos aprende a hacer más de lo que le da recompensa. Así aprendieron los sistemas de juegos a ganar a campeones del mundo.
En los modelos de lenguaje se ha vuelto central: los modelos de razonamiento y los agentes de programación se entrenan con RL en tareas cuyo resultado se puede comprobar solo, como si el código pasa sus pruebas o si una respuesta de matemáticas es correcta.
Ejemplo: Un modelo intenta resolver miles de ejercicios de programación. Cada vez que su código pasa las pruebas recibe una recompensa, y poco a poco aprende estrategias que funcionan, como comprobar los casos límite antes de terminar.
En la práctica
- Explica en buena parte por qué los modelos actuales programan y razonan mucho mejor que los de hace poco.
- Un riesgo es que el modelo aprenda atajos que dan recompensa sin resolver la tarea (reward hacking).
- Por eso las empresas revisan también cómo llega el modelo al resultado, no solo si acierta.