Glosario de IA
RLHF
Entrenar un modelo con aprendizaje por refuerzo en el que la recompensa sale de personas que juzgan qué respuestas son mejores.
RLHF son las siglas en inglés de aprendizaje por refuerzo con retroalimentación humana. Tras el preentrenamiento, un modelo sabe mucho pero todavía no es un asistente útil. En el RLHF, unas personas comparan pares de respuestas y eligen la mejor. Esas elecciones entrenan un modelo de recompensa, que luego puntúa las respuestas del modelo de lenguaje durante el aprendizaje por refuerzo.
El RLHF explica en buena parte por qué los asistentes siguen instrucciones, rechazan peticiones dañinas y responden con un tono útil. Algunas variantes sustituyen parte de la opinión humana por la de otra IA guiada por principios escritos.
Ejemplo: A unas personas se les muestran dos respuestas a «¿cómo me relajo antes de un examen?»: una útil y amable, otra seca y genérica. Eligen la primera. Con miles de elecciones así, el modelo aprende qué tipo de respuesta se prefiere.
En la práctica
- Explica por qué los asistentes suelen ser educados y prudentes.
- También puede volverlos complacientes, con tendencia a darte la razón: si quieres críticas directas, pídelas.
- Variantes como la IA constitucional usan principios escritos para guiar parte de las valoraciones.