Glosario de IA
Destilación
Entrenar un modelo «alumno» más pequeño para que imite a un modelo «profesor» más grande, conservando buena parte de su calidad por mucho menos coste.
El modelo grande genera respuestas (o probabilidades) para muchas entradas y el pequeño se entrena para reproducirlas. Como lo que produce el profesor es más rico que una simple etiqueta de acierto o fallo, el alumno aprende más rápido que si empezara de cero.
La destilación es una de las razones por las que los modelos baratos y rápidos no paran de mejorar: las gamas pequeñas de una familia suelen aprender de la grande. Las condiciones de muchos proveedores prohíben usar sus respuestas para destilar modelos de la competencia.
Ejemplo: Una empresa usa su modelo grande para responder miles de preguntas de soporte y entrena con esas respuestas un modelo pequeño. El pequeño contesta casi igual de bien en ese tema, mucho más rápido y por una fracción del coste.
En la práctica
- Si un modelo pequeño te sorprende por lo bien que funciona, es probable que aprendiera de uno grande de su familia.
- Antes de destilar con las respuestas de un modelo comercial, lee sus condiciones de uso.
- Un modelo destilado suele rendir bien en lo que se le enseñó y peor fuera de ese terreno.