Glosario de IA
Evaluaciones (evals)
Un conjunto de casos de prueba con resultados esperados que sirve para medir lo bien que un sistema de IA hace una tarea concreta.
Una evaluación es como una batería de tests para prompts y funciones de IA. Reúnes entradas realistas, defines cómo es una buena respuesta y puntúas los resultados: de forma automática, con otro modelo como juez o a mano. Cada vez que cambias el prompt, el modelo o los ajustes, la vuelves a pasar y ves si ha mejorado.
Con 20 a 50 casos bien elegidos ya se detectan la mayoría de los retrocesos.
Ejemplo: Antes de cambiar de modelo, un equipo pasa sus 40 casos de prueba de clasificación de tickets con el modelo actual y con el nuevo. El nuevo acierta más, pero falla en dos casos de facturación, así que ajustan el prompt antes de cambiar.
En la práctica
- Incluye casos difíciles y raros, no solo los típicos.
- Define antes qué es una buena respuesta: un criterio claro facilita puntuar.
- Si usas un modelo como juez, revisa a mano una muestra para comprobar que puntúa bien.
Cómo mejorar un prompt paso a paso: técnicas de prompting.
