Glosario de IA
Latencia
Cuánto esperas la respuesta de un modelo: el tiempo hasta el primer token más el que tarda en generar el resto.
Importan dos cifras: el tiempo hasta el primer token (lo rápido que empieza a salir la respuesta) y la velocidad de salida (tokens por segundo). Los modelos grandes y el razonamiento largo aumentan la latencia; los modelos pequeños y mostrar la respuesta según se genera reducen la espera.
En un chat, unos segundos no importan. En asistentes de voz o en el autocompletado cuenta cada décima de segundo, y por eso usan modelos pequeños y rápidos.
Ejemplo: En un asistente de voz, si la respuesta tarda tres segundos en empezar, la conversación se siente rota. En un informe que vas a leer durante diez minutos, esperar treinta segundos da igual.
En la práctica
- Muestra la respuesta a medida que se genera (streaming): la espera se percibe mucho menor.
- Usa modelos pequeños o menos esfuerzo de razonamiento donde importe la rapidez.
- En prompts largos, la caché de prompts también reduce el tiempo hasta la primera palabra.