Saltar al contenido
estudIA

Glosario de IA

Latencia

Cuánto esperas la respuesta de un modelo: el tiempo hasta el primer token más el que tarda en generar el resto.

Importan dos cifras: el tiempo hasta el primer token (lo rápido que empieza a salir la respuesta) y la velocidad de salida (tokens por segundo). Los modelos grandes y el razonamiento largo aumentan la latencia; los modelos pequeños y mostrar la respuesta según se genera reducen la espera.

En un chat, unos segundos no importan. En asistentes de voz o en el autocompletado cuenta cada décima de segundo, y por eso usan modelos pequeños y rápidos.

Ejemplo: En un asistente de voz, si la respuesta tarda tres segundos en empezar, la conversación se siente rota. En un informe que vas a leer durante diez minutos, esperar treinta segundos da igual.

En la práctica

  • Muestra la respuesta a medida que se genera (streaming): la espera se percibe mucho menor.
  • Usa modelos pequeños o menos esfuerzo de razonamiento donde importe la rapidez.
  • En prompts largos, la caché de prompts también reduce el tiempo hasta la primera palabra.

Términos relacionados

← Volver al glosario