Saltar al contenido
estudIA

Glosario de IA

Caché de prompts

Reutilizar entre peticiones el principio ya procesado de un prompt, lo que abarata y acelera los prompts largos que se repiten.

Muchas aplicaciones envían una y otra vez el mismo comienzo largo: un gran prompt de sistema, un documento, una lista de herramientas. Con la caché de prompts el proveedor guarda durante un tiempo la versión procesada de ese comienzo, y las peticiones que empiezan exactamente igual pagan mucho menos por esos tokens y responden más rápido.

Para aprovecharla, pon al principio las partes del prompt que no cambian y al final lo que varía, como la pregunta del usuario.

Ejemplo: Un asistente de soporte envía en cada pregunta el mismo manual de 50 páginas. Con caché, la primera petición procesa el manual entero y las siguientes reutilizan esa parte. Según Anthropic, leer de la caché cuesta un 10 % del precio normal de entrada en la mayoría de sus modelos.

En la práctica

  • Pon lo fijo primero (instrucciones, documentos, herramientas) y lo variable al final.
  • Cualquier cambio al principio del prompt, aunque sea una fecha o una hora, invalida la caché.
  • La caché dura un tiempo limitado: compensa en flujos con peticiones seguidas.

Términos relacionados

Para saber más

← Volver al glosario