Saltar al contenido
estudIA

Glosario de IA

Inferencia

Ejecutar un modelo ya entrenado para obtener un resultado: cada vez que envías un prompt y recibes una respuesta.

El entrenamiento crea el modelo una vez; la inferencia es usarlo, millones de veces. El coste de inferencia es lo que pagas por token en una API, y su velocidad es lo rápido que aparecen los tokens en pantalla.

Depende del tamaño del modelo, del hardware, de lo largas que sean la entrada y la salida y de cuánto razone el modelo antes de responder.

Ejemplo: Cuando preguntas algo a un chatbot, el modelo hace inferencia: procesa tu mensaje y genera la respuesta token a token. Si mil personas preguntan a la vez, hay mil inferencias en marcha en los servidores del proveedor.

En la práctica

  • El coste crece con los tokens de entrada y de salida: prompts más cortos y respuestas más concisas ahorran.
  • Los modelos pequeños, la caché de prompts y el procesamiento por lotes abaratan la inferencia.
  • Con un modelo de pesos abiertos puedes hacer la inferencia en tu propio equipo.

Precios por millón de tokens de cada modelo: comparativa de modelos.

Términos relacionados

← Volver al glosario