Saltar al contenido
estudIA

Glosario de IA

Token

La unidad de texto que lee y escribe un modelo de lenguaje: una palabra entera, un trozo de palabra, un número o un signo de puntuación.

Los modelos no ven letras ni palabras directamente: antes, un tokenizador divide el texto en tokens. Cuánto texto cabe en un token depende del tokenizador: según Anthropic, un millón de tokens eran unas 750.000 palabras en sus modelos anteriores y son unas 555.000 en los actuales. El español, el código y las palabras poco habituales suelen necesitar más tokens que el inglés.

Importan en la práctica porque el precio de la API, la velocidad y la ventana de contexto se miden en tokens. Cada familia de modelos tiene su propio tokenizador, así que el mismo texto puede ocupar un número distinto de tokens según el modelo.

Ejemplo: «Increíble!» podría dividirse en tokens como «Incre», «íble» y «!».

En la práctica

  • Los textos en español suelen ocupar algo más que en inglés: tenlo en cuenta al calcular costes.
  • Las API tienen herramientas para contar los tokens de una petición antes de enviarla.
  • Un precio «por millón de tokens» se refiere a la entrada y a la salida por separado.

Precios por millón de tokens de cada modelo: comparativa de modelos.

Términos relacionados

Para saber más

← Volver al glosario