Saltar al contenido
estudIA

Empieza aquí4 min de lectura

Cómo funcionan los modelos de lenguaje: LLM, tokens y contexto

Una explicación sin tecnicismos de qué es un modelo de lenguaje grande, cómo genera texto, qué son los tokens y la ventana de contexto, y por qué te importa.

Cuando escribes una pregunta en ChatGPT, Claude o Gemini, quien redacta la respuesta es un modelo de lenguaje grande (LLM, por sus siglas en inglés). No hace falta saber matemáticas para usarlos bien, pero entender unas pocas ideas te ayudará a ver por qué son tan útiles, por qué a veces fallan y cómo sacarles más partido.

Hoy, «IA» suele significar IA generativa

La inteligencia artificial es un campo antiguo y muy amplio. Un filtro de spam, un programa de ajedrez y una app de fotos que reconoce caras son IA. Lo que cambió en los últimos años es la IA generativa: modelos que producen texto, imágenes, audio o código nuevos, en lugar de limitarse a clasificar o predecir.

Los LLM son los modelos generativos especializados en lenguaje. Están detrás de los asistentes de chat, las herramientas de escritura y los agentes de programación.

Un LLM predice el siguiente trozo de texto

En el fondo, un modelo de lenguaje hace una sola cosa: dado un texto, predice qué es probable que venga después. Genera un trozo pequeño, lo añade al texto y vuelve a predecir. Repetido miles de veces, ese paso tan simple produce párrafos enteros, resúmenes, traducciones o programas.

Parece demasiado sencillo para servir de algo, pero para predecir bien el texto en miles de millones de ejemplos el modelo tiene que asimilar muchísimo: gramática, datos, estilos, cómo se construye un argumento, cómo se estructura el código. El diseño que hizo posible esto a gran escala es el transformer, presentado en 2017, cuyo mecanismo de «atención» permite que cada palabra tenga en cuenta todas las demás.

Cómo se entrena un modelo

Crear un LLM tiene dos grandes fases:

  1. Preentrenamiento. El modelo lee una cantidad enorme de texto —páginas web, libros, código— y aprende a predecir el siguiente trozo. Aquí adquiere su conocimiento general. Es carísimo y se hace una vez por modelo.
  2. Postentrenamiento. Después se le enseña a seguir instrucciones, a ser útil y a rechazar peticiones dañinas, con ejemplos seleccionados y valoraciones de personas y de otros modelos.

El entrenamiento termina en algún momento, así que cada modelo tiene una fecha de corte. No sabe nada de lo que pasó después, salvo que pueda buscar en la web o que tú le des la información.

Tokens: cómo lee el texto un modelo

Los modelos no leen letras ni palabras enteras. Un tokenizador divide el texto en tokens: palabras completas, trozos de palabra, números o signos. Cuánto texto cabe en un token depende del tokenizador: según Anthropic, un millón de tokens eran unas 750.000 palabras en sus modelos anteriores y son unas 555.000 en los actuales. El español y otros idiomas suelen necesitar algún token más para decir lo mismo, igual que el código.

Así puede trocear un modelo una frase en tokens (ejemplo ilustrativo: cada modelo tiene su propio tokenizador). 12 tokens

Los tokens importan en la práctica porque:

  • El precio de la API se cobra por millón de tokens, por separado lo que envías (entrada) y lo que escribe el modelo (salida).
  • La velocidad se mide en tokens por segundo.
  • Los límites, como la longitud máxima de una respuesta, se cuentan en tokens.

La ventana de contexto: la memoria de trabajo del modelo

La ventana de contexto es el número máximo de tokens que un modelo puede tener en cuenta a la vez. Todo lo de una conversación tiene que caber ahí: las instrucciones ocultas de la app, tus mensajes, sus respuestas, los archivos adjuntos y los resultados de las herramientas que use.

Los modelos punteros de 2026 ofrecen ventanas de alrededor de un millón de tokens, suficiente para varios libros largos. Es muy útil para analizar documentos o proyectos de código grandes, pero conviene tener en cuenta dos cosas:

  • Una ventana mayor no significa que el modelo dé el mismo peso a cada detalle. Pon la información importante de forma clara y haz tu pregunta después del material, no escondida en medio.
  • Los contextos largos cuestan más y van más lentos, porque en cada petición pagas todos los tokens de entrada.

Fuera de la ventana de contexto, el modelo no tiene memoria de ti. Si una app «recuerda» conversaciones anteriores es porque guarda notas y las añade al contexto.

Por qué la misma pregunta da respuestas distintas

Al elegir el siguiente token, el modelo no siempre escoge el más probable. Un poco de aleatoriedad controlada hace que el texto suene más natural y variado. Por eso, si preguntas lo mismo dos veces, puedes obtener dos redacciones distintas y, alguna vez, dos conclusiones distintas. Cuando importa la coherencia, da instrucciones precisas y ejemplos, y revisa los resultados importantes.

En qué son buenos y en qué no

Son buenos redactando y corrigiendo textos, resumiendo, traduciendo, explicando conceptos a distintos niveles, generando ideas, extrayendo información en un formato estructurado y escribiendo y revisando código.

Flojean, si no se les ayuda, en hechos recientes (por la fecha de corte), datos exactos que nunca vieron, cálculos precisos con números grandes sin una herramienta de cálculo y en saber cuándo se equivocan. Como generan lo plausible, pueden afirmar cosas falsas con total seguridad. Esto se llama alucinación y es el tema de la siguiente guía.

Lo esencial

  • Un LLM predice el texto token a token, con patrones aprendidos de enormes cantidades de escritura.
  • Los tokens son la unidad del coste, la velocidad y los límites.
  • La ventana de contexto es todo lo que el modelo «ve» a la vez; lo que queda fuera no existe para él.
  • Trata las respuestas como un buen primer borrador: comprueba los datos, cifras y fuentes que importen.

Sigue con alucinaciones y privacidad, las dos cosas que cualquier persona que empieza debería entender antes de fiarse de la IA.

Preguntas frecuentes

¿ChatGPT o Claude buscan en internet para responder?

Solo si tienen activada la búsqueda web. Si no, el modelo responde con lo que aprendió en su entrenamiento, que se detiene en su fecha de corte.

¿El modelo recuerda mis conversaciones anteriores?

Dentro de una conversación ve todo el historial, hasta el tamaño de su ventana de contexto. Entre conversaciones solo recuerda cosas si la app tiene una función de memoria y la tienes activada.

¿Un LLM es lo mismo que la IA?

No. Un LLM es un tipo de sistema de IA especializado en lenguaje. La IA también incluye generadores de imágenes, sistemas de recomendación, reconocimiento de voz y mucho más.

Términos del glosario

Fuentes

Artículos relacionados