Glosario de IA
Multimodal
Capaz de trabajar con más de un tipo de dato —por ejemplo texto, imágenes, audio, vídeo o PDF— en el mismo modelo.
Un modelo multimodal puede, por ejemplo, leer una captura de pantalla y explicar un error, describir un gráfico, transcribir una reunión o responder sobre un PDF con tablas e imágenes. Casi todos los modelos punteros aceptan ya imágenes y documentos como entrada; algunos también audio y vídeo.
Lo que entra y lo que sale puede ser distinto: muchos modelos leen imágenes pero solo escriben texto, y los generadores de imágenes hacen lo contrario.
Ejemplo: Haces una foto a una factura arrugada y le pides al asistente que saque el importe, la fecha y el NIF en una tabla. Lee la imagen y te devuelve los datos.
En la práctica
- Las imágenes también cuentan como tokens y pueden encarecer la petición.
- Revisa lo que lee en imágenes borrosas o con letra pequeña: puede equivocarse.
- No todos los modelos admiten todo: DeepSeek V4-Pro, por ejemplo, no lee imágenes. Lo indicamos en la comparativa de modelos.


