Saltar al contenido
estudIA

NoticiaGoogle2 min de lectura

EmbeddingGemma 2: busca por significado en texto, imagen y audio

Google lanza EmbeddingGemma 2, un modelo de embeddings abierto que entiende texto, código, imagen, vídeo y audio, y funciona sin conexión en el móvil.

Lo esencial

  • Convierte texto, código, imágenes, vídeo y audio en vectores comparables entre sí.
  • Con 740 millones de parámetros, cabe en un móvil: unos 570 MB de memoria en su versión completa.
  • Es abierto (licencia Apache 2.0) y se descarga desde Hugging Face, Kaggle u Ollama.
  • Lee hasta 8.000 tokens de una vez, cuatro veces más que la primera versión.

Google presentó el 6 de octubre EmbeddingGemma 2, la segunda versión de su modelo abierto de embeddings. No es un chatbot: es una pieza que usan muchas aplicaciones de IA por debajo, y esta versión la hace más útil y más fácil de llevar a cualquier dispositivo.

Qué es un modelo de embeddings

Un embedding es una lista de números que resume el significado de un contenido. Dos frases que dicen lo mismo con palabras distintas acaban con números parecidos. Así funcionan los buscadores «por significado» y el RAG, la técnica para que un chatbot responda con tus propios documentos: se convierten los documentos en embeddings, se guardan en una base de datos vectorial y se buscan los más parecidos a la pregunta.

Qué trae la versión 2

  • Multimodal: texto, código, imágenes, vídeo y audio comparten el mismo espacio. Puedes buscar una foto escribiendo una frase, o un fragmento de audio a partir de una descripción.
  • Pequeño: 740 millones de parámetros en total, o 270 millones si solo necesitas texto. Google dice que en un móvil ocupa unos 191 MB de memoria (solo texto) o 567 MB (completo), así que funciona sin conexión y sin enviar datos fuera.
  • Más contexto: hasta 8.000 tokens por entrada, cuatro veces más que la primera versión. Equivale a unos 5,5 minutos de audio o 29 imágenes.
  • Mejor en código: según Google, sube casi 10 puntos en la prueba MTEB Code.

Dónde usarlo

Es abierto, con licencia Apache 2.0, que permite el uso comercial. Se descarga desde Hugging Face y Kaggle, y funciona con las herramientas habituales para ejecutar modelos en local, como Ollama, llama.cpp o MLX, e incluso en el navegador con transformers.js.

Qué cambia para ti

  • Si estás montando un RAG o un buscador interno, es una opción gratuita y privada: los documentos no salen de tu ordenador.
  • Si trabajas con fotos, vídeos o audios, ahora puedes buscarlos por su contenido con un solo modelo, sin uno distinto para cada formato.
  • Si solo usas chatbots, no lo verás directamente, pero es el tipo de pieza que hace que las búsquedas en tus archivos funcionen mejor.

Términos del glosario

Fuentes

Artículos relacionados