Google DeepMind lanza EmbeddingGemma 2 para procesamiento vectorial multimodal en dispositivos locales

La herramienta de 740 millones de parámetros permite ejecutar búsquedas semánticas y sistemas RAG en hardware personal sin enviar datos a la nube.

0
12
Foto Google

Google DeepMind presentó EmbeddingGemma 2, un modelo abierto de procesamiento de vectores diseñado para ejecutarse localmente en dispositivos móviles y de cómputo personal. La herramienta sucede a la versión inicial lanzada en septiembre de 2025 —que superó los 20 millones de descargas— y expande sus capacidades desde la conversión de texto plano hacia el procesamiento unificado de código, imágenes, video y audio dentro de un único espacio vectorial.

Desarrollado sobre la arquitectura Gemma 4 y distribuido bajo una licencia comercial permisiva Apache 2.0, el modelo cuenta con 740 millones de parámetros. Su arquitectura modular permite adaptar el consumo de recursos a las necesidades de cada aplicación, requiriendo un mínimo de 270 millones de parámetros para tareas exclusivamente de texto, e integrando codificadores opcionales para visión (170 millones) y audio (300 millones).

En pruebas comparativas de rendimiento, EmbeddingGemma 2 registró un avance de 9,92 puntos en el referente MTEB Code, pasando de una puntuación de 68,76 en su versión anterior a 78,68 en la actual. Asimismo, superó los promedios de modelos sub-1B en evaluaciones del indicador de audio MAEB y del estándar de imágenes MAEB Lite. La ventana de contexto se amplió a 8.192 tokens, cuatro veces más que la generación precedente, lo que habilita la lectura continua de hasta 5,5 minutos de audio o 58 fotogramas de video.

El modelo incorpora la técnica de aprendizaje de representación Matryoshka, la cual permite truncar dinámicamente los vectores de salida desde 768 dimensiones hasta 512, 256 o 128 dimensiones. Este ajuste reduce el consumo de memoria y el almacenamiento en bases de datos vectoriales locales hasta en seis veces. En términos de hardware, mediante técnicas de cuantización en dispositivos como el teléfono Pixel 11 Pro, la versión de texto requiere aproximadamente 191 megabytes de memoria RAM activa, mientras que el modelo multimodal completo utiliza cerca de 567 megabytes.

La propuesta de procesamiento en el dispositivo busca resolver dos aspectos críticos en el desarrollo de software actual: la privacidad de los datos al evitar el envío de información a servidores externos y la reducción de costos operativos derivados de las tarifas por consulta en APIs en la nube. Diversos competidores del sector, como Microsoft con sus iniciativas de RAG local y plataformas open-source respaldadas por Hugging Face, impulsan soluciones orientadas al procesamiento en el borde (edge computing).

Para su despliegue, la empresa puso a disposición los pesos del modelo en plataformas como Hugging Face y Kaggle, además de habilitar la integración con herramientas de desarrollo como LiteRT, Ollama, llama.cpp, vLLM, SGLang, Transformers.js y el entorno de almacenamiento Qdrant.

Fuente: Blog de Google | Editado por CDOL

Custom Text
Artículo anteriorUCAB e Italbank renuevan alianza para impulsar el emprendimiento
Artículo siguienteLa clonación de voz mediante IA plantea nuevos retos para la ciberseguridad global