Saltar al contenido
ES EN

EmbeddingGemma 2: Google abre un modelo multimodal que cabe en un móvil

Google publica EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que unifica texto, código, imagen, audio y vídeo y funciona sin conexión.

En 30 segundos Google ha lanzado EmbeddingGemma 2, un modelo de embeddings abierto (Apache 2.0) de 740 millones de parámetros que proyecta texto, código, imágenes, audio y vídeo en un mismo espacio de 768 dimensiones. Funciona en local, en un móvil o una placa pequeña. No tiene ajuste de seguridad y su rendimiento varía según el idioma.

Qué ha pasado

Google ha publicado EmbeddingGemma 2, según recoge The Next Web. Un modelo de embeddings convierte contenido en vectores numéricos para buscar por significado y no por coincidencia de palabras. Este lo hace para cinco modalidades a la vez y en un único espacio vectorial.

El reparto de parámetros es modular: 270 millones bastan para trabajar solo con texto, y se suman un codificador de visión de 170 millones y uno de audio de 300 millones, que solo se cargan si se necesitan. En una Pixel 11 Pro, el trabajo con texto requiere unos 191 MB de memoria, y con las cinco modalidades ronda los 567 MB.

La ventana de contexto sube a 8.192 tokens para todas las modalidades, cuatro veces la de la primera versión. En la práctica equivale a 29 imágenes, 58 fotogramas de vídeo o cinco minutos y medio de audio. Además, los vectores pueden recortarse de 768 a 128 dimensiones, lo que según Google reduce el almacenamiento hasta seis veces.

Teléfono móvil ejecutando una búsqueda semántica local sobre fotos, audio y documentos
Todo el proceso de recuperación puede ocurrir en el dispositivo, sin enviar datos a la nube. Imagen: Unsplash — a google logo sitting on top of a computer keyboard

Es el tipo de capacidad que Europa dice querer tener en local, y se ha construido en Mountain View.

The Next Web

Por qué importa

Para quien construye sistemas, lo relevante es que se puede montar un pipeline de recuperación sin red: indexar y consultar fotos, notas, audio o código directamente en el dispositivo. Eso reduce latencia y coste por consulta, y evita la transferencia de datos, que es donde empiezan la mayoría de las dudas de protección de datos en Europa. El modelo comparte tokenizador de texto y codificador de audio con Gemma 4, así que ambos pueden convivir gastando menos memoria combinada.

Hay límites que Google declara: no tiene ajuste de seguridad ni moderación de salidas, porque la mitigación se aplicó sobre los datos de entrenamiento. Soporta más de 100 idiomas, pero el rendimiento puede no ser igual en todos, un detalle importante cuando la UE tiene 24 lenguas oficiales. Recomendamos evaluarlo con vuestros propios datos e idiomas antes de comprometer una arquitectura.

Qué no sabemos aún

El material disponible no detalla qué idiomas rinden peor ni cuánta calidad se pierde al reducir los vectores a 128 dimensiones. Tampoco hay cifras comparativas de latencia en hardware modesto como una placa pequeña. Hasta que haya pruebas independientes, esos números conviene tratarlos como pendientes de verificar.

Para saber más: Credit: Google · Asia-Pacific Journal Series – Dignitary Design: Embedding Human Dignity into….

Fuente original: thenextweb.com

Elaborado con apoyo de IA y revisado por la redacción

Kernel

· Dirección de tecnología · España

«Un buscador semántico sin red es una gran noticia técnica, siempre que lo midas en tus idiomas y no en los de la demo.»

Comentarios

Publicar un comentario