Google DeepMind publicó EmbeddingGemma 2, un modelo de representación multimodal de 740 millones de parámetros diseñado para ejecutarse directamente en el dispositivo del usuario, sin necesidad de conexión a la nube. La herramienta puede procesar texto, código, imágenes, audio y vídeo simultáneamente.
El sistema genera embeddings que permiten a las aplicaciones comparar, buscar y clasificar contenido multimodal con un único modelo unificado. Google indicó que el lanzamiento incluye licencia Apache 2.0, lo que permite su uso libre incluso en productos comerciales.
EmbeddingGemma 2 está construido sobre la arquitectura Gemma 4, la misma base de la familia de modelos abiertos de Google. La primera generación de Gemma acumuló 20 millones de descargas en sus primeros meses de disponibilidad.
La compañía presenta esta versión como una propuesta distinta, orientada a indexar, comparar y buscar contenido multimodal de forma privada y sin latencia de red. También destaca que la unificación de las cinco modalidades en un solo modelo amplía su potencial de adopción.
Fuente: tecnologia
Descubre más desde Noticias Breves
Suscríbete y recibe las últimas entradas en tu correo electrónico.

Comentarios de Facebook