> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Google lanza EmbeddingGemma 2 para buscar fotos, audio y video sin conexión
- URL: https://fomoera.com/embeddinggemma-2-busqueda-multimodal/
- Published: 2026-10-07T00:00:00.000Z
- Updated: 2026-10-07T00:00:00.000Z
- Description: El modelo abierto lleva la búsqueda multimodal al dispositivo. Su diseño modular ahorra memoria, aunque comprimir los vectores implica ajustes de calidad.
- Author: Patricia Rodriguez
- Tags: Tecnología y Ciencia, IA

Google DeepMind lanzó el 6 de octubre de 2026 **EmbeddingGemma 2**, un modelo abierto que permite buscar entre textos, código, imágenes, audio y video directamente en teléfonos y computadoras. Una consulta escrita puede localizar una grabación o un momento de un video sin enviar los archivos a la nube.

Basado en Gemma 4, el modelo completo tiene **740 millones de parámetros** y se distribuye bajo Apache 2.0, una licencia que permite su uso comercial. Google ofrece sus pesos en Hugging Face y Kaggle.

## Buscar un archivo por lo que contiene

Los embeddings son representaciones numéricas del contenido. Al colocar una pregunta, una foto o un fragmento de audio en el mismo espacio matemático, el sistema puede comparar su similitud y recuperar coincidencias entre formatos diferentes.

Google muestra ese funcionamiento en dos nuevas demostraciones de AI Edge Gallery. Instant Media Search busca fotos y videos locales mediante texto o una imagen de referencia. Video Moments Finder identifica momentos de grabaciones y devuelve sus marcas de tiempo, sin generar transcripciones o descripciones escritas intermedias.

Para redactar respuestas, la búsqueda se combina con un modelo generativo. **AI Edge Foresight**, una app experimental para Mac, emplea EmbeddingGemma 2 y Gemma 4 para recuperar información local y enriquecer notas de reuniones, según Google.

## Ahorrar RAM y reducir el índice son decisiones distintas

El diseño permite cargar solo los componentes necesarios. Para texto y código bastan 270 millones de parámetros; los módulos opcionales de visión y audio añaden 170 millones y 300 millones, respectivamente.

En un Pixel 11 Pro, Google reporta unos **191 MB de RAM activa para los pesos de texto** y unos **567 MB para el modelo multimodal completo**, con cuantización, una técnica que reduce la precisión numérica de los pesos. Son cifras ligadas a ese dispositivo y esa configuración.

El almacenamiento de las búsquedas tiene otro ajuste. Los vectores de 768 dimensiones pueden recortarse a 512, 256 o 128 mediante Matryoshka Representation Learning. Pasar de 768 a 128 deja una sexta parte de los valores por vector, a igualdad de precisión numérica.

Ese ahorro tiene un costo. En sus evaluaciones con pesos a precisión completa, la ficha técnica de Google indica que conserva casi toda la calidad hasta 256 dimensiones, pero que bajar a **128 dimensiones deteriora sustancialmente la calidad multimodal**. Por eso presenta esa opción como más adecuada para tareas de texto y recomienda validarla con los archivos de cada aplicación.

Así, cargar menos módulos limita los formatos disponibles; acortar los vectores modifica la calidad de las coincidencias. El ahorro de RAM y el de almacenamiento actúan sobre partes diferentes del sistema.

Google prevé incorporar el modelo como servicio de Android mediante ML Kit en las semanas posteriores al anuncio. Esa integración busca facilitar que otras aplicaciones añadan búsquedas locales sin gestionar por su cuenta todo el modelo.

*Fuentes:* [1](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/?ref=fomoera.com), [2](https://ai.google.dev/gemma/docs/embeddinggemma/model%5Fcard%5F2?ref=fomoera.com), [3](https://developers.googleblog.com/google-ai-edge-with-embeddinggemma-2/?ref=fomoera.com)