Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

EmbeddingGemma 2 de Google integra código, audio y video en un modelo para teléfonos de 740 millones de parámetros. )

EmbeddingGemma 2 de Google es un modelo de inserción multimodal ligero que se ejecuta en dispositivos periféricos, con capacidades de búsqueda y recuperación centradas en la privacidad.

Por mitch·4 min de lectura
A smartphone displays an AI interface with abstract audio, video, and text waveforms surrounding it.

Google tiene un nuevo modelo de incrustación multimodal, y quiere que se ejecute en su teléfono. EmbeddingGemma 2 es un modelo liviano que maneja texto, código, imágenes, video y audio en un solo paquete, y la compañía lo promociona como una herramienta que prioriza la privacidad para construir aplicaciones de búsqueda y recuperación directamente en hardware de consumo.

El modelo tiene 740 millones de parámetros, se ejecuta bajo una licencia Apache 2.0 comercialmente permisiva, y está construido sobre la arquitectura Gemma 4. Está destinado a funcionar dentro de los límites ajustados de memoria y procesamiento de los dispositivos de borde — en un Google Pixel 11 Pro, los pesos solo de texto toman tan solo ~191MB de RAM activa, con el modelo multimodal completo requiriendo ~567MB.

Lo que hace EmbeddingGemma 2

El modelo produce un espacio de incrustación compartido para las cinco modalidades. La idea es que una nota de voz, un clip de video y una consulta de texto puedan compararse entre sí utilizando la misma representación subyacente. Eso hace posible buscar a través de horas de audio basándose en una consulta de texto, o encontrar un clip de video específico a partir de una descripción hablada.

Publicidad

El diseño es modular. Los desarrolladores pueden usar los 740 millones de parámetros completos, o pueden reducirlos a 270M para cargas de trabajo solo de texto. Los codificadores de visión y audio opcionales suman 170M y 300M de parámetros respectivamente. La eficiencia de almacenamiento proviene del Aprendizaje de Representación Matrioshka (MRL), que permite que los vectores de salida se truncen a 768, 512, 256 o 128 dimensiones — hasta una reducción de 6x para bases de datos de vectores locales.

Los Números Detrás de Él

  • Parámetros: 740 millones en total, 270M solo para texto, 170M visión, 300M audio
  • RAM: ~191MB solo para texto en Pixel 11 Pro, ~567MB para el modelo completo
  • Ventana de contexto: 8K tokens, hasta 5.5 minutos de audio, 29 imágenes, 58 fotogramas de video
  • Puntaje de código: mejora de 9.92 puntos en MTEB Code (de 68.76 a 78.68)
  • Licencia: Apache 2.0

Por Qué Importa

El modelo se está posicionando como un componente fundamental para las canalizaciones RAG en el dispositivo. Google dice que el tokenizador compartido del modelo significa que puede combinarse con modelos generativos como Gemma 4 en una canalización unificada con una huella de memoria combinada menor. Ese emparejamiento permite la generación aumentada de recuperación que funciona completamente sin conexión, en el dispositivo mismo, que es todo el argumento.

La compañía también está impulsando herramientas de implementación. MediaPipe maneja las tareas de incrustación y recuperación en todas las plataformas, mientras que LiteRT permite a los desarrolladores integrar modelos personalizados. El lado del navegador obtiene transformers.js y WebGPU. Para el servicio, la lista de bibliotecas compatibles es larga: transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama y LMStudio. El almacenamiento es manejado por Qdrant.

La Ligereza de Todo

El modelo se está promocionando como una alternativa liviana a las incrustaciones multimodales más grandes. Google dice que supera o iguala a muchos modelos más grandes en tareas de texto, visión y audio en puntos de referencia como MTEB Code y MAEB. El rendimiento del código en particular vio una mejora de 9.92 puntos en MTEB Code, de 68.76 a 78.68.

La compañía también está vinculando esto a un patrón más amplio. El anuncio deja claro que la incrustación se está moviendo hacia modelos más pequeños, más rápidos y más eficientes que pueden ejecutarse en el dispositivo en lugar de requerir un viaje a la nube. Esa es la dirección del mercado.

Lo Que Hacemos Con Esto

El anuncio es un buen ejemplo de cómo las compañías de IA se están moviendo hacia el procesamiento en el dispositivo. El modelo es lo suficientemente pequeño como para ejecutarse en un teléfono, lo que significa que puede realizar búsquedas multimodales sin enviar datos a la nube, una función de privacidad, no solo un truco de rendimiento. Ese es el punto que Google está haciendo, y es un punto que vale la pena hacer.

El diseño modular y la truncación MRL son detalles técnicos reales, y importan. Pero el argumento es simple: este es un modelo que puede escuchar una voz, ver una imagen y leer una línea de código, todo a la vez, en un dispositivo que lleva consigo. Ese es el futuro de la búsqueda, y Google lo está lanzando hoy.

El anuncio es una buena lectura. Vale la pena echarle un vistazo a cualquiera que esté construyendo aplicaciones en el dispositivo, y muestra lo rápido que estos modelos se están moviendo de la investigación a herramientas cotidianas.

«EmbeddingGemma 2: An open, lightweight multimodal embedding model,» Google. )

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.