Google hat ein neues multimodales Embedding-Modell und möchte, dass dieses auf Ihrem Smartphone läuft. EmbeddingGemma 2 ist ein leichtgewichtiges Modell, das Text, Code, Bilder, Video und Audio in einem Paket verarbeitet, und das Unternehmen bewirbt es als datenschutzorientiertes Tool für den Aufbau von Such- und Abruf-Apps direkt auf Consumer-Hardware.
Das Modell verfügt über 740 Millionen Parameter, läuft unter einer kommerziell zulässigen Apache 2.0-Lizenz und basiert auf der Gemma 4-Architektur. Es ist dafür gedacht, innerhalb der engen Speicher- und Verarbeitungsgrenzen von Edge-Geräten zu funktionieren – auf einem Google Pixel 11 Pro benötigen die Text-Gewichte beispielsweise nur etwa 191 MB aktiven RAM, wobei das vollständige Multimodal-Modell etwa 567 MB benötigt.
Was EmbeddingGemma 2 leistet
Das Modell erzeugt einen gemeinsamen Embedding-Raum für alle fünf Modalitäten. Die Idee ist, dass eine Sprachnotiz, ein Videoclip und eine Textabfrage alle mithilfe derselben zugrunde liegenden Darstellung verglichen werden können. Das macht es möglich, Stundenlanges Audio basierend auf einer Textabfrage zu durchsuchen oder einen bestimmten Videoclip anhand einer gesprochenen Beschreibung zu finden.
Das Design ist modular. Entwickler können die vollen 740 Millionen Parameter verwenden, oder sie können es auf 270M für Text-Only-Workloads reduzieren. Die optionalen Vision- und Audio-Encoder haben 170M bzw. 300M Parameter. Die Speichereffizienz ergibt sich aus Matryoshka Representation Learning (MRL), das es ermöglicht, Ausgabektoren auf 768, 512, 256 oder 128 Dimensionen zu kürzen – bis zu 6-fach Reduzierung für lokale Vektordatenbanken.
Die Zahlen dahinter
- Parameter: 740 Millionen insgesamt, 270M für Text-Only, 170M Vision, 300M Audio
- RAM: ~191MB für Text-Only auf Pixel 11 Pro, ~567MB für vollständiges Modell
- Kontextfenster: 8K Token, bis zu 5,5 Minuten Audio, 29 Bilder, 58 Videoframes
- Code-Score: 9,92-Punkte-Verbesserung in MTEB Code (68,76 bis 78,68)
- Lizenz: Apache 2.0
Warum es wichtig ist
Das Modell wird als eine fundamentale Komponente für On-Device-RAG-Pipelines positioniert. Google sagt, dass der gemeinsame Tokenizer des Modells es ermöglicht, es mit generativen Modellen wie Gemma 4 in einer einheitlichen Pipeline mit einem geringeren kombinierten Speicherbedarf zu kombinieren. Diese Kombination ermöglicht Retrieval Augmented Generation, die vollständig offline auf dem Gerät selbst funktioniert, was die ganze Botschaft ist.
Das Unternehmen setzt auch auf Bereitstellungstools. MediaPipe übernimmt Embedding- und Retrieval-Aufgaben auf verschiedenen Plattformen, während LiteRT Entwicklern die Integration benutzerdefinierter Modelle ermöglicht. Die Browserseite erhält transformers.js und WebGPU. Für das Serving ist die Liste der unterstützten Bibliotheken lang: transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama und LMStudio. Der Speicher wird von Qdrant verwaltet.
Die Leichtigkeit des Ganzen
Das Modell wird als eine leichte Alternative zu größeren multimodalen Embeddings beworben. Google sagt, es schlägt oder gleicht viele größere Modelle in Text-, Vision- und Audio-Aufgaben in Benchmarks wie MTEB Code und MAEB. Die Code-Performance verbesserte sich insbesondere in MTEB Code um 9,92 Punkte von 68,76 auf 78,68.
Das Unternehmen verknüpft dies auch mit einem größeren Muster. Die Ankündigung macht deutlich, dass Embedding sich in Richtung kleinerer, schneller und effizienterer Modelle bewegt, die auf dem Gerät selbst ausgeführt werden können, anstatt eine Reise in die Cloud zu erfordern. Das ist die Richtung des Marktes.
Was wir daraus machen
Die Ankündigung ist ein gutes Beispiel dafür, wie sich KI-Unternehmen in Richtung On-Device-Verarbeitung bewegen. Das Modell ist klein genug, um auf einem Telefon zu laufen, was bedeutet, dass es mehrmodale Suchen ohne das Senden von Daten in die Cloud durchführen kann – ein Datenschutzmerkmal, nicht nur ein Performance-Trick. Das ist der Punkt, den Google macht, und es ist ein Punkt, der es wert ist, gemacht zu werden.
Das modulare Design und die MRL-Kürzung sind echte technische Details, und sie sind wichtig. Aber die Botschaft ist einfach: Dies ist ein Modell, das eine Stimme hören, ein Bild sehen und eine Zeile Code lesen kann, alles gleichzeitig, auf einem Gerät, das Sie mit sich führen. Das ist die Zukunft der Suche, und Google liefert sie heute aus.
Die Ankündigung ist eine gute Lektüre. Es lohnt sich für alle, die On-Device-Apps entwickeln, und es zeigt, wie schnell sich diese Modelle von der Forschung zu alltäglichen Werkzeugen entwickeln.
„EmbeddingGemma 2: An open, lightweight multimodal embedding model,“ Google.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

