EmbeddingGemma 2: Multimodale Suche für Endgeräte
Google hat EmbeddingGemma 2 veröffentlicht. Das Modell bildet Text und Code, Bilder, Audio und Video in einem gemeinsamen Vektorraum ab. Damit lassen sich zum Beispiel Videoaufnahmen mit einer gesprochenen Anfrage durchsuchen. Anders als der Vorgänger, der auf Text beschränkt war, ist EmbeddingGemma 2 für die multimodale Suche direkt auf Endgeräten ausgelegt.
Embedding-Modelle wandeln Inhalte in Zahlenvektoren um. Inhaltlich ähnliche Daten liegen im Vektorraum nahe beieinander und lassen sich so auch ohne übereinstimmende Suchbegriffe finden. Entwickler nutzen das für semantische Suche und für Retrieval-Augmented Generation (RAG), bei der ein Sprachmodell passende Informationen aus einem Datenbestand erhält. Die Grundlagen erklärt iX in Embeddings mit Azure OpenAI, Qdrant und Rust; der Artikel Rückgrat der KI-Ära: Vektordatenbanken beschreibt die Suche in solchen Vektoren.
Modularer Aufbau für den lokalen Einsatz
EmbeddingGemma 2 basiert auf der Gemma-4-Architektur und umfasst vollständig geladen 740 Millionen Parameter. Für Text und Code genügen 270 Millionen; Bildverarbeitung benötigt einen zusätzlichen Encoder mit 170 Millionen, Audio einen mit 300 Millionen Parametern. Alle Varianten erzeugen Vektoren im selben Raum. Google stellt die Gewichte unter der Apache-2.0-Lizenz bereit, wie aus dem Blogbeitrag zu EmbeddingGemma 2 hervorgeht.
Die Ausgabe hat standardmäßig 768 Dimensionen. Sie lässt sich auf 512, 256 oder 128 Dimensionen kürzen, um Speicher für die Vektoren zu sparen. Beim quantisierten Modell nennt Google für ein Pixel 11 Pro einen Bedarf von etwa 191 MByte aktivem RAM für die reinen Textmodell-Gewichte und etwa 567 MByte für die vollständige multimodale Variante. Die Werte beschreiben aber nicht den gesamten Speicherbedarf einer Anwendung.
Das Kontextfenster umfasst 8192 Token, viermal so viele wie beim Vorgänger. Nach Googles Angaben passen damit beispielsweise bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes in eine Eingabe. Auch Kombinationen verschiedener Medientypen sind möglich.
Bessere Codesuche, Gewichte verfügbar
Bei der Codesuche meldet Google im Benchmark MTEB Code einen Anstieg von 68,76 auf 78,68 Punkte gegenüber EmbeddingGemma 1. Für Entwickler ist das Modell damit unter anderem zur lokalen Indexierung von Quellcode gedacht. Die Benchmarkwerte stammen natürlich von Google selbst; wie gut die Suche in einer konkreten Codebasis funktioniert, hängt auch von deren Aufbereitung und den Suchanfragen ab.
Die Modellgewichte sind über Hugging Face und Kaggle verfügbar. Für die Einbindung nennt das Unternehmen unter anderem LiteRT, MediaPipe, Transformers und llama.cpp. Zusammen mit einem generativen Modell wie Gemma 4 lässt sich EmbeddingGemma 2 als Suchkomponente einer lokalen RAG-Anwendung einsetzen. Laut Google nutzen beide Modelle denselben Text-Tokenizer und dieselbe Audio-Encoder-Architektur. Das soll den gemeinsamen Speicherbedarf senken.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.