ESPNBetting: Is the over or under the play in Alabama-Georgia game?RTP Desporto18h30 Pavlidis aumentado e a polémica CR/JJThe Jerusalem PostILF launches dictionary to reclaim 'hijacked' terms related to October 7, Israel-Hamas warInquirerDTI maps halal calamansi supply chain in Oriental MindoroBollywood HungamaEXCLUSIVE: Kareena Kapoor Khan’s mystery helmet post decoded! She has teamed up with F1 champion Lando Norris for a global collaboration, say sourcesESPN DeportesMessi y Cristiano Ronaldo, diferentes hasta para irseDeadlineNBC Developing Series Based On Finland’s ’66th North Precinct’ From ‘The Irrational’ Creator Arika Mittman7sur7L’OMS “pas en mesure” de mener une évaluation complète des risques après la mort d’une laborantine en SibérieEuronewsTrump mocks Sheinbaum over Gulf of Mexico and imitates her alleged reaction: 'No, no, please'BBC News BrasilLula pode virar no segundo turno? As 5 batalhas do petista a partir de agoraLa PresseÉtude | La plus grande colonie de manchots du monde victime du changement climatiqueWirtualna PolskaTak Ukraina "świętuje" urodziny Putina. Podano bilans strat
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

EmbeddingGemma 2: Multimodale Suche für Endgeräte

Translate

Google hat EmbeddingGemma 2 veröffentlicht. Das Modell bildet Text und Code, Bilder, Audio und Video in einem gemeinsamen Vektorraum ab. Damit lassen sich zum Beispiel Videoaufnahmen mit einer gesprochenen Anfrage durchsuchen. Anders als der Vorgänger, der auf Text beschränkt war, ist EmbeddingGemma 2 für die multimodale Suche direkt auf Endgeräten ausgelegt.

Embedding-Modelle wandeln Inhalte in Zahlenvektoren um. Inhaltlich ähnliche Daten liegen im Vektorraum nahe beieinander und lassen sich so auch ohne übereinstimmende Suchbegriffe finden. Entwickler nutzen das für semantische Suche und für Retrieval-Augmented Generation (RAG), bei der ein Sprachmodell passende Informationen aus einem Datenbestand erhält. Die Grundlagen erklärt iX in Embeddings mit Azure OpenAI, Qdrant und Rust; der Artikel Rückgrat der KI-Ära: Vektordatenbanken beschreibt die Suche in solchen Vektoren.

EmbeddingGemma 2 basiert auf der Gemma-4-Architektur und umfasst vollständig geladen 740 Millionen Parameter. Für Text und Code genügen 270 Millionen; Bildverarbeitung benötigt einen zusätzlichen Encoder mit 170 Millionen, Audio einen mit 300 Millionen Parametern. Alle Varianten erzeugen Vektoren im selben Raum. Google stellt die Gewichte unter der Apache-2.0-Lizenz bereit, wie aus dem Blogbeitrag zu EmbeddingGemma 2 hervorgeht.

Die Ausgabe hat standardmäßig 768 Dimensionen. Sie lässt sich auf 512, 256 oder 128 Dimensionen kürzen, um Speicher für die Vektoren zu sparen. Beim quantisierten Modell nennt Google für ein Pixel 11 Pro einen Bedarf von etwa 191 MByte aktivem RAM für die reinen Textmodell-Gewichte und etwa 567 MByte für die vollständige multimodale Variante. Die Werte beschreiben aber nicht den gesamten Speicherbedarf einer Anwendung.

Das Kontextfenster umfasst 8192 Token, viermal so viele wie beim Vorgänger. Nach Googles Angaben passen damit beispielsweise bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videoframes in eine Eingabe. Auch Kombinationen verschiedener Medientypen sind möglich.

Bei der Codesuche meldet Google im Benchmark MTEB Code einen Anstieg von 68,76 auf 78,68 Punkte gegenüber EmbeddingGemma 1. Für Entwickler ist das Modell damit unter anderem zur lokalen Indexierung von Quellcode gedacht. Die Benchmarkwerte stammen natürlich von Google selbst; wie gut die Suche in einer konkreten Codebasis funktioniert, hängt auch von deren Aufbereitung und den Suchanfragen ab.

Die Modellgewichte sind über Hugging Face und Kaggle verfügbar. Für die Einbindung nennt das Unternehmen unter anderem LiteRT, MediaPipe, Transformers und llama.cpp. Zusammen mit einem generativen Modell wie Gemma 4 lässt sich EmbeddingGemma 2 als Suchkomponente einer lokalen RAG-Anwendung einsetzen. Laut Google nutzen beide Modelle denselben Text-Tokenizer und dieselbe Audio-Encoder-Architektur. Das soll den gemeinsamen Speicherbedarf senken.

View the original on heise online →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.