Ein Embedding-Modell wird plötzlich für viel mehr als Text interessant
Semantische Suche gehört längst zu den wichtigsten Bausteinen moderner KI-Anwendungen. Statt Inhalte nur über identische Wörter zu finden, übersetzen Embedding-Modelle deren Bedeutung in Zahlenvektoren. Ähnliche Inhalte liegen in diesem mathematischen Raum näher beieinander und lassen sich dadurch auch dann finden, wenn Suchanfrage und Quelle unterschiedlich formuliert sind. Mit EmbeddingGemma 2 erweitert Google DeepMind dieses Prinzip nun deutlich: Das am 6. Oktober 2026 vorgestellte offene Modell verarbeitet nicht nur Text und Code, sondern auch Bilder, Video und Audio.
Der entscheidende Punkt ist der gemeinsame Vektorraum. Eine Texteingabe kann dadurch beispielsweise zu einem passenden Bild, einer Audiodatei oder einer bestimmten Szene in einem Video führen, ohne dass jede Medienart zuerst in Text umgewandelt werden muss. Für Entwickler reduziert das potenziell die Zahl der Modelle und Verarbeitungsschritte, die für multimodale Suchsysteme benötigt werden.
Was Google mit EmbeddingGemma 2 veröffentlicht hat
EmbeddingGemma 2 basiert laut Google auf der Gemma-4-Architektur und besitzt in der vollständigen Variante 740 Millionen Parameter. Das Modell bildet Text, Code, Bilder, Video und Audio in einem gemeinsamen Vektorraum mit 768 Dimensionen ab. Die Architektur ist modular: Für reine Text- und Code-Aufgaben werden 270 Millionen Parameter benötigt. Zusammen mit dem Vision-Encoder sind es 440 Millionen, mit Text und Audio 570 Millionen und mit allen Modalitäten 740 Millionen Parameter.
Hinzu kommt Matryoshka Representation Learning. Damit lassen sich die standardmäßig 768-dimensionalen Vektoren auf 512, 256 oder 128 Dimensionen verkleinern. Weniger Dimensionen bedeuten kleinere Vektorindizes und geringeren Speicherbedarf. Google gibt beispielsweise an, dass 256 Dimensionen den Speicherbedarf gegenüber 768 Dimensionen auf ungefähr ein Drittel reduzieren, während bei vielen Aufgaben ein großer Teil der Retrieval-Qualität erhalten bleiben soll. Wie gut diese Kompromisse funktionieren, muss allerdings für den jeweiligen Datenbestand getestet werden.
Das Kontextfenster umfasst 8.192 Token. Nach Angaben von Google können damit unter anderem längere Textabschnitte, mehrere Bilder, Video-Frames oder mehrere Minuten Audio verarbeitet werden. Das Modell steht unter Apache 2.0 zur Verfügung und ist damit auch für viele kommerzielle Szenarien interessant.
Lokale Verarbeitung ist mehr als ein Datenschutzargument
Besonders spannend ist die Ausrichtung auf On-Device-Anwendungen. Google nennt für quantisierte Varianten auf einem Pixel 11 Pro etwa 191 MB aktiven RAM für die Textgewichte und rund 567 MB für das vollständige multimodale Modell. Das sind Herstellerangaben und keine unabhängigen Messwerte, zeigen aber, auf welches Einsatzfeld Google zielt: Embeddings sollen nicht zwingend in einem großen Cloud-Backend erzeugt werden.
Für Anwendungen mit sensiblen Daten kann das einen erheblichen Unterschied machen. Eine lokale Dokumentensuche, ein persönliches Medienarchiv oder eine semantische Suche in einem Quellcodebestand kann so konzipiert werden, dass die Ausgangsdaten das Gerät nicht für jeden Suchvorgang verlassen müssen. Gleichzeitig sinkt die Abhängigkeit von Netzverbindungen und externen Inferenz-APIs.
Datenschutz entsteht dadurch allerdings nicht automatisch. Auch eine lokale KI-Anwendung muss sauber mit Berechtigungen, gespeicherten Vektoren, Caches und eventuell nachgelagerten Cloud-Diensten umgehen. 'On device' ist deshalb ein technischer Vorteil, aber kein Ersatz für ein Datenschutzkonzept.
Vom Fotoarchiv bis zur lokalen Code-Suche
Google demonstriert EmbeddingGemma 2 unter anderem mit einer lokalen Mediensuche. Bilder und Videos werden auf dem Gerät in Embeddings umgewandelt und können anschließend mit natürlichsprachlichen Anfragen durchsucht werden. Ein Nutzer könnte beispielsweise nach einer bestimmten Situation suchen, obwohl weder Dateiname noch Metadaten diese Beschreibung enthalten. Beim Video Moments Finder wird dasselbe Prinzip auf einzelne Momente innerhalb lokaler Videos angewendet.
Für Entwickler ist die Code-Komponente mindestens ebenso interessant. Semantische Code-Suche kann Funktionen oder relevante Stellen anhand ihrer Bedeutung auffinden, statt ausschließlich nach exakten Symbolnamen zu suchen. Google berichtet für EmbeddingGemma 2 gegenüber der ersten Generation deutliche Verbesserungen beim MTEB-Code-Benchmark. Diese Zahlen stammen vom Hersteller und sollten für konkrete Projekte mit dem eigenen Repository evaluiert werden.
Auch für Content-Management, Digital-Asset-Management und kreative Workflows sind solche Modelle interessant. Ein Medienbestand könnte gleichzeitig anhand visueller Motive, beschreibender Texte oder verwandter Inhalte durchsucht werden. Gerade Teams mit großen Bild-, Audio- und Videobibliotheken könnten damit Suchfunktionen aufbauen, die weniger von manuell gepflegten Dateinamen und Schlagworten abhängig sind.
RAG muss nicht mehr ausschließlich textzentriert sein
Retrieval-Augmented Generation, kurz RAG, verbindet generative KI mit externem Wissen. Klassische Systeme zerlegen Dokumente in Textabschnitte, erzeugen Embeddings und holen bei einer Anfrage passende Passagen aus einer Vektordatenbank. Multimodale Embeddings erweitern dieses Konzept: Neben Text können beispielsweise Screenshots, Diagramme, Produktbilder, Audioaufnahmen oder Videomaterial Bestandteil des durchsuchbaren Wissensbestands werden.
EmbeddingGemma 2 kann dabei als Retrieval-Schicht dienen, während ein generatives Modell anschließend die gefundenen Informationen verarbeitet. Google hebt insbesondere die Kombination mit Gemma 4 hervor. Weil beide Technologien Teile ihrer Architektur teilen, sollen lokale RAG-Pipelines effizienter umgesetzt werden können.
Für Webprojekte bedeutet das nicht, dass künftig jedes Frontend ein KI-Modell laden sollte. Interessanter sind gezielte Anwendungen: Offline-fähige Wissenssysteme, lokale Desktop-Tools, interne Recherchewerkzeuge, intelligente Medienarchive oder hybride Lösungen, bei denen nur ausgewählte Verarbeitungsschritte in der Cloud stattfinden.
Auch im Browser wird das Thema relevant
Google nennt neben klassischen Python- und Server-Werkzeugen ausdrücklich transformers.js und WebGPU als mögliche Wege, EmbeddingGemma 2 in Browser-Szenarien einzusetzen. Damit rückt eine Entwicklung näher, die für Webentwickler grundsätzlich interessant ist: Teile einer KI-Pipeline können auf leistungsfähigen Endgeräten direkt im Browser ausgeführt werden.
Das ist allerdings kein Freifahrtschein für große Modelle auf jeder Website. Downloadgröße, Initialisierungszeit, Arbeitsspeicher, Akkubelastung und Geräteunterschiede bleiben wichtige UX- und Performance-Faktoren. Eine technisch mögliche Browser-Inferenz ist nicht automatisch die beste Produktentscheidung. Progressive Enhancement und ein sinnvoller Fallback bleiben gerade bei Webanwendungen entscheidend.
Was Entwickler jetzt praktisch testen können
EmbeddingGemma 2 lässt sich laut Google unter anderem mit Transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LM Studio und LiteRT einsetzen. Für einen ersten Test ist kein vollständiges KI-Produkt nötig. Sinnvoller ist ein begrenzter eigener Datenbestand: einige hundert Dokumente, Bilder oder Code-Dateien indexieren und anschließend typische Suchanfragen aus dem echten Arbeitsalltag testen.
Wichtig ist dabei, nicht nur beeindruckende Einzelbeispiele zu betrachten. Gemessen werden sollten Trefferqualität, Latenz, Speicherbedarf, Indexgröße und Fehlertypen. Gerade bei semantischer Suche ist ein Ergebnis, das plausibel aussieht, nicht zwingend das Ergebnis, das ein Nutzer tatsächlich benötigt.
Interessant ist außerdem der Vergleich verschiedener Vektordimensionen. Wer mit 256 statt 768 Dimensionen nahezu dieselbe Qualität für den eigenen Anwendungsfall erreicht, kann Speicher und Suchaufwand deutlich reduzieren. Bei multimodalen Daten sollte diese Entscheidung jedoch empirisch getroffen werden, weil Google selbst bei stärkerer Reduktion unterschiedliche Qualitätsverluste je nach Modalität ausweist.
Ein kleineres Modell verändert die Architekturfrage
Die eigentliche Bedeutung von EmbeddingGemma 2 liegt deshalb weniger in einem einzelnen Benchmark als in der Verschiebung der Architekturgrenzen. Multimodale Suche war bislang häufig mit mehreren spezialisierten Modellen, Cloud-Diensten oder vergleichsweise schwergewichtiger Infrastruktur verbunden. Ein kompaktes, modular ladbares Modell kann diese Hürde reduzieren.
Das macht Cloud-KI nicht überflüssig. Große zentrale Modelle bleiben für viele Aufgaben leistungsfähiger und einfacher zu betreiben. Aber Entwickler erhalten eine zusätzliche Option: Daten können dort verarbeitet werden, wo sie entstehen, und nur die Schritte, die tatsächlich Cloud-Leistung benötigen, müssen das Gerät verlassen.
Für Webdesigner, Entwickler und Marketer ist das vor allem deshalb relevant, weil Suche zunehmend nicht mehr nur aus Textfeld plus Keyword besteht. Inhalte liegen als Text, Bilder, Video, Audio und Code vor. Wenn diese Medien lokal in einem gemeinsamen semantischen Raum durchsuchbar werden, entstehen neue Interfaces und Workflows – von der intelligenten Asset-Suche bis zum privaten Wissensassistenten. EmbeddingGemma 2 ist noch kein Beweis dafür, dass all diese Anwendungen im Alltag automatisch gut funktionieren. Es ist aber ein bemerkenswert kompakter neuer Baustein, mit dem sich genau das jetzt praktisch testen lässt.