Gemini 3.8 Live: Upgrade bei Echtzeit-Sprachmodellen für Voice Agents
Google hat mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei neue Sprachmodelle vorgestellt, die auf Echtzeit-Audiodialoge und den Einsatz in Voice Agents ausgelegt sind. Die Modelle stehen Entwicklern ab sofort über die Gemini API und Google AI Studio zur Verfügung und sollen schrittweise in Search Live und im Fall von Extended Thinking auch in Google Workspace ausgerollt werden.
Wie Google in seinem Blog erläutert, ist Gemini 3.8 Live als kosteneffizientes Basismodell für skalierbare Sprachagenten konzipiert. Es verarbeitet Text-, Bild-, Audio- und Videoeingaben. Das Limit für das Kontextfenster liegt bei rund 128.000 Token. Das Modell beherrscht laut Google 97 Sprachen – darunter auch Deutsch – und wechselt automatisch zwischen ihnen im laufenden Gespräch.
Die Extended-Thinking-Variante richtet sich laut Google an komplexe Aufgaben mit mehrstufigem Reasoning. Sie könne wohl parallel zum Sprechen im Hintergrund nachdenken, Zwischenergebnisse verbal kommentieren und mehrere Funktionsaufrufe gleichzeitig abarbeiten.
Asynchrone Funktionsaufrufe
Technisch setzt Google bei den Live-Modellen unter anderem auf asynchrone Funktionsaufrufe: Der Modus ist laut Entwicklerdokumentation Standard. Damit können die Modelle im Hintergrund Tools aufrufen, während die Konversation weiterläuft. Die Scheduling-Modi SILENT, WHEN_IDLE und INTERRUPTED können dabei steuern, wann und wie Funktionsergebnisse in den Dialog einfließen.
Gemini 3.8 Live Extended Thinking erreicht laut Artificial Analysis mit 82,6 Punkten den ersten Platz im Speech-to-Speech Quality Index – vor OpenAIs GPT-Live-1 Astra (81,5) und Grok Voice Think Fast 2.0 High (81,3). Beim Reasoning liegt es jedoch hinter zwei Qwen-Modellen und dem Modell StepAudio 3 Realtime der in Shanghai registrierten Firma StepFun zurück. Bei der Agentic Performance liegt es vorn.
In der Speech Agent Arena, in der menschliche Nutzer im Blindtest immer aus zwei Modellen das ihrer Ansicht nach bessere auswählen, liegt Extended Thinking interessanterweise sieben Plätze hinter Live, und beide hinter ihrem Vorgängermodell Gemini 3.1 Flash Live Minimal. Auch bei der Zeit bis zur ersten Audioausgabe liegen sie bei diesem Ranking hinter ihrem Vorgänger zurück.
Rollout in Google-Produkten und Workspace
Die neue Version von Live steht Entwicklern über die Gemini API und Google AI Studio zur Verfügung und wird für Unternehmen zunächst als Preview in Gemini Enterprise angeboten. Für Endnutzer ist Gemini 3.8 Live in der Live Google-Suche verfügbar.
Gemini 3.8 Live Extended Thinking wird unter anderem in Gemini Live sowie für Google-AI-Abonnenten in Anwendungen wie Docs (nur für Pro und Ultra), Gmail und Keep verfügbar. Damit knüpft Google an die kürzlich gestartete KI-gestützte Sprachsteuerung in Workspace an. Unternehmen erhalten die Funktion zunächst in einer privaten Vorschau. Für Entwickler steht es auch über die API und in Google AI Studio zur Verfügung.
Alle von Googles KI-Produkten generierten Audioinhalte werden mit SynthID-Wasserzeichen versehen. Die nicht wahrnehmbaren Markierungen sollen maschinenlesbar nachweisbar bleiben – eine Maßnahme, die auch vor dem Hintergrund der seit dem 2. August 2026 geltenden Transparenzpflichten des EU AI Act (Artikel 50) relevant ist.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.