The Daily Newsstand · Free, Always
Friday, October 2, 2026

Microsoft erweitert KI-Modellfamilie MAI um drei Audio-Modelle

Translate

Eigene große KI-Modelle hat Microsoft erst spät entwickelt – aber nicht, weil man das Thema in Redmond verschlafen hat, sondern ganz im Gegenteil: Der Windows-Hersteller setzte mehrere Jahre lang vor allem auf die Kooperation mit OpenAI. Inzwischen baut Microsoft mit der MAI-Familie eine eigene Modellreihe auf. Mit MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash kommen nun drei weitere Modelle hinzu, die Microsofts Ambitionen im Audio-Bereich unterstreichen.

Der Schwerpunkt der Veröffentlichung vom 1. Oktober liegt auf dem Bau von Voice-Agents. Dafür sollen die drei Modelle Echtzeit-Transkription und Sprachausgabe liefern.

MAI-Transcribe-2-Streaming ist das erste Streamingmodell der MAI-Familie. Es beherrscht 60 Sprachen und erkennt die gesprochene Sprache automatisch und fortlaufend – ein Sprachwechsel während der Transkription ist also möglich. Erste vorläufige Ergebnisse verspricht Microsoft nach gut 100 Millisekunden. Sobald mehr Kontext vorliegt, korrigiert das Modell diese Zwischenergebnisse. Auf der Benchmark-Plattform Artificial Analysis liegt das Modell bei der Genauigkeit auf Platz 1, sowohl bei finalen als auch bei vorläufigen Transkripten. Laut internen Messungen erscheinen Wörter im Transkript doppelt so schnell wie beim „engsten Konkurrenten“, den Microsoft nicht benennt. Bei der Genauigkeit folgt auf Artificial Analysis Grok Voice Transcribe 2.0 von xAI auf Platz 2.

Als mögliche Anwendungsfälle beschreibt Microsoft Voice-Agents, die schon mitten im Satz Reasoning anstoßen oder Tools aufrufen, sowie Live-Untertitel und Diktierfunktionen. Bis Ende des Jahres bietet Microsoft das Modell zum Einführungspreis von 0,54 US-Dollar (rund 48 Cent) pro Audiostunde an. Was es danach kostet, ist noch offen. Seine ersten Audio-Gehversuche unternahm Microsoft bereits im August 2025 mit dem Sprachgenerierungsmodell MAI-Voice-1.

Das Text-to-Speech-Modell MAI-Voice-2.1 beherrscht 23 Sprachen, kann ebenfalls während der laufenden Ausgabe zwischen Sprachen wechseln und soll laut Microsoft jeweils mit muttersprachlichem Akzent sprechen. In unseren Versuchen mit der Demo-App „Chatter“ im MAI Playground bestätigte sich das für die deutsche Sprachausgabe. Der Preis beträgt 22 US-Dollar pro 1 Million Zeichen.

Die Flash-Variante ist mit 15 US-Dollar pro 1 Million Zeichen günstiger, beherrscht die gleichen Sprachen und Stimmen und soll für 45 Sekunden Audio eine Ende-zu-Ende-Latenz von 150 Millisekunden schaffen. Damit wären recht flüssige Gespräche möglich. Microsoft positioniert Flash entsprechend für Echtzeit-Agents, Callcenter und Telefonmenüs, das teurere Modell dagegen für längere Inhalte wie Hörbücher, Podcasts und Voice-over, bei denen die Stimme über lange Passagen konsistent bleiben soll. Messbare Qualitätsunterschiede zwischen beiden Varianten nennt Microsoft nicht.

Beide Modelle sollen Stimmen in allen Sprachen klonen können. Dafür genügen laut Microsoft 5 bis 60 Sekunden Referenzaudio. Um Missbrauch zu verhindern, ist die Funktion zugangsbeschränkt: Entwickler müssen eine Prüfung durch Microsoft durchlaufen und eine Audio-Einwilligung der Person hochladen, deren Stimme geklont werden soll.

Verfügbar sind alle drei Modelle über Microsoft Foundry, den MAI Playground, Vercel und Azure Voice Live, die beiden Voice-Modelle zusätzlich über OpenRouter. Eine Integration in LiveKit soll folgen.

Microsofts Modellfamilie wächst schnell: Zuvor waren bereits MAI-Transcribe-2, MAI-Image-2.6, MAI-Thinking-1 und MAI-Code-1.1-Flash erschienen – Modelle, mit denen Microsoft unabhängiger von OpenAI wird. Ihre Zusammenarbeit haben beide Unternehmen im Oktober 2025 mit veränderten Partnerschaftsregeln neu aufgestellt. MAI-Code-1.1-Flash steckt bereits in GitHub Copilot und VS Code. Für den Security-Bereich hat Microsoft zudem mit MAI-Cyber-1-Flash ein spezialisiertes Modell zur automatisierten Schwachstellensuche vorgestellt. Unklar bleibt, wann und wie die neuen Audio-Modelle in Microsoft-Produkte wie Copilot, Teams oder Windows einfließen. Echtzeit-Spracherkennung bietet Microsoft über Azure Speech in Foundry Tools zwar schon lange an, mit dem eigenen Streamingmodell tritt der Konzern nun aber direkt gegen spezialisierte Anbieter an. In diesem Markt konkurrieren unter anderem ElevenLabs, Deepgram, AssemblyAI, Google, OpenAI und xAI.

View the original on heise online →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.