Kurzfassung: Microsoft hat MAI-Transcribe-2-Streaming sowie MAI-Voice-2.1 und die schnellere Flash-Variante veröffentlicht. Ein unabhängiger Test stützt den Genauigkeits-Spitzenplatz der Transkription. Für komplette Voice-Agenten bleiben jedoch Denkzeit, Werkzeugaufrufe und mehrere fehlende ASR-Funktionen außerhalb dieses Benchmarks.
Streaming in 60 Sprachen
MAI-Transcribe-2-Streaming liefert während des Sprechens vorläufige Hypothesen und ersetzt sie anschließend durch stabile Segmente. Microsoft nennt 60 Sprachen, automatische fortlaufende Spracherkennung und einen Einführungspreis von 0,54 US-Dollar je Audiostunde bis Jahresende. Das Modell ist als Preview in Microsoft Foundry verfügbar.
Artificial Analysis führt das Modell bei der Genauigkeit sowohl für das erste Teiltranskript als auch für das finale Transkript auf Rang eins. Der Test umfasst rund acht Stunden aus Gesprächs-, Parlaments- und Earnings-Audio; gemessen wird die Ausgabe nach einem automatisch erkannten Sprechende. Das macht den Vergleich reproduzierbarer, ist aber kein Beleg für dieselbe Fehlerrate bei Telefonrauschen, Fachbegriffen oder kundeneigenen Akzenten.
Wichtige Betriebsfunktionen fehlen laut Microsofts Modellübersicht derzeit: Sprechertrennung, Wort-Zeitstempel und kontextuelle Stichwortvorgaben werden nicht unterstützt. Gerade Kontaktcenter benötigen dafür zusätzliche Komponenten oder müssen auf spätere Versionen warten.
Zwei Ausgabemodelle mit verschiedenen Latenzbegriffen
MAI-Voice-2.1 kostet 22 Dollar je Million Zeichen und nennt etwa 550 Millisekunden Modellinferenz. Voice-2.1-Flash kostet 15 Dollar und nennt rund 45 Millisekunden Inferenz; Microsoft beschreibt zusätzlich 150 Millisekunden Ende-zu-Ende-Latenz für 45 Sekunden erzeugtes Audio. Diese Werte messen unterschiedliche Abschnitte und dürfen nicht direkt mit der Zeit bis zum ersten Transkript verglichen werden.
Beide Stimmen unterstützen nach Ankündigung 23 Sprachen. Bei den Regionen ist Microsofts Dokumentation nicht konsistent: Der Blog nennt 26 Locales, die Produktseite listet 28 regionale Einträge. Die Modellkarte beschreibt Voice-Cloning aus fünf bis 60 Sekunden Referenzaudio; der Zugang ist genehmigungspflichtig und an Einwilligungs-Schutzmechanismen gebunden.
Pandorex Analyse: schneller Audio-Rand, nicht der ganze Agent
Microsoft senkt die Latenz an Ein- und Ausgabe und kann dadurch bereits mit vorläufigem Text Rechenarbeit anstoßen. Die eigentliche Gesprächsdauer hängt aber weiterhin vom Sprachende-Erkenner, dem Reasoning-Modell, Werkzeugen, Netzwerk und der Audioausgabe ab. Außerdem können sich Teiltranskripte ändern. Für irreversible Aktionen sollten Agenten deshalb auf stabile Segmente oder eine Bestätigung warten.
Der belastbare Fortschritt liegt in einem gemeinsam angebotenen Audio-Stack mit unabhängig gestützter ASR-Genauigkeit. Die Aussage, damit entstehe automatisch ein verzögerungsfreier Voice-Agent, wäre dagegen nicht belegt.
