Pandorex
DEEN
KI & Chips

Microsoft koppelt Streaming-Transkription und neue Stimmen für Voice-Agenten

Veröffentlicht Pandorex Redaktion·2 min Lesezeit
—
Illustration: Sprache fließt vom Mikrofon über vorläufige und stabile Transkripte in einen violetten KI-Prozessor und durch ein geschütztes Stimmtor zum Lautsprecher.
Redaktionelle Illustration · Pandorex

Kurzfassung: Microsoft hat MAI-Transcribe-2-Streaming sowie MAI-Voice-2.1 und die schnellere Flash-Variante veröffentlicht. Ein unabhängiger Test stützt den Genauigkeits-Spitzenplatz der Transkription. Für komplette Voice-Agenten bleiben jedoch Denkzeit, Werkzeugaufrufe und mehrere fehlende ASR-Funktionen außerhalb dieses Benchmarks.

Streaming in 60 Sprachen

MAI-Transcribe-2-Streaming liefert während des Sprechens vorläufige Hypothesen und ersetzt sie anschließend durch stabile Segmente. Microsoft nennt 60 Sprachen, automatische fortlaufende Spracherkennung und einen Einführungspreis von 0,54 US-Dollar je Audiostunde bis Jahresende. Das Modell ist als Preview in Microsoft Foundry verfügbar.

Artificial Analysis führt das Modell bei der Genauigkeit sowohl für das erste Teiltranskript als auch für das finale Transkript auf Rang eins. Der Test umfasst rund acht Stunden aus Gesprächs-, Parlaments- und Earnings-Audio; gemessen wird die Ausgabe nach einem automatisch erkannten Sprechende. Das macht den Vergleich reproduzierbarer, ist aber kein Beleg für dieselbe Fehlerrate bei Telefonrauschen, Fachbegriffen oder kundeneigenen Akzenten.

Wichtige Betriebsfunktionen fehlen laut Microsofts Modellübersicht derzeit: Sprechertrennung, Wort-Zeitstempel und kontextuelle Stichwortvorgaben werden nicht unterstützt. Gerade Kontaktcenter benötigen dafür zusätzliche Komponenten oder müssen auf spätere Versionen warten.

Zwei Ausgabemodelle mit verschiedenen Latenzbegriffen

MAI-Voice-2.1 kostet 22 Dollar je Million Zeichen und nennt etwa 550 Millisekunden Modellinferenz. Voice-2.1-Flash kostet 15 Dollar und nennt rund 45 Millisekunden Inferenz; Microsoft beschreibt zusätzlich 150 Millisekunden Ende-zu-Ende-Latenz für 45 Sekunden erzeugtes Audio. Diese Werte messen unterschiedliche Abschnitte und dürfen nicht direkt mit der Zeit bis zum ersten Transkript verglichen werden.

Beide Stimmen unterstützen nach Ankündigung 23 Sprachen. Bei den Regionen ist Microsofts Dokumentation nicht konsistent: Der Blog nennt 26 Locales, die Produktseite listet 28 regionale Einträge. Die Modellkarte beschreibt Voice-Cloning aus fünf bis 60 Sekunden Referenzaudio; der Zugang ist genehmigungspflichtig und an Einwilligungs-Schutzmechanismen gebunden.

Pandorex Analyse: schneller Audio-Rand, nicht der ganze Agent

Microsoft senkt die Latenz an Ein- und Ausgabe und kann dadurch bereits mit vorläufigem Text Rechenarbeit anstoßen. Die eigentliche Gesprächsdauer hängt aber weiterhin vom Sprachende-Erkenner, dem Reasoning-Modell, Werkzeugen, Netzwerk und der Audioausgabe ab. Außerdem können sich Teiltranskripte ändern. Für irreversible Aktionen sollten Agenten deshalb auf stabile Segmente oder eine Bestätigung warten.

Der belastbare Fortschritt liegt in einem gemeinsam angebotenen Audio-Stack mit unabhängig gestützter ASR-Genauigkeit. Die Aussage, damit entstehe automatisch ein verzögerungsfreier Voice-Agent, wäre dagegen nicht belegt.

Quellen und Nachweise

Quellen für die Fakten und den Kontext dieses Artikels.

  1. Microsoft AI, 01.10.2026: Our first streaming transcription model debuts at no. 1 on Artificial Analysismicrosoft.ai
  2. Microsoft AI: MAI-Transcribe-2 Modelübersichtmicrosoft.ai
  3. Microsoft AI: MAI-Voice-2.1 Modelübersichtmicrosoft.ai
  4. Microsoft AI: MAI-Voice-2.1 Model Cardmicrosoft.ai
  5. Microsoft Learn: MAI-Voice in Azure Speechlearn.microsoft.com
  6. Artificial Analysis: Speech to Text Streaming Leaderboard und Methodikartificialanalysis.ai

So recherchiert und korrigiert Pandorex

Kommentare

Melde dich an, um einen Kommentar zu schreiben.

Nach oben swipen
Nächster Artikel

Gemini 4 Argon: Eine Million Ausgabetokens, aber noch kein öffentlicher Start

KI & Chips