- Startseite
- KI-Modelle
- MAI-Transcribe-2-Streaming
MAI-Transcribe-2-Streaming
Microsoft
- Veröffentlicht
- 1. Oktober 2026
- Datenstand
- 3. Oktober 2026
- Modellklasse
- Zugang
MAI-Transcribe-2-Streaming nimmt laufendes Audio entgegen und liefert Echtzeit-Transkripte. Microsoft beschreibt kontinuierliche Spracherkennung für 60 Sprachen, sodass Sprachwechsel nicht erst am Ende einer Aufnahme aufgelöst werden müssen.
Die Variante ist als Vorschau über Microsoft Foundry verfügbar und nutzt die Kennung mai-transcribe-2-streaming. Der angekündigte Einführungspreis beträgt 0,54 $ pro Audiostunde bis Ende 2026.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Modellklasse | Streaming-SpracherkennungQuelle |
| Zugang | Microsoft Foundry APIQuelle |
| Eingabe | Laufendes AudioQuelle |
| Ausgabe | Streaming-TranskriptQuelle |
| API-Modellkennung | mai-transcribe-2-streamingQuelle |
| Sprachen | 60 Sprachen mit kontinuierlicher SpracherkennungQuelle |
| Streaming | Echtzeit-Transkription für laufende AudioeingabenQuelle |
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
Artificial Analysis final transcription WER (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 2.5
- Bewertung
- 2.5
- Messgröße
- word error rate
- Einheit
- %
- Kategorie
- audio
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- MAI-Transcribe-2-Streaming Model Card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AA-WER Streaming für die endgültige Transkription nach erkanntem Ende der Äußerung; Leaderboard-Snapshot vom 28. September 2026 in Microsofts Modellkarte, Seite 2. Veröffentlichte Evaluator-Methodik mit AA-AgentTalk 50 %, VoxPopuli-Cleaned-AA 25 % und Earnings22-Cleaned-AA 25 %; Wortfehlerrate innerhalb jedes Datensatzes nach Audiodauer gewichtet.
- Einordnung
- Microsoft zitiert ein Ergebnis von Artificial Analysis, dessen ursprünglicher Modelleintrag nicht direkt abgerufen wurde. Genaue Serving-Konfiguration, Stichprobengröße dieses Laufs, Benchmarkversion im Memo und Laufdatum fehlen. Das Snapshot-Datum ist kein Laufdatum; 60 unterstützte Sprachen belegen nicht die Sprachabdeckung des Tests.
Veröffentlichte Preise
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
- Einführungspreis
- 0,54 $ pro Audiostunde bis Ende 2026Quelle
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 4 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Nicht veröffentlicht | evaluation-protocol Originalwortlaut Modellkarte und Evaluator-Methodik belegen den endgültigen Transkriptionswert, das Snapshot-Datum und die Datensatzgewichtung. Genaue Serving-Konfiguration, laufbezogene Stichprobengröße, Laufdatum und ein direkt abgerufener Modelleintrag fehlen. |
| Weitere Quelle | Microsoft streaming transcription announcement (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Microsoft streaming transcription announcement · Redaktionelle Beschreibung geprüft am 3. Oktober 2026 |
| Weitere Quelle | Microsoft MAI-Transcribe-2 model page (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Microsoft MAI-Transcribe-2 model page · Redaktionelle Beschreibung geprüft am 3. Oktober 2026 |
| Weitere Quelle | MAI-Transcribe-2-Streaming Model Card (abgerufen 4. Oktober 2026) |
| Weitere Quelle | Modellmetadaten (abgerufen 4. Oktober 2026) |