Zum Hauptinhalt springen
AudiomodellVorschau

MAI-Voice-2.1-Flash

Microsoft

Veröffentlicht
1. Oktober 2026
Datenstand
3. Oktober 2026

MAI-Voice-2.1-Flash ist die auf niedrige Latenz ausgelegte Variante der aktuellen Microsoft-Sprachsynthese. Sie unterstützt dieselben 23 Sprachen und 26 Locales und erzeugt bis zu 45 Sekunden Audio pro Generierung.

Microsoft nennt rund 150 Millisekunden Ende-zu-Ende-Latenz und 15 $ pro 1 Mio. Zeichen. Die Foundry-API-Kennung lautet mai-voice-2-1-flash. Der Zugang ist eine öffentliche Vorschau ohne SLA, die Gewichte sind nicht öffentlich.

Technische Daten und Zugang

AngabeWert und Quelle
Modellklasse
Schnelle SprachsyntheseQuelle
Zugang
Microsoft Foundry APIQuelle
Eingabe
TextQuelle
Ausgabe
AudioQuelle
API-Modellkennung
mai-voice-2-1-flashQuelle
Vorschau-Bedingungen
Öffentliche Vorschau ohne SLAQuelle
Sprachen
23 Sprachen und 26 LocalesQuelle
Latenz
Rund 150 Millisekunden Ende zu EndeQuelle
Generationslimit
Bis zu 45 Sekunden AudioQuelle