Zum Hauptinhalt springen
AudiomodellVorschau

MAI-Transcribe-1.5

Microsoft

Veröffentlicht
2. Juni 2026
Datenstand
3. Oktober 2026
Modellklasse
Sprachen

MAI-Transcribe-1.5 ist ein Microsoft-Speech-to-Text-Modell für 43 Sprachen. Keyword-Biasing hilft bei Fachbegriffen, und Microsoft nennt bis zu fünffach höhere Geschwindigkeit als bei vergleichbaren Modellen.

Der Endpunkt nimmt Audio entgegen und liefert Text. Der Foundry-Zugang ist eine öffentliche Vorschau ohne SLA. Microsoft nennt 0,36 $ pro Audiostunde. Das Modell ist für Transkription und nicht für Sprachsynthese oder Audio-zu-Audio-Dialoge vorgesehen.

Technische Daten und Zugang

AngabeWert und Quelle
Modellklasse
SpracherkennungQuelle
Zugang
Microsoft Foundry APIQuelle
Eingabe
AudioQuelle
Ausgabe
TranskriptQuelle
API-Modellkennung
mai-transcribe-1.5Quelle
Vorschau-Bedingungen
Öffentliche Vorschau ohne SLAQuelle
Sprachen
43 SprachenQuelle
Funktionen
Keyword-Biasing und bis zu fünffach höhere Geschwindigkeit als vergleichbare ModelleQuelle