- Startseite
- KI-Modelle
- MAI-Thinking-1
SprachmodellVorschau
MAI-Thinking-1
Microsoft AI
- Veröffentlicht
- 12. August 2026
- Datenstand
- 3. Oktober 2026
MAI-Thinking-1 wurde laut Microsoft ohne Destillation von Modellen anderer Anbieter trainiert. Microsoft setzt stattdessen auf eigene nachvollziehbare Trainingsdaten und ausführbare Coding-Umgebungen, in denen echte Tests die Ergebnisse bewerten. Das MoE-Modell aktiviert 35 Milliarden von rund 1 Billion Parametern.
Seit dem 12. August 2026 ist es als öffentliche Vorschau in Microsoft Foundry zugänglich. Microsoft nennt ein Kontextfenster von 256K Token.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Veröffentlichung | 12. August 2026Quelle |
| Zugang | Öffentliche Vorschau in Microsoft FoundryQuelle |
| Schwerpunkt | Reasoning für Mathematik, Wissen und CodingQuelle |
| Parameter | Rund 1 Billion insgesamt laut Microsoft, 35 Milliarden aktiv (Mixture of Experts)Quelle |
| Kontextfenster | 256K Token laut MicrosoftQuelle |
| Funktionen | Funktionsaufrufe, Entwickleranweisungen und Chat-Completions-kompatible APIQuelle |
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
AIME 2025 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 97
- Bewertung
- 97
- Messgröße
- AIME 2025
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
AIME 2026 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 94.5
- Bewertung
- 94.5
- Messgröße
- AIME 2026
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
HMMT Feb 2026 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 84.9
- Bewertung
- 84.9
- Messgröße
- HMMT Feb 2026
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
GPQA Diamond (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 84.2
- Bewertung
- 84.2
- Messgröße
- GPQA Diamond
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
LCB v6 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 87.7
- Bewertung
- 87.7
- Messgröße
- LCB v6
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Terminal Bench 2.0 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 46
- Bewertung
- 46
- Messgröße
- Terminal Bench 2.0
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
SWE-Bench Verified (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 73.5
- Bewertung
- 73.5
- Messgröße
- SWE-Bench Verified
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
SWE-Bench Pro (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 52.8
- Bewertung
- 52.8
- Messgröße
- SWE-Bench Pro
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Microsoft announcement Table 1 pixels
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Post-trained model evaluation; percentages. Agentic coding uses 256K total context; others max output 256K. Separate blind human preference study has 1,276 tasks.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 1 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Weitere Quelle | Microsoft AI MAI-Thinking-1 announcement (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Microsoft AI MAI-Thinking-1 announcement · Redaktionelle Beschreibung geprüft am 4. Oktober 2026 |