- Startseite
- KI-Modelle
- AREX-2
SprachmodellOffene Gewichte
AREX-2
BAAI
- Veröffentlicht
- -
- Datenstand
- 3. Oktober 2026
AREX-2 lernt, einen Lösungsversuch über mehrere Runden zu verbessern. BAAI trainiert den 27B-Checkpoint auf einen Ablauf aus Vorschlag, Messung, Reflexion und Überarbeitung. Verifizierbares Feedback aus Machine-Learning- und Programmieraufgaben soll diese Arbeitsweise auch auf Deep Research übertragen.
Das multimodale Modell ist unter Apache 2.0 mit offenen Gewichten verfügbar. BAAI dokumentiert eine lokale Transformers-Bereitstellung.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Modellkennung | BAAI/AREX-2Quelle |
| Modellklasse | Multimodales Agentenmodell für lang laufende AufgabenQuelle |
| Parameter | 27 MilliardenQuelle |
| Kontextfenster | 262.144 TokenQuelle |
| Architektur | Dichtes multimodales Modell mit Qwen3.8-kompatibler ArchitekturQuelle |
| Zugang | Lokale Gewichte mit TransformersQuelle |
| Lizenz | Apache 2.0Quelle |
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
Frontier-CS (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 70.7
- Bewertung
- 70.7
- Messgröße
- Frontier-CS reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AREX technical report. Agent loop, tool/skills context, 5-12 hour task budgets; MLE score is mean over three seeds.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
MLE-Lite (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 81.8
- Bewertung
- 81.8
- Messgröße
- MLE-Lite reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AREX technical report. Agent loop, tool/skills context, 5-12 hour task budgets; MLE score is mean over three seeds.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
BrowseComp (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 84
- Bewertung
- 84
- Messgröße
- BrowseComp reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AREX technical report. Agent loop, tool/skills context, 5-12 hour task budgets; MLE score is mean over three seeds.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
HLE text-only (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 52.6
- Bewertung
- 52.6
- Messgröße
- HLE text-only reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AREX technical report. Agent loop, tool/skills context, 5-12 hour task budgets; MLE score is mean over three seeds.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
GAIA (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 92.2
- Bewertung
- 92.2
- Messgröße
- GAIA reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AREX technical report. Agent loop, tool/skills context, 5-12 hour task budgets; MLE score is mean over three seeds.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
DeepSearchQA F1 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 93.8
- Bewertung
- 93.8
- Messgröße
- DeepSearchQA F1 reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Technical report
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. AREX technical report. Agent loop, tool/skills context, 5-12 hour task budgets; MLE score is mean over three seeds.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 1 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Weitere Quelle | AREX-2 model card (abgerufen 3. Oktober 2026) · AREX-2 model card · Redaktionelle Beschreibung geprüft am 4. Oktober 2026 |
| Weitere Quelle | Technical report (abgerufen 4. Oktober 2026) |