Code MigrationOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 14,228 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
CorpFin v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 59,907 % | | Vals AIQuellendetailsDatenstand: 12.08.2026 |
EMBOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 55,092 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Finance Agent (v2)OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 36,728 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 81,566 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besser | 1,667 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Legal Research BenchOverall · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besser | 9,135 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 77,129 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LiveCodeBench v6OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 81,354 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMiMo-V2.5: Stilbereinigte Arena-Bewertung aus 44.540 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 57.416 anonymen Paarvergleichen. | 1.433,798 95-%-Konfidenzintervall: ±4,342Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 95-%-Konfidenzintervall: ±3,92Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MedCodeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 31,895 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
MedScribeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 72,151 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 82,931 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
ProofBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | 16 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 71 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | 71,832 % | | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besser | | 57,303 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Vals IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: weighted index scoreBewertung: Mehr ist besser | 39,91 % | | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Vibe Code Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | | 34,113 % | Vals AIQuellendetailsDatenstand: 03.09.2026 |
Code MigrationCLITestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 9,88 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Exact PagesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 59,441 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)AdjustmentsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 31,746 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
GPQA DiamondFew-Shot CoTTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 79,798 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LegalBenchConclusion TasksTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 86,386 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LiveCodeBench v6EasyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 98,447 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMiMo-V2.5: Stilbereinigte Arena-Bewertung aus 9.127 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 11.336 anonymen Paarvergleichen. | 1.441,542 95-%-Konfidenzintervall: ±7,42Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 95-%-Konfidenzintervall: ±6,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MMLU-ProBiologyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 90,237 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SWE-bench Verified<15 min fixTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 80,928 % | | Vals AIQuellendetailsDatenstand: 08.08.2026 |
TaxEval v2CorrectnessTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 60,752 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Terminal-Bench 2.1EasyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 75 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Vals IndexCorpFin v2TestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 60,14 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Code MigrationCOBOLTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 27,273 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Max Fitting ContextTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 60,14 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)All-PassTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 23,785 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
GPQA DiamondZero-Shot CoTTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 83,333 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LegalBenchInterpretation TasksTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 74,351 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LiveCodeBench v6HardTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 58,571 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMiMo-V2.5: Stilbereinigte Arena-Bewertung aus 2.140 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 3.151 anonymen Paarvergleichen. | 1.483,45 95-%-Konfidenzintervall: ±13,352Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 95-%-Konfidenzintervall: ±11,287Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MMLU-ProBusinessTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 89,227 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SWE-bench Verified>4 hoursTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 0 % | | Vals AIQuellendetailsDatenstand: 08.08.2026 |
TaxEval v2Stepwise ReasoningTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 82,911 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Terminal-Bench 2.1HardTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 36,667 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Vals IndexFinance Agent v2TestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 37,61 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Code MigrationCode QualityTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: mean reviewer code-quality ratingBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 2,788 / 5 | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Shared Max ContextTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 60,14 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)ComparablesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 31,672 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
LegalBenchIssue TasksTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 80,173 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LiveCodeBench v6MediumTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 86,423 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMiMo-V2.5: Stilbereinigte Arena-Bewertung aus 12.854 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 15.755 anonymen Paarvergleichen. | 1.491,02 95-%-Konfidenzintervall: ±6,676Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 95-%-Konfidenzintervall: ±6,131Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MMLU-ProChemistryTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 89,841 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SWE-bench Verified1-4 hoursTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | | Vals AIQuellendetailsDatenstand: 08.08.2026 |
Terminal-Bench 2.1MediumTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 65,455 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Vals IndexSWE-benchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besser | 64,706 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Finance Agent (v2)Disclosure AnalysisTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 47,346 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
LegalBenchRhetoric TasksTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 64,964 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMiMo-V2.5: Stilbereinigte Arena-Bewertung aus 7.343 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 10.262 anonymen Paarvergleichen. | 1.392,817 95-%-Konfidenzintervall: ±8,004Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 95-%-Konfidenzintervall: ±7,065Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MMLU-ProComputer ScienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 86,585 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SWE-bench Verified15 min - 1 hourTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 70,498 % | | Vals AIQuellendetailsDatenstand: 08.08.2026 |
Vals IndexTerminal-Bench 2.1TestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 57,303 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Finance Agent (v2)Earnings AnalysisTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 45,006 % | | Vals AIQuellendetailsDatenstand: 06.08.2026 |
LegalBenchRule TasksTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 69,582 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserMiMo-V2.5: Snapshot: mimo-v2.5, Harness: Arena text, style control MiMo-V2.5-Pro: Snapshot: mimo-v2.5-pro, Harness: Arena text, style controlMiMo-V2.5: Stilbereinigte Arena-Bewertung aus 20.213 anonymen Paarvergleichen.MiMo-V2.5-Pro: Stilbereinigte Arena-Bewertung aus 24.800 anonymen Paarvergleichen. | 1.452,388 95-%-Konfidenzintervall: ±5,607Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 95-%-Konfidenzintervall: ±5,077Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 01.09.2026 |
MMLU-ProEconomicsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | 86,73 % | | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Vals IndexVibe Code BenchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserEinstellungen: Temperatur: 1, Top P: 0.95, Ausgabegrenze: 128.000 tokens | | 36,321 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |