Code MigrationOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 26,201 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
CorpFin v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 61,383 % | Vals AIQuellendetailsDatenstand: 12.08.2026 |
CyberBench v1.1PatchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 79,661 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
EMBOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 51,623 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Finance Agent (v2)OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 44,083 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
GPQA DiamondOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 89,394 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besser | | 3,75 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
IOIIOI 2024TestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: max, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 31,333 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Legal Research BenchOverall · All-passTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besser | | 23,077 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
LegalBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 80,323 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
LiveCodeBench v6OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 87,484 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 55.063 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 54.884 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±3,89Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.454,675 95-%-Konfidenzintervall: ±3,973Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
MedCodeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 40,455 % | Vals AIQuellendetailsDatenstand: 26.09.2026 |
MedScribeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 75,144 % | Vals AIQuellendetailsDatenstand: 26.09.2026 |
MMLU-ProOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 87,249 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
ProgramBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 0 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
ProofBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 16 % | Vals AIQuellendetailsDatenstand: 28.09.2026 |
Public Benefits Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besser | | 62,923 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
SkillsBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | | 51,274 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
SWE-bench VerifiedOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 77,4 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Tax Agent BenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | | 58,499 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
TaxEval v2OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: accuracyBewertung: Mehr ist besser | | 72,077 % | Vals AIQuellendetailsDatenstand: 01.09.2026 |
Terminal-Bench 2.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besser | | 50,187 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Vals IndexOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2Messgröße: weighted index scoreBewertung: Mehr ist besser | | 42,888 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Vibe Code Bench v1.1OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1.1Messgröße: accuracyBewertung: Mehr ist besserEinstellungen: Harness: OpenHands | | 49,931 % | Vals AIQuellendetailsDatenstand: 27.09.2026 |
Code MigrationCLITestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 15,47 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Exact PagesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 59,207 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
CyberBench v1.1PoCTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 0 % | | Vals AIQuellendetailsDatenstand: 03.08.2026 |
EMBCompsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 57,434 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)AdjustmentsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: max, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 41,586 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
GPQA DiamondFew-Shot CoTTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 90,404 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Harvey's Legal Agent BenchmarkAntitrust Competition · Criteria passedTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: criteria pass rateBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 83,696 % | Vals AIQuellendetailsDatenstand: 07.08.2026 |
IOIIOI 2025TestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: max, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 40,333 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Legal Research BenchAdministrative / Regulatory · All-passTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: all-pass rateBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 28,788 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
LegalBenchConclusion TasksTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 89,117 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LiveCodeBench v6EasyTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 98,758 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 10.655 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.076 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±7,021Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.448,077 95-%-Konfidenzintervall: ±6,825Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
MMLU-ProBiologyTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 92,887 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
ProgramBenchAlmost ResolvedTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 0 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SkillsBenchNo SkillsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: max, Harness: OpenHands, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Reasoning: max, Harness: OpenHands, Ausgabegrenze: 384.000 tokens | | 27,226 % | Vals AIQuellendetailsDatenstand: 07.08.2026 |
SWE-bench Verified<15 min fixTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 87,629 % | Vals AIQuellendetailsDatenstand: 08.08.2026 |
TaxEval v2CorrectnessTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 60,589 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Terminal-Bench 2.1EasyTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: high, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Ausgabegrenze: 128.000 tokens | | 66,667 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Vals IndexCorpFin v2TestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 61,888 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Code MigrationCOBOLTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 58,393 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Max Fitting ContextTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 63,054 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
EMBDataroomTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 62,572 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Finance Agent (v2)All-PassTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: max, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 31,448 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
GPQA DiamondZero-Shot CoTTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 88,384 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Harvey's Legal Agent BenchmarkAntitrust Competition · Task fully resolvedTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: task resolution rateBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | | Vals AIQuellendetailsDatenstand: 07.08.2026 |
Legal Research BenchAdministrative / Regulatory · Weighted partial creditTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: weighted partial-credit scoreBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 83,372 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
LegalBenchInterpretation TasksTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 75,169 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LiveCodeBench v6HardTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 72,571 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserClaude Opus 5: Snapshot: claude-opus-5-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style controlClaude Opus 5: Stilbereinigte Arena-Bewertung aus 4.449 anonymen Paarvergleichen.DeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.360 anonymen Paarvergleichen. | 95-%-Konfidenzintervall: ±10,016Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.499,718 95-%-Konfidenzintervall: ±10,912Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 25.09.2026 |
MMLU-ProBusinessTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 91,888 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
ProgramBenchFully ResolvedTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 0 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
SkillsBenchWith SkillsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: max, Harness: OpenHands, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Reasoning: max, Harness: OpenHands, Ausgabegrenze: 384.000 tokens | | 51,274 % | Vals AIQuellendetailsDatenstand: 07.08.2026 |
SWE-bench Verified>4 hoursTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 256.000 tokens | | 0 % | Vals AIQuellendetailsDatenstand: 08.08.2026 |
TaxEval v2Stepwise ReasoningTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 83,565 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Terminal-Bench 2.1HardTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2.1Messgröße: accuracyBewertung: Mehr ist besserClaude Opus 5: Compute: high, Temperatur: 1, Ausgabegrenze: 128.000 tokens DeepSeek-V4-Pro: Ausgabegrenze: 128.000 tokens | | 31,111 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
Vals IndexFinance Agent v2TestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1.2Messgröße: benchmark scoreBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 44,081 % | Vals AIQuellendetailsDatenstand: 09.08.2026 |
Code MigrationCode QualityTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: mean reviewer code-quality ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 3,401 / 5 | Vals AIQuellendetailsDatenstand: 09.08.2026 |
CorpFin v2Shared Max ContextTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 2Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 128.000 tokens | | 61,888 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |
EMBDCFTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1Messgröße: accuracyBewertung: Mehr ist besserDeepSeek-V4-Pro: Reasoning: max, Ausgabegrenze: 384.000 tokens | | 44,435 % | Vals AIQuellendetailsDatenstand: 06.08.2026 |