Code MigrationOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 26.201 % | Vals AISource detailsData as of: 09/27/2026 |
EMBOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 51.623 % | Vals AISource detailsData as of: 09/27/2026 |
Finance Agent (v2)OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 44.083 % | Vals AISource detailsData as of: 09/27/2026 |
GPQA DiamondOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 89.394 % | Vals AISource detailsData as of: 09/01/2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTest detailsNo documented difference in the test setupVersion: 1Metric: task resolution rateScoring: Higher is better | | 3.75 % | Vals AISource detailsData as of: 09/27/2026 |
Legal Research BenchOverall · All-passTest detailsNo documented difference in the test setupVersion: 1Metric: all-pass rateScoring: Higher is better | | 23.077 % | Vals AISource detailsData as of: 09/27/2026 |
LegalBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 80.323 % | Vals AISource detailsData as of: 09/27/2026 |
LiveCodeBench v6OverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 87.484 % | Vals AISource detailsData as of: 09/01/2026 |
MedCodeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 40.455 % | Vals AISource detailsData as of: 09/26/2026 |
MedScribeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 75.144 % | Vals AISource detailsData as of: 09/26/2026 |
MMLU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 87.249 % | Vals AISource detailsData as of: 09/01/2026 |
ProgramBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | | Vals AISource detailsData as of: 09/27/2026 |
ProofBenchOverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | | 16 % | Vals AISource detailsData as of: 09/28/2026 |
SkillsBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 51.274 % | Vals AISource detailsData as of: 09/27/2026 |
SWE-bench VerifiedOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 77.4 % | Vals AISource detailsData as of: 09/01/2026 |
Tax Agent BenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 57.665 % | | Vals AISource detailsData as of: 09/27/2026 |
TaxEval v2OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 72.077 % | Vals AISource detailsData as of: 09/01/2026 |
Terminal-Bench 2.1OverallTest detailsNo documented difference in the test setupVersion: 2.1Metric: accuracyScoring: Higher is better | | 50.187 % | Vals AISource detailsData as of: 09/27/2026 |
Vals IndexOverallTest detailsNo documented difference in the test setupVersion: 2Metric: weighted index scoreScoring: Higher is better | | 42.888 % | Vals AISource detailsData as of: 09/27/2026 |
Vibe Code Bench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 49.931 % | Vals AISource detailsData as of: 09/27/2026 |