Code MigrationOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 16.099 % | Vals AISource detailsData as of: 09/27/2026 |
CyberBench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | 43.75 % | | Vals AISource detailsData as of: 09/27/2026 |
EMBOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 66.399 % | Vals AISource detailsData as of: 09/27/2026 |
Finance Agent (v2)OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 54.36 % | Vals AISource detailsData as of: 09/27/2026 |
GPQA DiamondOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 92.929 % | Vals AISource detailsData as of: 09/01/2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTest detailsNo documented difference in the test setupVersion: 1Metric: task resolution rateScoring: Higher is better | 8.75 % | | Vals AISource detailsData as of: 09/27/2026 |
IOIOverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 48.944 % | Vals AISource detailsData as of: 09/27/2026 |
Legal Research BenchOverall · All-passTest detailsNo documented difference in the test setupVersion: 1Metric: all-pass rateScoring: Higher is better | 34.615 % | | Vals AISource detailsData as of: 09/27/2026 |
LegalBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 86.016 % | Vals AISource detailsData as of: 09/27/2026 |
LiveCodeBench v6OverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 87.185 % | Vals AISource detailsData as of: 09/01/2026 |
MedCodeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 48.884 % | Vals AISource detailsData as of: 09/26/2026 |
MedScribeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 83.942 % | | Vals AISource detailsData as of: 09/26/2026 |
MMLU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 87.973 % | Vals AISource detailsData as of: 09/01/2026 |
MMMU-ProOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 88.15 % | Vals AISource detailsData as of: 09/01/2026 |
MortgageTaxOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 66.336 % | Vals AISource detailsData as of: 09/01/2026 |
ProgramBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 0 % | | Vals AISource detailsData as of: 09/27/2026 |
ProofBenchOverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | 58 % | | Vals AISource detailsData as of: 09/28/2026 |
SAGEOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 49.232 % | | Vals AISource detailsData as of: 09/26/2026 |
SWE-bench VerifiedOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 80.8 % | | Vals AISource detailsData as of: 09/01/2026 |
Tax Agent BenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | 57.665 % | | Vals AISource detailsData as of: 09/27/2026 |
TaxEval v2OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | 74.734 % | | Vals AISource detailsData as of: 09/01/2026 |
Terminal-Bench 2.1OverallTest detailsNo documented difference in the test setupVersion: 2.1Metric: accuracyScoring: Higher is better | 77.528 % | | Vals AISource detailsData as of: 09/27/2026 |
Terminal-Bench 4.0OverallTest detailsNo documented difference in the test setupVersion: 4.0Metric: accuracyScoring: Higher is better | 6.061 % | | Vals AISource detailsData as of: 09/27/2026 |
Terminal-Bench ScienceOverallTest detailsNo documented difference in the test setupVersion: 0.1Metric: accuracyScoring: Higher is better | | 2.857 % | Vals AISource detailsData as of: 09/27/2026 |
Vals IndexOverallTest detailsNo documented difference in the test setupVersion: 2Metric: weighted index scoreScoring: Higher is better | | 57.813 % | Vals AISource detailsData as of: 09/27/2026 |
Vibe Code Bench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | 70.395 % | | Vals AISource detailsData as of: 09/27/2026 |