BioMysteryBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is betterSettings: Harness: Terminus 2 | | 61.481 % | Vals AISource detailsData as of: 09/22/2026 |
Code MigrationOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 42.554 % | Vals AISource detailsData as of: 09/22/2026 |
EMBOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 68.515 % | Vals AISource detailsData as of: 09/22/2026 |
Finance Agent (v2)OverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 49.873 % | Vals AISource detailsData as of: 09/22/2026 |
Harvey's Legal Agent BenchmarkOverall · Task fully resolvedTest detailsNo documented difference in the test setupVersion: 1Metric: task resolution rateScoring: Higher is better | | 2.917 % | Vals AISource detailsData as of: 09/22/2026 |
IOIOverallTest detailsNo documented difference in the test setupVersion: 2Metric: accuracyScoring: Higher is better | | 55.556 % | Vals AISource detailsData as of: 09/22/2026 |
Legal Research BenchOverall · All-passTest detailsNo documented difference in the test setupVersion: 1Metric: all-pass rateScoring: Higher is better | | 30.288 % | Vals AISource detailsData as of: 09/22/2026 |
MedCodeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 44.685 % | Vals AISource detailsData as of: 09/22/2026 |
MedScribeOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 83.71 % | Vals AISource detailsData as of: 09/22/2026 |
MysteryMechanismOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 19.369 % | Vals AISource detailsData as of: 09/22/2026 |
ProgramBenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 0.5 % | Vals AISource detailsData as of: 09/22/2026 |
ProofBenchOverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | | 64 % | Vals AISource detailsData as of: 09/22/2026 |
Public Benefits Bench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is better | | 57.645 % | Vals AISource detailsData as of: 09/22/2026 |
SAGEOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 48.091 % | Vals AISource detailsData as of: 09/22/2026 |
Tax Agent BenchOverallTest detailsNo documented difference in the test setupVersion: 1Metric: accuracyScoring: Higher is better | | 58.864 % | Vals AISource detailsData as of: 09/22/2026 |
Terminal-Bench 2.1OverallTest detailsNo documented difference in the test setupVersion: 2.1Metric: accuracyScoring: Higher is better | | 73.034 % | Vals AISource detailsData as of: 09/22/2026 |
Vals IndexOverallTest detailsNo documented difference in the test setupVersion: 2Metric: weighted index scoreScoring: Higher is better | | 58.45 % | Vals AISource detailsData as of: 09/22/2026 |
Vibe Code Bench v1.1OverallTest detailsNo documented difference in the test setupVersion: 1.1Metric: accuracyScoring: Higher is betterSettings: Harness: OpenHands | | 81.649 % | Vals AISource detailsData as of: 09/22/2026 |