- Startseite
- KI-Modelle
- Mercury 2.5
Mercury 2.5
Inception
- Veröffentlicht
- 8. September 2026
- Datenstand
- 3. Oktober 2026
Neu an Mercury 2.5 ist unter anderem das 260K-Kontextfenster, gegenüber 128K bei Mercury 2. Inception behält den Diffusionsansatz bei und nennt für die neue Version 1.107 Token pro Sekunde auf NVIDIA-GPUs. Diese Geschwindigkeit stammt aus der Herstellermessung.
Inception hat das Training anhand von Kundenfeedback und Fehlern im Produktionseinsatz überarbeitet. Mercury 2.5 erzeugt Text und ist über die Inception API, Baseten und OpenRouter verfügbar.
Technische Daten und Zugang
Seite 1 von 2
Veröffentlichte Benchmarks
Programmieren
Code Migration
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-code-migration:1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 57
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 997.717. Kosten je Aufgabe in USD: 0.627223. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-code-migration-2026-09-29-f0b317d5bed3. Prüfsumme der Quelldaten: f0b317d5bed3a2654a9ea39762d5e57f4649306adce3e6103e845ee1b9b94add. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
IOI
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-ioi:2:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 28
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 242.94. Kosten je Aufgabe in USD: 0.160874. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-ioi-2026-09-29-14c4f2dcc872. Prüfsumme der Quelldaten: 14c4f2dcc872d5e07bce234aebe4932202931d7f5b05f9bcd02e7695b5664750. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
CyberBench v1.1
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-cyberbench:1.1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 29
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 1139.168. Kosten je Aufgabe in USD: 0.12462. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-cyber-2026-09-29-36ddb5f67bc8. Prüfsumme der Quelldaten: 36ddb5f67bc8725a7ff9d1cc1349f89d29e0e907ad313eb5ac277b42b3d275e1. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Finanzen
EMB
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-emb:1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 54
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 301.681. Kosten je Aufgabe in USD: 0.419811. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-emb-2026-09-29-90535b2fd4dc. Prüfsumme der Quelldaten: 90535b2fd4dc213540eac0aff8ae769e34b6b1ba54e1ed6d0a51dcfe307d5598. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Finance Agent (v2)
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-finance-agent-v2:2:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 55
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 95.056. Kosten je Aufgabe in USD: 0.106441. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-fabv2-2026-09-29-addcd124c670. Prüfsumme der Quelldaten: addcd124c6706893659c1ae26698bf6ffa29c91018ee95b98ab15b9d4b6edcdb. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Recht
Harvey's Legal Agent Benchmark
Overall · Task fully resolved
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-legal-agent-benchmark:1:overall
- Messgröße
- task resolution rate
- Skala
- 0-100
- Teilnehmer
- 56
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 125.317. Kosten je Aufgabe in USD: 0.192614. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-hlab-2026-09-29-d6fb708e5bcc. Prüfsumme der Quelldaten: d6fb708e5bccec56c7a5e5ad97918d9cc47c5ebefb88af4a1a5771493dadba2f. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
LegalBench
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-legal-bench:1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 78
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 3.908. Kosten je Aufgabe in USD: 0.000787. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-legal_bench-2026-09-29-c1213019b552. Prüfsumme der Quelldaten: c1213019b55234a262ae86fd4ebfe291530f315c988a4ee32fd501c13777f85f. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Legal Research Bench
Overall · All-pass
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-legal-research:1:overall
- Messgröße
- all-pass rate
- Skala
- 0-100
- Teilnehmer
- 55
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 45.996. Kosten je Aufgabe in USD: 0.058112. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-legal_research-2026-09-29-b15acd492114. Prüfsumme der Quelldaten: b15acd492114174e151eff7ff17a38d547d5a1e93d2d598c153066542bbc56b7. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Gesundheit
MedCode
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-medcode:1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 64
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-26. Latenz in Sekunden: 7.93. Kosten je Aufgabe in USD: 0.004535. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-medcode-2026-09-29-7062229b5ab4. Prüfsumme der Quelldaten: 7062229b5ab4a5e16f014a78fd550f9f34e7147be6be796b610ab1ca3de055ab. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
MedScribe
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-medscribe:1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 65
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-26. Latenz in Sekunden: 9.992. Kosten je Aufgabe in USD: 0.004476. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-medscribe-2026-09-29-6533d95c8055. Prüfsumme der Quelldaten: 6533d95c80553d2dd26927f7269ab6454c589d2181f1858c662a4f493b5685c7. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
ProofBench
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-proof-bench:1.1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 34
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-28. Latenz in Sekunden: 201.725. Kosten je Aufgabe in USD: 0.044105. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-proof_bench-2026-09-29-95d190db7be5. Prüfsumme der Quelldaten: 95d190db7be508012399269386113bf7df88cf108a8647fae6d361d15c60126b. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
SkillsBench
Overall
höhere Werte sind besserStand 29. September 2026Skala: 0 % - 100 %
Methodik und Einordnung
- Vergleichskohorte
- vals-skillsbench:1:overall
- Messgröße
- accuracy
- Skala
- 0-100
- Teilnehmer
- 30
- Methodik und Einordnung
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Harness: OpenHands. Latenz in Sekunden: 49.364. Kosten je Aufgabe in USD: 0.101286. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-skillsbench-2026-09-29-38ec42553ceb. Prüfsumme der Quelldaten: 38ec42553ceb08e4efe7336723e87e67325977245b113ef7b86401dc72b0481a. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Dokumentierte Messdetails
Jede Beobachtung enthält den Quellwert und die veröffentlichten Testbedingungen.
Code Migration: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 4.494
- Bewertung
- 4.494
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- coding
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-code-migration:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 997.717. Kosten je Aufgabe in USD: 0.627223. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-code-migration-2026-09-29-f0b317d5bed3. Prüfsumme der Quelldaten: f0b317d5bed3a2654a9ea39762d5e57f4649306adce3e6103e845ee1b9b94add. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
CyberBench v1.1: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 45.476
- Bewertung
- 45.476
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1.1
- Kategorie
- cybersecurity
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-cyberbench:1.1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 1139.168. Kosten je Aufgabe in USD: 0.12462. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-cyber-2026-09-29-36ddb5f67bc8. Prüfsumme der Quelldaten: 36ddb5f67bc8725a7ff9d1cc1349f89d29e0e907ad313eb5ac277b42b3d275e1. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
EMB: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 8.823
- Bewertung
- 8.823
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- finance
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-emb:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 301.681. Kosten je Aufgabe in USD: 0.419811. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-emb-2026-09-29-90535b2fd4dc. Prüfsumme der Quelldaten: 90535b2fd4dc213540eac0aff8ae769e34b6b1ba54e1ed6d0a51dcfe307d5598. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Finance Agent (v2): Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 18.556
- Bewertung
- 18.556
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 2
- Kategorie
- finance
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-finance-agent-v2:2:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 95.056. Kosten je Aufgabe in USD: 0.106441. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-fabv2-2026-09-29-addcd124c670. Prüfsumme der Quelldaten: addcd124c6706893659c1ae26698bf6ffa29c91018ee95b98ab15b9d4b6edcdb. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
IOI: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 2.444
- Bewertung
- 2.444
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 2
- Kategorie
- coding
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-ioi:2:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 242.94. Kosten je Aufgabe in USD: 0.160874. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-ioi-2026-09-29-14c4f2dcc872. Prüfsumme der Quelldaten: 14c4f2dcc872d5e07bce234aebe4932202931d7f5b05f9bcd02e7695b5664750. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Harvey's Legal Agent Benchmark: Overall · Task fully resolved (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0
- Bewertung
- 0
- Messgröße
- task resolution rate
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- legal
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall · Task fully resolved
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-legal-agent-benchmark:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 125.317. Kosten je Aufgabe in USD: 0.192614. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-hlab-2026-09-29-d6fb708e5bcc. Prüfsumme der Quelldaten: d6fb708e5bccec56c7a5e5ad97918d9cc47c5ebefb88af4a1a5771493dadba2f. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
LegalBench: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 83.06
- Bewertung
- 83.06
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- legal
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-legal-bench:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 3.908. Kosten je Aufgabe in USD: 0.000787. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-legal_bench-2026-09-29-c1213019b552. Prüfsumme der Quelldaten: c1213019b55234a262ae86fd4ebfe291530f315c988a4ee32fd501c13777f85f. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
Legal Research Bench: Overall · All-pass (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 4.327
- Bewertung
- 4.327
- Messgröße
- all-pass rate
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- legal
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall · All-pass
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-legal-research:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-27. Latenz in Sekunden: 45.996. Kosten je Aufgabe in USD: 0.058112. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-legal_research-2026-09-29-b15acd492114. Prüfsumme der Quelldaten: b15acd492114174e151eff7ff17a38d547d5a1e93d2d598c153066542bbc56b7. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
MedCode: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 31.326
- Bewertung
- 31.326
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- health
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-medcode:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-26. Latenz in Sekunden: 7.93. Kosten je Aufgabe in USD: 0.004535. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-medcode-2026-09-29-7062229b5ab4. Prüfsumme der Quelldaten: 7062229b5ab4a5e16f014a78fd550f9f34e7147be6be796b610ab1ca3de055ab. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
MedScribe: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 55.093
- Bewertung
- 55.093
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- health
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-medscribe:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-26. Latenz in Sekunden: 9.992. Kosten je Aufgabe in USD: 0.004476. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-medscribe-2026-09-29-6533d95c8055. Prüfsumme der Quelldaten: 6533d95c80553d2dd26927f7269ab6454c589d2181f1858c662a4f493b5685c7. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
ProofBench: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 3
- Bewertung
- 3
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1.1
- Kategorie
- math
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-proof-bench:1.1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: private. Stand der Rangliste: 2026-09-28. Latenz in Sekunden: 201.725. Kosten je Aufgabe in USD: 0.044105. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-proof_bench-2026-09-29-95d190db7be5. Prüfsumme der Quelldaten: 95d190db7be508012399269386113bf7df88cf108a8647fae6d361d15c60126b. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
SkillsBench: Overall (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 18.061
- Bewertung
- 18.061
- Messgröße
- accuracy
- Einheit
- %
- Benchmark-Version
- 1
- Kategorie
- agentic
- Aufgabe
- overall
- Aufgabenbezeichnung
- Overall
- Richtung
- Mehr ist besser
- Vergleichskohorte
- vals-skillsbench:1:overall
- Quellentyp
- independent-evaluator
- Auswertung
- Vals AI
- Status
- active
- Abrufdatum
- 2026-09-29
- Methodik
- Kennung des Quellmodells: inception/mercury-2.5. Name des Quellmodells: Mercury 2.5. Evaluator: Vals AI. Datensatztyp: public. Stand der Rangliste: 2026-09-27. Harness: OpenHands. Latenz in Sekunden: 49.364. Kosten je Aufgabe in USD: 0.101286. Quellenkennung: vals-ai. Kennung der Evidenzaufnahme: vals-skillsbench-2026-09-29-38ec42553ceb. Prüfsumme der Quelldaten: 38ec42553ceb08e4efe7336723e87e67325977245b113ef7b86401dc72b0481a. Parserversion: vals-astro-v2. Importiert am: 2026-09-29
- Vergleichsmethodik
- Harness: OpenHands
Seite 1 von 2
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.