- Startseite
- KI-Modelle
- Mercury 2
SprachmodellAktiv
Mercury 2
Inception Labs
- Veröffentlicht
- 24. Februar 2026
- Datenstand
- 3. Oktober 2026
Mercury 2 erzeugt Antworten durch parallele Verfeinerung eines Textes statt durch autoregressives Token-für-Token-Decoding. Inception Labs überträgt mit diesem Diffusionsansatz eine vor allem aus der Bildgenerierung bekannte Arbeitsweise auf ein Reasoning-Sprachmodell.
Das Modell verarbeitet laut Anbieter 128K Token Kontext. Es ist über die Inception API und Mercury Chat verfügbar; Mercury 2.5 erweitert das Kontextfenster später auf 260K Token.
Seite 1 von 2
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
AA-Omniscience Index (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- -50.71666666666667
- Bewertung
- -50.71666666666667
- Messgröße
- AA-Omniscience Index
- Einheit
- points
- Benchmark-Version
- AA-Omniscience (current evaluator version not exposed on model page)
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
AA-Omniscience Accuracy (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.21183333333333335
- Bewertung
- 0.21183333333333335
- Messgröße
- AA-Omniscience Accuracy
- Einheit
- ratio
- Benchmark-Version
- AA-Omniscience (current evaluator version not exposed on model page)
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
AA-Omniscience Hallucination Rate (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.9122436032987947
- Bewertung
- 0.9122436032987947
- Messgröße
- AA-Omniscience Hallucination Rate
- Einheit
- ratio
- Benchmark-Version
- AA-Omniscience (current evaluator version not exposed on model page)
- Kategorie
- source-specific
- Richtung
- Weniger ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
GDPval-AA (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 497.66
- Bewertung
- 497.66
- Messgröße
- GDPval-AA
- Einheit
- elo
- Benchmark-Version
- GDPval-AA v2.1
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
τ²-Bench Telecom (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.707602339181287
- Bewertung
- 0.707602339181287
- Messgröße
- τ²-Bench Telecom
- Einheit
- ratio
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
τ²-Bench Banking (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.0948453608247423
- Bewertung
- 0.0948453608247423
- Messgröße
- τ²-Bench Banking
- Einheit
- ratio
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Terminal-Bench Hard (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.265151515151515
- Bewertung
- 0.265151515151515
- Messgröße
- Terminal-Bench Hard
- Einheit
- ratio
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Terminal-Bench 2.1 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.273408239700375
- Bewertung
- 0.273408239700375
- Messgröße
- Terminal-Bench 2.1
- Einheit
- ratio
- Benchmark-Version
- Terminal-Bench 2.1
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Terminal-Bench 4.0 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0
- Bewertung
- 0
- Messgröße
- Terminal-Bench 4.0
- Einheit
- ratio
- Benchmark-Version
- Terminal-Bench 4.0
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
SciCode (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.377314814814815
- Bewertung
- 0.377314814814815
- Messgröße
- SciCode
- Einheit
- ratio
- Benchmark-Version
- SciCode current AA evaluator (version not exposed on model page)
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
AA-LCR (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.436666666666667
- Bewertung
- 0.436666666666667
- Messgröße
- AA-LCR
- Einheit
- ratio
- Benchmark-Version
- AA-LCR v1.1
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
IFBench (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.697959183673469
- Bewertung
- 0.697959183673469
- Messgröße
- IFBench
- Einheit
- ratio
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- independent-evaluator
- Auswertung
- Artificial Analysis
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Unabhängige Evaluation. Artificial Analysis misst mercury-2 mit reasoning_effort=high. Der dokumentierte Standard ist medium.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Seite 1 von 2
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 4 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Weitere Quelle | Inception Labs Mercury 2 announcement (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Inception Labs Mercury 2 announcement · Redaktionelle Beschreibung geprüft am 4. Oktober 2026 |
| Weitere Quelle | Inception original publication dates (abgerufen 3. Oktober 2026) |
| Weitere Quelle | Artificial Analysis (abgerufen 4. Oktober 2026) |
| Weitere Quelle | Modellmetadaten (abgerufen 4. Oktober 2026) |
| Weitere Quelle | Modellmetadaten (abgerufen 4. Oktober 2026) |