Claude Opus 4.8
Noch nicht getestet
Anthropic
Der Index mittelt Rangperzentile aus 4 dokumentierten Vergleichskohorten.
Einträge 1-12 von 15. Seite 1 von 2.
Die Charts vergleichen Modelle im selben dokumentierten Test. Das aktuelle Modell ist hervorgehoben.
Nach Aufgabentyp
Overall
Hinweis (Claude Opus 4.8): Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: 1.161 komplexe, häufig multimodale Rätsel prüfen kreative Problemlösung außerhalb klar definierter Schulaufgaben.
Einordnung: Rätselkompetenz ist ein enger Spezialfall und kein Ersatz für professionelle oder alltägliche Aufgaben.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: Computer-Aufgaben in realistischen Desktop-Umgebungen.
Einordnung: Das Ergebnis gehört zum vollständigen Agentensystem und ist kein isolierter Modellwert.
Hinweis (Claude Opus 4.8): Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Anthropics Veröffentlichungsseite nennt nach einer aktualisierten Ausführung 82,3 %. Die zugehörige System-Card-Tabelle enthält noch 82,8 %.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: 108 lange Computer-Workflows mit bis zu 500 Schritten.
Einordnung: Bewertet wird ein vollständiges System. Binäre und partielle Erfolgsrate bleiben getrennt.
Hinweis (Claude Opus 4.8): Claude verwendete ungefähr 244.000 Output-Tokens. Das ist ein Systemwert, kein isolierter Modellscore.
Hinweis: Claude verwendete ungefähr 244.000 Output-Tokens. Das ist ein Systemwert, kein isolierter Modellscore.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: 1.266 schwer auffindbare, aber kurz und eindeutig beantwortbare Rechercheaufgaben.
Einordnung: Der Test belohnt hartnäckige Faktensuche. Er bildet offene Rechercheberichte und typische Nutzerfragen nur teilweise ab.
Hinweis (Claude Opus 4.8): Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Hinweis: Redaktionelle Auswahl aus der Hersteller-Tabelle, kein vollständiger Auszug der Vergleichsgruppe.
Skala: 0 % - 100 %
Binary resolution, pass@1
Was der Benchmark prüft: 20 mehrstündige Repository-Aufgaben prüfen sehr lange Softwarearbeit mit binärem Enderfolg.
Einordnung: Die Werte gehören zum v1.0-Agentensystem. Für v1.1 war zum Datenstand kein Leaderboard veröffentlicht.
Hinweis: Zwei Ablehnungen und drei nicht verfügbare Versuche wurden als null gewertet.
Skala: 0 % - 100 %
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
Jede Beobachtung enthält den Quellwert und die veröffentlichten Testbedingungen.
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Opus 4.8
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)Steckbrief
Veröffentlichte Angaben zum Modell. Vorhandene Schätzungen sind ausdrücklich gekennzeichnet.
Kosten
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
Kostenbeispiel
1,75 $
100 Anfragen mit je 1.000 Eingabe- und 500 Ausgabe-Token kosten rechnerisch 1,75 $. Davon entfallen 0,5 $ auf Eingaben und 1,25 $ auf Ausgaben.
Die Rechnung nutzt die dokumentierten Tokenpreise und keinen Cache-Rabatt. Zusätzliche Tools, Steuern, Reasoning-Token und weitere nicht sichtbare Ausgabe-Token sind nicht enthalten.
Quelle öffnenDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
API-Basispreise ohne Cache- oder Batch-Rabatt. Höhere Kontextstufen und weitere Tarife stehen unter Kosten.