Claude Sonnet 4.5
Noch nicht getestet
Anthropic
Für dieses Modell liegt keine veröffentlichte, kategorieweit vergleichbare Gesamtwertung vor.
Einträge 1-12 von 42. Seite 1 von 4.
Die Charts vergleichen Modelle im selben dokumentierten Test. Das aktuelle Modell ist hervorgehoben.
Nach Aufgabentyp
Overall
Was der Benchmark prüft: Berkeleys Function-Calling-Test verbindet einzelne und mehrstufige Tool-Aufrufe mit Websuche, Gedächtnis und Halluzinationsmessung.
Einordnung: Der Gesamtscore ist ein ungewichteter Mix der Teilbereiche und hängt von nativem Function Calling oder Prompt-Workarounds ab.
Skala: 0 % - 100 %
Automatic validation
Was der Benchmark prüft: 45 öffentliche Aufgaben zur Reproduktion von Forschungsergebnissen mit Code, Daten und Abhängigkeiten.
Einordnung: Automatische und manuell geprüfte Werte sind verschiedene Metriken. Das Agentengerüst beeinflusst den Score stark.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 65 wissenschaftliche Programmierprobleme mit 338 Teilproblemen aus 16 Forschungsgebieten.
Einordnung: Zero Shot, Tool Calling und HAL Generalist sind nicht direkt miteinander vergleichbar.
Skala: 0 % - 100 %
Attack success rate
Was der Benchmark prüft: 365 schädliche Sequenzen prüfen Sicherheitsrisiken bei mehrstufiger Werkzeugnutzung.
Einordnung: Eine niedrigere Angriffs-Erfolgsrate ist besser. Kompetenz und Sicherheit sind getrennte Größen.
Hinweis (Claude Sonnet 4.5): Tabelle 4 nennt für die Ablehnungsquote 15,43 %. Tabelle 9 desselben Papers nennt 15,34 %. Hier steht der Wert aus der direkten Einzel-gegen-Mehrfachdialog-Tabelle.
Skala: 0 % - 100 %
Refusal rate
Was der Benchmark prüft: 365 schädliche Sequenzen prüfen Sicherheitsrisiken bei mehrstufiger Werkzeugnutzung.
Einordnung: Eine niedrigere Angriffs-Erfolgsrate ist besser. Kompetenz und Sicherheit sind getrennte Größen.
Hinweis (Claude Sonnet 4.5): Tabelle 4 nennt für die Ablehnungsquote 15,43 %. Tabelle 9 desselben Papers nennt 15,34 %. Hier steht der Wert aus der direkten Einzel-gegen-Mehrfachdialog-Tabelle.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: Mehrstufige Gespräche prüfen Erinnern, Anweisungsbindung, versionierte Überarbeitung und innere Konsistenz.
Einordnung: Die Aufgaben wurden anhand gemeinsamer Fehler sechs älterer Spitzenmodelle ausgewählt und können diese Modelle benachteiligen.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: 600 realistische Finanzfragen mit gewichteten Kriterien, davon 300 im schwierigen Teildatensatz.
Einordnung: Ein o4-mini-Juror bewertet die Antworten. Fachliche Richtigkeit und praktische Verlässlichkeit bleiben deshalb getrennte Fragen.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: 500 realistische Rechtsfragen mit gewichteten Kriterien aus unterschiedlichen Ländern und Rechtsgebieten.
Einordnung: Der Benchmark misst professionelle Antwortqualität, ersetzt aber weder Rechtsprüfung noch menschliche Verantwortung.
Skala: 0 % - 100 %
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
Jede Beobachtung enthält den Quellwert und die veröffentlichten Testbedingungen.
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Sonnet 4.5
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)Steckbrief
Veröffentlichte Angaben zum Modell. Vorhandene Schätzungen sind ausdrücklich gekennzeichnet.
Datierte Angaben aus Dokumentation und Modellkarten. Anbieterlimits sowie native und erweiterte Kontextfenster können sich unterscheiden. Konfigurationshinweise bleiben im Original erhalten.
Kosten
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
Kostenbeispiel
1,05 $
100 Anfragen mit je 1.000 Eingabe- und 500 Ausgabe-Token kosten rechnerisch 1,05 $. Davon entfallen 0,3 $ auf Eingaben und 0,75 $ auf Ausgaben.
Die Rechnung nutzt die dokumentierten Tokenpreise und keinen Cache-Rabatt. Zusätzliche Tools, Steuern, Reasoning-Token und weitere nicht sichtbare Ausgabe-Token sind nicht enthalten.
Quelle öffnenDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Für dieses Modell sind noch keine direkten Vergleiche veröffentlicht.
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
Anthropic, Non-reasoning. Ausgabetempo nach dem ersten empfangenen Textabschnitt, nicht die gesamte Antwortzeit. Bei Artificial Analysis als veraltet eingeordnet. Artificial Analysis pflegt dort nur noch den Standard-Workload mit 10.000 Eingabe-Token. Abgerufen am 8. September 2026.
API-Basispreise ohne Cache- oder Batch-Rabatt. Höhere Kontextstufen und weitere Tarife stehen unter Kosten.
Dokumentierte Modalitäten. Abgerufen am 8. September 2026.
Dokumentierte Modalitäten. Abgerufen am 8. September 2026.
Recherchestand 8. September 2026. 3 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell.
In den geprüften Quellen nicht gefunden
parameters-billions. Anthropic does not publish parameter counts for this model.
In den geprüften Quellen nicht gefunden
active-parameters-billions. Anthropic does not publish active parameter counts for this model.