Claude Opus 4.5
Noch nicht getestet
Direktvergleich
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
Steckbrief
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Claude Opus 4.5 | Claude Sonnet 4.5 |
|---|---|---|
| Anbieter | Anthropic | Anthropic |
| Erschienen | Nov. 2025 | Sept. 2025 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Proprietär |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 200.000 Token | 200.000 Token |
| Wissensstand | März 2025 | Januar 2025 |
| Technische Quellen | Modell, Kontext | Modell, Kontext |
Kosten
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Claude Opus 4.5 | Claude Sonnet 4.5 |
|---|---|---|
| API-Eingabe | 5 $ | 3 $ |
| API-Ausgabe | 25 $ | 15 $ |
| Cache lesen | 0,5 $ | 0,3 $ |
| Cache schreiben (5 Min.) | 6,25 $ | 3,75 $ |
| Cache schreiben (1 Std.) | 10 $ | 6 $ |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Claude Opus 4.5 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/eu-west-1 | 5,5 $ | 27,5 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | ||
| Claude Sonnet 4.5 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/eu-west-1 | 3,3 $ | 16,5 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/us-east5 | 3,3 $ | 16,5 $ | Quelle12.09.2026 |
Leistung
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
6 passende Messreihen aus 6 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 6 von 6 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Claude Opus 4.5 | Claude Sonnet 4.5 | Quelle |
|---|---|---|---|
BFCL v4OverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: v4, commit f7cf735Messgröße: unweighted overall accuracyBewertung: Mehr ist besserClaude Opus 4.5: Snapshot: claude-opus-4-5-20251101-fc Claude Sonnet 4.5: Snapshot: claude-sonnet-4-5-20250929-fcUngewichteter Gesamtscore aus agentischen, mehrstufigen und einzelnen Function-Calling-Tests. | Gewinner77,47 % | 73,24 % | Berkeley BFCLQuellendetailsDatenstand: 12.04.2026 |
CORE-Bench HardAutomatic validationTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 45-paper public hard setMessgröße: automatic accuracyBewertung: Mehr ist besserEinstellungen: Agent: Claude Code, Harness: Claude CodeClaude Code auf 45 öffentlichen Paper-Reproduktionen. Kosten sind durch 45 geteilt. | Gewinner77,78 % | 62,22 % | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
MultiChallengeOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: four multi-turn challenge typesMessgröße: rubric pass rateBewertung: Mehr ist besserEinstellungen: Reasoning: thinking, Versuche: pass@1Mehrstufige Gespräche mit binären, aufgabenspezifischen Rubriken. | Gewinner58,97 % ± 0,42 95-%-Konfidenzintervall: ±0,42 | 55,32 % ± 1,47 95-%-Konfidenzintervall: ±1,47 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
MultiNRCOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: French, Spanish, and Chinese releaseMessgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: thinking, Versuche: pass@1Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung. | Gewinner48,63 % ± 3,02 95-%-Konfidenzintervall: ±3,02 | 35,83 % ± 2,89 95-%-Konfidenzintervall: ±2,89 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench FinanceOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: full finance setMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Opus 4.5: Reasoning: thinking, Versuche: pass@1 Claude Sonnet 4.5: Versuche: pass@1600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Höherer Messwert46,16 % ± 0,27 95-%-Konfidenzintervall: ±0,27 | 43,79 % ± 0,4 95-%-Konfidenzintervall: ±0,4 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench LegalOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: full legal setMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Opus 4.5: Reasoning: thinking, Versuche: pass@1 Claude Sonnet 4.5: Versuche: pass@1500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Höherer Messwert44,21 % ± 0,34 95-%-Konfidenzintervall: ±0,34 | 40,84 % ± 0,4 95-%-Konfidenzintervall: ±0,4 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
TutorBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1,490-task releaseMessgröße: weighted rubric scoreBewertung: Mehr ist besserEinstellungen: Reasoning: thinking, Versuche: pass@11.490 Aufgaben mit gewichteten Rubriken und Claude 4 Sonnet als Juror. | Gewinner51,2 % ± 0,99 95-%-Konfidenzintervall: ±0,99 | 49 % ± 1,01 95-%-Konfidenzintervall: ±1,01 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
VISTAOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 758 private prompt-image pairsMessgröße: rubric scoreBewertung: Mehr ist besserEinstellungen: Reasoning: thinking, Versuche: pass@1758 einzelne Bild-Text-Aufgaben mit strukturierten Ja-Nein-Rubriken. | 46,43 % ± 0,03 95-%-Konfidenzintervall: ±0,03 | Gewinner48,75 % ± 1,67 95-%-Konfidenzintervall: ±1,67 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Opus 4.5
Noch nicht getestet
Claude Sonnet 4.5
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)So liest du den Vergleich
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Vergleiche Claude Opus 4.5 und Claude Sonnet 4.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.