Claude Opus 4.6
Noch nicht getestet
Direktvergleich
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
Steckbrief
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Claude Opus 4.6 | Claude Sonnet 4.5 |
|---|---|---|
| Anbieter | Anthropic | Anthropic |
| Erschienen | Feb. 2026 | Sept. 2025 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Proprietär |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 1.000.000 Token | 200.000 Token |
| Wissensstand | Mai 2025 | Januar 2025 |
| Technische Quellen | Modell, Kontext | Modell, Kontext |
Kosten
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Claude Opus 4.6 | Claude Sonnet 4.5 |
|---|---|---|
| API-Eingabe | 5 $ | 3 $ |
| API-Ausgabe | 25 $ | 15 $ |
| Cache lesen | 0,5 $ | 0,3 $ |
| Cache schreiben (5 Min.) | 6,25 $ | 3,75 $ |
| Cache schreiben (1 Std.) | 10 $ | 6 $ |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Claude Opus 4.6 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/europe | 5,5 $ | 27,5 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | ||
| Claude Sonnet 4.5 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/eu-west-1 | 3,3 $ | 16,5 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/us-east5 | 3,3 $ | 16,5 $ | Quelle12.09.2026 |
Leistung
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
Nicht genug direkt vergleichbare Kategorien für ein belastbares Radar
Nur 1 von mindestens 5 Kategorien enthalten direkt vergleichbare Modellmessungen. Die Benchmarktabellen darunter zeigen die vorhandenen Belege, ohne fehlende Achsen aufzufüllen.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Claude Opus 4.6 | Claude Sonnet 4.5 | Quelle |
|---|---|---|---|
MultiChallengeOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: four multi-turn challenge typesMessgröße: rubric pass rateBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: none, Versuche: pass@1 Claude Sonnet 4.5: Reasoning: thinking, Versuche: pass@1Mehrstufige Gespräche mit binären, aufgabenspezifischen Rubriken. | Höherer Messwert56,02 % ± 1,08 95-%-Konfidenzintervall: ±1,08 | 55,32 % ± 1,47 95-%-Konfidenzintervall: ±1,47 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench FinanceOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: full finance setMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: none, Versuche: pass@1 Claude Sonnet 4.5: Versuche: pass@1600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Höherer Messwert53,28 % ± 0,18 95-%-Konfidenzintervall: ±0,18 | 43,79 % ± 0,4 95-%-Konfidenzintervall: ±0,4 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench LegalOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: full legal setMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: none, Versuche: pass@1 Claude Sonnet 4.5: Versuche: pass@1500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Höherer Messwert52,27 % ± 0,66 95-%-Konfidenzintervall: ±0,66 | 40,84 % ± 0,4 95-%-Konfidenzintervall: ±0,4 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
VisualToolBenchOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1,204-task releaseMessgröße: average pass rateBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: thinking, Versuche: pass@1 Claude Sonnet 4.5: Versuche: pass@11.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe. | Höherer Messwert27,52 % ± 1,45 95-%-Konfidenzintervall: ±1,45 | 5,6 % ± 0,12 95-%-Konfidenzintervall: ±0,12 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
VisualToolBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1,204-task releaseMessgröße: average pass rateBewertung: Mehr ist besserEinstellungen: Reasoning: thinking, Versuche: pass@11.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe. | Gewinner27,52 % ± 1,45 95-%-Konfidenzintervall: ±1,45 | 6,2 % ± 0,14 95-%-Konfidenzintervall: ±0,14 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Opus 4.6
Noch nicht getestet
Claude Sonnet 4.5
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)So liest du den Vergleich
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Vergleiche Claude Opus 4.6 und Claude Sonnet 4.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.