Claude Opus 4.6
Noch nicht getestet
Direktvergleich
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
Steckbrief
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Claude Opus 4.6 | Claude Opus 4.5 |
|---|---|---|
| Anbieter | Anthropic | Anthropic |
| Erschienen | Feb. 2026 | Nov. 2025 |
| Verfügbarkeit | Aktiv | Aktiv |
| Modelltyp | Proprietär | Proprietär |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 1.000.000 Token | 200.000 Token |
| Wissensstand | Mai 2025 | März 2025 |
| Technische Quellen | Modell, Kontext | Modell, Kontext |
Kosten
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Claude Opus 4.6 | Claude Opus 4.5 |
|---|---|---|
| API-Eingabe | 5 $ | 5 $ |
| API-Ausgabe | 25 $ | 25 $ |
| Cache lesen | 0,5 $ | 0,5 $ |
| Cache schreiben (5 Min.) | 6,25 $ | 6,25 $ |
| Cache schreiben (1 Std.) | 10 $ | 10 $ |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Claude Opus 4.6 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/europe | 5,5 $ | 27,5 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | ||
| Claude Opus 4.5 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/eu-west-1 | 5,5 $ | 27,5 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 |
Leistung
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
10 passende Messreihen aus 5 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 5 von 5 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Claude Opus 4.6 | Claude Opus 4.5 | Quelle |
|---|---|---|---|
METR Time Horizon50% time horizonTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: TH 1.1Messgröße: 50% time horizonBewertung: Mehr ist besserClaude Opus 4.6: Snapshot: claude-opus-4-6-2026-02-05, Agent: ReAct, Harness: ReAct, Versuche: 6 independent runs per task Claude Opus 4.5: Snapshot: claude-opus-4-5-2025-11-24, Agent: ReAct, Harness: ReAct, Versuche: 6 independent runs per taskReAct-Agent, sechs unabhängige Läufe je Aufgabe. Die Zeit ist die geschätzte menschliche Bearbeitungsdauer. | Gewinner12 Std. (95-Prozent-Konfidenzintervall 5,3 Std. bis 60,6 Std.) | 4,9 Std. (95-Prozent-Konfidenzintervall 2,7 Std. bis 10,4 Std.) | METRQuellendetailsDatenstand: 08.05.2026 |
MultiChallengeOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: four multi-turn challenge typesMessgröße: rubric pass rateBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: none, Versuche: pass@1 Claude Opus 4.5: Reasoning: thinking, Versuche: pass@1Mehrstufige Gespräche mit binären, aufgabenspezifischen Rubriken. | 56,02 % ± 1,08 95-%-Konfidenzintervall: ±1,08 | Höherer Messwert58,97 % ± 0,42 95-%-Konfidenzintervall: ±0,42 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
MultiNRCOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: French, Spanish, and Chinese releaseMessgröße: accuracyBewertung: Mehr ist besserEinstellungen: Reasoning: none, Versuche: pass@1Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung. | Gewinner48,34 % ± 3,02 95-%-Konfidenzintervall: ±3,02 | 41,23 % ± 2,97 95-%-Konfidenzintervall: ±2,97 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench FinanceOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: full finance setMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: none, Versuche: pass@1 Claude Opus 4.5: Reasoning: thinking, Versuche: pass@1600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Höherer Messwert53,28 % ± 0,18 95-%-Konfidenzintervall: ±0,18 | 46,16 % ± 0,27 95-%-Konfidenzintervall: ±0,27 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench LegalOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: full legal setMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Opus 4.6: Reasoning: none, Versuche: pass@1 Claude Opus 4.5: Reasoning: thinking, Versuche: pass@1500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Höherer Messwert52,27 % ± 0,66 95-%-Konfidenzintervall: ±0,66 | 44,21 % ± 0,34 95-%-Konfidenzintervall: ±0,34 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
SecCodeBench-V2Generation with security hintsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.2.0Messgröße: security-aware generation pass@1Bewertung: Mehr ist besser98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung. | 70,65 % | Gewinner72,1 % | SecCodeBenchQuellendetailsDatenstand: 16.02.2026 |
TutorBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1,490-task releaseMessgröße: weighted rubric scoreBewertung: Mehr ist besserEinstellungen: Reasoning: none, Versuche: pass@11.490 Aufgaben mit gewichteten Rubriken und Claude 4 Sonnet als Juror. | Gewinner53,55 % ± 1,01 95-%-Konfidenzintervall: ±1,01 | 49,82 % ± 0,98 95-%-Konfidenzintervall: ±0,98 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
VISTAOverallTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: 758 private prompt-image pairsMessgröße: rubric scoreBewertung: Mehr ist besserEinstellungen: Reasoning: none, Versuche: pass@1758 einzelne Bild-Text-Aufgaben mit strukturierten Ja-Nein-Rubriken. | Kein klarer Vorsprung45,48 % ± 0,44 95-%-Konfidenzintervall: ±0,44 | 45,32 % ± 0,03 95-%-Konfidenzintervall: ±0,03 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
METR Time Horizon80% time horizonTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: TH 1.1Messgröße: 80% time horizonBewertung: Mehr ist besserClaude Opus 4.6: Snapshot: claude-opus-4-6-2026-02-05, Agent: ReAct, Harness: ReAct, Versuche: 6 independent runs per task Claude Opus 4.5: Snapshot: claude-opus-4-5-2025-11-24, Agent: ReAct, Harness: ReAct, Versuche: 6 independent runs per taskReAct-Agent, sechs unabhängige Läufe je Aufgabe. Die Zeit ist die geschätzte menschliche Bearbeitungsdauer. | Gewinner1,2 Std. (95-Prozent-Konfidenzintervall 27 min bis 2,8 Std.) | 49,4 min (95-Prozent-Konfidenzintervall 20,7 min bis 1,7 Std.) | METRQuellendetailsDatenstand: 08.05.2026 |
SecCodeBench-V2Generation without hintsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.2.0Messgröße: native generation pass@1Bewertung: Mehr ist besser98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung. | 51,05 % | Gewinner58,02 % | SecCodeBenchQuellendetailsDatenstand: 16.02.2026 |
SecCodeBench-V2Repair with security hintsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.2.0Messgröße: security-aware repair pass@1Bewertung: Mehr ist besser98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung. | 81,73 % | Gewinner82,18 % | SecCodeBenchQuellendetailsDatenstand: 16.02.2026 |
SecCodeBench-V2Repair without hintsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.2.0Messgröße: native repair pass@1Bewertung: Mehr ist besser98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung. | 73,1 % | Gewinner73,67 % | SecCodeBenchQuellendetailsDatenstand: 16.02.2026 |
SecCodeBench-V2Weighted totalTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 2.2.0Messgröße: weighted pass@1Bewertung: Mehr ist besser98 Projektfälle. Funktionstests laufen vor dynamischen Exploit-Prüfungen und Sicherheitsbewertung. | 64,9 % | Gewinner68,1 % | SecCodeBenchQuellendetailsDatenstand: 16.02.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Opus 4.6
Noch nicht getestet
Claude Opus 4.5
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)So liest du den Vergleich
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Vergleiche Claude Opus 4.6 und Claude Opus 4.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.