Claude Sonnet 4.5
Noch nicht getestet
Direktvergleich
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
Steckbrief
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Claude Sonnet 4.5 | Gemini 3.1 Pro Preview |
|---|---|---|
| Anbieter | Anthropic | |
| Erschienen | Sept. 2025 | 19. Feb. 2026 |
| Verfügbarkeit | Aktiv | Preview |
| Modelltyp | Proprietär | Proprietär |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 200.000 Token | 1.048.576 Token |
| Wissensstand | Januar 2025 | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext | Modell |
Kosten
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Claude Sonnet 4.5 | Gemini 3.1 Pro Preview |
|---|---|---|
| API-Eingabe | 3 $ | 2 $ ≤200K / 4 $ >200K |
| API-Ausgabe | 15 $ | 12 $ ≤200K / 18 $ >200K |
| Cache lesen | 0,3 $ | 0,2 $ ≤200K / 0,4 $ >200K |
| Cache schreiben (5 Min.) | 3,75 $ | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | 6 $ | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Claude Sonnet 4.5 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/eu-west-1 | 3,3 $ | 16,5 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 3 $ | Günstigster erfasster Preis: 15 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/us-east5 | 3,3 $ | 16,5 $ | Quelle12.09.2026 | ||
| Gemini 3.1 Pro Preview | Direkt beim EntwicklerBis 200.000 Kontext-Token | 2 $ | 12 $ | Quelle30.07.2026 | |
| Direkt beim EntwicklerÜber 200.000 Kontext-Token | 4 $ | 18 $ | Quelle30.07.2026 | ||
| Über OpenRoutergoogle-vertex/global | 2 $ | 12 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global/flex | Günstigster erfasster Preis: 1 $ | Günstigster erfasster Preis: 6 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global/priority | 3,6 $ | 21,6 $ | Quelle12.09.2026 | ||
| Google AI Studio | Über OpenRoutergoogle-ai-studio | 2 $ | 12 $ | Quelle12.09.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/flex | Günstigster erfasster Preis: 1 $ | Günstigster erfasster Preis: 6 $ | Quelle12.09.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/priority | 3,6 $ | 21,6 $ | Quelle12.09.2026 |
Leistung
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
5 passende Messreihen aus 5 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 5 von 5 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Claude Sonnet 4.5 | Gemini 3.1 Pro Preview | Quelle |
|---|---|---|---|
MultiChallengeOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: four multi-turn challenge typesMessgröße: rubric pass rateBewertung: Mehr ist besserClaude Sonnet 4.5: Reasoning: thinking, Versuche: pass@1 Gemini 3.1 Pro Preview: Versuche: pass@1Mehrstufige Gespräche mit binären, aufgabenspezifischen Rubriken. | 55,32 % ± 1,47 95-%-Konfidenzintervall: ±1,47 | Höherer Messwert71,37 % ± 1,74 95-%-Konfidenzintervall: ±1,74 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
MultiNRCOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: French, Spanish, and Chinese releaseMessgröße: accuracyBewertung: Mehr ist besserEinstellungen: Versuche: pass@1Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung. | 28,15 % ± 2,71 95-%-Konfidenzintervall: ±2,71 | Gewinner64,74 % ± 2,88 95-%-Konfidenzintervall: ±2,88 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench FinanceOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: full finance setMessgröße: weighted rubric scoreBewertung: Mehr ist besserEinstellungen: Versuche: pass@1600 Finanzaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | Gewinner43,79 % ± 0,4 95-%-Konfidenzintervall: ±0,4 | 41,87 % ± 1,22 95-%-Konfidenzintervall: ±1,22 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
PRBench LegalOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: full legal setMessgröße: weighted rubric scoreBewertung: Mehr ist besserEinstellungen: Versuche: pass@1500 Rechtsaufgaben mit aufgabenspezifischen Rubriken und o4-mini als Juror. | 40,84 % ± 0,4 95-%-Konfidenzintervall: ±0,4 | Gewinner44,02 % ± 1,12 95-%-Konfidenzintervall: ±1,12 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
TutorBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1,490-task releaseMessgröße: weighted rubric scoreBewertung: Mehr ist besserEinstellungen: Versuche: pass@11.490 Aufgaben mit gewichteten Rubriken und Claude 4 Sonnet als Juror. | 45,7 % ± 1,01 95-%-Konfidenzintervall: ±1,01 | Gewinner52,99 % ± 1,06 95-%-Konfidenzintervall: ±1,06 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
VisualToolBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1,204-task releaseMessgröße: average pass rateBewertung: Mehr ist besserEinstellungen: Versuche: pass@11.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe. | 5,6 % ± 0,12 95-%-Konfidenzintervall: ±0,12 | Gewinner28,97 % ± 0,91 95-%-Konfidenzintervall: ±0,91 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
MultiNRCOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: French, Spanish, and Chinese releaseMessgröße: accuracyBewertung: Mehr ist besserClaude Sonnet 4.5: Reasoning: thinking, Versuche: pass@1 Gemini 3.1 Pro Preview: Versuche: pass@1Native, nicht aus dem Englischen übersetzte Reasoning-Aufgaben mit automatischer Bewertung. | 35,83 % ± 2,89 95-%-Konfidenzintervall: ±2,89 | Höherer Messwert64,74 % ± 2,88 95-%-Konfidenzintervall: ±2,88 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
TutorBenchOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1,490-task releaseMessgröße: weighted rubric scoreBewertung: Mehr ist besserClaude Sonnet 4.5: Reasoning: thinking, Versuche: pass@1 Gemini 3.1 Pro Preview: Versuche: pass@11.490 Aufgaben mit gewichteten Rubriken und Claude 4 Sonnet als Juror. | 49 % ± 1,01 95-%-Konfidenzintervall: ±1,01 | Höherer Messwert52,99 % ± 1,06 95-%-Konfidenzintervall: ±1,06 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
VisualToolBenchOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: 1,204-task releaseMessgröße: average pass rateBewertung: Mehr ist besserClaude Sonnet 4.5: Reasoning: thinking, Versuche: pass@1 Gemini 3.1 Pro Preview: Versuche: pass@11.204 Aufgaben, sechs Werkzeuge und höchstens 20 Werkzeugaufrufe pro Aufgabe. | 6,2 % ± 0,14 95-%-Konfidenzintervall: ±0,14 | Höherer Messwert28,97 % ± 0,91 95-%-Konfidenzintervall: ±0,91 | Scale AIQuellendetailsDatenstand: 26.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Sonnet 4.5
Noch nicht getestet
Gemini 3.1 Pro Preview
In diesem Testlauf war kein API-Zugang verfügbar. Das Modell wurde nicht bewertet.
Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)So liest du den Vergleich
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Vergleiche Claude Sonnet 4.5 und Gemini 3.1 Pro Preview mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.