Claude Opus 4.7
Noch nicht getestet
Direktvergleich
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
Steckbrief
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Claude Opus 4.7 | Gemini 3.1 Pro Preview |
|---|---|---|
| Anbieter | Anthropic | |
| Erschienen | Apr. 2026 | 19. Feb. 2026 |
| Verfügbarkeit | Aktiv | Preview |
| Modelltyp | Proprietär | Proprietär |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Architektur | Nicht veröffentlicht | Nicht veröffentlicht |
| Kontextfenster | 1.000.000 Token | 1.048.576 Token |
| Wissensstand | Januar 2026 | Nicht veröffentlicht |
| Technische Quellen | Modell, Wissensstand | Modell |
Kosten
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Claude Opus 4.7 | Gemini 3.1 Pro Preview |
|---|---|---|
| API-Eingabe | 5 $ | 2 $ ≤200K / 4 $ >200K |
| API-Ausgabe | 25 $ | 12 $ ≤200K / 18 $ >200K |
| Cache lesen | 0,5 $ | 0,2 $ ≤200K / 0,4 $ >200K |
| Cache schreiben (5 Min.) | 6,25 $ | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | 10 $ | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Claude Opus 4.7 | Anthropic | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle30.07.2026 |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/eu-west-1 | 5,5 $ | 27,5 $ | Quelle12.09.2026 | |
| Amazon Bedrock | Über OpenRouteramazon-bedrock/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Anthropic | Über OpenRouteranthropic | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Azure | Über OpenRouterazure/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Claude Platform on AWS | Über OpenRouterclaude-on-aws | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | |
| Über OpenRoutergoogle-vertex/europe | 5,5 $ | 27,5 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global | Günstigster erfasster Preis: 5 $ | Günstigster erfasster Preis: 25 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/us | 5,5 $ | 27,5 $ | Quelle12.09.2026 | ||
| Gemini 3.1 Pro Preview | Direkt beim EntwicklerBis 200.000 Kontext-Token | 2 $ | 12 $ | Quelle30.07.2026 | |
| Direkt beim EntwicklerÜber 200.000 Kontext-Token | 4 $ | 18 $ | Quelle30.07.2026 | ||
| Über OpenRoutergoogle-vertex/global | 2 $ | 12 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global/flex | Günstigster erfasster Preis: 1 $ | Günstigster erfasster Preis: 6 $ | Quelle12.09.2026 | ||
| Über OpenRoutergoogle-vertex/global/priority | 3,6 $ | 21,6 $ | Quelle12.09.2026 | ||
| Google AI Studio | Über OpenRoutergoogle-ai-studio | 2 $ | 12 $ | Quelle12.09.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/flex | Günstigster erfasster Preis: 1 $ | Günstigster erfasster Preis: 6 $ | Quelle12.09.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/priority | 3,6 $ | 21,6 $ | Quelle12.09.2026 |
Leistung
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
Nicht genug direkt vergleichbare Kategorien für ein belastbares Radar
Nur 2 von mindestens 5 Kategorien enthalten direkt vergleichbare Modellmessungen. Die Benchmarktabellen darunter zeigen die vorhandenen Belege, ohne fehlende Achsen aufzufüllen.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Claude Opus 4.7 | Gemini 3.1 Pro Preview | Quelle |
|---|---|---|---|
GAIA ReliabilityAccuracyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final leak-cleaned public validation setMessgröße: exact-match accuracyBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht. | 73,3 % | Gewinner76,2 % | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
Humanity's Last ExamOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final 2,500-question public setMessgröße: accuracyBewertung: Mehr ist besserClaude Opus 4.7: Versuche: pass@1 Gemini 3.1 Pro Preview: Snapshot: gemini-3.1-pro-preview-thinking-high, Versuche: pass@1Alle 2.500 öffentlichen Fragen, Temperatur 0 und automatischer Antwort-Extraktor. | 36,20 % ± 1,88 95-%-Konfidenzintervall: ±1,88 | Gewinner46,44 % ± 1,96 95-%-Konfidenzintervall: ±1,96 | Scale AIQuellendetailsDatenstand: 02.09.2026 |
τ-bench Airline CleanAccuracyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 26-task cleaned subsetMessgröße: task success rateBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet. | Gewinner84,6 % | 82,1 % | Princeton HALQuellendetailsDatenstand: 05.08.2026 |
GAIA ReliabilityConsistencyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final leak-cleaned public validation setMessgröße: aggregate consistencyBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht. | Gewinner0,81 Bewertungspunkte | 0,76 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
τ-bench Airline CleanConsistencyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 26-task cleaned subsetMessgröße: aggregate consistencyBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet. | Gewinner0,88 Bewertungspunkte | 0,81 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 05.08.2026 |
GAIA ReliabilityPredictabilityTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final leak-cleaned public validation setMessgröße: aggregate predictabilityBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht. | 0,73 Bewertungspunkte | Gewinner0,78 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
τ-bench Airline CleanPredictabilityTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 26-task cleaned subsetMessgröße: aggregate predictabilityBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet. | Gewinner0,87 Bewertungspunkte | 0,83 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 05.08.2026 |
GAIA ReliabilityReliabilityTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final leak-cleaned public validation setMessgröße: aggregate reliabilityBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht. | Gewinner0,84 Bewertungspunkte | 0,82 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
τ-bench Airline CleanReliabilityTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 26-task cleaned subsetMessgröße: aggregate reliabilityBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet. | Gewinner0,89 Bewertungspunkte | 0,86 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 05.08.2026 |
GAIA ReliabilityRobustnessTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final leak-cleaned public validation setMessgröße: aggregate robustnessBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht. | Gewinner0,99 Bewertungspunkte | 0,94 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
τ-bench Airline CleanRobustnessTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 26-task cleaned subsetMessgröße: aggregate robustnessBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet. | 0,91 Bewertungspunkte | Gewinner0,94 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 05.08.2026 |
GAIA ReliabilitySafetyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: final leak-cleaned public validation setMessgröße: aggregate safetyBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability165 GAIA-Aufgaben mit wiederholten Läufen und Perturbationen. Kosten veröffentlicht HAL für diese Auswertung nicht. | Gleichstand1 Bewertungspunkte | Gleichstand1 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 06.08.2026 |
τ-bench Airline CleanSafetyTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 26-task cleaned subsetMessgröße: aggregate safetyBewertung: Mehr ist besserEinstellungen: Agent: HAL Reliability, Harness: HAL Reliability26 bereinigte Airline-Aufgaben. Alle Kennzahlen wurden von Princeton HAL auf diesem Ausschnitt neu berechnet. | 0,94 Bewertungspunkte | Gewinner0,97 Bewertungspunkte | Princeton HALQuellendetailsDatenstand: 05.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
Claude Opus 4.7
Noch nicht getestet
Gemini 3.1 Pro Preview
In diesem Testlauf war kein API-Zugang verfügbar. Das Modell wurde nicht bewertet.
Visuell noch nicht bewertet. Eine erfolgreiche Aufzeichnung bestätigt weder korrekte Physik noch die vollständige Umsetzung des Prompts.
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)So liest du den Vergleich
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Vergleiche Claude Opus 4.7 und Gemini 3.1 Pro Preview mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.