o1
Noch nicht getestet
OpenAI
Für dieses Modell liegt keine veröffentlichte, kategorieweit vergleichbare Gesamtwertung vor.
Einträge 1-12 von 96. Seite 1 von 8.
Die Charts vergleichen Modelle im selben dokumentierten Test. Das aktuelle Modell ist hervorgehoben.
Consistency
Was der Benchmark prüft: Zuverlässigkeitsauswertung auf 165 GAIA-Aufgaben mit Wiederholungen und Perturbationen.
Einordnung: Trefferquote, Zuverlässigkeit, Konsistenz, Vorhersagbarkeit, Robustheit und Sicherheit sind getrennte Kennzahlen.
Skala: 0 Bewertung - 0,81 Bewertung
Accuracy
Was der Benchmark prüft: Zuverlässigkeitsauswertung auf 165 GAIA-Aufgaben mit Wiederholungen und Perturbationen.
Einordnung: Trefferquote, Zuverlässigkeit, Konsistenz, Vorhersagbarkeit, Robustheit und Sicherheit sind getrennte Kennzahlen.
Skala: 0 % - 100 %
Predictability
Was der Benchmark prüft: Zuverlässigkeitsauswertung auf 165 GAIA-Aufgaben mit Wiederholungen und Perturbationen.
Einordnung: Trefferquote, Zuverlässigkeit, Konsistenz, Vorhersagbarkeit, Robustheit und Sicherheit sind getrennte Kennzahlen.
Skala: 0 Bewertung - 0,84 Bewertung
Reliability
Was der Benchmark prüft: Zuverlässigkeitsauswertung auf 165 GAIA-Aufgaben mit Wiederholungen und Perturbationen.
Einordnung: Trefferquote, Zuverlässigkeit, Konsistenz, Vorhersagbarkeit, Robustheit und Sicherheit sind getrennte Kennzahlen.
Skala: 0 Bewertung - 0,85 Bewertung
Robustness
Was der Benchmark prüft: Zuverlässigkeitsauswertung auf 165 GAIA-Aufgaben mit Wiederholungen und Perturbationen.
Einordnung: Trefferquote, Zuverlässigkeit, Konsistenz, Vorhersagbarkeit, Robustheit und Sicherheit sind getrennte Kennzahlen.
Skala: 0 Bewertung - 1 Bewertung
Safety
Was der Benchmark prüft: Zuverlässigkeitsauswertung auf 165 GAIA-Aufgaben mit Wiederholungen und Perturbationen.
Einordnung: Trefferquote, Zuverlässigkeit, Konsistenz, Vorhersagbarkeit, Robustheit und Sicherheit sind getrennte Kennzahlen.
Skala: 0 Bewertung - 1 Bewertung
Consistency
Was der Benchmark prüft: 26 bereinigte Kundenservice-Aufgaben mit Dialogen, Richtlinien und mutierenden Backend-Werkzeugen.
Einordnung: Der bereinigte Ausschnitt entfernt 24 fehlerhafte oder mehrdeutige Aufgaben. Trefferquote und Zuverlässigkeitsdimensionen messen verschiedene Eigenschaften.
Skala: 0 Bewertung - 0,88 Bewertung
Accuracy
Was der Benchmark prüft: 26 bereinigte Kundenservice-Aufgaben mit Dialogen, Richtlinien und mutierenden Backend-Werkzeugen.
Einordnung: Der bereinigte Ausschnitt entfernt 24 fehlerhafte oder mehrdeutige Aufgaben. Trefferquote und Zuverlässigkeitsdimensionen messen verschiedene Eigenschaften.
Skala: 0 % - 100 %
Predictability
Was der Benchmark prüft: 26 bereinigte Kundenservice-Aufgaben mit Dialogen, Richtlinien und mutierenden Backend-Werkzeugen.
Einordnung: Der bereinigte Ausschnitt entfernt 24 fehlerhafte oder mehrdeutige Aufgaben. Trefferquote und Zuverlässigkeitsdimensionen messen verschiedene Eigenschaften.
Skala: 0 Bewertung - 0,87 Bewertung
Reliability
Was der Benchmark prüft: 26 bereinigte Kundenservice-Aufgaben mit Dialogen, Richtlinien und mutierenden Backend-Werkzeugen.
Einordnung: Der bereinigte Ausschnitt entfernt 24 fehlerhafte oder mehrdeutige Aufgaben. Trefferquote und Zuverlässigkeitsdimensionen messen verschiedene Eigenschaften.
Skala: 0 Bewertung - 0,89 Bewertung
Robustness
Was der Benchmark prüft: 26 bereinigte Kundenservice-Aufgaben mit Dialogen, Richtlinien und mutierenden Backend-Werkzeugen.
Einordnung: Der bereinigte Ausschnitt entfernt 24 fehlerhafte oder mehrdeutige Aufgaben. Trefferquote und Zuverlässigkeitsdimensionen messen verschiedene Eigenschaften.
Skala: 0 Bewertung - 0,98 Bewertung
Safety
Was der Benchmark prüft: 26 bereinigte Kundenservice-Aufgaben mit Dialogen, Richtlinien und mutierenden Backend-Werkzeugen.
Einordnung: Der bereinigte Ausschnitt entfernt 24 fehlerhafte oder mehrdeutige Aufgaben. Trefferquote und Zuverlässigkeitsdimensionen messen verschiedene Eigenschaften.
Skala: 0 Bewertung - 0,99 Bewertung
Jede Beobachtung enthält den Quellwert und die veröffentlichten Testbedingungen.
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
o1
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)Steckbrief
Veröffentlichte Angaben zum Modell. Vorhandene Schätzungen sind ausdrücklich gekennzeichnet.
Datierte Angaben aus Dokumentation und Modellkarten. Anbieterlimits sowie native und erweiterte Kontextfenster können sich unterscheiden. Konfigurationshinweise bleiben im Original erhalten.
Kosten
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
Kostenbeispiel
4,5 $
100 Anfragen mit je 1.000 Eingabe- und 500 Ausgabe-Token kosten rechnerisch 4,5 $. Davon entfallen 1,5 $ auf Eingaben und 3 $ auf Ausgaben.
Die Rechnung nutzt die dokumentierten Tokenpreise und keinen Cache-Rabatt. Zusätzliche Tools, Steuern, Reasoning-Token und weitere nicht sichtbare Ausgabe-Token sind nicht enthalten.
Quelle öffnenDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Für dieses Modell sind noch keine direkten Vergleiche veröffentlicht.
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
API-Basispreise ohne Cache- oder Batch-Rabatt. Höhere Kontextstufen und weitere Tarife stehen unter Kosten.
Dokumentierte Modalitäten. Abgerufen am 8. September 2026.
Dokumentierte Modalitäten. Abgerufen am 8. September 2026.
Recherchestand 8. September 2026. 3 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell.
In den geprüften Quellen nicht gefunden
parameters-billions. OpenAI API and release pages do not publish parameter counts.
In den geprüften Quellen nicht gefunden
independent-benchmarks. Only exact OpenAI appendix columns were used in this artifact.
Ungeklärt
release-date. The o1 family launched in September 2024, while the stable API snapshot was released in December 2024; this record does not choose between those distinct dates.
In den geprüften Quellen nicht gefunden
AA benchmark rows. No exact-model row in the selected public JSON-LD datasets (some pages only expose N/A or unknown metric summaries).