GPT-5
Noch nicht getestet
OpenAI
Für dieses Modell liegt keine veröffentlichte, kategorieweit vergleichbare Gesamtwertung vor.
Einträge 1-12 von 149. Seite 1 von 13.
Die Charts vergleichen Modelle im selben dokumentierten Test. Das aktuelle Modell ist hervorgehoben.
Nach Aufgabentyp
Document grounding
Was der Benchmark prüft: 3.513 öffentliche Beispiele prüfen Faktentreue bei Dokumenten, Bildern, internem Wissen und Websuche.
Einordnung: Der Gesamtscore mittelt vier verschiedene Fähigkeiten. Die Teilwerte bleiben für Entscheidungen wichtiger.
Skala: 0 % - 100 %
Multimodal factuality
Was der Benchmark prüft: 3.513 öffentliche Beispiele prüfen Faktentreue bei Dokumenten, Bildern, internem Wissen und Websuche.
Einordnung: Der Gesamtscore mittelt vier verschiedene Fähigkeiten. Die Teilwerte bleiben für Entscheidungen wichtiger.
Skala: 0 % - 100 %
FACTS overall score
Was der Benchmark prüft: 3.513 öffentliche Beispiele prüfen Faktentreue bei Dokumenten, Bildern, internem Wissen und Websuche.
Einordnung: Der Gesamtscore mittelt vier verschiedene Fähigkeiten. Die Teilwerte bleiben für Entscheidungen wichtiger.
Skala: 0 % - 100 %
Parametric knowledge
Was der Benchmark prüft: 3.513 öffentliche Beispiele prüfen Faktentreue bei Dokumenten, Bildern, internem Wissen und Websuche.
Einordnung: Der Gesamtscore mittelt vier verschiedene Fähigkeiten. Die Teilwerte bleiben für Entscheidungen wichtiger.
Skala: 0 % - 100 %
Factuality with search
Was der Benchmark prüft: 3.513 öffentliche Beispiele prüfen Faktentreue bei Dokumenten, Bildern, internem Wissen und Websuche.
Einordnung: Der Gesamtscore mittelt vier verschiedene Fähigkeiten. Die Teilwerte bleiben für Entscheidungen wichtiger.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 33 automatisch prüfbare HAL-Aufgaben aus 214 realistischen, zeitaufwendigen Web-Rechercheaufgaben.
Einordnung: Der veröffentlichte HAL-Ausschnitt ist kleiner als der vollständige Datensatz. Die Kosten berücksichtigen keine Cache-Vorteile.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 300 verifizierte Aufgaben auf 136 dynamischen Live-Websites.
Einordnung: SeeAct und Browser-Use sind unterschiedliche Agentengerüste und bleiben deshalb getrennte Vergleichsgruppen.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 300 verifizierte Aufgaben auf 136 dynamischen Live-Websites.
Einordnung: SeeAct und Browser-Use sind unterschiedliche Agentengerüste und bleiben deshalb getrennte Vergleichsgruppen.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 65 wissenschaftliche Programmierprobleme mit 338 Teilproblemen aus 16 Forschungsgebieten.
Einordnung: Zero Shot, Tool Calling und HAL Generalist sind nicht direkt miteinander vergleichbar.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 102 von Fachleuten geprüfte Aufgaben für datengetriebene wissenschaftliche Arbeit.
Einordnung: Agentengerüst, Werkzeuge und Codeausführung sind Teil des Ergebnisses. HAL nennt an verschiedenen Stellen 42 und 44 zugrunde liegende Publikationen.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: Zufälliger, vollständig von Menschen geprüfter Ausschnitt mit 50 GitHub-Issues aus 12 Python-Repositories.
Einordnung: Der kleine Ausschnitt ist günstiger, aber statistisch weniger stabil als die vollständigen 500 Aufgaben. SWE-Agent und HAL Generalist bleiben getrennt.
Hinweis (GPT-5): HAL veröffentlicht bei mehreren Läufen Min-Max-Spannen. Der zentrale Wert ist der gemeldete Mittelwert, nicht ein 95-Prozent-Konfidenzintervall.
Hinweis: HAL veröffentlicht bei mehreren Läufen Min-Max-Spannen. Der zentrale Wert ist der gemeldete Mittelwert, nicht ein 95-Prozent-Konfidenzintervall.
Hinweis: HAL veröffentlicht bei mehreren Läufen Min-Max-Spannen. Der zentrale Wert ist der gemeldete Mittelwert, nicht ein 95-Prozent-Konfidenzintervall.
Hinweis: HAL veröffentlicht bei mehreren Läufen Min-Max-Spannen. Der zentrale Wert ist der gemeldete Mittelwert, nicht ein 95-Prozent-Konfidenzintervall.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 307 algorithmische Programmieraufgaben von Bronze bis Platinum mit vollständigen Tests.
Einordnung: Der Test misst Wettbewerbsprogrammierung, nicht Repository-Navigation, Wartbarkeit oder Produktkomfort.
Skala: 0 % - 100 %
Jede Beobachtung enthält den Quellwert und die veröffentlichten Testbedingungen.
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
GPT-5
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)Steckbrief
Veröffentlichte Angaben zum Modell. Vorhandene Schätzungen sind ausdrücklich gekennzeichnet.
Datierte Angaben aus Dokumentation und Modellkarten. Anbieterlimits sowie native und erweiterte Kontextfenster können sich unterscheiden. Konfigurationshinweise bleiben im Original erhalten.
Kosten
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
Kostenbeispiel
0,625 $
100 Anfragen mit je 1.000 Eingabe- und 500 Ausgabe-Token kosten rechnerisch 0,625 $. Davon entfallen 0,125 $ auf Eingaben und 0,5 $ auf Ausgaben.
Die Rechnung nutzt die dokumentierten Tokenpreise und keinen Cache-Rabatt. Zusätzliche Tools, Steuern, Reasoning-Token und weitere nicht sichtbare Ausgabe-Token sind nicht enthalten.
Quelle öffnenDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Für dieses Modell sind noch keine direkten Vergleiche veröffentlicht.
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
OpenAI, High effort. Ausgabetempo nach dem ersten empfangenen Textabschnitt, nicht die gesamte Antwortzeit. Bei Artificial Analysis als veraltet eingeordnet. Artificial Analysis pflegt dort nur noch den Standard-Workload mit 10.000 Eingabe-Token. Abgerufen am 8. September 2026.
API-Basispreise ohne Cache- oder Batch-Rabatt. Höhere Kontextstufen und weitere Tarife stehen unter Kosten.
Dokumentierte Modalitäten. Abgerufen am 8. September 2026.
Dokumentierte Modalitäten. Abgerufen am 8. September 2026.
Recherchestand 8. September 2026. 3 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell.
In den geprüften Quellen nicht gefunden
parameters-billions. OpenAI API and release pages do not publish total or active parameter counts.
In den geprüften Quellen nicht gefunden
independent-benchmarks. This pass used the exact OpenAI model-column tables; no separate independent evaluator record was added.