DeepSeek-R1
Noch nicht getestet
DeepSeek
Nächste Generation im Verzeichnis
DeepSeek publishes the 0528 release as a dated update to DeepSeek-R1.
DeepSeek-R1 0528 model card (2026-09-09)Für dieses Modell liegt keine veröffentlichte, kategorieweit vergleichbare Gesamtwertung vor.
Einträge 1-12 von 91. Seite 1 von 8.
Die Charts vergleichen Modelle im selben dokumentierten Test. Das aktuelle Modell ist hervorgehoben.
Nach Aufgabentyp
Overall
Was der Benchmark prüft: 225 Code-Editing-Aufgaben aus Exercism in C++, Go, Java, JavaScript, Python und Rust.
Einordnung: Aider, Edit-Format, Reasoning-Budget und zwei Versuche sind Teil des Resultats.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 102 von Fachleuten geprüfte Aufgaben für datengetriebene wissenschaftliche Arbeit.
Einordnung: Agentengerüst, Werkzeuge und Codeausführung sind Teil des Ergebnisses. HAL nennt an verschiedenen Stellen 42 und 44 zugrunde liegende Publikationen.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 307 algorithmische Programmieraufgaben von Bronze bis Platinum mit vollständigen Tests.
Einordnung: Der Test misst Wettbewerbsprogrammierung, nicht Repository-Navigation, Wartbarkeit oder Produktkomfort.
Skala: 0 % - 100 %
Accuracy
Was der Benchmark prüft: 300 verifizierte Aufgaben auf 136 dynamischen Live-Websites.
Einordnung: SeeAct und Browser-Use sind unterschiedliche Agentengerüste und bleiben deshalb getrennte Vergleichsgruppen.
Skala: 0 % - 100 %
Easy
Was der Benchmark prüft: 503 Aufgaben mit Kontexten von 8.000 bis 2 Millionen Wörtern decken Dokumente, Dialoge, Code-Repositories und strukturierte Daten ab.
Einordnung: Die Werte mit Chain of Thought sind nicht mit direkten Antworten ohne Reasoning gleichzusetzen.
Skala: 0 % - 100 %
Hard
Was der Benchmark prüft: 503 Aufgaben mit Kontexten von 8.000 bis 2 Millionen Wörtern decken Dokumente, Dialoge, Code-Repositories und strukturierte Daten ab.
Einordnung: Die Werte mit Chain of Thought sind nicht mit direkten Antworten ohne Reasoning gleichzusetzen.
Skala: 0 % - 100 %
Long, 128,000 to 2 million words
Was der Benchmark prüft: 503 Aufgaben mit Kontexten von 8.000 bis 2 Millionen Wörtern decken Dokumente, Dialoge, Code-Repositories und strukturierte Daten ab.
Einordnung: Die Werte mit Chain of Thought sind nicht mit direkten Antworten ohne Reasoning gleichzusetzen.
Skala: 0 % - 100 %
Medium, 32,000 to 128,000 words
Was der Benchmark prüft: 503 Aufgaben mit Kontexten von 8.000 bis 2 Millionen Wörtern decken Dokumente, Dialoge, Code-Repositories und strukturierte Daten ab.
Einordnung: Die Werte mit Chain of Thought sind nicht mit direkten Antworten ohne Reasoning gleichzusetzen.
Skala: 0 % - 100 %
Overall
Was der Benchmark prüft: 503 Aufgaben mit Kontexten von 8.000 bis 2 Millionen Wörtern decken Dokumente, Dialoge, Code-Repositories und strukturierte Daten ab.
Einordnung: Die Werte mit Chain of Thought sind nicht mit direkten Antworten ohne Reasoning gleichzusetzen.
Skala: 0 % - 100 %
Short, up to 32,000 words
Was der Benchmark prüft: 503 Aufgaben mit Kontexten von 8.000 bis 2 Millionen Wörtern decken Dokumente, Dialoge, Code-Repositories und strukturierte Daten ab.
Einordnung: Die Werte mit Chain of Thought sind nicht mit direkten Antworten ohne Reasoning gleichzusetzen.
Skala: 0 % - 100 %
Average across 29 languages
Was der Benchmark prüft: 11.829 parallele Aufgaben je Sprache vergleichen Fachwissen und Reasoning in 29 Sprachen.
Einordnung: Die Ergebnisse gelten für 5-Shot Chain of Thought und sind nicht mit MMLU-Pro gleichzusetzen.
Skala: 0 % - 100 %
German
Was der Benchmark prüft: 11.829 parallele Aufgaben je Sprache vergleichen Fachwissen und Reasoning in 29 Sprachen.
Einordnung: Die Ergebnisse gelten für 5-Shot Chain of Thought und sind nicht mit MMLU-Pro gleichzusetzen.
Skala: 0 % - 100 %
Jede Beobachtung enthält den Quellwert und die veröffentlichten Testbedingungen.
Eigene Modelltests
Vergleiche, wie die Modelle denselben Prompt umsetzen. Jeder Test zeigt den ersten Versuch, ohne nachträgliche Korrekturen am erzeugten Code. Die Ergebnisse fließen nicht in einen Gesamtscore ein.
Community-Klassiker für eine freie SVG-Zeichnung.
DeepSeek-R1
Noch nicht getestet
Generate an SVG of a pelican riding a bicycle
Tokenlimit inklusive Reasoning: 8.192 Token
Ursprung der Aufgabe (Simon Willison)Steckbrief
Veröffentlichte Angaben zum Modell. Vorhandene Schätzungen sind ausdrücklich gekennzeichnet.
Datierte Angaben aus Dokumentation und Modellkarten. Anbieterlimits sowie native und erweiterte Kontextfenster können sich unterscheiden. Konfigurationshinweise bleiben im Original erhalten.
Kosten
Die Preise gelten für die jeweils genannte Einheit. Auflösung, Ausgabelänge und Anbieter können die Kosten verändern.
Kostenbeispiel
0,195 $
100 Anfragen mit je 1.000 Eingabe- und 500 Ausgabe-Token kosten rechnerisch 0,195 $. Davon entfallen 0,07 $ auf Eingaben und 0,125 $ auf Ausgaben.
Die Rechnung nutzt die dokumentierten Tokenpreise und keinen Cache-Rabatt. Zusätzliche Tools, Steuern, Reasoning-Token und weitere nicht sichtbare Ausgabe-Token sind nicht enthalten.
Quelle öffnenDirekte Vergleiche
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Für dieses Modell sind noch keine direkten Vergleiche veröffentlicht.
Nachweise
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
API-Basispreise ohne Cache- oder Batch-Rabatt. Höhere Kontextstufen und weitere Tarife stehen unter Kosten.
Recherchestand 8. September 2026. 2 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell.
Ungeklärt
release-date. No normalized release-date field in card.
In den geprüften Quellen nicht gefunden
AA benchmark rows. No exact-model row in the selected public JSON-LD datasets (some pages only expose N/A or unknown metric summaries).