- Startseite
- KI-Modelle
- Seedream 4.0
Seedream 4.0
ByteDance
- Veröffentlicht
- September 2025
- Datenstand
- 15. August 2026
Einordnung
Position in der Kategorie
Die Übersicht nutzt nur veröffentlichte, zusammenpassende Daten. Fehlende Werte verändern keinen Rang.
Diese Position mittelt 4 feste Gradually-Bildtests gleich. Pro Modell und Aufgabe fließt ein archiviertes erstes Ergebnis ein.
- Position
- Platz 25 von 28
- Indexwert
- 29,9 / 100
- Abdeckung
- 4 / 4
Bestenliste
Messreihen
Vergleichbare Benchmarkwerte
Jedes Diagramm zeigt ausschließlich eine Quelle, eine Messreihe und eine gespeicherte Vergleichskohorte. Die Balken ordnen die Position. Der Messwert steht rechts.
Text to Image Arena
1.227 Elo · Platz 13 von 25
Stichprobe: 4.603 · Datenstand: 26. August 2026
7 von 25 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Image Editing Arena
1.185 Elo · Platz 15 von 19
Stichprobe: 10.984 · Datenstand: 26. August 2026
7 von 19 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
GenExam Mathematik, streng
2,6 % · Platz 6 von 6
Stichprobe: 151 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Physik, streng
3,5 % · Platz 6 von 6
Stichprobe: 113 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Chemie, streng
5,9 % · Platz 6 von 6
Stichprobe: 118 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Biologie, streng
18,6 % · Platz 5 von 6
Stichprobe: 156 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Geografie, streng
10,6 % · Platz 6 von 6
Stichprobe: 66 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Informatik, streng
6,9 % · Platz 6 von 6
Stichprobe: 102 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Ingenieurwesen, streng
11,7 % · Platz 5 von 6
Stichprobe: 111 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Wirtschaft, streng
5,2 % · Platz 5 von 6
Stichprobe: 77 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Musik, streng
0 % · Platz 6 von 6
Stichprobe: 65 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Geschichte, streng
7,3 % · Platz 5 von 6
Stichprobe: 41 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Gesamtwert, streng
7,2 % · Platz 6 von 6
Stichprobe: 1.000 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Mathematik, gelockert
39,8 % · Platz 6 von 6
Stichprobe: 151 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Physik, gelockert
49 % · Platz 6 von 6
Stichprobe: 113 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Chemie, gelockert
46,1 % · Platz 6 von 6
Stichprobe: 118 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Biologie, gelockert
71 % · Platz 6 von 6
Stichprobe: 156 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Geografie, gelockert
65,1 % · Platz 6 von 6
Stichprobe: 66 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Informatik, gelockert
52,2 % · Platz 6 von 6
Stichprobe: 102 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Ingenieurwesen, gelockert
60 % · Platz 6 von 6
Stichprobe: 111 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Wirtschaft, gelockert
56 % · Platz 6 von 6
Stichprobe: 77 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Musik, gelockert
34,5 % · Platz 6 von 6
Stichprobe: 65 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Geschichte, gelockert
56,7 % · Platz 6 von 6
Stichprobe: 41 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GenExam Gesamtwert, gelockert
53 % · Platz 6 von 6
Stichprobe: 1.000 · Datenstand: 26. August 2026
6 von 6 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
1.000 fachübergreifende Zeichenaufgaben mit Referenzbildern und feingranularen Bewertungspunkten. Strenge und gelockerte Bewertung bleiben getrennt.
GRADE Schlussfolgern
32,4 Punkte · Platz 7 von 7
Stichprobe: 520 · Datenstand: 26. August 2026
7 von 7 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
520 wissenschaftliche Bildbearbeitungsaufgaben aus zehn Fachgebieten. GRADE bewertet Schlussfolgern, Konsistenz, Lesbarkeit und fachliche Genauigkeit getrennt.
GRADE Konsistenz
53,2 Punkte · Platz 7 von 7
Stichprobe: 520 · Datenstand: 26. August 2026
7 von 7 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
520 wissenschaftliche Bildbearbeitungsaufgaben aus zehn Fachgebieten. GRADE bewertet Schlussfolgern, Konsistenz, Lesbarkeit und fachliche Genauigkeit getrennt.
GRADE Lesbarkeit
77 Punkte · Platz 5 von 7
Stichprobe: 520 · Datenstand: 26. August 2026
7 von 7 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
520 wissenschaftliche Bildbearbeitungsaufgaben aus zehn Fachgebieten. GRADE bewertet Schlussfolgern, Konsistenz, Lesbarkeit und fachliche Genauigkeit getrennt.
GRADE fachliche Genauigkeit
3,1 Punkte · Platz 7 von 7
Stichprobe: 520 · Datenstand: 26. August 2026
7 von 7 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
520 wissenschaftliche Bildbearbeitungsaufgaben aus zehn Fachgebieten. GRADE bewertet Schlussfolgern, Konsistenz, Lesbarkeit und fachliche Genauigkeit getrennt.
GEBench Chinesisch, Einzelschritt
62,04 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Chinesisch, Mehrschritt
48,64 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Chinesisch, fiktive App
49,28 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Chinesisch, reale App
50,93 Punkte · Platz 4 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Chinesisch, Verankerung
53,53 Punkte · Platz 3 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Chinesisch, Gesamtwert
52,88 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Englisch, Einzelschritt
53,28 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Englisch, Mehrschritt
37,57 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Englisch, fiktive App
47,92 Punkte · Platz 4 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Englisch, reale App
49,36 Punkte · Platz 2 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Englisch, Verankerung
44,17 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
GEBench Englisch, Gesamtwert
46,46 Punkte · Platz 5 von 5
Datenstand: 26. August 2026
5 von 5 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Zweisprachiger Test für grafische Benutzeroberflächen. Chinesische und englische Aufgaben sowie Einzelschritt, Mehrschritt, fiktive App, reale App und räumliche Verankerung bleiben getrennt.
Gradually-Bildtest: Typografie und Layout
18,5 Rangpunkte · Platz 23 von 28
Stichprobe: 1 · Datenstand: 18. August 2026
7 von 28 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Ein archiviertes, ungefiltertes Erstbild je Modell. Alle 28 Bilder werden in drei modellblinden, unterschiedlich sortierten Durchläufen gerankt. Der Wert von 0 bis 100 normalisiert den mittleren Rang. Das bleibt eine Stichprobe mit n = 1. Ein automatisches Prüfmodell kann eigene visuelle Präferenzen haben.
Gradually-Bildtest: Produktfotografie
19,7 Rangpunkte · Platz 23 von 28
Stichprobe: 1 · Datenstand: 18. August 2026
7 von 28 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Ein archiviertes, ungefiltertes Erstbild je Modell. Alle 28 Bilder werden in drei modellblinden, unterschiedlich sortierten Durchläufen gerankt. Der Wert von 0 bis 100 normalisiert den mittleren Rang. Das bleibt eine Stichprobe mit n = 1. Ein automatisches Prüfmodell kann eigene visuelle Präferenzen haben.
Gradually-Bildtest: Figur und Details
13,6 Rangpunkte · Platz 27 von 28
Stichprobe: 1 · Datenstand: 18. August 2026
5 von 28 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Ein archiviertes, ungefiltertes Erstbild je Modell. Alle 28 Bilder werden in drei modellblinden, unterschiedlich sortierten Durchläufen gerankt. Der Wert von 0 bis 100 normalisiert den mittleren Rang. Das bleibt eine Stichprobe mit n = 1. Ein automatisches Prüfmodell kann eigene visuelle Präferenzen haben.
Gradually-Bildtest: Infografik
67,9 Rangpunkte · Platz 9 von 28
Stichprobe: 1 · Datenstand: 18. August 2026
7 von 28 Modellversionen im Diagramm. Ein höherer Wert liegt vorn.
Ein archiviertes, ungefiltertes Erstbild je Modell. Alle 28 Bilder werden in drei modellblinden, unterschiedlich sortierten Durchläufen gerankt. Der Wert von 0 bis 100 normalisiert den mittleren Rang. Das bleibt eine Stichprobe mit n = 1. Ein automatisches Prüfmodell kann eigene visuelle Präferenzen haben.
Steckbrief
Technische Daten und Zugang
Veröffentlichte Angaben zum Modell. Nicht bekannte Werte werden nicht geschätzt.
Kosten
Veröffentlichte Preise
Preise bleiben an die dokumentierte Einheit und Quelle gebunden.
Direkte Vergleiche
Dieses Modell im Vergleich
Jedes Duell vergleicht dieses Modell mit genau einem weiteren Modell aus derselben Kategorie.
Weitere Modelle
Modelle derselben Auswahl
Alle KI-Modelle
Nachweise
Primärquellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.