Direktvergleich
GPT Image 2.5 Sunburst vs. FLUX.2 Max
Vergleiche gemeinsame Fähigkeitstests, Arena-Werte mit dokumentiertem Abrufdatum, aufgabenspezifische Bildpreise und geprüfte technische Daten. Forschungs-Benchmarks, Präferenz-Arenen und unsere Stichproben mit n = 1 bleiben getrennt.
- gemeinsame Messreihen
- 10
- gemeinsame Bildmotive
- 0
- jüngster Arena-Abruf
- 19.09.2026
Bildmodellauswahl ändern
Steckbrief und Kosten
Allgemeine Daten und aufgabenspezifische Preise
Ein Modell kann für neue Bilder einen anderen Preis haben als für Bearbeitungen. Deshalb bleibt der Preis an die jeweilige Arena-Konfiguration gebunden.
| Merkmal | GPT Image 2.5 Sunburst | FLUX.2 Max |
|---|---|---|
| Anbieter | OpenAI | Black Forest Labs |
| Erschienen | 8. September 2026 | Dezember 2025 |
| Zugang | API | API, Web-App |
| Lebenszyklus | Kein gesonderter Statushinweis hinterlegt | Kein gesonderter Statushinweis hinterlegt |
| Gewichte | Proprietär | Proprietär |
| Parameter | Nicht veröffentlicht | Nicht veröffentlicht |
| Maximale Ausgabe | 3.840 × 2.160 Pixel | 4 Megapixel |
| Arena-Konfiguration | Sunburst | Max |
| Text-zu-Bild-Preis | Kein Arena-Eintrag | 70 $ pro 1.000 Bilder |
| Editing-Preis | Kein Arena-Eintrag | 140 $ pro 1.000 Bilder |
| Technische Quelle | ModellquelleGeprüft 19.09.2026 | ModellquelleGeprüft 15.08.2026 |
Prompt-Treue und Fachtests
Gemeinsame Fähigkeits-Benchmarks
Diese exakten Checkpoints haben das feste Gradually-Stichprobenprotokoll noch nicht beide absolviert. Frühere Modellstände dienen nicht als Ersatz. Für dieses Paar liegt aus den eingebundenen Forschungs-Benchmarks kein exakt gemeinsamer Modellstand vor.
Noch kein gemeinsames Gradually-Ranking
Ein Wert erscheint erst, wenn beide exakten Checkpoints alle vier festen Prompts und dieselbe verblindete Auswertung abgeschlossen haben.
Unabhängige Präferenztests
Gemeinsame Arena-Benchmarks
Artificial Analysis und Arena ermitteln Bewertungswerte aus Blindvergleichen. Personen sehen Ausgaben zum gleichen Prompt und wählen ihr bevorzugtes Bild. Neben Gesamtwerten findest du hier getrennte Messreihen für Textdarstellung, Fotorealismus, Porträts, Kunst, kommerzielles Design und Bildbearbeitung. Die Konfidenzintervalle zeigen, wie sicher der jeweilige Vorsprung ist.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark | GPT Image 2.5 Sunburst | FLUX.2 Max | Quelle |
|---|---|---|---|
| LMArena Text to Image: 3D modeling | Höherer Wert1.404,714 Platz 1, 95-%-Konfidenzintervall: ±41,7, 273 Bewertungen | 1.161,397 Platz 28, 95-%-Konfidenzintervall: ±7,37, 11.586 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Art | Höherer Wert1.390,12 Platz 1, 95-%-Konfidenzintervall: ±31,11, 406 Bewertungen | 1.169,986 Platz 26, 95-%-Konfidenzintervall: ±6,55, 16.551 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Cartoon | Höherer Wert1.439,841 Platz 1, 95-%-Konfidenzintervall: ±20,54, 1.198 Bewertungen | 1.169,356 Platz 26, 95-%-Konfidenzintervall: ±5,37, 42.883 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Commercial design | Höherer Wert1.418,818 Platz 1, 95-%-Konfidenzintervall: ±20,95, 1.104 Bewertungen | 1.164,737 Platz 27, 95-%-Konfidenzintervall: ±5,04, 44.226 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Overall | Höherer Wert1.420,715 Platz 1, 95-%-Konfidenzintervall: ±13,08, 3.149 Bewertungen | 1.162,042 Platz 25, 95-%-Konfidenzintervall: ±3,55, 117.339 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Photorealism | Höherer Wert1.423,225 Platz 1, 95-%-Konfidenzintervall: ±20,32, 1.168 Bewertungen | 1.160,996 Platz 27, 95-%-Konfidenzintervall: ±4,96, 50.605 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Portraits | Höherer Wert1.450,124 Platz 2, 95-%-Konfidenzintervall: ±31,56, 509 Bewertungen | 1.157,109 Platz 30, 95-%-Konfidenzintervall: ±6,04, 26.736 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Text to Image: Text rendering | Höherer Wert1.481,069 Platz 1, 95-%-Konfidenzintervall: ±22,66, 1.125 Bewertungen | 1.167,242 Platz 26, 95-%-Konfidenzintervall: ±5,28, 40.341 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Image Editing: Multi-image editing | Höherer Wert1.535,121 Platz 1, 95-%-Konfidenzintervall: ±9,09, 6.150 Bewertungen | 1.250,292 Platz 21, 95-%-Konfidenzintervall: ±4,31, 136.199 Bewertungen | LMArenaAbruf 19.09.2026 |
| LMArena Image Editing: Overall | Höherer Wert1.520,443 Platz 1, 95-%-Konfidenzintervall: ±9,21, 6.704 Bewertungen | 1.261,81 Platz 29, 95-%-Konfidenzintervall: ±3,2, 352.883 Bewertungen | LMArenaAbruf 19.09.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
Visueller Vergleich
Beispielbilder
Eigene Bilder ergänzen die Präferenzdaten, ersetzen sie aber nicht. Prompt, Anzahl der Aufträge und Auswahlregel sind gleich. Anbieterabhängige Auflösung, Qualitätsstufe, Zufall und Prompt-Verarbeitung bleiben sichtbar und verhindern eine vollständig kontrollierte Labormessung.
Noch kein gemeinsamer dokumentierter Lauf
Die feste Testsuite umfasst Typografie, Produktfoto, Figurendetails und Infografik. Ein Motiv erscheint erst, wenn für beide Modelle ein überprüfbarer erster Lauf vorliegt.
Fehlender Bildlauf für GPT Image 2.5 Sunburst
Fehlende Motive. Typografie und Layout, Produktfotografie, Figur und Details, Infografik.
Für diesen nach dem Archivtest veröffentlichten Checkpoint liegt noch kein Gradually-Lauf vor. Die Ergebnisse von GPT Image 2 bleiben GPT Image 2 zugeordnet.
Nächster Schritt. Die vier festen Prompts einmal mit der exakten API-Kennung gpt-image-2.5-sunburst ausführen und anschließend verblindet auswerten.
DokumentationSo liest du den Vergleich
Ein Elo-Wert ist kein Kreativurteil
Ein höherer Arena-Wert bedeutet, dass diese konkrete Konfiguration in Blindwahlen häufiger bevorzugt wurde.
Typografie, Charakterkonsistenz, lokale Ausführung, Lizenz und Preis können für deinen Einsatz wichtiger sein als der Gesamteindruck.
Preise gelten für 1.000 Bilder mit 1.024 × 1.024 Pixeln und den von Artificial Analysis dokumentierten Standardeinstellungen. Abos und Sondertarife sind nicht eingerechnet.
Weitere Duelle
Ähnliche Bildmodell-Vergleiche
Vergleiche GPT Image 2.5 Sunburst und FLUX.2 Max mit weiteren wichtigen Bildmodellen nach denselben Evidenzregeln. Jede Seite zeigt nur exakte gemeinsame Messwerte und Testbilder.
Zum vollständigen Bildmodelle-Vergleich