Zum Hauptinhalt springen

Direktvergleich

GPT Image 2.5 Sunburst vs. FLUX.2 Flex

Vergleiche gemeinsame Fähigkeitstests, Arena-Werte mit dokumentiertem Abrufdatum, aufgabenspezifische Bildpreise und geprüfte technische Daten. Forschungs-Benchmarks, Präferenz-Arenen und unsere Stichproben mit n = 1 bleiben getrennt.

gemeinsame Messreihen
10
gemeinsame Bildmotive
0
jüngster Arena-Abruf
19.09.2026

Bildmodellauswahl ändern

Steckbrief und Kosten

Allgemeine Daten und aufgabenspezifische Preise

Ein Modell kann für neue Bilder einen anderen Preis haben als für Bearbeitungen. Deshalb bleibt der Preis an die jeweilige Arena-Konfiguration gebunden.

Allgemeine Daten und Preise von GPT Image 2.5 Sunburst und FLUX.2 Flex
MerkmalGPT Image 2.5 SunburstFLUX.2 Flex
AnbieterOpenAIBlack Forest Labs
Erschienen8. September 2026November 2025
ZugangAPIAPI, Web-App
LebenszyklusKein gesonderter Statushinweis hinterlegtKein gesonderter Statushinweis hinterlegt
GewichteProprietärProprietär
ParameterNicht veröffentlichtNicht veröffentlicht
Maximale Ausgabe3.840 × 2.160 Pixel4 Megapixel
Arena-KonfigurationSunburstFlex
Text-zu-Bild-PreisKein Arena-Eintrag60 $ pro 1.000 Bilder
Editing-PreisKein Arena-Eintrag120 $ pro 1.000 Bilder
Technische QuelleModellquelleGeprüft 19.09.2026ModellquelleGeprüft 15.08.2026

Prompt-Treue und Fachtests

Gemeinsame Fähigkeits-Benchmarks

Diese exakten Checkpoints haben das feste Gradually-Stichprobenprotokoll noch nicht beide absolviert. Frühere Modellstände dienen nicht als Ersatz. Für dieses Paar liegt aus den eingebundenen Forschungs-Benchmarks kein exakt gemeinsamer Modellstand vor.

Noch kein gemeinsames Gradually-Ranking

Ein Wert erscheint erst, wenn beide exakten Checkpoints alle vier festen Prompts und dieselbe verblindete Auswertung abgeschlossen haben.

Unabhängige Präferenztests

Gemeinsame Arena-Benchmarks

Artificial Analysis und Arena ermitteln Bewertungswerte aus Blindvergleichen. Personen sehen Ausgaben zum gleichen Prompt und wählen ihr bevorzugtes Bild. Neben Gesamtwerten findest du hier getrennte Messreihen für Textdarstellung, Fotorealismus, Porträts, Kunst, kommerzielles Design und Bildbearbeitung. Die Konfidenzintervalle zeigen, wie sicher der jeweilige Vorsprung ist.

10 gemeinsame Messreihen
GPT Image 2.5 SunburstFLUX.2 Flex
LMArena Text to Image: 3D modelingBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.404,714
FLUX.2 Flex1.172,339
LMArena Text to Image: ArtBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.390,12
FLUX.2 Flex1.155,555
LMArena Text to Image: CartoonBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.439,841
FLUX.2 Flex1.162,266
LMArena Text to Image: Commercial designBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.418,818
FLUX.2 Flex1.173,172
LMArena Text to Image: OverallBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.420,715
FLUX.2 Flex1.156,503
LMArena Text to Image: PhotorealismBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.423,225
FLUX.2 Flex1.146,875
LMArena Text to Image: PortraitsBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.450,124
FLUX.2 Flex1.144,629
LMArena Text to Image: Text renderingBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.481,069
FLUX.2 Flex1.171,992
LMArena Image Editing: Multi-image editingBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.535,121
FLUX.2 Flex1.234,148
LMArena Image Editing: OverallBlindwahl aus identischem Prompt, höher ist besser
GPT Image 2.5 SunburstHöherer Wert1.520,443
FLUX.2 Flex1.225,241

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Arena-Benchmarkwerte von GPT Image 2.5 Sunburst und FLUX.2 Flex
BenchmarkGPT Image 2.5 SunburstFLUX.2 FlexQuelle
LMArena Text to Image: 3D modeling
Höherer Wert1.404,714
Platz 1, 95-%-Konfidenzintervall: ±41,7, 273 Bewertungen
1.172,339
Platz 24, 95-%-Konfidenzintervall: ±7,04, 15.061 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Art
Höherer Wert1.390,12
Platz 1, 95-%-Konfidenzintervall: ±31,11, 406 Bewertungen
1.155,555
Platz 31, 95-%-Konfidenzintervall: ±6,39, 21.767 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Cartoon
Höherer Wert1.439,841
Platz 1, 95-%-Konfidenzintervall: ±20,54, 1.198 Bewertungen
1.162,266
Platz 29, 95-%-Konfidenzintervall: ±5,16, 55.805 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Commercial design
Höherer Wert1.418,818
Platz 1, 95-%-Konfidenzintervall: ±20,95, 1.104 Bewertungen
1.173,172
Platz 24, 95-%-Konfidenzintervall: ±4,96, 55.214 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Overall
Höherer Wert1.420,715
Platz 1, 95-%-Konfidenzintervall: ±13,08, 3.149 Bewertungen
1.156,503
Platz 27, 95-%-Konfidenzintervall: ±3,43, 149.288 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Photorealism
Höherer Wert1.423,225
Platz 1, 95-%-Konfidenzintervall: ±20,32, 1.168 Bewertungen
1.146,875
Platz 36, 95-%-Konfidenzintervall: ±4,88, 63.739 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Portraits
Höherer Wert1.450,124
Platz 2, 95-%-Konfidenzintervall: ±31,56, 509 Bewertungen
1.144,629
Platz 37, 95-%-Konfidenzintervall: ±5,83, 33.656 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Text to Image: Text rendering
Höherer Wert1.481,069
Platz 1, 95-%-Konfidenzintervall: ±22,66, 1.125 Bewertungen
1.171,992
Platz 25, 95-%-Konfidenzintervall: ±5,15, 49.929 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Image Editing: Multi-image editing
Höherer Wert1.535,121
Platz 1, 95-%-Konfidenzintervall: ±9,09, 6.150 Bewertungen
1.234,148
Platz 24, 95-%-Konfidenzintervall: ±4,35, 125.558 Bewertungen
LMArenaAbruf 19.09.2026
LMArena Image Editing: Overall
Höherer Wert1.520,443
Platz 1, 95-%-Konfidenzintervall: ±9,21, 6.704 Bewertungen
1.225,241
Platz 38, 95-%-Konfidenzintervall: ±3,18, 415.750 Bewertungen
LMArenaAbruf 19.09.2026

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Visueller Vergleich

Beispielbilder

Eigene Bilder ergänzen die Präferenzdaten, ersetzen sie aber nicht. Prompt, Anzahl der Aufträge und Auswahlregel sind gleich. Anbieterabhängige Auflösung, Qualitätsstufe, Zufall und Prompt-Verarbeitung bleiben sichtbar und verhindern eine vollständig kontrollierte Labormessung.

Noch kein gemeinsamer dokumentierter Lauf

Die feste Testsuite umfasst Typografie, Produktfoto, Figurendetails und Infografik. Ein Motiv erscheint erst, wenn für beide Modelle ein überprüfbarer erster Lauf vorliegt.

Fehlender Bildlauf für GPT Image 2.5 Sunburst

Fehlende Motive. Typografie und Layout, Produktfotografie, Figur und Details, Infografik.

Für diesen nach dem Archivtest veröffentlichten Checkpoint liegt noch kein Gradually-Lauf vor. Die Ergebnisse von GPT Image 2 bleiben GPT Image 2 zugeordnet.

Nächster Schritt. Die vier festen Prompts einmal mit der exakten API-Kennung gpt-image-2.5-sunburst ausführen und anschließend verblindet auswerten.

Dokumentation

So liest du den Vergleich

Ein Elo-Wert ist kein Kreativurteil

Ein höherer Arena-Wert bedeutet, dass diese konkrete Konfiguration in Blindwahlen häufiger bevorzugt wurde.

Typografie, Charakterkonsistenz, lokale Ausführung, Lizenz und Preis können für deinen Einsatz wichtiger sein als der Gesamteindruck.

Preise gelten für 1.000 Bilder mit 1.024 × 1.024 Pixeln und den von Artificial Analysis dokumentierten Standardeinstellungen. Abos und Sondertarife sind nicht eingerechnet.

Weitere Duelle

Vergleiche GPT Image 2.5 Sunburst und FLUX.2 Flex mit weiteren wichtigen Bildmodellen nach denselben Evidenzregeln. Jede Seite zeigt nur exakte gemeinsame Messwerte und Testbilder.

Zum vollständigen Bildmodelle-Vergleich