ChatGPT Bilder 2.0: Der erste “denkende” KI-Bildgenerator, der alles verändert

ChatGPT-Bild 2: Pressekonferenz

Heute Abend wurde ChatGPT Images 2.0 mit großem Erfolg offiziell vorgestellt und ist damit die erste “denkende” Bild-KI. Altman sagte sogar, dies fühle sich an wie ein Sprung von GPT-3 direkt zu GPT-5. Das System versteht nicht nur chinesische Anweisungen präzise und rendert komplexe Benutzeroberflächen, sondern kann sogar Text auf ein Reiskorn gravieren.

OPENL stellt ChatGPT Images 2.0 vor

Das bekannte OpenAI ist wieder da.

Am frühen Morgen moderierte Altman persönlich einen 20-minütigen Livestream und brach damit sein tagelanges Schweigen.

OpenAI hat nun endlich das bereits seit längerem gemunkelte „ChatGPT Images 2.0“ vorgestellt und damit offiziell eine völlig neue Ära der Bildgenerierung eingeläutet.

Was genau ist ChatGPT Images 2.0 (und warum wird es als “denkend” bezeichnet)?

ChatGPT Images 2.0 stellt einen echten Qualitätssprung dar. Es hat enorme Fortschritte beim präzisen Verständnis langer Eingabeaufforderungen, bei der korrekten Anordnung von Objekten und der Verdeutlichung der Beziehungen zwischen ihnen sowie bei der Darstellung komplexer Texte erzielt.

Vor allem aber ist ChatGPT Images 2.0 das erste Bildmodell mit “Denkvermögen”. Es kann im Internet nach Echtzeitinformationen suchen und Selbstüberprüfungen durchführen.

Außerdem kann es acht stilistisch einheitliche Bilder auf einmal ausgeben, und zwar mit einer ultrahohen Auflösung von bis zu 2K.

Einfach ausgedrückt: Die Einführung von ChatGPT Images 2.0 setzt neue Maßstäbe bei der Erzeugung visueller Inhalte—

Präzision auf Pixelebene: Kleiner Text, Symbole, UI-Elemente und andere komplexe Details lassen sich in einem Durchgang generieren, wobei alle Seitenverhältnisse von 3:1 bis 1:3 unterstützt werden;

Mehrsprachige Umwandlung: Chinesische, japanische, koreanische und andere nicht-lateinische Schriften werden korrekt wiedergegeben – nicht nur die Zeichen sind korrekt, sondern auch die Sätze sind flüssig und schlüssig;

Ausgereifte Stile: Fotorealismus, Filmstills, Pixelkunst, Comics – jede Bildsprache wird mühelos beherrscht;

Denkvermögen: ChatGPT Images 2.0 verfügt über Schlussfolgerungsfähigkeiten, kann online recherchieren und sich selbst überprüfen, wobei das Wissen auf den Stand von Dezember 2025 aktualisiert wurde.

In der aktuellen Arena-Rangliste liegt ChatGPT Images 2.0 weit vorne und sichert sich damit den weltweiten Spitzenplatz im Bereich der KI-Bildgenerierung. Es übertrifft Google Nano Banana 2/Pro um 242 Punkte.

In der aktuellen Arena-Rangliste liegt ChatGPT Images 2.0 weit vorne

In allen sieben Text-zu-Bild-Kategorien belegt es den ersten Platz.

In allen sieben Text-zu-Bild-Kategorien belegt es den ersten Platz.

Kernfunktionen von ChatGPT Images 2.0: Vier entscheidende Durchbrüche

FunktionBeschreibungWarum das wichtig ist
Präzision auf PixelebeneStellt kleinen Text, Symbole, UI-Elemente und komplexe Layouts detailgetreu dar; unterstützt flexible Seitenverhältnisse von 3:1 bis 1:3Dadurch eignet es sich für praktische Anwendungen wie UI-Design, Plakate und textlastige Grafiken
Mehrsprachige DarstellungErzeugt korrekt chinesische, japanische, koreanische und andere nicht-lateinische Schriften mit korrekter Rechtschreibung und natürlicher FormulierungBeseitigt eine wesentliche Einschränkung früherer Modelle und ermöglicht die Erstellung globaler und lokalisierter Inhalte
Ausgereifte visuelle StileErzeugt fotorealistische Bilder, filmreife Szenen, Pixelkunst, Comics und vieles mehr mit hoher stilistischer KonsistenzErmöglicht es Kreativen, die Lösung in verschiedenen kreativen und kommerziellen Szenarien einzusetzen
DenkvermögenVersteht Eingabeaufforderungen gründlich, führt Schlussfolgerungen durch, kann Informationen in Echtzeit abrufen und die Ergebnisse selbst überprüfenVerbessert die Genauigkeit und Zuverlässigkeit, insbesondere bei komplexen, mehrstufigen Aufgaben zur Bilderzeugung
Bild

ChatGPT Images 2.0 ermöglicht die Erzeugung von Bildern auf Pixelebene

Das Auffälligste daran ist die Fähigkeit, Grafiken auf Pixelebene zu erzeugen.

Während des Livestreams wurde ein Bild eines Reishaufens erzeugt. Auf einem einzelnen Reiskorn waren die Worte “GPT image 2” eingraviert.

Während des Livestreams wurde ein Bild eines Reishaufens erzeugt. Auf einem einzelnen Reiskorn waren die Worte “GPT image 2” eingraviert.

Altman präsentierte außerdem gemeinsam mit dem Leiter der Bildabteilung, Gabriel Goh, weitere GPU-gestützte Comic-Bilder.

Die Nutzer probierten es sofort aus und waren erneut von den Fähigkeiten von ChatGPT Images 2.0 begeistert.

Manche sagten sogar: “OpenAI ist endlich wieder führend auf dem Gebiet der Bildgenerierung!”

ChatGPT Images 2.0 erzielt Durchbruch bei der Darstellung chinesischer Zeichen

OpenAI scherzte sogar: “Wir kriegen dich schon noch”

In der Vergangenheit lieferten Bildmodelle bei Englisch und lateinischen Sprachen recht ordentliche Ergebnisse, doch sobald sie auf Chinesisch, Japanisch oder Koreanisch stießen, zerfielen sie in “Kritzeleien”.”

Diesmal erfreute sich die offizielle chinesische Demo rasant wachsender Beliebtheit und erregte auf dem asiatischen Markt großes Aufsehen – ähnlich wie damals, als HappyOyster von Alibaba KI-Tools eingeführt.

Chen Boyuan, Forschungswissenschaftler bei OpenAI, trat persönlich in Erscheinung (und hat die Eingabe wahrscheinlich auch selbst verfasst) und erzeugte einen ganzseitigen chinesischen Farbcomic. Darin erzählt er, wie er bei OpenAI die Darstellung chinesischer Texte für ChatGPT Images 2.0 optimiert hat.

Dieses Bild belegt gleich drei Dinge: einen qualitativen Sprung bei der Darstellung chinesischer Texte, präzise Steuerung bei extrem kleinen Schriftgrößen und die Fähigkeit von ChatGPT Images 2.0, komplexe Comics mit mehreren Panels in einem Durchgang zu generieren.

ChatGPT Images 2.0 erzielt Durchbruch bei der Darstellung chinesischer Zeichen

Der Comic besteht aus fünf Reihen. In der ersten Reihe arbeitet Chen an seinem Computer, im Hintergrund ist Bubble Tea zu sehen und an der Wand klebt eine Banane (eine Hommage an eine berühmte Kunstszene).

In der zweiten Zeile ist zu sehen, wie er ein mehrsprachiges, handgezeichnetes Infografik-Poster für seine Heimatstadt Wuxi erstellt, das mit dichtem chinesischem Text gefüllt ist – und alles wird korrekt dargestellt.

In der dritten Reihe ist zu sehen, wie das Team nach Bekanntgabe der Ergebnisse begeistert jubelt.

In der vierten Zeile ändert sich die Stimmung – Chen entspannt sich mit seinem Handy und erhält eine übersetzte Glückwunschnachricht von Altman.

Dann kommt der Höhepunkt.

In der fünften Zeile sieht Chen das von Altman erstellte Glückwunschbild, auf dem in der Mitte deutlich der Satz “steadily catch you” zu lesen ist.

Wer es weiß, weiß es.

In chinesischen Unterhaltungen sagt GPT oft Dinge wie “Ich werde dich nach und nach einholen” oder “Deine Gefühle sind berechtigt”, worüber viele chinesische Nutzer seit Monaten scherzen, da es sich wie übertrieben aufrichtige Therapie-Sprache im amerikanischen Stil anhört.

Im Comic bricht Chen sofort zusammen und schreit in komischer Wut: “Oh nein! Es hat wieder gelernt, zu ‘fangen’!” Die Teamkollegen in der Nähe schwitzen nervös und sagen: “Wir arbeiten hart daran, das Problem zu beheben!”

Dieser selbstironische Humor verdient die volle Punktzahl.

Neben Chinesisch präsentierte ChatGPT Images 2.0 auch einen japanischen Abenteuercomic, eine indische Buchhandlung mit Buchcovern in neun Sprachen, darunter Hindi, Bengali und Telugu, sowie eine Anzeige für eine Unterkunft im koreanischen Hanok-Stil.

Sprache spielt bei der Bilderzeugung keine “untergeordnete Rolle” mehr.

ChatGPT Images 2.0: Der Sprung von GPT-3 zu GPT-5

ChatGPT Images 2.0 kann als nächster Meilenstein in der Bildgenerierung von OpenAI bezeichnet werden.

Während des Livestreams beschrieb Altman ChatGPT Images 2.0 als “ein Gefühl, als würde man direkt von GPT-3 zu GPT-5 springen”.”

Laden Sie ein Gruppenfoto von vier Personen hoch, und ChatGPT Images 2.0 kann direkt ein Magazin-Cover erstellen – mit sorgfältig gestaltetem Layout und typografischer Gestaltung.

Das Poster enthält eine Fülle von Details: die Gestaltung der kleinen Schrift, die einheitliche Darstellung der Gesichter – all das vermittelt ein starkes “Boyband”-Flair.

Was die Detailgenauigkeit angeht, erreicht ChatGPT Images 2.0 einen echten Realismus auf “Fotoniveau” – so realistisch, dass man kaum erkennen kann, dass es sich um KI-generierte Bilder handelt.

Ein Bild stellt beispielsweise das Jahr 2015 nach, als OpenAI gegründet wurde. Die Beleuchtung im Hörsaal und der PPT-Text wirken erstaunlich realistisch.

Das atemberaubendste Beispiel war ein 360°-Panoramabild der Mondlandung.

In einem Panorama-Viewer werden die Position der Sonne, die Schattenrichtungen und feine Details deutlich sichtbar und zeugen von einer räumlichen Intelligenz, die es mit speziellen Lingbot Map – 3D-Kartierung Systeme.

Eine weitere offizielle Demo zeigt einen Screenshot eines macOS-Browsers, in dem ChatGPT geöffnet ist. Die Anordnung der Fenster, das Terminal im Hintergrund, der unaufgeräumte Desktop – so viele visuelle Details, dass er fast wie ein echter Screenshot aussieht.

Bei dieser Darstellungsgenauigkeit zeigt ChatGPT Images 2.0, dass die Kontrolle des Modells über jedes einzelne Pixel eine entscheidende Schwelle überschritten hat.

ChatGPT Images 2.0 erreicht fotorealistische Qualität

Ein weiterer großer Fortschritt ist der Realismus.

Früher hatten KI-Bilder immer einen gewissen “KI-Charakter” – die Haut wirkte zu glatt, die Beleuchtung zu gleichmäßig, die Bildkomposition zu perfekt.

ChatGPT Images 2.0 geht den umgekehrten Weg und lernt “Unvollkommenheit”.”

In offiziellen Demos zeigen Schnappschüsse die Textur von 35-mm-Film, sichtbare Körnung, eine leicht dezentrierte Bildkomposition sowie Kleidung und Haare, die sich im Wind bewegen.

Wenn man es nicht wüsste, könnte man meinen, es handele sich um einen Fotografen, der am Straßenrand ganz beiläufig auf den Auslöser drückt.

ChatGPT Images 2.0 erreicht fotorealistische Qualität

Eine weitere Serie ahmt Fotos aus Einwegkameras nach, wie sie Anfang der 2000er Jahre in den Computerräumen amerikanischer High Schools entstanden sind.

Blitzüberbelichtung, leichte Bewegungsunschärfe und ein orangefarbener Zeitstempel “02 18 04” in der Ecke – all diese Unvollkommenheiten der Filmära werden präzise wiedergegeben.

Auch in puncto Stilvielfalt hat ChatGPT Images 2.0 die Nase vorn.

Die Seitenverhältnisse unterstützen nun Breiten von bis zu 3:1 und Höhen von bis zu 1:3. OpenAI präsentierte sogar eine horizontale traditionelle chinesische Landschaftsrolle mit überzeugender Tuscheverwischung und Negativraum.

Von Filmplakaten der französischen Nouvelle Vague der 1960er Jahre über Lesezeichen im Art-Déco-Stil bis hin zu Charakterbeschreibungen aus Anime – ChatGPT Images 2.0 zeichnet sich durch eine hohe stilistische Konsistenz aus – es ist nicht nur “irgendwie ähnlich”.”

ChatGPT Images 2.0 führt den „Thinking Mode“ ein

Während des Livestreams erklärte Gabriel Goh, Leiter des Bereichs Bildbearbeitung, dass ChatGPT Images 2.0 mit zwei Modi auf den Markt kommt:

Sofortmodus
Denkmodus

Die einschneidendste Neuerung liegt in “Denkmodus.”

Wenn man in ChatGPT die Option “ChatGPT Images 2.0” auswählt, ist diese Funktion nicht mehr nur ein Renderer nach dem Motto „Du sagst, ich zeichne“ – sie wird zu einem Partner für visuelles Denken.

Es verwendet mehr Zeit darauf, Ihre Absicht zu verstehen, im Internet nach Echtzeitinformationen zu suchen, die Bildstruktur zu analysieren und anschließend das Ergebnis zu generieren.

Noch wichtiger ist, dass ChatGPT Images 2.0 im „Thinking“-Modus bis zu acht stilistisch und charakterlich einheitliche, sich schrittweise weiterentwickelnde Bilder in einem Durchgang generieren kann.

 Im „Thinking Mode“ kann ChatGPT Images 2.0 in einem Durchgang bis zu acht stilistisch und charakterlich einheitliche, sich schrittweise weiterentwickelnde Bilder generieren.

Laden Sie ein Porträt hoch, und ChatGPT Images 2.0 liefert Ihnen sofort acht Kombinationen für Sommeroutfits. Wählen Sie eine davon aus, und das Programm generiert weitere Blickwinkel und Kleidungsdetails.

Bei dieser Aufgabe nutzt ChatGPT Images 2.0 zwei Arten von “visueller Intelligenz”:

An erster Stelle steht das visuelle Verständnis – das System muss das Foto wirklich “sehen”, das Aussehen einer Person erfassen und passende Outfit-Kombinationen planen.

An zweiter Stelle steht die visuelle Darstellung – sie muss das geplante Layout in zusammenhängende, strukturierte Bilder umsetzen.

Bisher mussten für die Erstellung von Social-Media-Inhalten Bilder einzeln generiert und manuell zusammengefügt werden. Jetzt lassen sich mit einer einzigen Eingabeaufforderung in ChatGPT Images 2.0 Inhalte für Twitter, Instagram Stories, den Instagram-Feed und LinkedIn auf einmal generieren – und das in einheitlichem Stil und mit einheitlicher Gestaltung.

Eine offizielle Demo zeigte Werbematerialien für den Matcha-Laden “kizuki” in Brooklyn – eisgekühlter Erdbeer-Matcha im Sonnenlicht, eine Mischung aus Streetwear-Ästhetik und japanischem Minimalismus, wobei alle Formate in einem Schritt erstellt wurden.

In einer offiziellen Demo wurden Werbematerialien für den Matcha-Laden “kizuki” in Brooklyn gezeigt.”

Eine weitere Demo zeigt ein wissenschaftliches Poster: Laden Sie eine PDF-Datei hoch, und ChatGPT Images 2.0 extrahiert wichtige Diagramme, Daten und Strukturen und ordnet sie zu einem querformatigen Poster an.

Insbesondere im „Thinking“-Modus kann ChatGPT Images 2.0 auch direkt im Internet suchen.

Das Team gab bekannt, dass es sich bei dem “DuckTape”-Modell aus dem Blindtest von Arena vor einigen Tagen tatsächlich um ChatGPT Images 2.0 handelte.

Sie ließen das Programm sogar online Nutzerfeedback sammeln und daraus ein Bild erstellen – und es erzeugte einen scanbaren QR-Code.

Also… Ist es tatsächlich besser als Midjourney oder Stable Diffusion?

Das ist die Frage, die sich die meisten Menschen stellen werden, auch wenn sie sie nicht direkt aussprechen.

Eine grobe Vorstellung davon:

  • Textdarstellung: ChatGPT Images 2.0 ist der Konkurrenz weit voraus
  • Mehrsprachig: auch in Zukunft (insbesondere Chinesisch)
  • Benutzerfreundlichkeit: deutlich geringere Hürde
  • Steuerung: immer noch nicht so flexibel wie Stable Diffusion
  • Reiner “Kunststil”: Midjourney hat nach wie vor die Nase vorn

Wenn Ihre Arbeit also Folgendes umfasst: Inhalte aus der Praxis (Benutzeroberflächen, Plakate, Anzeigen, textlastige Grafiken), Images 2.0 scheint nun schon viel näher an der Einsatzreife zu sein.

Wenn man sehr stilisierte Kunst schafft oder extreme Kontrolle wünscht, haben die alten Geräte nach wie vor ihre Berechtigung.

Realismus auf Fotoniveau: KI-Bilder sehen endlich nicht mehr nach KI aus

Ein weiterer großer Fortschritt ist der Realismus.

Frühere KI-Bilder hatten oft diesen seltsamen “KI-Charakter” – zu glatt, zu perfekt, irgendwie nicht ganz stimmig.

Images 2.0 schlägt den umgekehrten Weg ein und beginnt, “Unvollkommenheit” zu erlernen.”

In offiziellen Demos zeigen Schnappschüsse die Textur von 35-mm-Film, sichtbare Körnung, eine leicht dezentrierte Bildkomposition sowie Kleidung und Haare, die sich im Wind bewegen.

Eine weitere Serie ahmt Fotos aus Einwegkameras nach, wie sie Anfang der 2000er Jahre in den Computerräumen amerikanischer High Schools entstanden sind.

Blitzüberbelichtung, Bewegungsunschärfe, Zeitstempel in der Ecke – all diese chaotischen, unvollkommenen Details sind zu sehen.

Wenn man es nicht wüsste, würde man wahrscheinlich annehmen, dass ein Mensch sie aufgenommen hat.

So wendet man es tatsächlich an (ohne zu viel darüber nachzudenken)

Der Einstieg ist ziemlich einfach:

  1. ChatGPT öffnen
  2. Bildgenerierung auswählen
  3. Wähle den „Instant“- oder den „Thinking“-Modus
  4. Beschreibe, was du willst (übertreibe es dabei aber nicht)
  5. Ein bisschen durchprobieren

Ein kleiner Tipp:
Wenn Ihre Aufgabe Folgendes umfasst: Layout, Text oder mehrere Elemente, dann wechsle einfach direkt in den Denkmodus. Das dauert zwar etwas länger, erspart dir aber erneute Versuche.

Anregungen sind immer noch wichtiger, als man denkt

Trotz aller Verbesserungen spielen Eingabeaufforderungen nach wie vor eine wichtige Rolle.

Ein einfaches Muster, das in den meisten Fällen funktioniert:

Thema + Stil + Details + Kontext

Zum Beispiel:

  • “ein Plakat” → zu vage
  • “Ein minimalistisches Poster im japanischen Stil mit gefrorenem Erdbeer-Matcha, sanftem Sonnenlicht, Street-Fotografie-Flair und klarer Typografie” → viel besser
Echter Test von GPT-Bild 2

Und falls du Text im Bild brauchst, sag es einfach ganz klar. Das Modell ist endlich gut genug, um es auszuprobieren.

ChatGPT Images 2.0 ist nun sowohl in ChatGPT als auch in Codex verfügbar

Ab heute können alle ChatGPT- und Codex-Nutzer ChatGPT Images 2.0 nutzen.

Die Funktion zur Erzeugung von “denkenden” Bildern steht nun Nutzern von ChatGPT Plus, Pro und Business mit klar definierten Zugriffsebenen zur Verfügung, wodurch die Verwirrung vermieden wird, die entstand, als Nutzer sich fragten: “Hat Anthropic den Claude-Code aus Pro entfernt??” Das zugrunde liegende Modell „gpt-image-2“ ist ebenfalls in der API verfügbar.

Was die Preisgestaltung angeht, ist ChatGPT Images 2.0 leistungsstärker, während die Kosten für die Ein- und Ausgabe von Token unverändert bleiben, was im Vergleich zu Claude Opus 4.7 Preisgestaltung.

gpt image 2 Preise

Für normale Nutzer lassen sich Präsentationsgrafiken, Social-Media-Beiträge und Produktkarten – Aufgaben, für die man früher stundenlang in Photoshop arbeiten musste – nun mit ChatGPT Images 2.0 durch eine einzige Eingabe erledigen.

Für Entwickler und Unternehmen lassen sich lokalisierte Anzeigen, mehrsprachige Infografiken, Bildungsinhalte und Design-Tools nun über eine API in großem Maßstab automatisieren.

In Codex integriert ChatGPT Images 2.0 die Bilderzeugung in den Arbeitsbereich und verleiht dem laufenden Prozess damit eine interessante visuelle Dimension. ChatGPT Codex vs Claude Code Diskussion. Designteams können UI-Konzepte erstellen, Optionen vergleichen und direkt zur Produktentwicklung übergehen – und das alles, ohne das Tool wechseln zu müssen.

Preise, Zugang und was das in der Praxis bedeutet

ChatGPT Images 2.0 ist ab sofort in ChatGPT (Plus, Pro, Business) sowie über die API (gpt-image-2) verfügbar.

Auf den ersten Blick haben sich die Preise nicht wesentlich verändert, aber die Wert pro Ausgang ist deutlich höher.

In der Praxis bedeutet das:

  • Dinge, für die Sie früher Photoshop geöffnet haben – das tun Sie vielleicht mittlerweile nicht mehr, was den allgemeinen Wandel in der Branche widerspiegelt von der Vibe-Codierung zur Wunsch-Codierung wobei die KI die Hauptarbeit übernimmt.
  • Teams können ganze Serien von Grafiken ohne großen manuellen Aufwand erstellen
  • Entwickler können die Bildgenerierung direkt in ihre Arbeitsabläufe integrieren

Es geht weniger um “billige Bilder”, sondern vielmehr um Reibungsverluste bei der visuellen Produktion beseitigen.

Ist ChatGPT Images 2.0 der „iPhone-Moment“ der KI-Bildgenerierung?

Rückblickend – von DALL·E über Midjourney bis hin zu Stable Diffusion – befand sich die KI-Bildgenerierung lange Zeit in einem Zustand, in dem sie zwar “nutzbar, aber noch nicht ganz ausgereift” war.”

Fehler bei der Textdarstellung, mangelhafte Mehrsprachigkeit, sich wiederholende Stile und offensichtlich von einer KI erstellte Texte – all dies stand einer ernsthaften Nutzung in realen Szenarien im Wege.

ChatGPT Images 2.0 behebt all diese Mängel auf einen Schlag und bietet darüber hinaus Denkfähigkeit sowie die Erzeugung mehrerer Bilder.

Es ist zwar noch nicht perfekt, aber ChatGPT Images 2.0 könnte das erste Bildmodell sein, bei dem Designer, Marketingfachleute und Content-Ersteller das Gefühl haben: “Das kann ich tatsächlich in der Praxis einsetzen.”

Nun müssen Designer möglicherweise neu überdenken, worin ihr eigentlicher Wettbewerbsvorteil besteht, zumal die KI die kreative Landschaft im Zuge der Fortschritte in Claude-Design.

Nach oben scrollen