ChatGPT Images 2.0: il primo generatore di immagini basato sull'intelligenza artificiale “pensante” che sta rivoluzionando il settore

ChatGPT immagine 2 conferenza stampa

Stasera, ChatGPT Images 2.0 è stato lanciato ufficialmente con grande clamore, diventando la prima IA “pensante” dedicata alle immagini. Altman ha persino affermato che sembra un balzo da GPT-3 direttamente a GPT-5. Non solo comprende con precisione le istruzioni in cinese e riproduce interfacce utente complesse, ma è persino in grado di incidere del testo su un chicco di riso.

OPENL: Presentazione di ChatGPT Images 2.0

Quella ben nota OpenAI è tornata di nuovo.

Di prima mattina, Altman ha condotto personalmente una diretta in streaming di 20 minuti, rompendo il silenzio durato diversi giorni.

OpenAI ha finalmente svelato il tanto chiacchierato ChatGPT Images 2.0, inaugurando ufficialmente una nuova era nella generazione di immagini.

Che cos’è esattamente ChatGPT Images 2.0 (e perché la gente lo definisce “pensante”)

ChatGPT Images 2.0 rappresenta un vero e proprio salto di qualità. Ha compiuto enormi progressi nella comprensione precisa di prompt lunghi, nella disposizione accurata degli oggetti e nella chiarificazione delle relazioni tra di essi, nonché nella resa di testi complessi.

Ma soprattutto, ChatGPT Images 2.0 è il primo modello di immagini dotato di “capacità di ragionamento”. È in grado di cercare informazioni in tempo reale su Internet e di effettuare autocontrolli.

È inoltre in grado di generare otto immagini stilisticamente coerenti in un’unica operazione, con una risoluzione ultra-alta fino a 2K.

Per dirla in parole semplici, l’arrivo di ChatGPT Images 2.0 ridefinisce lo standard di riferimento nella generazione di immagini—

Precisione a livello di pixel: è possibile generare in un unico passaggio testi di piccole dimensioni, icone, elementi dell'interfaccia utente e altri dettagli complessi, con supporto per tutti i rapporti di aspetto da 3:1 a 1:3;

Trasformazione multilingue: il cinese, il giapponese, il coreano e altri alfabeti non latini vengono riprodotti in modo accurato: non solo i caratteri sono corretti, ma le frasi risultano fluide e coerenti;

Stili consolidati: fotorealismo, immagini tratte da film, pixel art, fumetti… ogni linguaggio visivo viene gestito con disinvoltura;

Capacità di ragionamento: ChatGPT Images 2.0 introduce la funzione di ragionamento, in grado di effettuare ricerche online e di autocontrollo, con conoscenze aggiornate a dicembre 2025.

Nell'ultima classifica di Arena, ChatGPT Images 2.0 si pone nettamente in testa, aggiudicandosi il primato mondiale nella generazione di immagini tramite IA. Supera Google Nano Banana 2/Pro di 242 punti.

Nell’ultima classifica di Arena, ChatGPT Images 2.0 è di gran lunga in testa

In tutte e sette le categorie "da testo a immagine", si classifica al primo posto.

In tutte e sette le categorie "da testo a immagine", si classifica al primo posto.

Funzionalità principali di ChatGPT Images 2.0: quattro innovazioni chiave

CaratteristicaDescrizionePerché è importante
Precisione a livello di pixelRiproduce con precisione testi di piccole dimensioni, icone, elementi dell’interfaccia utente e layout complessi con dettagli minuziosi; supporta rapporti di aspetto flessibili da 3:1 a 1:3Lo rende utilizzabile per attività concrete come la progettazione di interfacce utente, la realizzazione di poster e la creazione di immagini con molto testo
Rendering multilingueGenera correttamente testi in cinese, giapponese, coreano e altri alfabeti non latini, con ortografia corretta e fraseggio naturaleElimina una delle principali limitazioni dei modelli precedenti, consentendo la creazione di contenuti sia a livello globale che localizzato
Stili visivi consolidatiCrea immagini fotorealistiche, scene cinematografiche, pixel art, fumetti e altro ancora, garantendo una forte coerenza stilisticaConsente ai creatori di utilizzarlo in diversi contesti creativi e commerciali
Capacità di ragionamentoComprende a fondo le istruzioni, svolge ragionamenti, è in grado di cercare informazioni in tempo reale e verifica autonomamente i risultatiMigliora la precisione e l'affidabilità, in particolare per attività complesse di generazione di immagini articolate in più fasi
immagine

ChatGPT Images 2.0 raggiunge la generazione a livello di pixel

La caratteristica più sorprendente è la sua capacità di generazione a livello di pixel.

Durante la diretta in streaming è stata generata l'immagine di un mucchio di riso. Su un singolo chicco di riso erano incise le parole “GPT image 2”.

Durante la diretta in streaming è stata generata l'immagine di un mucchio di riso. Su un singolo chicco di riso erano incise le parole “GPT image 2”.

Altman ha inoltre presentato altre immagini di fumetti realizzate con l'ausilio della GPU, insieme al responsabile del reparto immagini Gabriel Goh.

Gli utenti lo hanno subito provato e sono rimasti nuovamente stupiti dalle potenzialità di ChatGPT Images 2.0.

Alcuni hanno addirittura affermato: “OpenAI è finalmente tornata a fare da apripista nel campo della generazione di immagini!”

ChatGPT Images 2.0 fa un passo avanti nella resa delle immagini in cinese

OpenAI ha persino scherzato: “ti prenderemo di sicuro”

In passato, i modelli basati su immagini funzionavano discretamente con l’inglese e le lingue di origine latina, ma non appena si trovavano di fronte al cinese, al giapponese o al coreano, i risultati si trasformavano in “scarabocchi”.”

Questa volta, la demo ufficiale cinese ha riscosso un enorme successo, attirando grande attenzione sul mercato asiatico, proprio come era successo quando HappyOyster di Alibaba Lancio degli strumenti di intelligenza artificiale.

Chen Boyuan, ricercatore di OpenAI, è intervenuto di persona (probabilmente scrivendo lui stesso il prompt) e ha generato un fumetto a colori in cinese a pagina intera. Il fumetto racconta la storia di come abbia ottimizzato la resa del testo cinese per ChatGPT Images 2.0 presso OpenAI.

Questa immagine dimostra tre cose contemporaneamente: un salto di qualità nella resa del testo cinese, un controllo preciso anche con caratteri di dimensioni estremamente ridotte e la capacità di ChatGPT Images 2.0 di generare fumetti complessi a più vignette in un unico passaggio.

ChatGPT Images 2.0 fa un passo avanti nella resa delle immagini in cinese

Il fumetto è composto da cinque righe. Nella prima riga, Chen lavora al computer, con un tè alle bollicine sullo sfondo e una banana attaccata al muro con del nastro adesivo (un omaggio a una famosa scena artistica).

La seconda riga lo ritrae mentre realizza un poster informativo multilingue disegnato a mano per la sua città natale, Wuxi, ricco di testo in cinese molto denso, tutto riprodotto correttamente.

La terza riga mostra la squadra che festeggia con entusiasmo dopo aver visto i risultati.

La quarta riga cambia tono: Chen si rilassa con il cellulare e riceve un messaggio di congratulazioni tradotto da Altman.

E poi arriva il momento clou.

Nella quinta riga, Chen vede l’immagine di auguri creata da Altman, con la frase “ti raggiungerò sicuramente” scritta in evidenza al centro.

Chi lo sa, lo sa.

Nelle conversazioni in cinese, GPT dice spesso frasi del tipo “Ti raggiungerò passo dopo passo” o “I tuoi sentimenti sono legittimi”, che molti utenti cinesi hanno preso in giro per mesi perché suonano come discorsi terapeutici in stile americano eccessivamente sinceri.

Nel fumetto, Chen crolla immediatamente, gridando con rabbia comica: “Oh no! Ha imparato di nuovo a ‘prendere’!” I compagni di squadra lì vicino sudano nervosamente, dicendo: “Stiamo lavorando sodo per risolvere il problema!”

Questo umorismo autoironico merita il massimo dei voti.

Oltre al cinese, ChatGPT Images 2.0 ha presentato anche un fumetto d'avventura giapponese, una libreria indiana con copertine di libri in nove lingue, tra cui l'hindi, il bengalese e il telugu, e un annuncio pubblicitario di un alloggio in stile hanok coreano.

La lingua non è più considerata un elemento “di secondo piano” nella generazione di immagini.

ChatGPT Images 2.0: dal GPT-3 al GPT-5, un vero e proprio balzo in avanti

ChatGPT Images 2.0 può essere definito la prossima pietra miliare nella generazione di immagini di OpenAI.

Durante la diretta streaming, Altman ha descritto ChatGPT Images 2.0 come “un’esperienza simile a quella di passare direttamente da GPT-3 a GPT-5”.”

Carica una foto di gruppo di quattro persone e ChatGPT Images 2.0 potrà generare direttamente la copertina di una rivista, con un layout e una tipografia curati nei minimi dettagli.

Il poster presenta una grande ricchezza di dettagli: la gestione dei caratteri di piccole dimensioni, la coerenza dei tratti dei volti, il tutto a creare una forte atmosfera da “boy band”.

In termini di dettagli, ChatGPT Images 2.0 raggiunge un realismo davvero “a livello fotografico”, talmente realistico che è difficile capire che si tratta di immagini generate dall’IA.

Ad esempio, un'immagine riproduce il 2015, anno in cui è stata fondata OpenAI. L'illuminazione dell'aula e il testo della presentazione PowerPoint sono incredibilmente realistici.

L'esempio più sbalorditivo è stata un'immagine panoramica a 360° dello sbarco sulla Luna.

Se visualizzati in un visualizzatore panoramico, la posizione del sole, la direzione delle ombre e i minimi dettagli appaiono tutti chiaramente, dimostrando un’intelligenza spaziale che non ha nulla da invidiare a quella dei dispositivi dedicati Mappatura 3D di Lingbot Map sistemi.

Un’altra demo ufficiale mostra uno screenshot di un browser su macOS con ChatGPT aperto. La disposizione delle finestre, il terminale in background, il desktop disordinato: ci sono così tanti dettagli visivi che sembra quasi identico a uno screenshot reale.

A questo livello di precisione di rendering, ChatGPT Images 2.0 dimostra che il controllo del modello su ogni singolo pixel ha superato una soglia critica.

ChatGPT Images 2.0 raggiunge il fotorealismo

Un altro importante passo avanti è il realismo.

In passato, le immagini generate dall'IA avevano sempre un certo “tocco tipico dell'IA”: la pelle troppo liscia, l'illuminazione troppo uniforme, la composizione troppo perfetta.

ChatGPT Images 2.0 segue la strada opposta e impara a riconoscere le “imperfezioni”.”

Nelle demo ufficiali, alcune immagini spontanee mostrano la texture tipica della pellicola da 35 mm, la grana visibile, una composizione leggermente decentrata e abiti e capelli mossi dal vento.

Se non te lo dicessero, penseresti che si tratti di un fotografo che scatta con disinvoltura un’immagine sul ciglio della strada.

ChatGPT Images 2.0 raggiunge il fotorealismo

Un’altra serie riproduce le foto scattate con le macchine fotografiche usa e getta nei laboratori di informatica delle scuole superiori americane dei primi anni 2000.

Sovraesposizione del flash, una leggera sfocatura dovuta al movimento e la data in arancione “02 18 04” nell’angolo: tutte le imperfezioni dell’era della pellicola sono riprodotte con precisione.

Anche in termini di varietà stilistica, ChatGPT Images 2.0 si distingue dalla concorrenza.

I rapporti di aspetto ora supportano proporzioni fino a 3:1 in larghezza e 1:3 in altezza. OpenAI ha persino presentato un rotolo orizzontale raffigurante un paesaggio tradizionale cinese, con una diffusione dell’inchiostro e uno spazio negativo molto realistici.

Dai manifesti dei film della Nouvelle Vague francese degli anni “60 ai segnalibri in stile Art Déco, fino alle schede dei personaggi degli anime, ChatGPT Images 2.0 mantiene una forte coerenza stilistica — non solo una ”vaga somiglianza”.”

ChatGPT Images 2.0 introduce la modalità "Thinking"

Durante la diretta streaming, Gabriel Goh, responsabile del settore immagini, ha dichiarato che ChatGPT Images 2.0 viene lanciato con due modalità:

Modalità istantanea
Modalità di riflessione

L'aggiornamento più rivoluzionario consiste in “Modalità di riflessione.”

Una volta selezionato in ChatGPT, ChatGPT Images 2.0 non è più solo uno strumento di rendering del tipo “tu dici, io disegno”, ma diventa un partner di pensiero visivo.

Dedica più tempo a comprendere le tue intenzioni, a cercare informazioni in tempo reale sul web, ad analizzare la struttura delle immagini e infine a generare i risultati.

Ma soprattutto, in modalità "pensiero", ChatGPT Images 2.0 è in grado di generare in un unico processo fino a otto immagini stilisticamente coerenti, con personaggi coerenti e in continua evoluzione.

 In modalità "pensiero", ChatGPT Images 2.0 è in grado di generare fino a otto immagini in un unico ciclo, tutte coerenti dal punto di vista stilistico e dei personaggi, nonché in continua evoluzione.

Carica un ritratto e ChatGPT Images 2.0 ti proporrà immediatamente otto combinazioni di outfit estivi. Scegline una e il programma genererà ulteriori angolazioni e dettagli sull’abbigliamento.

In questa attività, ChatGPT Images 2.0 utilizza due tipi di “intelligenza visiva”:

In primo luogo, la comprensione visiva: deve davvero “vedere” la foto, cogliere l’aspetto di una persona e pianificare abbinamenti di abbigliamento adeguati.

Il secondo aspetto è la generazione visiva: deve trasformare il layout progettato in immagini coerenti e strutturate.

In passato, la creazione di contenuti per i social media richiedeva di generare le immagini una per una e di unirle manualmente. Ora, con un unico prompt su ChatGPT Images 2.0 è possibile generare contemporaneamente contenuti nei formati Twitter, Storie di Instagram, Feed di Instagram e LinkedIn, con tono e composizione uniformi.

Una demo ufficiale ha mostrato il materiale pubblicitario di un negozio di matcha di Brooklyn chiamato “kizuki”: matcha alla fragola ghiacciato sotto i raggi del sole, in cui l’estetica streetwear si fonde con il minimalismo giapponese, il tutto realizzato in un unico passaggio.

Una demo ufficiale ha mostrato il materiale pubblicitario di un negozio di matcha di Brooklyn chiamato “kizuki”

Un’altra demo mostra un poster accademico: basta caricare un PDF e ChatGPT Images 2.0 estrae i grafici, i dati e la struttura principali, organizzandoli in un poster orizzontale.

In particolare, in modalità "pensiero", ChatGPT Images 2.0 è anche in grado di effettuare ricerche direttamente sul web.

Il team ha rivelato che il modello “DuckTape”, oggetto di un test alla cieca condotto da Arena pochi giorni fa, era in realtà ChatGPT Images 2.0.

Hanno persino fatto in modo che raccogliesse i feedback degli utenti online e li trasformasse in un'immagine, generando così un codice QR scansionabile.

Allora… È davvero migliore di Midjourney o Stable Diffusion?

Questa è la domanda che la maggior parte delle persone si pone, anche se non la formula esplicitamente.

Un modo approssimativo per pensarci:

  • Visualizzazione del testo: ChatGPT Images 2.0 è decisamente all'avanguardia
  • Multilingue: anche in futuro (soprattutto in Cina)
  • Facilità d'uso: una barriera molto più bassa
  • Controllo: non è ancora flessibile come Stable Diffusion
  • Puro “stile artistico”: Midjourney non ha ancora perso il suo smalto

Quindi, se il tuo lavoro prevede contenuti reali (interfaccia utente, manifesti, pubblicità, immagini con molto testo), Images 2.0 sembra ormai molto più vicino a essere utilizzabile.

Se ti dedichi a un’arte altamente stilizzata o desideri un controllo estremo, i modelli di vecchia generazione hanno ancora un posto nel mercato.

Realismo fotografico: le immagini generate dall’IA finalmente non sembrano più create dall’IA

Un altro importante passo avanti è il realismo.

Le immagini generate dall'intelligenza artificiale del passato presentavano spesso quella strana “sensazione tipica dell'IA”: troppo levigate, troppo perfette, leggermente fuori posto.

Images 2.0 va nella direzione opposta e inizia a imparare l“”imperfezione”.”

Nelle demo ufficiali, alcune immagini spontanee mostrano la texture tipica della pellicola da 35 mm, la grana visibile, una composizione leggermente decentrata e abiti e capelli mossi dal vento.

Un’altra serie riproduce le foto scattate con le macchine fotografiche usa e getta nei laboratori di informatica delle scuole superiori americane dei primi anni 2000.

Sovraesposizione del flash, sfocatura dovuta al movimento, data e ora nell’angolo: tutti quei dettagli disordinati e imperfetti ci sono tutti.

Se non lo sapessi, probabilmente penseresti che siano state scattate da una persona.

Come usarlo davvero (senza pensarci troppo)

Iniziare è piuttosto semplice:

  1. Apri ChatGPT
  2. Scegli la generazione di immagini
  3. Scegli la modalità "Istantanea" o "Riflessiva"
  4. Descrivi ciò che desideri (senza rifinirlo troppo)
  5. Ripetiamo un po'

Un piccolo consiglio:
Se il tuo incarico prevede impaginazione, testo o più elementi, passa direttamente alla modalità "Pensamento". È più lenta, ma ti evita di dover riprovare.

Il prompt è ancora più importante di quanto si pensi

Nonostante tutti gli aggiornamenti, i suggerimenti continuano ad avere la loro importanza.

Uno schema semplice che funziona quasi sempre:

Argomento + stile + dettagli + contesto

Ad esempio:

  • “un poster” → troppo vago
  • “Un poster minimalista in stile giapponese con matcha alla fragola ghiacciato, luce solare soffusa, atmosfera da fotografia di strada, tipografia pulita” → molto meglio
test reale dell'immagine GPT 2

Inoltre, se hai bisogno di inserire del testo nell'immagine, basta che lo dici chiaramente. Il modello è finalmente abbastanza valido da poter essere provato.

ChatGPT Images 2.0 è ora disponibile su ChatGPT e Codex

A partire da oggi, tutti gli utenti di ChatGPT e Codex possono utilizzare ChatGPT Images 2.0.

La funzione di generazione di immagini “pensanti” è ora disponibile per gli utenti di ChatGPT Plus, Pro e Business con livelli di accesso ben definiti, evitando così la confusione che si era creata quando gli utenti si chiedevano: “Anthropic ha rimosso Claude Code da Pro??” Anche il modello sottostante, gpt-image-2, è disponibile nell’API.

In termini di prezzi, ChatGPT Images 2.0 è più potente, mentre i costi di input/output dei token rimangono invariati, offrendo un vantaggio competitivo rispetto a Prezzi di Claude Opus 4.7.

gpt image 2 Prezzi

Per gli utenti comuni, le immagini per le presentazioni, i post sui social media e le schede prodotto — attività che un tempo richiedevano ore di lavoro su Photoshop — possono ora essere realizzate con un unico comando utilizzando ChatGPT Images 2.0.

Per gli sviluppatori e le aziende, gli annunci pubblicitari localizzati, le infografiche multilingue, i contenuti didattici e gli strumenti di progettazione possono ora essere automatizzati su larga scala tramite API.

In Codex, ChatGPT Images 2.0 integra la generazione di immagini nell'area di lavoro, aggiungendo un'interessante dimensione visiva al processo in corso ChatGPT Codex contro Claude Code dibattito. I team di progettazione possono creare concept di interfaccia utente, confrontare le opzioni e passare alla fase di realizzazione del prodotto, il tutto senza dover cambiare strumento.

Prezzi, accesso e cosa significa nella pratica

ChatGPT Images 2.0 è ora disponibile su ChatGPT (Plus, Pro, Business) e tramite API (gpt-image-2).

A prima vista, i prezzi non sono cambiati in modo significativo, ma il valore per uscita è chiaramente più alto.

In pratica, ciò significa che:

  • Cose per cui un tempo aprivi Photoshop — ma che forse ora non fai più, a testimonianza di un cambiamento più ampio nel settore dalla codifica delle vibrazioni alla codifica dei desideri dove l'intelligenza artificiale si occupa del lavoro più impegnativo.
  • I team possono generare serie di immagini senza dover ricorrere a un intenso lavoro manuale
  • Gli sviluppatori possono integrare la generazione di immagini direttamente nei flussi di lavoro

Non si tratta tanto di “immagini di scarsa qualità”, quanto piuttosto di eliminare gli ostacoli nella produzione visiva.

ChatGPT Images 2.0 rappresenta forse il “momento iPhone” della generazione di immagini tramite IA?

Guardando indietro — da DALL·E a Midjourney fino a Stable Diffusion — la generazione di immagini tramite IA è rimasta a lungo in una fase in cui era “utilizzabile, ma non ancora del tutto matura”.”

Errori di visualizzazione del testo, scarso supporto multilingue, stili ripetitivi e composizioni palesemente generate dall’intelligenza artificiale: tutti questi aspetti ne scoraggiavano l’uso serio in contesti reali.

ChatGPT Images 2.0 risolve tutte queste carenze in un colpo solo e aggiunge la capacità di ragionamento oltre alla generazione di più immagini.

Non è ancora perfetto, ma ChatGPT Images 2.0 potrebbe essere il primo modello di generazione di immagini che fa pensare a designer, esperti di marketing e creatori di contenuti: “Posso davvero utilizzarlo nel mio lavoro quotidiano”.”

Ora, i designer potrebbero dover ripensare a dove risieda il loro vero vantaggio competitivo, soprattutto ora che l’intelligenza artificiale sta ridefinendo il panorama creativo parallelamente ai progressi nel campo di Design Claude.

Torna in alto