Recentemente, una serie di sviluppi in tutto il settore ha delineato una chiara tendenza: l’intelligenza incorporata si sta allontanando dalla pura “simulazione visiva” per entrare ufficialmente in una nuova fase di “comprensione spaziale”.”
Non molto tempo fa, il mercato globale modello del mondo incarnato Il benchmark WorldArena ha pubblicato le sue ultime classifiche. Il nuovissimo modello di mondo incarnato, FlowWAM, sviluppato da Fifth Age, è riuscito a conquistare la vetta della classifica di WorldArena grazie alle sue eccezionali prestazioni nella comprensione fisica e spaziale. Dimostra infatti una precisione e un realismo notevoli nella gestione delle interazioni dinamiche.

Fonte: https://huggingface.co/spaces/WorldArena/WorldArena
Questo primato conferma ancora una volta la rapida ascesa dei modelli di mondo incarnati provenienti dalla Cina in questo settore ed evidenzia il passaggio del settore verso una comprensione del mondo reale.
Risultati principali di FlowWAM: all’avanguardia nella comprensione spaziale
Primo posto in due importanti criteri di valutazione
A differenza delle valutazioni precedenti, incentrate sull“”attrattiva visiva”, WorldArena adotta un quadro di riferimento più completo, che copre 6 dimensioni principali e 16 sottodimensioni.
FlowWAM mostra vantaggi schiaccianti in due di queste dimensioni fondamentali, dimostrando di non essere solo un generatore di video, ma un sistema in grado di fornire ai robot una percezione fisica e spaziale precisa.
Adesione alla fisica: interazione reale contro illusione ottica
Si colloca al primo posto in termini di fedeltà alle leggi della fisica, rifiutando gli “inganni visivi” e riproducendo interazioni reali. Ciò risolve il comune problema delle “interazioni fittizie” nei modelli generativi.
Per quanto riguarda la qualità dell’interazione, le azioni del robot da esso generate dimostrano un elevato realismo nel comportamento di contatto e nella trasmissione della forza. In particolare, per quanto riguarda la precisione della traiettoria, il suo allineamento spazio-temporale è il migliore tra tutti i modelli. Ciò significa che non si limita a prevedere gli aspetti visivi, ma anche percorsi di esecuzione precisi e conformi alle leggi della fisica.
Precisione 3D: ricostruzione della geometria spaziale reale
Si colloca inoltre al primo posto in Precisione 3D, ricostruendo la geometria tridimensionale ed eliminando le illusioni ottiche.
In particolare per quanto riguarda la precisione della profondità, la coerenza geometrica dei suoi risultati rispecchia fedelmente le scene del mondo reale, riducendo l’ambiguità di scala nella visione monoculare — anche in questo caso risultando il modello più performante tra tutti. Per quanto riguarda la prospettiva, sia che si tratti di variazioni di scala in funzione della profondità o di complesse relazioni di occlusione luce-ombra, il modello dimostra una spiccata capacità di ragionamento 3D.
Il fatto di aver ottenuto il primo posto in entrambe le dimensioni significa che FlowWAM è in grado di operare in modo più accurato e affidabile nelle attività del mondo reale che richiedono comprensione fisica e ricostruzione spaziale.
Il percorso evolutivo di FlowWAM: verso un cervello incarnato
FlowWAM rappresenta l'ultimo lavoro di 中科第五纪 nel campo dell'intelligenza incarnata. Ripercorrendo il suo percorso tecnico, emerge chiaramente l'approccio del team ai modelli di grandi dimensioni incarnati:
FAM-1: Modello di manipolazione incarnata con pochi esempi
L'introduzione di mappe di calore 3D per il pre-addestramento secondario riduce efficacemente la perdita di informazioni nella comprensione spaziale. Ciò consente una rapida messa a punto con una quantità minima di dati, fornendo ai robot capacità iniziali di generalizzazione con pochi esempi.
BridgeV2W: modello del mondo incarnato di prima generazione
Pixelizzando spazialmente i comportamenti dei robot nelle diverse incarnazioni, si riduce il divario di rappresentazione tra “sequenze di azioni e fotogrammi visivi”. Ciò consente una generazione accurata di video futuri nelle diverse incarnazioni, rendendo possibili operazioni iniziali affidabili su più piattaforme.
FlowWAM: Progressi nel ragionamento spaziale dinamico
Trattandosi del modello mondiale di ultima generazione, i suoi dettagli architettonici non sono stati ancora resi noti. Tuttavia, dal termine “Flow” si può dedurre che il modello abbia probabilmente compiuto progressi significativi nel flusso spaziale dinamico e nella previsione causale, il che spiega le sue eccellenti prestazioni in termini di fedeltà fisica e precisione 3D.
Il “momento dell’alba” dei modelli del mondo incarnato in Cina
In cima alla classifica di WorldArena, insieme a 中科第五纪, figurano numerose squadre e istituti di ricerca cinesi. Ciò riflette una tendenza significativa: nella competizione globale sull’intelligenza incarnata, i team cinesi stanno rapidamente emergendo sul campo di battaglia principale dei modelli del mondo incarnato.
Rispetto ai vantaggi iniziali dei colossi internazionali nel campo della generazione di video in generale, gli sforzi della Cina mostrano una “spinta verticale” più forte nell’ambito dell’intelligenza incarnata:
Dalla percezione alla cognizione
Non più soddisfatti del semplice “vedere”, l’attenzione si sta spostando verso una “comprensione profonda”.”
Dalla simulazione all'implementazione nel mondo reale
Questi sforzi si stanno traducendo in un aumento concreto della produttività in settori quali l'industria manifatturiera, la logistica e i servizi.
Mentre l’intelligenza incarnata entra nel 2026, anno cruciale per le sue applicazioni, i modelli di mondo incarnato provenienti dalla Cina hanno già raggiunto una posizione di predominio nello sviluppo tecnologico di questo settore.


