La bataille mondiale autour de la génération d'images par IA bat son plein. La semaine dernière encore, OpenAI a officiellement dévoilé GPT Image 2, laissant tout Internet bouche bée. Qu'il s'agisse d'images pour le commerce en ligne en direct, de photos nostalgiques inspirées des années 90 ou de schémas conceptuels complexes, les démonstrations époustouflantes se succèdent et inondent les fils d'actualité partout dans le monde.
Inutile de se poser la question : la génération d'images par IA a clairement franchi une nouvelle étape.
En l'espace de quelques jours seulement, SenseTime, un géant chinois de la technologie, a réagi rapidement en sortant un tout nouvel atout : SenseNova U1. Ce modèle multimodal de compréhension et de génération place la “ compréhension des images ” et la “ génération d'images ” au sein d'un même cerveau.
Sa principale avancée réside dans une “ architecture de modèle unifiée ” développée en interne, baptisée NEO-Unify, qui intègre la compréhension, le raisonnement et la génération au sein d'un même système.
Mais surtout, ils ne l'ont pas gardé fermé. SenseNova U1 est désormais entièrement open source sur GitHub, et de nombreux utilisateurs ont déjà commencé à l'expérimenter. Même les experts en IA de Hugging Face et du MLS Super Intelligence Lab suivent son évolution de près et lui donnent leur aval.
Modèles SenseNova U1 Lite : petite taille, grand impact
Cette version inclut la série « lightweight » SenseNova U1 Lite, disponible en deux versions :
Variantes du modèle SenseNova U1
- SenseNova-U1-8B-MoT : basé sur un réseau de structure dense
- SenseNova-U1-A3B-MoT : basé sur un réseau de base MoE
Les paramètres peuvent paraître “ modestes ”, mais les performances dépassent largement les attentes. D’après plusieurs tests de performance, SenseNova U1 fait preuve de performances supérieures dans tous les domaines, atteignant les niveaux de pointe (SOTA) parmi les modèles open source de taille similaire.
Plus surprenant encore, sur plusieurs indicateurs, il se rapproche — voire dépasse — certains grands modèles commerciaux propriétaires.
SenseNova U1 : génération continue d'images et de textes
Avant d'entrer dans les détails techniques, regardons quelques démonstrations concrètes pour nous faire une idée des limites de SenseNova U1 capacités.
Son principal atout réside dans la génération continue d'images et de textes, rendue possible grâce à la technologie originale de SenseTime dite « chaîne de pensée entrelacée image-texte ».
Esquisse architecturale avec SenseNova U1
Prenons l'exemple de la création d'un croquis étape par étape d'une cathédrale gothique. Au cours de son processus de raisonnement, SenseNova U1 analyse en détail l'esthétique architecturale complexe, presque à la manière d'un “ architecte ” doté d'une grande capacité de réflexion spatiale.
Par le passé, garantir la cohérence entre plusieurs images générées constituait l'un des principaux défis. Or, dans cette démonstration, depuis les contours sommaires jusqu'au résultat final richement orné, la structure principale, le nombre d'arcs-boutants et même les motifs des rosaces restent alignés de manière quasi parfaite.
Ce niveau de cohérence donne l'impression d'assister à une véritable démonstration de conception, propice à l'apprentissage.
Génération de conceptions multi-angles avec SenseNova U1
Encore un sujet simple : concevez une bibliothèque située sur une falaise en bord de mer et présentez-la sous différents angles.
Cinq points de vue, cinq extraits de texte, cinq images — s’alternant rigoureusement et s’enchaînant de manière logique. De l’extérieur à l’intérieur, de la structure à l’atmosphère, du jour au crépuscule, chaque “ pensée ” est directement mise en images.
Le texte explique l'intention de conception ; les images permettent de la valider visuellement. Les deux se complètent mutuellement.
Ce qui est encore plus frappant, c'est la cohérence stylistique qui se dégage des cinq images : l'architecture, les matériaux et les palettes de couleurs s'inscrivent tous dans le même concept de design.
Voilà à quoi devrait ressembler le fait de “ réfléchir tout en dessinant ”.
SenseNova U1 : narration et création artistique
Récits sous forme de BD avec SenseNova U1
En quelques étapes simples, SenseNova U1 peut donner lieu à une histoire de bande dessinée.
Le rythme, articulé en quatre cases, est précis : d’une lumière isolée au milieu de ruines cybernétiques à des robots se rassemblant autour d’un vieil homme en train de lire, puis à un gros plan sur des larmes coulant sur des pages, pour finir par un plan d’ensemble sur une longue ligne d’horizon. La progression émotionnelle se construit couche après couche.
Les personnages et les scènes gardent une cohérence tout au long de l'œuvre, grâce à SenseNova U1’l’intégration native de la compréhension et de la génération d’images et de textes.
D'une case à l'autre, il ajoute même de lui-même des détails narratifs — comme en nommant la “ Tour silencieuse ”, en décrivant des doigts qui effleurent des traces usées par le temps, ou encore en opposant les larmes aux pages jaunies. Le texte lui-même se lit comme une mini-histoire de science-fiction, tandis que les images illustrent les moments d'intensité émotionnelle.
Génération d'images dans différents styles avec SenseNova U1
Demandez-lui de dessiner un loup dans différents styles, et vous obtiendrez des illustrations de style ukiyo-e, art déco et expressionniste, toutes présentées les unes après les autres.
Il peut même générer des résultats de type infographie à haute dimension, similaires à des diapositives, tout en conservant une cohérence structurelle et visuelle grâce à un contexte commun.
SenseNova U1 pour l'infographie et la visualisation des connaissances
SenseNova U1 peut également expliquer des problèmes du quotidien à l'aide d'associations image-texte, ce qui les rend intuitifs et captivants.
Infographie sur le café réalisée par SenseNova U1
Consigne : rédigez un guide sur le café préparé à la main.
SenseNova U1 Il commence par réfléchir, puis recherche les informations pertinentes et développe la consigne pour en faire une infographie détaillée. Le résultat final comprend huit étapes bien articulées entre elles, qui couvrent avec précision l'ensemble du processus, de la mouture des grains à l'extraction.
Visualisation du cycle de l'eau avec SenseNova U1
Autre exemple : “ le parcours du cycle de l'eau ”.”
SenseNova U1 Il recherche et compile des connaissances, pour produire un schéma ultra-clair de 2K qui reconstitue tous les éléments géographiques clés : rayonnement solaire, évaporation, condensation, transport, précipitations et ruissellement.
Chaque étape s'appuie précisément sur la précédente.
Infographies à haute densité générées par SenseNova U1
Une consigne de six mots peut générer une infographie complète sur la pastèque, abordant ses valeurs nutritionnelles, ses bienfaits pour la santé et des conseils de consommation — prête à être publiée sous forme d'article complet.
Il peut également créer des guides de trajets domicile-travail très complexes, des bandes dessinées sur la reconversion professionnelle dans un style pop art, et même des infographies sur les petits-déjeuners du monde entier à la manière des LEGO, en reconstituant des plats emblématiques de pays tels que le Japon, le Mexique, le Royaume-Uni, la Turquie, le Brésil et l'Inde.
Architecture SenseNova U1 : présentation de NEO-Unify
SenseNova U1’Les performances impressionnantes de ce modèle soulèvent une question fondamentale : comment un modèle relativement petit peut-il atteindre un tel niveau ?
La réponse réside dans son architecture.
De l'IA modulaire au modèle unifié SenseNova U1
Les modèles multimodaux traditionnels suivent une approche “ modulaire ” :
- Encodeur visuel (VE) pour la vision
- Auto-encodeur variationnel (VAE) pour le dessin
- Modèle linguistique à grande échelle (LLM) dédié au raisonnement
Ces composants sont entraînés séparément, puis combinés. Cela fonctionne, mais la perception et la création restent dissociées.
NEO-Unify : le cœur de SenseNova U1
NEO-Unify prend une mesure audacieuse : il supprime à la fois le VE et le VAE.
Ce concept repose sur un postulat fondamental : le langage et l'information visuelle sont intrinsèquement liés et doivent être modélisés comme une entité unique.
Au lieu d'une conversion entre les systèmes, SenseNova U1 agit comme un penseur bilingue, en traitant simultanément les informations visuelles et linguistiques dès le départ.
Parcours technique de SenseNova U1
- Interface visuelle quasi sans perte pour une représentation unifiée des entrées et sorties
- Architecture native « Mixture-of-Transformers » (MoT)
- Une base commune pour la compréhension et la création
- Apprentissage conjoint : texte via l'entropie croisée autorégressive, vision via la correspondance de flux de pixels
Des expériences montrent que, même lorsque la branche de compréhension est figée, la branche de génération est toujours capable de restituer des détails visuels très fins. Cela suggère que la représentation unifiée conserve à la fois la richesse sémantique et la fidélité au niveau des pixels.
SenseNova U1 contre GPT-Image-2
Il y a tout juste une semaine, GPT-Image-2 (Images ChatGPT 2.0) a établi une nouvelle référence grâce à un rendu de texte quasi parfait et à des fonctionnalités d'édition en plusieurs étapes.
Mais, fondamentalement, il s'agit toujours d'un “ modèle spécialisé dans la génération d'images ”.”
SenseNova U1 emprunte une voie différente. Il ne sert pas uniquement à générer des images : il s'agit d'un modèle nativement unifié qui prend en charge :
- Compréhension des images
- Raisonnement visuel
- Pensée entre image et texte entrelacées
- Création d'infographies
Tout cela repose sur la même architecture, la même formation, le même modèle.
Et surtout, SenseNova U1 est open source.
Pour les développeurs qui ont besoin d'un déploiement privé, d'une personnalisation poussée ou d'une intégration multimodale dans leurs produits, SenseNova U1 offre une possibilité que GPT-Image-2 ne propose pas.
SenseNova U1 et la voie vers l'IA générale
Si l'on considère la situation dans son ensemble, la “ bataille de la génération d'images ” actuelle s'inscrit toujours dans un paradigme fragmenté : un meilleur rendu, une résolution plus élevée, davantage de styles.
Il s'agit là d'améliorations progressives, et non de changements de paradigme.
Vrai AGI ne sera pas un assemblage disparate de modules spécialisés. Le cerveau humain n’est pas une combinaison mécanique de systèmes distincts dédiés au langage, à la vision et à l’action : c’est une entité cognitive unifiée.
L'IA multimodale évoluera à terme vers une unification native.
SenseNova U1, qui s'appuie sur la technologie NEO-Unify, est l'une des premières architectures à intégrer pleinement ce concept, ce qui lui confère une valeur unique tant sur le plan académique que sur le plan technique.
SenseNova U1 Future : la version 8B n'est qu'un début
SenseTime l'a clairement indiqué : SenseNova U1 Lite Il ne s'agit que de la version allégée. Des modèles à plus grande échelle basés sur NEO-Unify sont en cours de développement.
Ils estiment qu'avec une architecture native efficace, il est possible d'atteindre des performances de haut niveau à un coût de calcul bien moindre.
La conclusion est claire : si le modèle 8B atteint déjà l'état de l'art en matière d'open source, passer à des dizaines de milliards de paramètres pourrait amplifier encore davantage l'avantage architectural.
SenseNova U1 marque un nouveau tournant
L'IA multimodale est en pleine mutation : elle passe d'un assemblage modulaire à une unification native.
La mise en open source de SenseNova U1 Ce n'est qu'une première étape. Mais à en juger par les résultats actuels, c'est déjà un pas solide.
La direction que prendra finalement cette voie dépendra peut-être de la communauté mondiale des développeurs.
Le code et les pondérations sont déjà disponibles.
Ce qui va se passer ensuite, c'est à vous de décider.


