La batalla mundial por la generación de imágenes mediante IA está en pleno apogeo. La semana pasada, OpenAI presentó oficialmente GPT Image 2, dejando atónito a todo Internet. Ya se trate de imágenes para el comercio electrónico en directo, fotos nostálgicas al estilo de los 90 o complejos diagramas de conocimiento, una demostración alucinante tras otra ha inundado los feeds de todas partes.
No hace falta preguntarlo: está claro que la generación de imágenes mediante IA ha dado un salto cualitativo.
En tan solo unos días, SenseTime, una importante empresa tecnológica china, respondió rápidamente con una nueva baza: SenseNova U1. Este modelo multimodal de comprensión y generación sitúa la “comprensión de imágenes” y la “generación de imágenes” en el mismo cerebro.
Su principal avance radica en una “arquitectura de modelo unificado” desarrollada por la propia empresa, denominada NEO-Unify, que integra la comprensión, el razonamiento y la generación en un único sistema.
Y lo que es más importante, no lo mantuvieron cerrado. SenseNova U1 Ahora es un proyecto de código abierto al 100 % en GitHub, y ya hay una gran cantidad de usuarios que han empezado a probarlo. Incluso los expertos en IA de Hugging Face y del MLS Super Intelligence Lab lo están siguiendo de cerca y le dan el visto bueno.
Modelos SenseNova U1 Lite: tamaño reducido, gran impacto
Esta versión incluye la serie ligera SenseNova U1 Lite, con dos variantes del modelo:
Variantes del modelo SenseNova U1
- SenseNova-U1-8B-MoT: basado en una red de estructura densa
- SenseNova-U1-A3B-MoT: basado en una red de estructura MoE
Los parámetros pueden parecer “compactos”, pero el rendimiento supera con creces las expectativas. En diversas pruebas de rendimiento, SenseNova U1 muestra un rendimiento superior en todas las dimensiones, alcanzando niveles de vanguardia (SOTA) entre los modelos de código abierto de tamaño similar.
Lo que resulta aún más sorprendente es que, en varios indicadores, se acerca —o incluso supera— a algunos grandes modelos comerciales propietarios.
SenseNova U1: Generación continua de imágenes y texto
Antes de entrar en detalles técnicos, veamos algunas demostraciones reales para hacernos una idea de los límites de SenseNova U1 capacidades.
Su principal punto fuerte es la generación continua de imágenes y texto, gracias a la tecnología original de SenseTime de «cadena de pensamiento» entrelazada de imágenes y texto.
Boceto arquitectónico con SenseNova U1
Tomemos como ejemplo la creación de un boceto paso a paso de una catedral gótica. Durante su proceso de razonamiento, SenseNova U1 analiza con gran detalle la estética arquitectónica compleja, casi como un “arquitecto” dotado de una profunda visión espacial.
En el pasado, mantener la coherencia entre varias imágenes generadas era uno de los problemas más difíciles. Sin embargo, en esta demostración, desde los bocetos iniciales hasta el resultado final ornamentado, la estructura principal, el número de arbotantes e incluso los motivos de los rosetones permanecen alineados casi a la perfección.
Este nivel de coherencia hace que parezca un tutorial de diseño real y fácil de seguir.
Generación de diseños multiángulo con SenseNova U1
Otra propuesta sencilla: diseña una biblioteca situada en un acantilado junto al mar y preséntala desde varios ángulos.
Cinco perspectivas, cinco fragmentos de texto, cinco imágenes: se alternan de forma rigurosa y avanzan de manera lógica. Desde el exterior al interior, desde la estructura a la atmósfera, desde el día al atardecer, cada “pensamiento” se visualiza directamente.
El texto explica la intención del diseño; las imágenes sirven de validación visual. Ambos elementos se complementan entre sí.
Aún más llamativa es la coherencia estilística que se aprecia en las cinco imágenes: la arquitectura, los materiales y la paleta de colores se ajustan al mismo concepto de diseño.
Así es como debería ser “pensar mientras se dibuja”.
SenseNova U1: Narración y generación artística
Narración de cómics con SenseNova U1
Con solo unas sencillas instrucciones, SenseNova U1 puede crear una historia de cómic.
La sucesión de las cuatro viñetas es precisa: desde una luz solitaria en unas ruinas cibernéticas, pasando por unos robots que se reúnen alrededor de un anciano que lee, hasta un primer plano de lágrimas que caen sobre las páginas y, por último, un plano general de una larga línea del horizonte. La progresión emocional se va construyendo capa a capa.
Los personajes y las escenas mantienen su coherencia a lo largo de toda la obra, gracias a SenseNova U1’su integración nativa de la comprensión y la generación de imágenes y texto.
Entre viñeta y viñeta, incluso añade detalles narrativos por sí misma, como al bautizar la “Torre Silenciosa”, al describir dedos que recorren marcas desgastadas por el paso del tiempo y al contrastar las lágrimas con las páginas amarillentas. El texto en sí mismo se lee como un pequeño relato de ciencia ficción, mientras que las imágenes plasman los momentos de mayor intensidad emocional.
Generación de imágenes de múltiples estilos con SenseNova U1
Pídele que dibuje un lobo en diferentes estilos y obtendrás ukiyo-e, art déco y expresionismo, todos ellos representados uno tras otro.
Incluso puede generar resultados de alta dimensión similares a infografías, como diapositivas, manteniendo la coherencia estructural y visual gracias a un contexto compartido.
SenseNova U1 para infografías y visualización del conocimiento
SenseNova U1 También puede explicar problemas cotidianos mediante combinaciones de imágenes y texto, lo que los hace intuitivos y atractivos.
Infografía sobre el café de SenseNova U1
Indicación: crea una guía sobre el café de filtro.
SenseNova U1 Primero reflexiona, luego recopila la información pertinente y desarrolla la indicación para convertirla en una infografía detallada. El resultado final incluye ocho pasos bien interrelacionados que describen con precisión el proceso, desde la molienda de los granos hasta la extracción.
Visualización del ciclo del agua con SenseNova U1
Otro ejemplo: “el recorrido del ciclo del agua”.”
SenseNova U1 busca y recopila información, elaborando un diagrama ultraclaro de 2K que reconstruye todos los elementos geográficos clave: radiación solar, evaporación, condensación, transporte, precipitación y escorrentía.
Cada paso se basa precisamente en el anterior.
Infografías de alta densidad generadas por SenseNova U1
Una indicación de seis palabras puede generar una infografía completa sobre la sandía, que abarque aspectos nutricionales, beneficios para la salud y consejos de consumo, lista para publicarse como un artículo completo.
También puede crear guías de desplazamientos al trabajo muy complejas, cómics sobre la transición profesional al estilo pop art e incluso infografías sobre desayunos de todo el mundo al estilo LEGO, en las que recrea platos emblemáticos de países como Japón, México, el Reino Unido, Turquía, Brasil y la India.
Arquitectura de SenseNova U1: explicación de NEO-Unify
SenseNova U1’El impresionante rendimiento de este modelo plantea una pregunta fundamental: ¿cómo puede un modelo relativamente pequeño lograr esto?
La respuesta está en su arquitectura.
De la IA modular al modelo unificado SenseNova U1
Los modelos multimodales tradicionales siguen un enfoque “modular”:
- Codificador visual (VE) para ver
- Autoencoder variacional (VAE) para el dibujo
- Modelo de lenguaje a gran escala (LLM) para el razonamiento
Estos componentes se entrenan por separado y luego se combinan. Funciona, pero la percepción y la creación siguen estando desconectadas.
NEO-Unify: el núcleo de SenseNova U1
NEO-Unify da un paso audaz: elimina tanto VE como VAE.
Parte de una hipótesis fundamental: el lenguaje y la información visual están intrínsecamente relacionados y deben modelarse como una entidad unificada.
En lugar de realizar la conversión entre sistemas, SenseNova U1 se comporta como un pensador bilingüe, procesando la visión y el lenguaje de forma conjunta desde el principio.
Trayectoria técnica de SenseNova U1
- Interfaz visual prácticamente sin pérdidas para una representación unificada de la entrada y la salida
- Arquitectura nativa «Mixture-of-Transformers» (MoT)
- Base común para la comprensión y la creación
- Entrenamiento conjunto: texto mediante entropía cruzada autorregresiva; visión mediante coincidencia de flujos de píxeles
Los experimentos demuestran que, incluso cuando la rama de comprensión está congelada, la rama de generación sigue siendo capaz de recuperar detalles visuales muy precisos. Esto sugiere que la representación unificada conserva tanto la riqueza semántica como la fidelidad de los píxeles.
SenseNova U1 frente a GPT-Image-2
Hace apenas una semana, GPT-Image-2 (Imágenes de ChatGPT 2.0) ha establecido un nuevo referente gracias a una visualización del texto casi perfecta y a la edición en varios pasos.
Pero, en esencia, sigue siendo un “modelo especializado en la generación de imágenes”.”
SenseNova U1 toma un camino diferente. No sirve solo para generar imágenes, sino que es un modelo unificado de forma nativa que gestiona:
- Comprensión de imágenes
- Razonamiento visual
- Pensamiento entrelazado de imagen y texto
- Creación de infografías
Todo ello partiendo de la misma arquitectura, la misma formación y el mismo modelo.
Y, lo que es más importante, SenseNova U1 es de código abierto.
Para los desarrolladores que necesiten una implementación privada, una personalización avanzada o una integración multimodal en sus productos, SenseNova U1 ofrece una vía que GPT-Image-2 no ofrece.
SenseNova U1 y el camino hacia la IA general
Si lo miramos desde una perspectiva más amplia, la actual “batalla por la generación de imágenes” sigue enmarcada en un paradigma fragmentado: mejor renderizado, mayor resolución, más estilos.
Se trata de mejoras graduales, no de cambios de paradigma.
Verdadero AGI No será un mosaico de módulos especializados. El cerebro humano no es una combinación mecánica de sistemas independientes para el lenguaje, la visión y la acción, sino una entidad cognitiva unificada.
La IA multimodal acabará avanzando hacia una unificación nativa.
SenseNova U1, basada en NEO-Unify, es una de las primeras arquitecturas en adoptar plenamente esta idea, lo que le confiere un valor único tanto en el ámbito académico como en el de la ingeniería.
SenseNova U1 Future: el 8B es solo el principio
SenseTime lo ha dejado claro: SenseNova U1 Lite Es solo la versión ligera. Ya están en camino modelos a mayor escala basados en NEO-Unify.
Su convicción es que, con una arquitectura nativa eficiente, se puede alcanzar un rendimiento de primer nivel con un coste computacional mucho menor.
La conclusión es clara: si 8B ya alcanza el estado del arte (SOTA) en código abierto, ampliarlo a decenas de miles de millones de parámetros podría potenciar aún más la ventaja arquitectónica.
SenseNova U1 marca un nuevo paradigma
La IA multimodal está experimentando un cambio: está pasando del ensamblaje modular a la unificación nativa.
La publicación en código abierto de SenseNova U1 Es solo el primer paso. Pero, a juzgar por los resultados actuales, ya es un paso firme.
El destino final de este camino puede depender de la comunidad mundial de desarrolladores.
El código y las ponderaciones ya están disponibles.
Lo que pase a continuación depende de ti.


