Appearance
📰 概要
图像理解和生成,长期是两条平行线。
理解用一套模型,生成用另一套,中间靠适配器拼。这是过去几年几乎所有AI图像产品的底层架构。现在这个模式被打破了。
2026年4月30日,商汤开源SenseNova-U1,提出NEO-unify架构——像素进、像素出,理解生成第一次统一在一个网络里。
8B参数小版本能复刻GPT-Image-2的拿手绝活。在开源模型图像能力评测中登顶榜首。2048×2048分辨率图生图,9秒出。
🔍 解读
为什么这事值得关注?
传统方法的核心问题在于"桥接损失"。理解模型用一套方式编码图像,生成模型用另一套方式解码图像,两者之间靠适配器连接——适配器越好,损失越小,但永远不可能归零。
U1的思路是:别做桥接了,把两个任务塞进同一个网络里。输入是像素,输出也是像素,中间没有转换层,信息不会在"过桥"时丢失。
这意味着:文字密集排版、图文交错、多图一致性——这些AI生图的老大难问题,本质上都是"桥接损失"在作祟。U1从架构上绕开了这个问题。
当然,8B参数是小型版本,性能上限还需要更大规模验证。但这个架构方向值得关注——如果它在大参数规模下依然有效,可能会影响未来多模态模型的设计思路。
💎 深挖
传统架构为什么卡住了
主流AI图像产品的架构基本是:Vision Encoder(视觉编码器)负责理解图片,Vision Decoder或VAE负责生成图片。两者之间靠Adapter(适配层)连接。
这个架构的问题:编码和解码用的是不同的表征空间。就像翻译——先把中文译成英文,再把英文译成中文,每次翻译都会丢一点信息。
适配层越好,丢得越少。但不可能归零。这就是为什么AI生图经常出现"文字乱码""主体变形""风格不一致"——根源都在适配层的翻译损失。
NEO-unify怎么做
NEO-unify的核心:让理解和生成共享同一个表征空间。简单说,就是输入像素直接进网络,输出像素直接从网络出来,中间没有"翻译"环节。
商汤在论文里用了"原生统一"这个词,意思是从一开始就设计成统一的,而不是事后拼接。
效果:模型能同时做图像理解和生成,两项任务在同一个表征空间里互相增强——理解任务学到的视觉特征会帮助生成,生成任务需要的细节感知也会反哺理解。
实战表现
量子位用U1跑了几组测试:
- 信息图(InfoGraph):八大行星轨道图,文字和图示自然交叠,细节丰富
- 文字密集排版:量子位招聘海报,文字、版式、配色挑不出毛病
- 钢铁侠:自动从轮廓、铺色、细节、质感、氛围多个阶段拆解绘画流程
- 煎牛排操作教学:每一步有图,牛排从生肉到五分熟形象高度一致,不会画着画着变成另一块肉
这些场景的共同点是:文字和图像必须高度协同,主体必须保持一致。传统架构在这些场景下经常"掉链子",U1表现稳定。
什么情况不建议用
如果你需要的是超写实人像或精细产品图(目前开源模型的通病),U1的8B版本可能达不到商用水平。
如果你的场景需要的是单任务极致性能(比如只做图像理解),专用模型可能比统一模型更高效。
接下来看什么
商汤同时开源了38B MoE版本。如果MoE版本能在保持架构统一性的同时提升生成质量,U1的路线会更有说服力。
这个方向真正的价值不在于打败GPT-Image-2,而在于:多模态模型的设计思路,可能正在从"拼图"走向"一体化"。
