Skip to content

商汤开源统一图像理解与生成模型U1:8B参数撑起GPT-Image-2级能力,还能边想边画

2026年5月1日

📰 概要

传统多模态模型是两个模型拼出来的:一个看,一个画,中间靠适配器对接。

商汤2026年4月30日开源的SenseNova-U1彻底拆了这个架构。 NEO-unify架构不需要视觉编码器(VE),也不需要变分自编码器(VAE),模型直接吃像素、直接吐像素。 8B参数的Lite版本能做出GPT-Image-2级别的图像,38B的MoE版本更强。

核心能力是连续性图文创作:文字和图片在同一段输出里自然交叠,模型边思考边画图。 做教程、做海报、做信息图、做连环画——一个模型一次调用全搞定。


🔍 解读

U1的技术路线跟主流多模态模型走了完全不同的方向。

主流做法是"拼积木":视觉编码器看图片→LLM理解→VAE/扩散模型画图。 每块各管各的,中间数据传输有信息损耗,连续性差。 U1的做法是"一体化":把所有模块揉进同一个网络,文本和图像共享同一个表征空间。

这个选择有两个代价和两个回报。 代价一:架构设计复杂度高,NEO-unify是商汤自研的。 代价二:模型不能复用现有的成熟VE/VAE组件。 回报一:理解与生成之间没有信息损耗,图文连贯性极强。 回报二:8B小模型就能实现接近闭源商用模型的效果。

商汤在README里主动标注了局限性:32K上下文、复杂场景细节不稳、长文字渲染偶尔出错。 这种"自曝短板"的风格在开源项目里不多见,也说明项目定位是"持续迭代的起点"而非"终点产品"。


💎 深挖

U1有几个值得单独拎出来讲的能力。

第一个是思维链推理式编辑。 给模型一张"刚泡好的热茶"照片,让它画"一小时后的样子"。 模型不是直接改图,而是先推理:茶叶会沉降、茶汤会变深、蒸汽会消散、光影会变化。 推理完才出图。这种"先思考再执行"的编辑能力,远远超出传统的图像编辑滤镜。

第二个是Skills工具包。 商汤同步开源了SenseNova-Skills,把U1封装成Agent可直接调用的工具。 sn-infographic自带87种版式、66种风格,能自己评分自己挑,不需要人工调参。 挂进OpenClaw后,一句/skill sn-infographic "做个招聘海报"就能出图。 这意味着U1的目标用户不只是AI研究者,还包括用Agent做自动化创作的开发者。

第三个是端侧可跑。 8B的U1 Lite能在端侧设备上运行,生成2048×2048的图像约9秒(H100单节点)。 对于需要本地方案的企业来说,这是可落地、可私有化部署的级别。

什么情况不建议用U1? 目前连续性图文创作还是beta功能,生产环境的高频使用可能会有稳定性问题。 人物在复杂场景的细节有时不稳,需要精细人像生成的场景建议先用闭源模型。 Skills工具包还在早期阶段,集成到现有工作流可能需要额外工程开发。

对开发者的启发:多模态模型正在从"拼积木"走向"一体化"。 U1证明了8B参数足以撑起高质量的图像理解与生成,这个方向的竞争重点将从"参数规模"转向"架构效率"。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来