Appearance
一周之内,OpenAI和商汤先后放出图像生成的"核武器"。一边是Arena榜单断层登顶的GPT Image 2,一边是原生统一架构的SenseNova U1。它们分别站在了两条不同的进化路径上。
4月22日-28日,AI图像生成领域连续迎来两次重磅事件。
4月21日 · OpenAI 发布 GPT Image 2
官方名称 ChatGPT Images 2.0,OpenAI首个具备推理能力的图像模型。Image Arena全榜第一,文生图1512分,领先第二名242分。
4月28日 · 商汤科技 SenseNova U1 全面开源
基于NEO-unify原生统一架构,原生多模态统一模型,去掉视觉编码器和VAE。业内首创连续图文共生输出——单次调用即可生成步骤化、风格一致的图文交错内容。8B参数即达商业级水准。
GPT Image 2:把生图推向"真假难辨"
核心突破:思考模式(Thinking Mode)
这是GPT Image 2与所有前代模型最大的区别。在生成图像之前,模型会执行一套完整的"创作流程":
- 任务拆解规划 — 先分析你的需求是什么,需要什么样的画面元素和风格
- 联网搜索 — 实时搜索网络获取最新信息
- 多方案生成 — 根据同一提示词创建多个不同风格的候选方案
- 自我复核 — 对输出结果进行自检,发现并修正明显错误
文本渲染:终于解决了中文字难题
AI生图长期以来最大的痛点就是文字渲染——尤其是中文、日文等非拉丁字母文字。GPT Image 2在这方面取得了质的飞跃:能够像素级还原字体、字号、排版细节,大标题和小字注释都能准确无误。
Arena评测:断层登顶
| 指标 | 数据 |
|---|---|
| Arena ELO 评分 | 1512分 |
| 领先第二名 | +242分(历史最大差距) |
| 全榜排名 |
