Appearance
📰 概要
2026年4月,Google DeepMind发布Vision Banana。何恺明、谢赛宁署名,核心结论:图像生成模型经过轻量指令微调,可以成为通才视觉模型。
方法很简洁:把所有视觉任务的输出统一重新参数化为RGB图像。分割、深度估计、表面法向量,都变成「生成一张图」。
Cityscapes分割mIoU达0.699,超过SAM 3的0.652。深度估计δ1=0.882,超越UniK3D 6个百分点。一个模型打多个专用模型。
🔍 解读
计算机视觉圈长期有个争论:生成式方法vs判别式方法。过去判别式一直占上风,分割、检测、深度估计各有专用模型。
Vision Banana的逻辑是:如果一个模型能「创造」图像,它应该也「理解」图像。把所有视觉任务都变成图像生成任务,就能复用生成模型的强大表征能力。
这不是第一次有人这么想,但之前的尝试要么效果差,要么需要加专门模块。Vision Banana证明了不需要——轻量微调就够了。
💎 深挖
来看关键数据对比:
| 任务 | Vision Banana | 专用模型 | 差距 |
|---|---|---|---|
| Cityscapes分割 | mIoU 0.699 | SAM 3: 0.652 | +4.7pp |
| 深度估计 | δ1 0.882 | UniK3D: 0.822 | +6pp |
| 表面法向量 | 17.4° | Lotus-2: 17.8° | -0.4° |
一个模型在多个任务上都接近或超越专用模型。
方法的关键是「重新参数化」。分割的输出是一张mask图,深度的输出是一张灰度图,法向量是一张RGB图。所有输出都变成图像生成任务,模型只要学会「按要求画图」。
训练数据配比也很重要:原始生成数据中只需混入0.5%-5%的视觉任务数据。不是全量微调,是轻量适配。
对视觉研究的影响:这条路线如果成立,分割、深度估计这些专用模型的价值会被压缩。以后可能不需要为每个任务训练专用模型,一个通用的视觉基础模型就够了。
但也要注意,Vision Banana是在Nano Banana Pro这个强生成模型基础上微调的。底座能力决定了上限。如果你的生成模型不够强,效果会打折扣。
什么情况不建议追:如果只有小规模数据和算力,从零训练生成模型再微调的成本可能高于直接训练专用模型。如果对实时性要求高,生成模型的推理速度一般慢于判别式模型。
