Skip to content

何恺明Vision Banana论文:图像生成器就是通才视觉模型,生成即理解

2026年4月25日

📰 概要

2026年4月,Google DeepMind发布Vision Banana。何恺明、谢赛宁署名,核心结论:图像生成模型经过轻量指令微调,可以成为通才视觉模型。

方法很简洁:把所有视觉任务的输出统一重新参数化为RGB图像。分割、深度估计、表面法向量,都变成「生成一张图」。

Cityscapes分割mIoU达0.699,超过SAM 3的0.652。深度估计δ1=0.882,超越UniK3D 6个百分点。一个模型打多个专用模型。


🔍 解读

计算机视觉圈长期有个争论:生成式方法vs判别式方法。过去判别式一直占上风,分割、检测、深度估计各有专用模型。

Vision Banana的逻辑是:如果一个模型能「创造」图像,它应该也「理解」图像。把所有视觉任务都变成图像生成任务,就能复用生成模型的强大表征能力。

这不是第一次有人这么想,但之前的尝试要么效果差,要么需要加专门模块。Vision Banana证明了不需要——轻量微调就够了。


💎 深挖

来看关键数据对比:

任务Vision Banana专用模型差距
Cityscapes分割mIoU 0.699SAM 3: 0.652+4.7pp
深度估计δ1 0.882UniK3D: 0.822+6pp
表面法向量17.4°Lotus-2: 17.8°-0.4°

一个模型在多个任务上都接近或超越专用模型。

方法的关键是「重新参数化」。分割的输出是一张mask图,深度的输出是一张灰度图,法向量是一张RGB图。所有输出都变成图像生成任务,模型只要学会「按要求画图」。

训练数据配比也很重要:原始生成数据中只需混入0.5%-5%的视觉任务数据。不是全量微调,是轻量适配。

对视觉研究的影响:这条路线如果成立,分割、深度估计这些专用模型的价值会被压缩。以后可能不需要为每个任务训练专用模型,一个通用的视觉基础模型就够了。

但也要注意,Vision Banana是在Nano Banana Pro这个强生成模型基础上微调的。底座能力决定了上限。如果你的生成模型不够强,效果会打折扣。

什么情况不建议追:如果只有小规模数据和算力,从零训练生成模型再微调的成本可能高于直接训练专用模型。如果对实时性要求高,生成模型的推理速度一般慢于判别式模型。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来