Skip to content

多模态大模型都在比谁看得清,DeepSeek说真正的问题是「说不清楚」

2026年5月4日

📰 概要

多模态大模型都在比谁看得更清,DeepSeek 说真正的问题是「说不清楚」。

2026年4月30日,DeepSeek 在 GitHub 发布多模态大模型和技术报告,提出「基于视觉原语的思考」框架。

核心思路是:语言说不清楚空间关系,但点、边界框这些视觉标记可以。把它们从「视觉输入」提升为「基本思维单元」。

模型就能在空间推理上追平 GPT-5.4、Claude-Sonnet-4.6 和 Gemini-3-Flash——而且用的是更小的模型、更少的标记。


🔍 解读

DeepSeek 指出了一个被忽视的问题:主流的多模态大语言模型都在用「感知鸿沟」(让模型看得更清楚)来解决问题,但忽视了「参照鸿沟」——语言本身的模糊性。

「左边第二个」「上方那个区域」——这类描述在语言层面是模糊的。当模型需要精确的空间推理时,语言局限性会导致推理链条断裂。

视觉原语的解法很聪明:不跟语言较劲,直接在视觉层面建立「指代能力」。把点、边界框当成模型「思考」的语言,而不是「看到」的内容。

这意味着:更少的标记,更低的计算成本,但达到了同样的空间推理能力。


💎 深挖

技术报告披露了几个关键信息:这个框架采用了高度优化的模型架构,具备极高的视觉标记效率。

模型规模紧凑,图像标记预算显著较低——但在与前沿模型的对比测试中,计数和空间推理基准测试的表现能够匹配。

这个对比很重要:不是用更大的模型、更贵的算力来追赶,而是用更聪明的方法来达到同等效果。对于资源有限的团队来说,这条路线更有参考价值。

DeepSeek 此前已经上线了「识图模式」,这次技术报告是其多模态能力的系统性阐释。从「能看图」到「能准确理解图里的空间关系」,这是多模态能力的一个台阶。

「什么情况不建议用」:如果你只是需要一个能识别图片内容的模型,现有方案可能已经够用。

但如果你在构建需要精确理解图像空间关系的应用——比如自动驾驶、工业检测、机器人操作——这个「视觉原语」框架值得研究。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来