Appearance
📰 概要
多模态大模型都在比谁看得更清,DeepSeek 说真正的问题是「说不清楚」。
2026年4月30日,DeepSeek 在 GitHub 发布多模态大模型和技术报告,提出「基于视觉原语的思考」框架。
核心思路是:语言说不清楚空间关系,但点、边界框这些视觉标记可以。把它们从「视觉输入」提升为「基本思维单元」。
模型就能在空间推理上追平 GPT-5.4、Claude-Sonnet-4.6 和 Gemini-3-Flash——而且用的是更小的模型、更少的标记。
🔍 解读
DeepSeek 指出了一个被忽视的问题:主流的多模态大语言模型都在用「感知鸿沟」(让模型看得更清楚)来解决问题,但忽视了「参照鸿沟」——语言本身的模糊性。
「左边第二个」「上方那个区域」——这类描述在语言层面是模糊的。当模型需要精确的空间推理时,语言局限性会导致推理链条断裂。
视觉原语的解法很聪明:不跟语言较劲,直接在视觉层面建立「指代能力」。把点、边界框当成模型「思考」的语言,而不是「看到」的内容。
这意味着:更少的标记,更低的计算成本,但达到了同样的空间推理能力。
💎 深挖
技术报告披露了几个关键信息:这个框架采用了高度优化的模型架构,具备极高的视觉标记效率。
模型规模紧凑,图像标记预算显著较低——但在与前沿模型的对比测试中,计数和空间推理基准测试的表现能够匹配。
这个对比很重要:不是用更大的模型、更贵的算力来追赶,而是用更聪明的方法来达到同等效果。对于资源有限的团队来说,这条路线更有参考价值。
DeepSeek 此前已经上线了「识图模式」,这次技术报告是其多模态能力的系统性阐释。从「能看图」到「能准确理解图里的空间关系」,这是多模态能力的一个台阶。
「什么情况不建议用」:如果你只是需要一个能识别图片内容的模型,现有方案可能已经够用。
但如果你在构建需要精确理解图像空间关系的应用——比如自动驾驶、工业检测、机器人操作——这个「视觉原语」框架值得研究。
