Appearance
📰 概要
DeepSeek发布多模态大模型技术报告,提出「视觉原语」新框架。
核心思路:将点、边界框等空间标记从视觉输入元素,提升为模型推理过程中的「基本思维单元」。这让模型在思考时具备了「指哪打哪」的能力——能把抽象的认知轨迹锚定到图像的具体物理坐标上。
技术报告披露,模型规模紧凑、图像标记预算较低。DeepSeek多模态模型在计数和空间推理基准测试上能与GPT-5.4、Claude-Sonnet匹配。
🔍 解读
这个框架解决了一个长期被忽视的问题:参照鸿沟。
主流的链式思维(CoT)推理范式主要局限于语言学领域。当模型需要执行涉及严谨空间参照的任务时,自然语言固有的模糊性导致推理链条断裂。
「视觉原语」提供了一种替代路径:用视觉坐标替代语言描述,让模型直接「指」给AI看,而不是「说」给AI听。
这也印证了一个趋势:更高效的模型不需要更大的参数,而是需要更好的推理结构。
💎 深挖
为什么CoT在视觉任务上失效
技术报告指出:尽管多模态大语言模型近年来取得长足进步,但主流的链式思维推理范式仍主要局限于语言学领域。
现有研究多聚焦于通过高分辨率图像裁剪等技术手段弥合「感知鸿沟」——即提升模型对视觉细节的识别能力。但DeepSeek团队认为,这一思路忽视了一个更为根本的限制:参照鸿沟。
自然语言固有的模糊性,使其难以对复杂的空间布局提供精确、明确的指引。当模型需要执行涉及严谨空间参照的任务时,这种语言表达的局限性往往导致推理链条断裂,出现逻辑崩溃。
视觉原语框架如何工作
DeepSeek提出了「基于视觉原语的思考」(Thinking with Visual Primitives)框架。
核心设计:将点、边界框等空间标记从单纯的视觉输入元素,提升为推理过程中的「基本思维单元」。
通过将这些视觉原语直接嵌入模型的思考链路,DeepSeek使模型在推理过程中具备了「指代」能力——能够将抽象的认知轨迹锚定到图像的具体物理坐标上,实现对空间关系的精确推演。
小模型的突破
技术报告披露,框架采用了高度优化的模型架构,具备极高的视觉标记效率。模型规模紧凑、图像标记预算较低,但在计数和空间推理基准测试上能与GPT-5.4、Claude-Sonnet匹配。
这为开发更高效、更具可扩展性的System-2类多模态智能指明了方向——不需要堆参数才能变强,优化推理结构同样有效。
已上线「识图模式」
DeepSeek此前已上线「识图模式」,与「快速模式」「专家模式」并列。并非简单的OCR文字识别,而是终于具备多模态识别能力。
结合本次技术报告可以看出,DeepSeek的多模态能力正在快速迭代,从识别到推理的路径正在打通。
什么情况不建议用
如果你只需要文字OCR和简单图像描述,普通的视觉识别模型已经足够,「视觉原语」框架的优势不明显。
如果你的应用场景不涉及精确的空间参照,这个框架带来的增益有限。
