Skip to content

DeepSeek识图模式上线:TVP框架把"思考"塞进图片里

2026年6月21日

DeepSeek识图模式上线:TVP框架把"思考"塞进图片里

识图模式不是"加了个图片上传按钮",而是把"看见图片"升级成了"在图片上思考"。


上线速览

6月18日下午,DeepSeek网页端和App端上线识图模式,与快速模式、专家模式并列。

背后是4月公开的**TVP(Thinking with Visual Primitives,以视觉原语思考)**框架。

三个模式各司其职:

模式特点适用场景
快速模式纯文本、低延迟日常问答、短任务
专家模式长链推理、强思考数学、代码、复杂规划
识图模式原生图像输入,视觉纳入思考链路图表、几何、UI截图

TVP框架:什么是"视觉原语"

传统多模态方案:视觉编码器把图片转成特征向量→语言模型去"读"向量。本质是把图片当外语翻译,空间关系、几何推理容易丢信息。

TVP框架换了个思路

  • 视觉原语作为思考单元:模型直接在视觉空间里"画线"、"圈区域"、"标注坐标"
  • 思维链扩展到视觉层:推理中间结果以视觉形式保留,不立即塌缩成文本
  • 文字+视觉联合决策:两条路径相互验证
  • 超越OCR边界:处理图形推理、物理直觉、空间想象

传统方案是"给盲人描述一张照片",TVP是"让模型直接睁开眼睛看"。


能力跃迁:从OCR到视觉推理

任务类型传统OCRTVP视觉推理
图表解读识别文字片段"2025、增长30%"结合坐标轴趋势线,直接告诉"Q2拐点"
几何推理先转文字描述再计算,空间信息丢失图上标辅助线,计算角度边长
物理直觉无法处理理解重力、液面、容器形状
UI截图→代码描述再写,效率低识别图层间距组件,直接生成HTML/CSS

技术对比

路径代表方案强项
视觉编码器+LLMGPT-4V、LLaVA通用图文问答、OCR
原生多模态Gemini、阿里HappyOyster音视频联合、长程一致性
视觉推理DeepSeek TVP几何、空间、图表推理

三条路不是替代关系,而是互补。


行业背景

识图模式上线同期,多模态赛道发生了几件大事:

  • 6月17日:阿里云发布HappyOyster 1.0,走原生多模态路线
  • 6月19日:DeepSeek开源AutoResearch协议,AI在285B模型上自主完成RL研究闭环
  • 6月20日:彭博报道微软成全球最大AI模型中间商
  • DeepSeek完成70亿美元首轮融资,估值4000亿

DeepSeek选择TVP这条路的判断是:纯文本思维链的边际收益在递减,下一步突破口是把视觉拉进推理过程


快速上手

三步使用识图模式

  1. 打开DeepSeek网页版或App,顶部选择"识图模式"
  2. 上传图片(JPG/PNG/WebP,建议不超过20MB)
  3. 用自然语言提问

效果更好的技巧

  • 图片尽量清晰,避免过度压缩
  • 提问时说明场景,比"这是什么"更具体
  • 多图对比时一次上传,模型能跨图推理
  • 复杂问题追加"请在图上标注关键区域"

局限与未来

局限说明
视频理解有限本质抽帧分析,长视频连贯性丢失
高分辨率细节超长工程图、密集表格精度下降
3D几何平面图可处理,三维空间推理仍是开放问题
专业领域医学影像、工业图纸需专业标注数据

下一步方向

  • 视觉原语+Agent能力结合(类似Computer Use)
  • 多图+长视频联合推理
  • 与AutoResearch类能力结合
  • 开放API和开发者工具

DeepSeek这次给出了一个反例——"国产大模型只会卷价格"这种叙事,被TVP报告和识图模式上线各打了一次脸。


关键词:DeepSeek, 识图模式, TVP, 视觉推理, 多模态

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来