Appearance
DeepSeek识图模式上线:TVP框架把"思考"塞进图片里
识图模式不是"加了个图片上传按钮",而是把"看见图片"升级成了"在图片上思考"。
上线速览
6月18日下午,DeepSeek网页端和App端上线识图模式,与快速模式、专家模式并列。
背后是4月公开的**TVP(Thinking with Visual Primitives,以视觉原语思考)**框架。
三个模式各司其职:
| 模式 | 特点 | 适用场景 |
|---|---|---|
| 快速模式 | 纯文本、低延迟 | 日常问答、短任务 |
| 专家模式 | 长链推理、强思考 | 数学、代码、复杂规划 |
| 识图模式 | 原生图像输入,视觉纳入思考链路 | 图表、几何、UI截图 |
TVP框架:什么是"视觉原语"
传统多模态方案:视觉编码器把图片转成特征向量→语言模型去"读"向量。本质是把图片当外语翻译,空间关系、几何推理容易丢信息。
TVP框架换了个思路:
- 视觉原语作为思考单元:模型直接在视觉空间里"画线"、"圈区域"、"标注坐标"
- 思维链扩展到视觉层:推理中间结果以视觉形式保留,不立即塌缩成文本
- 文字+视觉联合决策:两条路径相互验证
- 超越OCR边界:处理图形推理、物理直觉、空间想象
传统方案是"给盲人描述一张照片",TVP是"让模型直接睁开眼睛看"。
能力跃迁:从OCR到视觉推理
| 任务类型 | 传统OCR | TVP视觉推理 |
|---|---|---|
| 图表解读 | 识别文字片段"2025、增长30%" | 结合坐标轴趋势线,直接告诉"Q2拐点" |
| 几何推理 | 先转文字描述再计算,空间信息丢失 | 图上标辅助线,计算角度边长 |
| 物理直觉 | 无法处理 | 理解重力、液面、容器形状 |
| UI截图→代码 | 描述再写,效率低 | 识别图层间距组件,直接生成HTML/CSS |
技术对比
| 路径 | 代表方案 | 强项 |
|---|---|---|
| 视觉编码器+LLM | GPT-4V、LLaVA | 通用图文问答、OCR |
| 原生多模态 | Gemini、阿里HappyOyster | 音视频联合、长程一致性 |
| 视觉推理 | DeepSeek TVP | 几何、空间、图表推理 |
三条路不是替代关系,而是互补。
行业背景
识图模式上线同期,多模态赛道发生了几件大事:
- 6月17日:阿里云发布HappyOyster 1.0,走原生多模态路线
- 6月19日:DeepSeek开源AutoResearch协议,AI在285B模型上自主完成RL研究闭环
- 6月20日:彭博报道微软成全球最大AI模型中间商
- DeepSeek完成70亿美元首轮融资,估值4000亿
DeepSeek选择TVP这条路的判断是:纯文本思维链的边际收益在递减,下一步突破口是把视觉拉进推理过程。
快速上手
三步使用识图模式:
- 打开DeepSeek网页版或App,顶部选择"识图模式"
- 上传图片(JPG/PNG/WebP,建议不超过20MB)
- 用自然语言提问
效果更好的技巧:
- 图片尽量清晰,避免过度压缩
- 提问时说明场景,比"这是什么"更具体
- 多图对比时一次上传,模型能跨图推理
- 复杂问题追加"请在图上标注关键区域"
局限与未来
| 局限 | 说明 |
|---|---|
| 视频理解有限 | 本质抽帧分析,长视频连贯性丢失 |
| 高分辨率细节 | 超长工程图、密集表格精度下降 |
| 3D几何 | 平面图可处理,三维空间推理仍是开放问题 |
| 专业领域 | 医学影像、工业图纸需专业标注数据 |
下一步方向:
- 视觉原语+Agent能力结合(类似Computer Use)
- 多图+长视频联合推理
- 与AutoResearch类能力结合
- 开放API和开发者工具
DeepSeek这次给出了一个反例——"国产大模型只会卷价格"这种叙事,被TVP报告和识图模式上线各打了一次脸。
关键词:DeepSeek, 识图模式, TVP, 视觉推理, 多模态
