Appearance
DeepSeek那只「盲眼鲸鱼」终于开眼了:识图模式悄悄灰度,背后是个新模型
📰 概要
DeepSeek那只一直「闭眼」的鲸鱼,今天睁开了。
2026年4月29日深夜起,多名网友在社交平台晒出截图:DeepSeek网页端出现「识图模式」选项,与「快速模式」「专家模式」并列。
用户上传图片后,模型会对内容进行理解和描述——不是简单提取文字,而是真正的「看图说话」。
这个功能上线节奏快得让人意外。DeepSeek V4于2026年4月24日发布,仅5天后识图功能就灰度登场。
AI圈技术人员从各方向挖出蛛丝马迹:识图模式的底层,大概率是一个独立于V4的新视觉模型。
🔍 解读
从实测来看,识图模式支持「深度思考」开关。
开启后,模型先进行视觉分析再输出推理,类似于 GPT-4V 的思维链模式。
关闭时,响应速度极快,「比闪电五连鞭还快」。两个模式的速度差异说明,用的是不同的模型——很可能是轻量级蒸馏视觉模型与端到端视觉-语言联合模型的组合。
开源社区早就注意到,DeepSeek V4技术报告预留了大量「未来展望」,包括多模态理解和生成。
但没人预料到落实得这么快——5天,这个数字比GPT-4V当年从发布到多模态上线的时间快了一个量级。
💎 深挖
这次功能更新是以「灰度」而非「全量开放」的形式出现,功能还在验证阶段。
DeepSeek在多模态上的动作,暴露了一个更大的趋势:开源多模态模型的能力差距正在快速缩小。
2025年,多模态几乎被GPT-4V和Gemini Pro垄断。
2026年,Janus-Pro、Qwen-VL等快速迭代,DeepSeek此时推出自研视觉能力,给开源社区补上了一个关键空缺。
从技术架构推断,识图模式大概率是基于自研视觉模型Janus的演进版本——这个团队年初就释出Janus-Pro,一度登顶开源多模态榜首。
对于你来说,识图模式的直接价值是:现在可以丢一张截图、照片或图表给DeepSeek,让它帮你分析或解释。代码审查、数据解读、文档处理等场景的效率提升,非常明显。
什么情况不建议用?识图功能目前处于灰度阶段,响应速度和准确率不稳定,用于生产环境还为时过早。如果你的场景对准确性要求极高,比如医学影像、法律文档解读,建议等全量上线后再评估。
V4发布5天就补上多模态短板,这个速度本身就是信号:开源大模型的竞争,已经从「文本能力」全面扩散到「多模态能力」。
