Appearance
📰 概要
DeepSeek发布新功能"开眼"。
这是一次图像理解能力的升级,让DeepSeek能够"看"懂图片内容。
AI圈的用户们开始用各种刁钻图片测试它:从艺术画作到物理公式,从梗图到数据图表。
结果如何?
有明显进步,但也有边界。
🔍 解读
"开眼"是什么?
简单说:让DeepSeek能看懂图片。
之前的DeepSeek主要是文本处理。"开眼"之后,你可以上传图片,让它分析、描述、解答。
比如:
- 上传一张流程图,它能帮你解释
- 上传一张代码截图,它能帮你找bug
- 上传一张数据图表,它能帮你分析趋势
对于需要处理视觉信息的人来说,这个功能很实用。
测试结果如何?
用户用12张刁钻图片测试,发现:
第一,强项:标准化的视觉内容。
流程图、结构图、数据图表——这些有明确规则的图片,DeepSeek理解得很好。
第二,弱项:复杂的创意图像。
艺术画作、抽象概念图、需要背景知识理解的图片——这些仍是挑战。
💎 深挖
为什么DeepSeek要做图像理解?
市场竞争需要。
OpenAI有GPT-4V,Google有Gemini,Anthropic有Claude的视觉能力。
DeepSeek要在多模态领域有一席之地,图像理解是必须补上的能力。
图像理解的难点在哪里?
最难的不是"看懂",而是"理解上下文"。
比如一张梗图:
- AI能识别图里有什么
- 但不一定能理解"为什么好笑"
- 更不一定能理解"这个梗的背景是什么"
这就是图像理解的边界。
什么情况不建议用DeepSeek图像理解
如果你需要处理高度创意性或需要深度文化背景的图像,DeepSeek可能给不了你满意的答案。
它更适合处理"有标准答案"的视觉内容,而不是"见仁见智"的创意作品。
