Appearance
DeepSeek-V4全面解读:1M上下文标配、Agent能力冲顶、三大架构革新
让全球从春节苦等到四月的DeepSeek V4,终于来了。1M上下文成标配,Agent Coding超越Sonnet 4.5,下半年批量上华为算力。不是聊天模型的升级,而是明确奔着Agent工作模型去的——从"对话"到"执行"的定位转变。
DeepSeek-V4预览版今天正式上线,同步开源。
两个版本:V4-Pro(1.6T参数,49B激活)对标顶级闭源模型;V4-Flash(284B参数,13B激活)更小更快更便宜。两个版本上下文长度都是1M,最大输出384K。
这不是一次简单的版本迭代。从官方定位看,V4明确押注Agent——不是聊天模型的升级,而是奔着Agent工作模型去的。
核心能力:三大赛道领先
官方给出了三条判断:
| 能力 | 表现 |
|---|---|
| Agent能力 | Agentic Coding稳居开源第一,内部评测优于Sonnet 4.5,交付质量接近Opus 4.6非思考模式 |
| 世界知识 | 大幅领先其他开源模型,仅稍逊于Gemini-Pro-3.1 |
| 推理性能 | 数学、STEM、竞赛代码冠绝开源,比肩顶级闭源 |
内部反馈更直接:V4已经成为公司内部员工使用的Agentic Coding模型,但与Opus 4.6思考模式仍有差距。
V4-Flash:性价比之选
Flash版参数和激活更小,推理能力接近Pro,世界知识稍弱。简单Agent任务上与Pro旗鼓相当,高难度任务有差距。
适合高频调用、成本敏感、响应速度优先的API场景。
1M上下文:从高端功能到水电煤
这次最有冲击力的点不是单项榜单,而是上下文。
一年前,1M上下文还是Gemini独家的王牌;其他闭源模型128K或200K,开源几乎没人玩得起。DeepSeek直接把百万上下文变成了标配。
这意味着:
- 一整本书可以直接塞进去
- 大型代码仓库可以整体分析
- 几十万字的法律材料可以一次性处理
- 完整项目文档不用切块
他们是怎么做到的?
V4开创了混合注意力机制:
- CSA(压缩稀疏注意力):对KV缓存进行token维度压缩,结合DSA稀疏注意力,精细检索
- HCA(重压缩注意力):压缩率拉到128,不稀疏选择,全局感知
- 滑动窗口:每层128 token捕捉局部依赖
三条路径协同,在100万token上下文的极端场景下,单token推理计算量仅为前代的27%,KV缓存占用缩减到10%。
半年前V3.2-Exp那次"没什么亮点"的中间版本,首次引入DSA。当时外界关注度不高。现在回头看,那是V4的地基。
三大架构革新
支撑V4性能的,是底层的三项技术突破:
1. mHC(流形约束超连接)
升级传统残差连接,把残差映射矩阵约束在双随机矩阵流形上,确保谱范数不超过1。信号在深层网络传播不发散,额外时间开销仅6.7%。
2. Muon优化器
对梯度动量做Newton-Schulz正交化,10次混合迭代。收敛更快,训练更稳定。
配合两个工程技巧:
- Anticipatory Routing:路由索引与主干网络更新解耦,检测到loss spike时自动触发
- SwiGLU Clamping:线性分量钳制在[-10, 10],简单粗暴但有效
3. 专家分训+蒸馏合一
用On-Policy Distillation(OPD)替代混合RL。先独立训练数学、代码、Agent等领域专家,再用学生模型对十几个专家做全词表logit蒸馏。不缓存教师logits,只缓存最后一层隐藏状态,按需重建。
Agent能力专项优化
V4不是想停留在聊天框里,而是要进入开发者真实工作流。
官方文档专门给出了接入Claude Code、OpenClaw、OpenCode、CodeBuddy等主流Agent工具链的说明。以Claude Code为例,配置Anthropic兼容接口,把Sonnet、Opus、Haiku映射到V4-Pro或V4-Flash。
写代码、改bug、理解项目结构、生成文档、执行多轮工具调用——这些才是Agent模型真正的战场。
当1M上下文和Agentic Coding结合,不只是给建议,而是能连续执行任务。
API价格:继续打下来
V4的定价延续DeepSeek一贯风格——把成本打下来:
| 版本 | 百万token输入(缓存命中) | 百万token输入(缓存未命中) | 百万token输出 |
|---|---|---|---|
| V4-Flash | 0.2元 | 1元 | 2元 |
| V4-Pro | 1元 | 12元 | 24元 |
这个价格意味着1M上下文不再只是实验室能力,有机会变成产品里的基础能力。Flash版本很可能成为大量AI应用、知识库产品、文档处理工具、代码助手的默认选择。
迁移指南:三个月倒计时
新模型名:
- 追求性能:
deepseek-v4-pro - 追求效率:
deepseek-v4-flash
旧模型名停用:
deepseek-chat→ 映射到V4-Flash非思考模式deepseek-reasoner→ 映射到V4-Flash思考模式- 停用日期:2026年7月24日
对个人开发者影响不大,改一个model参数。对接生产环境的公司,这三个月要做迁移。
国产算力:下半年批量上华为
这是另一个值得关注的信号。官方明确表示,下半年批量上华为算力。
国产模型+国产算力的深度绑定,正在从规划变成现实。
一个测试案例
在"绝望的父亲"这个经典生物学推理测试中,V4没有一轮get到红绿色盲的关键点(根据遗传学规律,如果一名女性是红绿色盲,其生物学父亲必然也是)。
这说明复杂推理能力与顶级闭源模型仍有差距。但也从侧面反映,V4在大多数场景已经够用,极端推理任务是少数。
写在最后
DeepSeek官方在发布稿结尾引了一句话:
不诱于誉,不恐于诽,率道而行,端然正己。
过去半年,关于V4什么时候发、是不是跳票、是不是已经被超越的传言在AI圈来回跑了好几轮。他们没回应过一次。
然后在某个时间点,把V4放出来——同步开源,同步上线官网和App,同步更新API,顺便把内部员工已经弃用Claude的事实写进发布稿。
没有路线图,没有直播,没有访谈。
率道而行这四个字,听着像口号。但如果你把过去半年V3.2那次"没亮点"的Exp版本、DSA那套为V4铺了半年的稀疏注意力、1M上下文从王牌变成标配的路径放在一起看——DeepSeek确实做到了。
相关链接:
