Appearance
DeepSeek V4训练全解:三把钥匙解开百万上下文低成本之谜
V4不是冲破AGI天花板的模型,而是让开发者第一次放心用上100万上下文Agent模型。闭源卷天花板,开源卷地板——V4把地板往上抬了抬。
核心结论
DeepSeek V4真正的价值:把百万上下文、Agent原生能力、能接受的价格这三件事第一次绑在了一起。
这两种叙事差别非常大:
| 叙事 | 目标 | V4表现 |
|---|---|---|
| 冲顶峰 | 全面击败Opus 4.7、GPT-5.5、Gemini 3.1 Pro | 做不到 |
| 抬地板 | 让开发者用上百万元上下文Agent | 做到了 |
业内说法:闭源模型卷能力天花板,开源模型卷地板,地板抬高速度决定AI应用爆发规模。
V4-Pro vs V4-Flash:两个定位不一样的模型
| 模型 | 参数规模 | 定位 | 价格 |
|---|---|---|---|
| V4-Pro | 1.6T总参数,49B激活 | 开源阵营里跟闭源旗舰掰手腕 | 目前不便宜,下半年降 |
| V4-Flash | Pro的约六分之一 | 快速模型,反超V3.2 | 同类1/7到1/18 |
建议:AI编程、写作、复杂任务、关键决策用Opus 4.7;批量任务、Agent后台、数据处理用V4-Flash。
架构动了哪些刀
V4没有推倒V3重来,真正大改的地方只有三处:
| 改动 | 解决的痛点 |
|---|---|
| mHC | 残差连接堆深时数值不稳定 |
| CSA+HCA | 百万token长上下文KV cache爆炸 |
| Muon | AdamW收敛慢、偏科严重 |
第一把钥匙:mHC——只准收缩不准放大的护栏
残差连接是深度学习用了十年的基础设计。DeepSeek在V4中把残差连接升级成mHC(Modified Hyper-Connections)。
问题出在HC的致命缺陷:训练不稳定。27B模型上,HC的信号放大倍数峰值达到3000倍。mHC的解法是强制每一层守恒:进多少水就出多少水,一滴不多一滴不少。
超过3000倍的信号放大,杯子直接爆了。
mHC带来的结果:V4能把模型从V3的671B推到1.6T,参数量2.4倍增长,训练稳定性反而比V3更好。
第二把钥匙:CSA+HCA——读800页的书先翻目录再精读
100万上下文为什么难做?标准注意力机制每个新token都要和前面所有token算内积。100万上下文的单次推理成本比4K高约6万倍。
V4的解法是两种注意力交替使用:
| 注意力类型 | 压缩率 | 作用 |
|---|---|---|
| CSA | 64:1 | 扫小标题定位,挑最相关几块精读 |
| HCA | 1024:1 | 翻目录看大意,所有压缩块全扫一遍 |
这就像读一本800页的书:先翻目录定位章节,再扫小标题找页码,最后精读那几页。
结果:V4在100万上下文下单次推理成本只有V3.2的约1/4,KV cache占用只有传统baseline的约2%。
第三把钥匙:Muon——整组旋钮一起掰
Muon是V4用来替代AdamW的优化器。
AdamW的逻辑:每个旋钮单独看它过去抖得厉害不厉害,单独调。问题是旋钮不独立,同一台机器上的零件彼此联动。结果:少数热门方向步子迈得特别大,其他方向几乎没动。
Muon的反向思路:看整组旋钮合起来往哪个方向走,把方向强行拉平——原本迈得大的压一压,几乎没动的拉一拉。
好处:原本被淹没的冷门方向,现在能和热门方向拿一样步长。模型探索范围更广,收敛更稳。
两个他们自己也不懂的trick
训练1.6T的MoE时,V4团队遇到loss spike——训练损失突然飙升。他们用了两个办法救回来:
| Trick | 原理 |
|---|---|
| Anticipatory Routing | 路由器用"昨天的脑子"做"今天的决定",恶性循环被切断 |
| SwiGLU Clamping | 给激活函数强行加上下限(-10到10),神经元想输出一万也只能给10 |
DeepSeek自己说:"the underlying principles of these mechanisms remain insufficiently understood"(底层的原理仍然没有被充分理解)。只知道用了有效,至于为什么,希望社区一起探索。
后训练范式变化:Specialist + OPD
这是V4最深刻的变化:混合RL阶段被彻底替换成On-Policy Distillation(在策略蒸馏)。
传统后训练问题:数学、代码、Agent、对话这些能力在RL阶段会互相打架,"负迁移"问题几乎每个团队都踩过坑。
V4的解法——分治+合并:
| 阶段 | 做法 |
|---|---|
| Specialist训练 | 每个领域单独训练专家模型,先SFT再用GRPO做RL |
| OPD蒸馏 | 十多个专家当老师,通过反向KL loss蒸馏出统一学生模型 |
妙处:RL只在专家阶段做,学生模型只做蒸馏。RL训练不稳定性被隔离在专家内部。
为什么用反向KL:正向KL让学生cover老师所有模式,学成四不像;反向KL让学生集中老师的高概率区域,自动"选老师"。
评测结果:强在哪弱在哪
数学推理:反超闭源旗舰
| Benchmark | V4-Pro-Max | 对比 |
|---|---|---|
| Putnam-2025 | 120/120满分 | 超过Axiom和Seed-Prover |
| Apex Shortlist | 90.2 | 全场第一 |
| Codeforces Rating | 3206 | 人类选手第23名 |
Agent:全方位落后闭源
| Benchmark | V4-Pro-Max | 最强 |
|---|---|---|
| Terminal Bench 2.0 | 67.9 | GPT-5.4: 75.1 |
| HLE w/ tools | 48.2 | Opus 4.6: 53.1 |
长上下文:128K内稳如狗,1M勉强能用
128K以内性能稳定在0.9以上,256K后掉到0.82,1024K降至0.59。
为什么V4这么偏科?
读完整份报告,一个鲜明模式:V4擅长做题,品味型任务差一档。
这和DeepSeek招的人有关:以竞赛获奖选手为主,擅长在给定规则下把单点做到极致,擅长解有明确答案的题。模型的性格映射着团队的性格。
DeepSeek还是那个DeepSeek吗?
V4团队已经从几十人成长到350+人。但有几个东西没变:
- 工程至上:创新重点在"信号怎么流动"和"梯度怎么更新"底层问题
- 诚实:承认架构太复杂、承认训练稳定性机制不理解、承认Agent能力落后闭源
- Open是真Open:让别人真的能复现的Open
DeepSeek引用:不诱于誉,不恐于诽,率道而行,端然正己。
总结
V4是开源阵营的一次基础设施级更新。把百万token上下文、Agent原生支持、成本优势打包成一个可复用的底座。
真正的价值不在V4-Pro能不能打赢最强闭源,而在V4-Flash让每个独立开发者都能在自己的产品里塞进百万上下文。
更有意思的故事,会在V5身上。
