Skip to content

DeepSeek V4训练全解:三把钥匙解开百万上下文低成本之谜

2026年4月25日

DeepSeek V4训练全解:三把钥匙解开百万上下文低成本之谜

V4不是冲破AGI天花板的模型,而是让开发者第一次放心用上100万上下文Agent模型。闭源卷天花板,开源卷地板——V4把地板往上抬了抬。

核心结论

DeepSeek V4真正的价值:把百万上下文、Agent原生能力、能接受的价格这三件事第一次绑在了一起。

这两种叙事差别非常大:

叙事目标V4表现
冲顶峰全面击败Opus 4.7、GPT-5.5、Gemini 3.1 Pro做不到
抬地板让开发者用上百万元上下文Agent做到了

业内说法:闭源模型卷能力天花板,开源模型卷地板,地板抬高速度决定AI应用爆发规模。

V4-Pro vs V4-Flash:两个定位不一样的模型

模型参数规模定位价格
V4-Pro1.6T总参数,49B激活开源阵营里跟闭源旗舰掰手腕目前不便宜,下半年降
V4-FlashPro的约六分之一快速模型,反超V3.2同类1/7到1/18

建议:AI编程、写作、复杂任务、关键决策用Opus 4.7;批量任务、Agent后台、数据处理用V4-Flash。

架构动了哪些刀

V4没有推倒V3重来,真正大改的地方只有三处:

改动解决的痛点
mHC残差连接堆深时数值不稳定
CSA+HCA百万token长上下文KV cache爆炸
MuonAdamW收敛慢、偏科严重

第一把钥匙:mHC——只准收缩不准放大的护栏

残差连接是深度学习用了十年的基础设计。DeepSeek在V4中把残差连接升级成mHC(Modified Hyper-Connections)。

问题出在HC的致命缺陷:训练不稳定。27B模型上,HC的信号放大倍数峰值达到3000倍。mHC的解法是强制每一层守恒:进多少水就出多少水,一滴不多一滴不少。

超过3000倍的信号放大,杯子直接爆了。

mHC带来的结果:V4能把模型从V3的671B推到1.6T,参数量2.4倍增长,训练稳定性反而比V3更好。

第二把钥匙:CSA+HCA——读800页的书先翻目录再精读

100万上下文为什么难做?标准注意力机制每个新token都要和前面所有token算内积。100万上下文的单次推理成本比4K高约6万倍。

V4的解法是两种注意力交替使用:

注意力类型压缩率作用
CSA64:1扫小标题定位,挑最相关几块精读
HCA1024:1翻目录看大意,所有压缩块全扫一遍

这就像读一本800页的书:先翻目录定位章节,再扫小标题找页码,最后精读那几页。

结果:V4在100万上下文下单次推理成本只有V3.2的约1/4,KV cache占用只有传统baseline的约2%。

第三把钥匙:Muon——整组旋钮一起掰

Muon是V4用来替代AdamW的优化器。

AdamW的逻辑:每个旋钮单独看它过去抖得厉害不厉害,单独调。问题是旋钮不独立,同一台机器上的零件彼此联动。结果:少数热门方向步子迈得特别大,其他方向几乎没动。

Muon的反向思路:看整组旋钮合起来往哪个方向走,把方向强行拉平——原本迈得大的压一压,几乎没动的拉一拉。

好处:原本被淹没的冷门方向,现在能和热门方向拿一样步长。模型探索范围更广,收敛更稳。

两个他们自己也不懂的trick

训练1.6T的MoE时,V4团队遇到loss spike——训练损失突然飙升。他们用了两个办法救回来:

Trick原理
Anticipatory Routing路由器用"昨天的脑子"做"今天的决定",恶性循环被切断
SwiGLU Clamping给激活函数强行加上下限(-10到10),神经元想输出一万也只能给10

DeepSeek自己说:"the underlying principles of these mechanisms remain insufficiently understood"(底层的原理仍然没有被充分理解)。只知道用了有效,至于为什么,希望社区一起探索。

后训练范式变化:Specialist + OPD

这是V4最深刻的变化:混合RL阶段被彻底替换成On-Policy Distillation(在策略蒸馏)。

传统后训练问题:数学、代码、Agent、对话这些能力在RL阶段会互相打架,"负迁移"问题几乎每个团队都踩过坑。

V4的解法——分治+合并:

阶段做法
Specialist训练每个领域单独训练专家模型,先SFT再用GRPO做RL
OPD蒸馏十多个专家当老师,通过反向KL loss蒸馏出统一学生模型

妙处:RL只在专家阶段做,学生模型只做蒸馏。RL训练不稳定性被隔离在专家内部。

为什么用反向KL:正向KL让学生cover老师所有模式,学成四不像;反向KL让学生集中老师的高概率区域,自动"选老师"。

评测结果:强在哪弱在哪

数学推理:反超闭源旗舰

BenchmarkV4-Pro-Max对比
Putnam-2025120/120满分超过Axiom和Seed-Prover
Apex Shortlist90.2全场第一
Codeforces Rating3206人类选手第23名

Agent:全方位落后闭源

BenchmarkV4-Pro-Max最强
Terminal Bench 2.067.9GPT-5.4: 75.1
HLE w/ tools48.2Opus 4.6: 53.1

长上下文:128K内稳如狗,1M勉强能用

128K以内性能稳定在0.9以上,256K后掉到0.82,1024K降至0.59。

为什么V4这么偏科?

读完整份报告,一个鲜明模式:V4擅长做题,品味型任务差一档。

这和DeepSeek招的人有关:以竞赛获奖选手为主,擅长在给定规则下把单点做到极致,擅长解有明确答案的题。模型的性格映射着团队的性格。

DeepSeek还是那个DeepSeek吗?

V4团队已经从几十人成长到350+人。但有几个东西没变:

  1. 工程至上:创新重点在"信号怎么流动"和"梯度怎么更新"底层问题
  2. 诚实:承认架构太复杂、承认训练稳定性机制不理解、承认Agent能力落后闭源
  3. Open是真Open:让别人真的能复现的Open

DeepSeek引用:不诱于誉,不恐于诽,率道而行,端然正己。

总结

V4是开源阵营的一次基础设施级更新。把百万token上下文、Agent原生支持、成本优势打包成一个可复用的底座。

真正的价值不在V4-Pro能不能打赢最强闭源,而在V4-Flash让每个独立开发者都能在自己的产品里塞进百万上下文。

更有意思的故事,会在V5身上。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来