Appearance
DeepSeek V4不是V3系列的放大,而是围绕1M长上下文效率重建的体系。
六大技术支柱
| # | 技术支柱 | 核心贡献 | 关键量化收益 |
|---|---|---|---|
| 1 | 混合注意力架构(CSA + HCA) | 双通路分工处理长文本 | 单token FLOPs降至V3.2的27%、KV cache压至10% |
| 2 | mHC流形约束超连接 | 重写残差连接,稳定深层信号 | wall-time开销仅overlapped pipeline的6.7% |
| 3 | MoE精度混合(FP4 + FP8 Mixed) | 专家权重FP4、其余FP8 | 进一步压缩推理显存与带宽 |
| 4 | Muon优化器 | 替代AdamW,前8步激进、后2步温和 | 1.6T MoE全程训练零崩溃 |
| 5 | 两阶段后训练(Domain Expert → OPD) | SFT + GRPO → On-Policy Distillation | 四大专家统一入一模 |
| 6 | 数据与推理模式 | 32T+ token预训练;三档推理 | Think Max推荐上下文≥384K |
混合注意力架构:CSA + HCA双通路
为什么要做混合
传统Transformer在1M token下两个致命瓶颈:
- FLOPs:与序列长度平方成正比,1M token的单token计算量约为32K的1000倍
- KV cache:显存线性爆炸,HBM不够用
两条通路各司其职
| CSA(细粒度) | HCA(粗粒度) | |
|---|---|---|
| 粒度 | 每m个token压缩成一个KV块 | 128个token压成一个块 |
| 机制 | indexer算query与压缩块相关性→top-k→Multi-Query Attention | 在压缩后的短序列上做全量注意力 |
| 定位 | 精确检索:"从百万文本里精准找到那句话" | 全局汇总:"理解全文的整体脉络" |
V4-Pro共61层、V4-Flash共43层。
直观理解
| 通路 | 比喻 |
|---|---|
| CSA | 查索引+精读:先扫摘要卡片、挑出相关块、再精读原文,精度优先 |
| HCA | 读目录+脑图:把所有章节印象做一次完整关联分析,宏观优先 |
两层交替(细→粗→细→粗),模型在1M token下既不丢细节也不被细节淹没。
效率收益
- 73% FLOPs降幅
- 90% KV cache降幅
意味着:HBM瓶颈松动,亚马逊硬件工程师评价"这可能缓解当前HBM短缺"
V4-Flash价格低于Claude Opus 4.7逾99%,架构效率直接转化为API定价优势。
Muon优化器
替代AdamW:
- 前8步激进收敛
- 后2步温和微调
成果:1.6T MoE全程训练零崩溃。
两阶段后训练
Domain Expert(SFT + GRPO)→ OPD(On-Policy Distillation)→ 统一模型四大专家(数学/代码/Agent/指令)统一入一模。
三档推理模式
| 模式 | 说明 |
|---|---|
| Think Fast | 快速响应 |
| Think | 标准推理 |
| Think Max | 探索模型推理极限(建议上下文≥384K) |
产业影响
| 维度 | 影响 |
|---|---|
| 硬件生态 | 对HBM依赖下降,缓解英伟达一家独大;非CUDA芯片(昇腾、寒武纪)首次Day 0适配 |
| 推理成本 | V4-Flash API价格较Claude Opus 4.7低逾99%;单token计算量仅V3.2的27% |
| 应用形态 | 1M上下文从"理论长度"变为"默认用法";Agent长任务、代码仓全量理解成为常规场景 |
| 开源生态 | 全球开源前5全部为中国模型;MIT协议无商用限制 |
| 资本预期 | "更聪明的架构+更小的激活参数"成为新的竞争焦点 |
核心认知
DeepSeek V4的意义不只是"又一个大模型",而是把1M上下文从理论长度变成了默认用法。
这意味着:
- 代码仓库全量理解不再是难题
- 长文档分析成为标配
- Agent执行超长任务成为可能
一个架构时代开启了。
