Appearance
📰 概要
2026年4月24日,华为官方宣布昇腾超节点全系列产品支持DeepSeek V4系列模型。双方芯模技术紧密协同,实现推理部署。
昇腾950通过融合kernel和多流并行技术,大幅降低Attention计算和访存开销。昇腾A3超节点系列产品全面适配。
性能数据:DeepSeek V4-Pro模型8K输入场景,单卡吞吐4700TPS。DeepSeek V4-Flash模型8K长序列输入,单卡吞吐1600TPS。
🔍 解读
这是国产AI芯片与大模型深度协同的典型案例。华为通过芯模协同优化,让昇腾跑DeepSeek V4达到实用性能。
值得关注的是性能数字:单卡4700TPS和2000+TPS的吞吐,说明昇腾在推理场景已具备竞争力。
DeepSeek V4-Pro和Flash两个版本分别面向高吞吐和低延迟场景。
昇腾A3 64卡超节点结合大EP模式部署,基于vLLM推理引擎。这说明华为在软件生态上也在跟进主流框架。
💎 深挖
来看性能对比:
| 配置 | 模型 | 吞吐 | TPOT |
|---|---|---|---|
| 昇腾950 | V4-Pro | 4700TPS | 约20ms |
| 昇腾950 | V4-Flash | 1600TPS | 约10ms |
| A3 64卡 | V4-Flash | 2000+TPS | — |
关键技术点:
- 融合kernel降低计算开销
- 多流并行降低访存延迟
- 多种量化算法提升吞吐
- 大EP模式部署优化
昇腾950通过融合kernel和多流并行技术,降低Attention计算和访存开销。结合多种量化算法,实现高吞吐低延迟。
对国产芯片行业的影响:昇腾跑通DeepSeek V4,说明国产芯片在最新大模型上的适配能力正在提升。这对打破英伟达垄断有实质意义。
但也要注意,这些数据是离线推理模式采集,不包含Serving调度和框架负载均衡影响。实际线上性能可能低于Benchmark数据。
华为还提供了基于昇腾A3超节点的训练参考实现,便于用户快速微调。这说明华为在推理和训练两端都在推进生态。
什么情况不建议盲目乐观:如果你是技术选型,需验证线上实际性能,离线基准数据仅供参考。如果你是投资人,国产芯片性能追赶还需时间,生态差距仍然较大。
