Skip to content

华为昇腾全面支持DeepSeek V4:950单卡4700TPS,A3超节点2000+TPS吞吐

2026年4月25日

📰 概要

2026年4月24日,华为官方宣布昇腾超节点全系列产品支持DeepSeek V4系列模型。双方芯模技术紧密协同,实现推理部署。

昇腾950通过融合kernel和多流并行技术,大幅降低Attention计算和访存开销。昇腾A3超节点系列产品全面适配。

性能数据:DeepSeek V4-Pro模型8K输入场景,单卡吞吐4700TPS。DeepSeek V4-Flash模型8K长序列输入,单卡吞吐1600TPS。


🔍 解读

这是国产AI芯片与大模型深度协同的典型案例。华为通过芯模协同优化,让昇腾跑DeepSeek V4达到实用性能。

值得关注的是性能数字:单卡4700TPS和2000+TPS的吞吐,说明昇腾在推理场景已具备竞争力。

DeepSeek V4-Pro和Flash两个版本分别面向高吞吐和低延迟场景。

昇腾A3 64卡超节点结合大EP模式部署,基于vLLM推理引擎。这说明华为在软件生态上也在跟进主流框架。


💎 深挖

来看性能对比:

配置模型吞吐TPOT
昇腾950V4-Pro4700TPS约20ms
昇腾950V4-Flash1600TPS约10ms
A3 64卡V4-Flash2000+TPS

关键技术点:

  1. 融合kernel降低计算开销
  2. 多流并行降低访存延迟
  3. 多种量化算法提升吞吐
  4. 大EP模式部署优化

昇腾950通过融合kernel和多流并行技术,降低Attention计算和访存开销。结合多种量化算法,实现高吞吐低延迟。

对国产芯片行业的影响:昇腾跑通DeepSeek V4,说明国产芯片在最新大模型上的适配能力正在提升。这对打破英伟达垄断有实质意义。

但也要注意,这些数据是离线推理模式采集,不包含Serving调度和框架负载均衡影响。实际线上性能可能低于Benchmark数据。

华为还提供了基于昇腾A3超节点的训练参考实现,便于用户快速微调。这说明华为在推理和训练两端都在推进生态。

什么情况不建议盲目乐观:如果你是技术选型,需验证线上实际性能,离线基准数据仅供参考。如果你是投资人,国产芯片性能追赶还需时间,生态差距仍然较大。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来