Skip to content

平头哥发布首款智能网卡「磐脉920」:补上AI算力最后一块短板,让万卡集群不再「堵车」

2026年5月7日

📰 你的AI训练任务可能正卡在网络上——万卡集群里,GPU实际利用率只有60%。平头哥发布了首款智能网卡「磐脉920」,要解决的就是这个「算力输油管」问题。

2026年4月28日,在数字中国建设峰会上,平头哥推出这款400G智能网卡。它内置PCIe Switch,最大支持400Gbps吞吐带宽,专为万卡智算集群设计。

这意味着单张GPU性能再强,整个集群也不会因为网络而「堵车」。行业里很多万卡级智算集群的GPU利用率仅60%。

平头哥产品总监李旭慧形容这是「输油管道」问题:算力是石油,网力是管道。磐脉920正是要给AI算力配上更宽的管道。


🔍 这个技术靠不靠谱?内置PCIe Switch是亮点,能减少CPU介入,让数据直接在GPU和存储间流动。对你来说,如果正在跑大规模AI训练,网络延迟可能是瓶颈,这个网卡能直接提升效率。

市场在赌什么?平头哥作为阿里全资半导体公司,从玄铁RISC-V到倚天服务器CPU,现在补齐网卡,意在打造全栈国产算力。磐脉920首先部署在阿里云,显然是为自研智算中心铺路。

但有个前提:这东西能不能跑通,取决于实际部署效果。建议你先关注阿里云后续的实测数据,再判断是否值得迁移。毕竟网络优化是个系统工程,单张网卡只是开始。


💎 平头哥的「多芯」战略在这里又添一块拼图。2018年成立至今,它已推出玄铁RISC-V处理器、含光AI芯片、倚天服务器CPU、以及企业级SSD主控芯片。磐脉920是智能网卡领域的首次尝试,瞄准的是AI集群网络这个细分但关键的环节。

为什么是400G?这是当前高端智能网卡的主流规格。英特尔的E810、AMD Xilinx的400G网卡早已商用,英伟达BlueField-3更是集成了DPU功能。

平头哥选择这个赛道,意味着要直接和国际巨头竞争。但优势是能深度适配阿里云的软硬件生态。

网络瓶颈有多严重?想象一个万卡集群训练大模型。每个训练步骤需要所有GPU同步参数,只要有一个节点网络慢了,整个集群就得等。

这就是为什么GPU利用率上不去——不是算力不够,是网络跟不上。平头哥的目标是把60%的利用率向上突破,具体能提升多少,要看实测。

磐脉920的技术路径是内置PCIe Switch。传统方案需要CPU介入数据转发,增加了延迟和CPU负担。

内置Switch后,数据能在GPU、存储、网络之间直接交换,减少CPU参与。这对AI训练这种高吞吐、低延迟的场景特别重要。

部署节奏上,磐脉920已经量产,首先用在阿里云数据中心。这意味着如果你用阿里云的AI算力服务,可能很快就能体验到。但自建数据中心的企业需要等平头哥开放采购,或者找兼容方案。

什么情况不建议用?如果你的AI训练规模不大,比如只有几十张卡,网络可能还不是瓶颈,先优化算法和模型架构更实际。另外,如果你的基础设施不是阿里云生态,迁移和适配成本需要评估。

平头哥这一步,补上了国产AI算力基础设施的最后一块短板。算力(GPU/CPU)、存储(SSD)、网络(智能网卡)全栈自主。

这在AI算力自主可控的背景下意义重大。接下来要看实际部署后,万卡集群的GPU利用率能提升多少个百分点。

如果这个数字可观,对大规模AI训练的企业来说,成本和时间都能显著优化。但网络优化从来不是单点问题。

需要芯片、驱动、协议栈、应用层的协同。磐脉920开了个头,后面的路还长。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来