Skip to content

平头哥发布首款智能网卡磐脉920:万卡集群GPU利用率仅60%,网力比算力更该补

2026年5月7日

📰 概要

AI行业长期关注GPU数量,却忽视了另一个瓶颈——网卡。

2026年4月28日,平头哥在数字中国建设峰会上发布首款智能网卡「磐脉920」。这是国内首个内置PCIe Switch的400G智能网卡,已量产,率先部署在阿里云数据中心。

平头哥产品总监李旭慧打了个比方:「算力是AI时代的石油,网力就是输油管道。」


🔍 解读

为什么万卡集群GPU利用率只有60%

当AI训练任务需要几千甚至上万张GPU同时协作,只要其中一部分节点慢下来,其他节点就只能等待。系统效率不是由最强硬件决定,而是受限于最慢的节点。

万卡级智算集群,GPU实际利用率能做到60%已经算行业顶尖水平。「领先节点的算力会持续闲置等待,造成大规模算力浪费。」

三招解决「堵」和「等」

磐脉920通过三项设计减少等待浪费:

多路径RDMA让数据从单通道变多路分流,单QP可打满400G带宽,交换机缓冲区水线降低90%。

内置PCIe Switch让网卡与CPU、GPU形成更直接的连接。网络感知可编程拥塞控制,让网络主动避堵。

实测:任务完成时间缩短14%。


💎 深挖

平头哥的全栈布局

磐脉920是平头哥四条产品线的最后一块拼图:真武系列AI芯片(算力)、倚天系列CPU(通用算力)、镇岳系列存储主控(存力)、磐脉系列智能网卡(网力)。

四条线覆盖数据中心三个关键环节,这是平头哥与其他单点芯片公司的根本区别。

什么情况不适合用

磐脉920目前聚焦智算集群场景。对于中小规模部署,传统网卡配合优化足够用,无需额外投入。

你应该关注什么

随着AI从训练走向推理,网力的重要性会进一步凸显。平头哥「通云哥」协同模式——通义做模型、阿里云提供场景、平头哥做底层硬件——这种全栈闭环在国内科技公司中不多见。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来