Appearance
📰 概要
AI训练最大的瓶颈,可能不是GPU,而是网络。2026年5月6日,OpenAI联合AMD、博通、英特尔、微软和英伟达,发布MRC多路径可靠连接协议,通过OCP向全行业开源。
这个协议解决的是:万卡级集群里,只要有一处网络抖动,整个训练就要中断。
MRC基于RoCE标准扩展,结合SRv6技术。实测中,即使链路抖动或交换机重启,MRC也能在不中断训练任务的情况下自动绕过故障。故障恢复时间从秒级缩短至微秒级。
🔍 解读
为什么OpenAI要牵头做网络协议?
因为网络已经成为AI训练的命门。当训练任务需要几千上万张GPU同步协作,只要有一处网络拥塞或设备故障,其他GPU就只能空等。
这是算力浪费的大头。OpenAI自己的数据显示,Colossus 1集群有22万张GPU,但实际利用率远没有这么高。
MRC做了什么?
三件事:多平面网络设计 + 自适应数据包喷淋 + 源路由。
多平面网络:用两层交换机替代传统的三到四层架构,连接约13.1万块GPU,成本和功耗都降了。
数据包喷淋:把单一传输的数据包分散到数百条路径并行传输,不再把鸡蛋放一个篮子里。
源路由:发送端直接指定数据包路径,交换机只负责转发,故障恢复从秒级变成微秒级。
💎 深挖
这是AI基础设施的"安卓时刻"
过去,AI网络协议是各家自研的闭门羹。英伟达有NVLink,AMD有Infinity Fabric——都是封闭生态。
MRC通过OCP开源,意味着任何厂商都可以用。这和当年安卓开源、打破诺基亚塞班生态的路数一样:标准开放,小厂商也能用上顶级协议。
5大巨头联手意味着什么?
AMD、博通、英特尔、微软、英伟达——这些公司在其他领域是死对头,但都愿意为MRC站在一起。
这说明网络瓶颈已经是整个行业的共识问题。没人能单独解决,不如一起开源。
对国内AI意味着什么?
MRC通过OCP开源,国内的阿里云、华为云、字节火山引擎理论上都可以用。这是绕过闭源生态封锁的机会。
但前提是国产交换机和网卡要先支持RoCE和SRv6。底层硬件不跟进,协议开源也没用。
什么情况不适合用?
如果你的集群规模在千卡以下,MRC的优势不明显。微秒级恢复时间在小规模集群里感知不到。反过来,如果你在做千卡以上训练,MRC值得认真评估。
你该关注什么?
AI竞争的主战场正在从模型层下沉到基础设施层。谁能跑通更大规模的训练,谁就能出更强的模型。网络协议就是这场竞争的关键配角。
