Skip to content

OpenAI发布MRC协议:联手英伟达/AMD/博通/英特尔/微软,重塑AI超算网络架构

2026年5月7日

📰 概要

AI训练最大的瓶颈,可能不是GPU,而是网络。2026年5月6日,OpenAI联合AMD、博通、英特尔、微软和英伟达,发布MRC多路径可靠连接协议,通过OCP向全行业开源。

这个协议解决的是:万卡级集群里,只要有一处网络抖动,整个训练就要中断。

MRC基于RoCE标准扩展,结合SRv6技术。实测中,即使链路抖动或交换机重启,MRC也能在不中断训练任务的情况下自动绕过故障。故障恢复时间从秒级缩短至微秒级。


🔍 解读

为什么OpenAI要牵头做网络协议?

因为网络已经成为AI训练的命门。当训练任务需要几千上万张GPU同步协作,只要有一处网络拥塞或设备故障,其他GPU就只能空等。

这是算力浪费的大头。OpenAI自己的数据显示,Colossus 1集群有22万张GPU,但实际利用率远没有这么高。

MRC做了什么?

三件事:多平面网络设计 + 自适应数据包喷淋 + 源路由。

多平面网络:用两层交换机替代传统的三到四层架构,连接约13.1万块GPU,成本和功耗都降了。

数据包喷淋:把单一传输的数据包分散到数百条路径并行传输,不再把鸡蛋放一个篮子里。

源路由:发送端直接指定数据包路径,交换机只负责转发,故障恢复从秒级变成微秒级。


💎 深挖

这是AI基础设施的"安卓时刻"

过去,AI网络协议是各家自研的闭门羹。英伟达有NVLink,AMD有Infinity Fabric——都是封闭生态。

MRC通过OCP开源,意味着任何厂商都可以用。这和当年安卓开源、打破诺基亚塞班生态的路数一样:标准开放,小厂商也能用上顶级协议。

5大巨头联手意味着什么?

AMD、博通、英特尔、微软、英伟达——这些公司在其他领域是死对头,但都愿意为MRC站在一起。

这说明网络瓶颈已经是整个行业的共识问题。没人能单独解决,不如一起开源。

对国内AI意味着什么?

MRC通过OCP开源,国内的阿里云、华为云、字节火山引擎理论上都可以用。这是绕过闭源生态封锁的机会。

但前提是国产交换机和网卡要先支持RoCE和SRv6。底层硬件不跟进,协议开源也没用。

什么情况不适合用?

如果你的集群规模在千卡以下,MRC的优势不明显。微秒级恢复时间在小规模集群里感知不到。反过来,如果你在做千卡以上训练,MRC值得认真评估。

你该关注什么?

AI竞争的主战场正在从模型层下沉到基础设施层。谁能跑通更大规模的训练,谁就能出更强的模型。网络协议就是这场竞争的关键配角。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来