Skip to content

OpenAI用MRC协议解决AI训练「最后一公里」网络问题,6大巨头罕见合作揭示残酷现实

2026年5月20日

📰 概要

2026年5月6日,AI训练迎来基础设施革命。OpenAI联合AMD、博通、英特尔、微软、英伟达发布MRC协议。

这6大巨头罕见地坐到了一起。原因很残酷:没有可靠的网络,再多的GPU也训练不出智能。

MRC全称多路径可靠连接。它解决的是AI训练的"最后一公里"问题:网络延迟导致GPU闲置。

协议已通过开放计算项目向全行业开放。这意味着任何云厂商或超算中心都能采用这个标准。


🔍 解读

对你来说,这意味着AI训练更可靠了。如果你在云上训练模型,网络故障导致的停机会减少。

成本可能降低。GPU闲置时间减少,训练效率提升,最终反映在账单上。

技术上看,这是网络与计算的深度融合。传统网络设计不考虑AI训练特性,现在专门优化。

6大巨头的合作信号明显。竞争再激烈,在基础设施标准上也需要协作。

已部署在NVIDIA GB200和Oracle云。实际效果显示,即使链路抖动也不中断训练。


💎 深挖

大规模AI训练的网络挑战很真实。单一数据传输延迟可导致整个进程中断。

GPU因此闲置。网络拥塞、链路故障是主要诱因。集群越大,问题越多。

传统网络架构扩展性不足。三层或四层交换机,功耗高,恢复慢。

MRC采用多平面网络设计。将800Gb/s接口拆分为多个较小链路。

仅需两层交换机即可连接约13.1万块GPU。对比传统架构,显著降低功耗。

流量调度引入自适应数据包喷淋技术。与传统单路径传输完全不同。

将数据包分散至数百条路径并行传输。有效避免核心网络拥塞。

即使数据包乱序到达,接收端也能正确重组。这是关键技术突破。

为简化网络控制,MRC摒弃复杂动态路由协议。如BGP这类传统协议。

转而采用SRv6源路由。发送端直接指定数据包路径,交换机依据静态配置表转发。

这种机制消除动态路由故障行为。网络故障恢复从秒级缩短至微秒级。

实际部署数据令人信服。MRC已应用于NVIDIA GB200超级计算机。

也部署在Oracle Cloud Infrastructure站点。真实训练场景验证效果。

即使发生链路抖动,MRC也能不中断训练任务自动绕过故障。

这对持续训练至关重要。传统网络中,故障可能导致数小时中断。

OpenAI的动机很清晰。训练大模型需要可靠网络,这是瓶颈。

通过OCP开源协议,推动行业采纳。建立生态领导权。

英伟达的参与合理。GB200超级计算机需要可靠网络发挥GPU性能。

AMD和英特尔作为竞争者参与。在基础设施标准上,合作大于竞争。

博通是网络芯片巨头。MRC可能催生新一代网络芯片。

微软Azure云服务受益。云上AI训练需要优化网络。

Oracle OCI也参与部署。云计算竞争延伸到基础设施。

网络与计算正在深度融合。传统网络设计独立于计算特性。

现在为AI训练专门优化。这是高性能计算新阶段。

开源硬件标准成为共识。OCP平台让竞争对手在标准层面合作。

最终使用者受益。获得更优解决方案,降低总体成本。

对AI行业影响深远。训练效率提升意味着更大模型成为可能。

成本下降加速AI技术进步。

但MRC不是万能药。它解决网络问题,但AI训练还有算力、算法等挑战。

实施需要硬件支持。现有网络设备可能需要升级。

标准化需要时间。虽然开源,广泛采纳需要生态建设。

从投资角度看,利好网络设备厂商。新协议催生新硬件。

什么情况不建议用?如果你不涉及大规模AI训练,这个协议影响有限。

但如果你在云上训练模型,或关注AI基础设施,MRC值得深入研究。

OpenAI用MRC协议揭示了AI竞赛底层逻辑。不仅是算法和数据竞争,更是基础设施竞争。

6大巨头合作提醒我们。在技术发展关键时刻,合作可能比竞争更重要。

网络作为AI训练"最后一公里",终于有专门解决方案。这可能比新模型更有价值。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来