Appearance
📰 概要
2026年5月6日,AI训练迎来基础设施革命。OpenAI联合AMD、博通、英特尔、微软、英伟达发布MRC协议。
这6大巨头罕见地坐到了一起。原因很残酷:没有可靠的网络,再多的GPU也训练不出智能。
MRC全称多路径可靠连接。它解决的是AI训练的"最后一公里"问题:网络延迟导致GPU闲置。
协议已通过开放计算项目向全行业开放。这意味着任何云厂商或超算中心都能采用这个标准。
🔍 解读
对你来说,这意味着AI训练更可靠了。如果你在云上训练模型,网络故障导致的停机会减少。
成本可能降低。GPU闲置时间减少,训练效率提升,最终反映在账单上。
技术上看,这是网络与计算的深度融合。传统网络设计不考虑AI训练特性,现在专门优化。
6大巨头的合作信号明显。竞争再激烈,在基础设施标准上也需要协作。
已部署在NVIDIA GB200和Oracle云。实际效果显示,即使链路抖动也不中断训练。
💎 深挖
大规模AI训练的网络挑战很真实。单一数据传输延迟可导致整个进程中断。
GPU因此闲置。网络拥塞、链路故障是主要诱因。集群越大,问题越多。
传统网络架构扩展性不足。三层或四层交换机,功耗高,恢复慢。
MRC采用多平面网络设计。将800Gb/s接口拆分为多个较小链路。
仅需两层交换机即可连接约13.1万块GPU。对比传统架构,显著降低功耗。
流量调度引入自适应数据包喷淋技术。与传统单路径传输完全不同。
将数据包分散至数百条路径并行传输。有效避免核心网络拥塞。
即使数据包乱序到达,接收端也能正确重组。这是关键技术突破。
为简化网络控制,MRC摒弃复杂动态路由协议。如BGP这类传统协议。
转而采用SRv6源路由。发送端直接指定数据包路径,交换机依据静态配置表转发。
这种机制消除动态路由故障行为。网络故障恢复从秒级缩短至微秒级。
实际部署数据令人信服。MRC已应用于NVIDIA GB200超级计算机。
也部署在Oracle Cloud Infrastructure站点。真实训练场景验证效果。
即使发生链路抖动,MRC也能不中断训练任务自动绕过故障。
这对持续训练至关重要。传统网络中,故障可能导致数小时中断。
OpenAI的动机很清晰。训练大模型需要可靠网络,这是瓶颈。
通过OCP开源协议,推动行业采纳。建立生态领导权。
英伟达的参与合理。GB200超级计算机需要可靠网络发挥GPU性能。
AMD和英特尔作为竞争者参与。在基础设施标准上,合作大于竞争。
博通是网络芯片巨头。MRC可能催生新一代网络芯片。
微软Azure云服务受益。云上AI训练需要优化网络。
Oracle OCI也参与部署。云计算竞争延伸到基础设施。
网络与计算正在深度融合。传统网络设计独立于计算特性。
现在为AI训练专门优化。这是高性能计算新阶段。
开源硬件标准成为共识。OCP平台让竞争对手在标准层面合作。
最终使用者受益。获得更优解决方案,降低总体成本。
对AI行业影响深远。训练效率提升意味着更大模型成为可能。
成本下降加速AI技术进步。
但MRC不是万能药。它解决网络问题,但AI训练还有算力、算法等挑战。
实施需要硬件支持。现有网络设备可能需要升级。
标准化需要时间。虽然开源,广泛采纳需要生态建设。
从投资角度看,利好网络设备厂商。新协议催生新硬件。
什么情况不建议用?如果你不涉及大规模AI训练,这个协议影响有限。
但如果你在云上训练模型,或关注AI基础设施,MRC值得深入研究。
OpenAI用MRC协议揭示了AI竞赛底层逻辑。不仅是算法和数据竞争,更是基础设施竞争。
6大巨头合作提醒我们。在技术发展关键时刻,合作可能比竞争更重要。
网络作为AI训练"最后一公里",终于有专门解决方案。这可能比新模型更有价值。
