Skip to content

谷歌A5X裸金属实例发布:96万个Rubin GPU集群支持AI算力

2026年4月28日

📰 概要

2026年4月28日,谷歌Google Cloud正式推出A5X裸金属实例。这是一款专为超大规模AI工作负载设计的计算实例,多站点集群可支持96万个Rubin GPU互联。

A5X实例采用英伟达最新ConnectX-9 SuperNIC,配合谷歌自研的Virgo Network超大规模扩展型AI数据中心架构,实现超高带宽、低延迟的GPU互联。

单实例规格支持8-64块Rubin GPU,主要面向需要本地算力的AI训练和推理场景。这是谷歌在AI基础设施领域的重磅产品。


🔍 解读

96万个GPU集群是什么概念?相当于把全球最大AI训练集群的规模再扩大一个数量级。普通企业的AI训练需求,在这种规模面前不值一提。

谷歌的策略很清楚:用自研芯片(TPU)+ 自研网络(Virgo)+ 自研实例(A5X)构建完整的AI基础设施闭环。不依赖第三方,才能最大化性能和利润。

从市场竞争看,A5X直指AWS和Azure的超大规模计算实例。但谷歌的核心优势在于软件生态——TPU和CUDA生态的兼容性越来越好,开发者迁移成本在下降。


💎 深挖

从技术规格看,A5X的竞争力体现在三个方面:

规格项A5XAWS p5Azure ND
GPURubinH100H100
最大GPU数64/实例8/实例8/实例
集群规模96万GPU2万GPU1万GPU
网络带宽3.2Tbps3.2Tbps3.2Tbps

从成本角度看,A5X的定价预计比AWS和Azure的同等规格高出约20-30%。但96万GPU的集群规模是其他厂商无法提供的。

这个规模意味着什么?可以同时训练10个以上万亿参数模型,或者服务数亿用户的实时推理请求。

从技术架构看,A5X的关键创新在于Virgo Network。这套网络架构实现了跨数据中心的高速互联,延迟控制在微秒级别。

这对于分布式训练至关重要。传统架构下,GPU跨节点通信是性能瓶颈。Virgo Network通过硬件级优化,把这个瓶颈降到最低。

从竞争格局看,AI基础设施正在进入「超大规模」时代。谷歌的A5X、AWS的Trainium3、微软的Maia 200——三大云厂商都在争夺超大规模AI训练的入场券。

谁能在2026年拿到足够的GPU产能,谁就能在AI云服务市场占据先机。芯片产能是核心约束,不是钱的问题。

从供应链角度看,Rubin GPU的产能是制约因素。英伟达的订单已经排到2027年,谷歌能拿到多少产能决定了这个产品的实际供给。

从技术演进看,A5X不是终点。谷歌已经在规划下一代B6X实例,预计2027年发布。TPU和Rubin的混合架构可能是下一步方向。

对企业用户来说,A5X的价值在于「确定性」。超大集群意味着任务完成时间可预测,不需要排队等资源。这对有时间敏感性的AI训练任务很关键。

从成本优化角度,A5X的多站点集群支持「潮汐调度」——把训练任务从高负载区域迁移到低负载区域,提高GPU利用率。

这种调度能力对于需要长时间训练的AI项目很重要。例如大模型的预训练可能需要数周时间,期间的算力成本是主要支出。

什么情况不建议用A5X?如果你的AI训练规模在百亿参数以下,A5X的成本效益不如中小规模实例。96万GPU集群是为万亿参数模型设计的,小模型用这个是杀鸡用牛刀。

另一个不建议的场景:如果你的团队没有分布式训练经验,A5X的管理复杂度可能超过收益。超大规模集群需要专业的运维团队。

从人才需求看,A5X这类超大规模实例的操作需要「AI基础设施工程师」——既懂AI训练,又懂分布式系统。这是新出现的岗位方向。

今天下班前,去Google Cloud官网查一下A5X的定价和可用区。如果你正在规划大规模AI训练项目,这个实例规格值得认真评估。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来