Appearance
📰 概要
2026年4月28日,谷歌Google Cloud正式推出A5X裸金属实例。这是一款专为超大规模AI工作负载设计的计算实例,多站点集群可支持96万个Rubin GPU互联。
A5X实例采用英伟达最新ConnectX-9 SuperNIC,配合谷歌自研的Virgo Network超大规模扩展型AI数据中心架构,实现超高带宽、低延迟的GPU互联。
单实例规格支持8-64块Rubin GPU,主要面向需要本地算力的AI训练和推理场景。这是谷歌在AI基础设施领域的重磅产品。
🔍 解读
96万个GPU集群是什么概念?相当于把全球最大AI训练集群的规模再扩大一个数量级。普通企业的AI训练需求,在这种规模面前不值一提。
谷歌的策略很清楚:用自研芯片(TPU)+ 自研网络(Virgo)+ 自研实例(A5X)构建完整的AI基础设施闭环。不依赖第三方,才能最大化性能和利润。
从市场竞争看,A5X直指AWS和Azure的超大规模计算实例。但谷歌的核心优势在于软件生态——TPU和CUDA生态的兼容性越来越好,开发者迁移成本在下降。
💎 深挖
从技术规格看,A5X的竞争力体现在三个方面:
| 规格项 | A5X | AWS p5 | Azure ND |
|---|---|---|---|
| GPU | Rubin | H100 | H100 |
| 最大GPU数 | 64/实例 | 8/实例 | 8/实例 |
| 集群规模 | 96万GPU | 2万GPU | 1万GPU |
| 网络带宽 | 3.2Tbps | 3.2Tbps | 3.2Tbps |
从成本角度看,A5X的定价预计比AWS和Azure的同等规格高出约20-30%。但96万GPU的集群规模是其他厂商无法提供的。
这个规模意味着什么?可以同时训练10个以上万亿参数模型,或者服务数亿用户的实时推理请求。
从技术架构看,A5X的关键创新在于Virgo Network。这套网络架构实现了跨数据中心的高速互联,延迟控制在微秒级别。
这对于分布式训练至关重要。传统架构下,GPU跨节点通信是性能瓶颈。Virgo Network通过硬件级优化,把这个瓶颈降到最低。
从竞争格局看,AI基础设施正在进入「超大规模」时代。谷歌的A5X、AWS的Trainium3、微软的Maia 200——三大云厂商都在争夺超大规模AI训练的入场券。
谁能在2026年拿到足够的GPU产能,谁就能在AI云服务市场占据先机。芯片产能是核心约束,不是钱的问题。
从供应链角度看,Rubin GPU的产能是制约因素。英伟达的订单已经排到2027年,谷歌能拿到多少产能决定了这个产品的实际供给。
从技术演进看,A5X不是终点。谷歌已经在规划下一代B6X实例,预计2027年发布。TPU和Rubin的混合架构可能是下一步方向。
对企业用户来说,A5X的价值在于「确定性」。超大集群意味着任务完成时间可预测,不需要排队等资源。这对有时间敏感性的AI训练任务很关键。
从成本优化角度,A5X的多站点集群支持「潮汐调度」——把训练任务从高负载区域迁移到低负载区域,提高GPU利用率。
这种调度能力对于需要长时间训练的AI项目很重要。例如大模型的预训练可能需要数周时间,期间的算力成本是主要支出。
什么情况不建议用A5X?如果你的AI训练规模在百亿参数以下,A5X的成本效益不如中小规模实例。96万GPU集群是为万亿参数模型设计的,小模型用这个是杀鸡用牛刀。
另一个不建议的场景:如果你的团队没有分布式训练经验,A5X的管理复杂度可能超过收益。超大规模集群需要专业的运维团队。
从人才需求看,A5X这类超大规模实例的操作需要「AI基础设施工程师」——既懂AI训练,又懂分布式系统。这是新出现的岗位方向。
今天下班前,去Google Cloud官网查一下A5X的定价和可用区。如果你正在规划大规模AI训练项目,这个实例规格值得认真评估。
