Appearance
从GPU到Token:AI基础设施竞争逻辑重构
概要
2026年4月22日,量子位发文探讨AI基础设施竞争逻辑的变化:从GPU算力竞争转向Token吞吐竞争。核心观点是,未来衡量AI基础设施能力的指标不再是"你有多少GPU",而是"你每秒能吐出多少Token"。
这个转变看似简单,实则影响深远。它意味着云服务商、芯片厂商、模型公司的竞争规则正在重写。
解读
为什么"Token"比"GPU"更重要?因为GPU只是投入,Token才是产出。用户关心的不是你有多少卡,而是你能多快、多便宜地响应他的请求。一个GPU利用率低的系统,即使卡再多也没有竞争力。
Token视角的改变,会让很多"隐形优化"变得重要。比如KVCache管理、推理批处理策略、模型量化技术——这些在"GPU时代"不太被关注的细节,在"Token时代"成为核心竞争力。
更重要的是,Token视角让不同技术路线有了可比性。GPU方案、ASIC方案、甚至CPU推理方案,都可以用"每美元Token数"来衡量。谁的性价比高,谁就更有竞争力。
深挖
对云服务商来说,这意味着商业模式可能调整。过去按GPU时长收费,未来可能按Token用量收费。这对用户更透明,对服务商的优化能力要求也更高——你必须持续提升Token吞吐,才能保持利润率。
对芯片厂商来说,竞争焦点从"峰值算力"转向"推理效率"。英伟达的H100算力很强,但如果有芯片能在推理场景用更少的功耗产生更多的Token,那它就有差异化空间。AMD、Intel、创业公司都在往这个方向发力。
对模型公司来说,Token视角让他们有了更多选择。训练时你可以用最强的GPU,推理时你可以用性价比最高的方案。模型架构设计也开始考虑"推理友好"——同样能力的模型,推理成本越低越好。
什么情况需要关注?如果你是AI应用的采购决策者,开始用"每美元Token数"评估不同方案,可能发现新的性价比最优解。什么情况影响较小?如果你是训练大模型的研究者,GPU算力仍然是硬指标,Token视角主要影响推理阶段。
