Appearance
📰 企业还在用每美元FLOPS评估AI基础设施时,英伟达说这个标准已经过时了。真正重要的是每Token成本。
2026年5月7日,英伟达重新定义AI基础设施经济效益评估标准。核心观点:AI数据中心是Token工厂。
产出变成了Token形式的智能。Blackwell平台每Token成本比Hopper降低35倍。这意味着AI基础设施的评价标准,正从算力投入转向产出效率。
🔍 这个技术靠不靠谱?英伟达用数据说话:仅看算力成本,Blackwell是Hopper的2倍。但实际每Token成本,Blackwell是Hopper的1/35。
对你来说,这意味着选择AI基础设施时,不能只看芯片规格和价格。要关注实际能交付多少Token。市场在赌什么?AI推理正在成为企业核心业务。
但有个前提:这个指标主要适用于大规模AI推理场景。如果你的业务主要是AI训练,可能还需要关注其他指标。建议你先明确你的主要工作负载。
💎 英伟达提出的「每Token成本」公式很简单:每Token成本 = (每GPU小时成本)/(每秒Token产出 × 3600)。问题在于,大多数企业只关注分子——每GPU小时成本。
而降低每Token成本的关键在分母——最大化实际交付的Token产出。英伟达把这比作「推理冰山」。分子在水面之上,直观可见。
分母隐藏在水面之下,才是决定实际Token产出的关键因素。对AI基础设施的准确评估,应从探究水面之下开始。
水面之上的问题包括:每GPU小时的成本、峰值PetaFLOPS性能、每美元FLOPS。这些是传统评估指标。
水面之下的深度分析包括:每百万Token的成本、每兆瓦可交付多少Token产出、是否支持FP4精度、推理运行时是否支持投机解码等。
这些算法、硬件与软件优化必须有效且可以相互集成。一块看似「更便宜」的GPU,如果每秒Token产出明显更低,反而会导致更高的每Token成本。
为什么每Token成本比每美元FLOPS更重要?英伟达用DeepSeek-R1 AI模型的数据展示了差异。
仅从算力成本看,Blackwell平台成本约为Hopper的2倍。但实际结果呈现数量级差异:Blackwell每瓦Token产出是Hopper的50倍以上。
每百万Token成本降低至Hopper的1/35左右。这一悬殊差异表明,Blackwell在商业价值上实现了巨大跃迁。
开源推理软件如vLLM、TensorRT-LLM等基于英伟达平台构建。这意味着在现有基础设施部署后,Token产出仍可不断提升。
领先的云服务提供商已部署Blackwell基础设施并优化技术栈。包括CoreWeave、Nebius等合作伙伴,提供当前最低的Token成本。
从商业角度看,这标志着AI基础设施评估的根本转变。企业不再为算力付费,而是为智能产出付费。这更符合AI业务的本质:用Token创造价值。
什么情况不建议用?如果你的AI应用规模很小,Token成本可能不是主要考量。另外,如果你的业务主要是AI训练而非推理,这个指标可能不完全适用。
对于大规模AI推理的企业,每Token成本是关键的盈利能力指标。英伟达的这个框架,提供了更贴近业务实际的评估标准。
但这也意味着企业需要更专业的评估能力。不能简单比较GPU价格,而要评估全栈优化效果。
从长远看,AI基础设施的评估标准会继续演进。但每Token成本这个方向是正确的:从投入指标转向产出指标。
英伟达这一步,不仅是在推广Blackwell平台,更是在重新定义行业标准。当整个行业都开始关注每Token成本时,英伟达的全栈优势会更加明显。
对于正在规划AI基础设施的企业,这个框架值得参考。
