Skip to content

英伟达重新定义AI成本:每Token成本才是唯一重要指标

2026年5月7日

📰 企业还在用每美元FLOPS评估AI基础设施时,英伟达说这个标准已经过时了。真正重要的是每Token成本。

2026年5月7日,英伟达重新定义AI基础设施经济效益评估标准。核心观点:AI数据中心是Token工厂。

产出变成了Token形式的智能。Blackwell平台每Token成本比Hopper降低35倍。这意味着AI基础设施的评价标准,正从算力投入转向产出效率。


🔍 这个技术靠不靠谱?英伟达用数据说话:仅看算力成本,Blackwell是Hopper的2倍。但实际每Token成本,Blackwell是Hopper的1/35。

对你来说,这意味着选择AI基础设施时,不能只看芯片规格和价格。要关注实际能交付多少Token。市场在赌什么?AI推理正在成为企业核心业务。

但有个前提:这个指标主要适用于大规模AI推理场景。如果你的业务主要是AI训练,可能还需要关注其他指标。建议你先明确你的主要工作负载。


💎 英伟达提出的「每Token成本」公式很简单:每Token成本 = (每GPU小时成本)/(每秒Token产出 × 3600)。问题在于,大多数企业只关注分子——每GPU小时成本。

而降低每Token成本的关键在分母——最大化实际交付的Token产出。英伟达把这比作「推理冰山」。分子在水面之上,直观可见。

分母隐藏在水面之下,才是决定实际Token产出的关键因素。对AI基础设施的准确评估,应从探究水面之下开始。

水面之上的问题包括:每GPU小时的成本、峰值PetaFLOPS性能、每美元FLOPS。这些是传统评估指标。

水面之下的深度分析包括:每百万Token的成本、每兆瓦可交付多少Token产出、是否支持FP4精度、推理运行时是否支持投机解码等。

这些算法、硬件与软件优化必须有效且可以相互集成。一块看似「更便宜」的GPU,如果每秒Token产出明显更低,反而会导致更高的每Token成本。

为什么每Token成本比每美元FLOPS更重要?英伟达用DeepSeek-R1 AI模型的数据展示了差异。

仅从算力成本看,Blackwell平台成本约为Hopper的2倍。但实际结果呈现数量级差异:Blackwell每瓦Token产出是Hopper的50倍以上。

每百万Token成本降低至Hopper的1/35左右。这一悬殊差异表明,Blackwell在商业价值上实现了巨大跃迁。

开源推理软件如vLLM、TensorRT-LLM等基于英伟达平台构建。这意味着在现有基础设施部署后,Token产出仍可不断提升。

领先的云服务提供商已部署Blackwell基础设施并优化技术栈。包括CoreWeave、Nebius等合作伙伴,提供当前最低的Token成本。

从商业角度看,这标志着AI基础设施评估的根本转变。企业不再为算力付费,而是为智能产出付费。这更符合AI业务的本质:用Token创造价值。

什么情况不建议用?如果你的AI应用规模很小,Token成本可能不是主要考量。另外,如果你的业务主要是AI训练而非推理,这个指标可能不完全适用。

对于大规模AI推理的企业,每Token成本是关键的盈利能力指标。英伟达的这个框架,提供了更贴近业务实际的评估标准。

但这也意味着企业需要更专业的评估能力。不能简单比较GPU价格,而要评估全栈优化效果。

从长远看,AI基础设施的评估标准会继续演进。但每Token成本这个方向是正确的:从投入指标转向产出指标。

英伟达这一步,不仅是在推广Blackwell平台,更是在重新定义行业标准。当整个行业都开始关注每Token成本时,英伟达的全栈优势会更加明显。

对于正在规划AI基础设施的企业,这个框架值得参考。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来