Skip to content

你跟AI说中文,比老外说英文贵64%

2026年5月5日

📰 概要

你跟AI说中文,比老外说英文贵一半还多。

这不是歧视,是历史。

英文是互联网主流语料,AI的tokenizer词表设计是"英文优先"的,中文是后来被塞进去的。

Claude的中文处理效率只有英文的61%,ChatGPT是71%。你每说100个中文字,等于烧了160+个英文token的费用。

但有一个反直觉的例外:Qwen和DeepSeek的中文反而比英文便宜35%左右。因为国产模型从一开始就把中文当"默认语言"设计,而不是"外来户"。


🔍 解读

为什么中文被"区别对待"?

关键在tokenizer的词表设计。

英文是字母文字,一个英文单词通常对应3-4个字符,tokenizer可以用几十k的词表覆盖大部分常用词。中文是方块字,每个字独立,词表要覆盖所有汉字就需要更大的词表。

统计数据显示,Claude tokenizer中89%的汉字被切成单字token,而英文只有57%。这意味着:同样表达一个意思,中文需要更多的token来编码。

但DeepSeek的Tokenier V2打破了这种格局。

在DeepSeek上,中文反而比英文便宜0.65倍——用更小的词表、更高的压缩率处理中文。

这是国产模型的"先天优势"——从架构设计开始就把中文当第一公民。


💎 深挖

一个反常识的现象:古文比现代汉语更省token。

比如"茴"字,在古文里是常用字,在现代汉语里几乎不用。tokenizer会给常用字分配更短的编码。古文的常用字密度高,所以"茴"字的token编码比"想"字短。

但这只是编码端的"省钱"。实际推理时,模型对每个token的计算量是一样的——不管你是用1个token还是0.8个token,处理它消耗的算力没有区别。

所以"用古文跟AI对话更省钱"是个误解。省的是token数量,不是推理成本。

「什么情况不建议用」:如果你在选模型做中文任务,不要只看价格,要看token效率+模型能力的综合性价比。

DeepSeek/通义在中文场景的综合表现,往往比Claude/ChatGPT更值——不只是因为中文便宜,还因为它们更懂中文语境。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来