Appearance
📰 概要
你跟AI说中文,比老外说英文贵一半还多。
这不是歧视,是历史。
英文是互联网主流语料,AI的tokenizer词表设计是"英文优先"的,中文是后来被塞进去的。
Claude的中文处理效率只有英文的61%,ChatGPT是71%。你每说100个中文字,等于烧了160+个英文token的费用。
但有一个反直觉的例外:Qwen和DeepSeek的中文反而比英文便宜35%左右。因为国产模型从一开始就把中文当"默认语言"设计,而不是"外来户"。
🔍 解读
为什么中文被"区别对待"?
关键在tokenizer的词表设计。
英文是字母文字,一个英文单词通常对应3-4个字符,tokenizer可以用几十k的词表覆盖大部分常用词。中文是方块字,每个字独立,词表要覆盖所有汉字就需要更大的词表。
统计数据显示,Claude tokenizer中89%的汉字被切成单字token,而英文只有57%。这意味着:同样表达一个意思,中文需要更多的token来编码。
但DeepSeek的Tokenier V2打破了这种格局。
在DeepSeek上,中文反而比英文便宜0.65倍——用更小的词表、更高的压缩率处理中文。
这是国产模型的"先天优势"——从架构设计开始就把中文当第一公民。
💎 深挖
一个反常识的现象:古文比现代汉语更省token。
比如"茴"字,在古文里是常用字,在现代汉语里几乎不用。tokenizer会给常用字分配更短的编码。古文的常用字密度高,所以"茴"字的token编码比"想"字短。
但这只是编码端的"省钱"。实际推理时,模型对每个token的计算量是一样的——不管你是用1个token还是0.8个token,处理它消耗的算力没有区别。
所以"用古文跟AI对话更省钱"是个误解。省的是token数量,不是推理成本。
「什么情况不建议用」:如果你在选模型做中文任务,不要只看价格,要看token效率+模型能力的综合性价比。
DeepSeek/通义在中文场景的综合表现,往往比Claude/ChatGPT更值——不只是因为中文便宜,还因为它们更懂中文语境。
