Appearance
📰 概要
2026年4月20日,阿里通义发布 Fun-ASR1.5 语音识别大模型。覆盖 30 国语言和中文 7 大方言(含 20+ 地方口音),方言 CER(字符错误率)较前代降低 56.2%。
核心能力:Code-Switching,同一句话中英日韩自由切换,无需预设语言标签。MoE 架构仅激活相关语言专家模块,兼顾精度与效率。
古诗词识别字级准确率 97%(训练语料覆盖先秦至现代)。自动标点、非标转标(数字、日期、金额、手机号自动规范化),已上线阿里云百炼和魔搭。
🔍 解读
方言 CER 降 56% 是个硬核数字。之前 ASR 模型对方言的处理基本是"听得懂大意",现在接近"逐字转写"。能保留"侬"(上海话)"倷"(苏州话)这类方言字,说明模型不是把方言硬翻成普通话,而是真的学到了方言的写法。
Code-Switching 无需预设标签,这个对实际使用影响很大。之前用多语言 ASR 得先告诉模型"我要说日语"——现实中谁说话前先选语言?能自动识别切换,才真的能在会议、客服、字幕场景里用起来。
但 MoE 架构的推理延迟需要实测。激活专家模块的路由开销在小 batch 实时场景下可能明显。
💎 深挖
对比一下主流 ASR 服务的语言覆盖:
| 服务 | 语言数 | 中文方言 | Code-Switch |
|---|---|---|---|
| Fun-ASR1.5 | 30 | 7大方言+20口音 | 自动 |
| Whisper V3 | 99 | 普通话为主 | 需预设 |
| Azure Speech | 100+ | 粤语+普通话 | 部分支持 |
| Google STT | 125 | 粤语+普通话 | 部分支持 |
语言覆盖数 Fun-ASR1.5 不占优,但中文方言深度碾压。
对做客服、会议记录、字幕、教育产品的人来说,Fun-ASR1.5 填了一个真空白:方言场景终于有可用的 ASR 了。广东客服中心、上海老年人语音交互、四川话会议记录——这些场景之前要么用普通话硬翻,要么靠人工。现在有了技术基础,但还需要结合业务流做定制。
古诗词 97% 的字级准确率,对教育、文化数字化、古籍整理有价值。但通用场景的精度要看实测——古诗词是"窄而深"的场景,不代表日常对话同等水平。
建议:如果你的产品涉及中文方言用户,现在就可以在百炼平台申请 API 测试。重点测两个:方言转写准确率和 Code-Switch 延迟。如果你的场景纯英语或纯普通话,Whisper V3 的生态更成熟,暂时不用换。纯 C 端语音输入法场景,精度差异用户感知不强,不必追新模型。
