Skip to content

方言不再是 AI 的盲区:通义 Fun-ASR1.5 让 30 国语言和 7 大方言听懂你

2026年4月21日

📰 概要

2026年4月20日,阿里通义发布 Fun-ASR1.5 语音识别大模型。覆盖 30 国语言和中文 7 大方言(含 20+ 地方口音),方言 CER(字符错误率)较前代降低 56.2%。

核心能力:Code-Switching,同一句话中英日韩自由切换,无需预设语言标签。MoE 架构仅激活相关语言专家模块,兼顾精度与效率。

古诗词识别字级准确率 97%(训练语料覆盖先秦至现代)。自动标点、非标转标(数字、日期、金额、手机号自动规范化),已上线阿里云百炼和魔搭。


🔍 解读

方言 CER 降 56% 是个硬核数字。之前 ASR 模型对方言的处理基本是"听得懂大意",现在接近"逐字转写"。能保留"侬"(上海话)"倷"(苏州话)这类方言字,说明模型不是把方言硬翻成普通话,而是真的学到了方言的写法。

Code-Switching 无需预设标签,这个对实际使用影响很大。之前用多语言 ASR 得先告诉模型"我要说日语"——现实中谁说话前先选语言?能自动识别切换,才真的能在会议、客服、字幕场景里用起来。

但 MoE 架构的推理延迟需要实测。激活专家模块的路由开销在小 batch 实时场景下可能明显。


💎 深挖

对比一下主流 ASR 服务的语言覆盖:

服务语言数中文方言Code-Switch
Fun-ASR1.5307大方言+20口音自动
Whisper V399普通话为主需预设
Azure Speech100+粤语+普通话部分支持
Google STT125粤语+普通话部分支持

语言覆盖数 Fun-ASR1.5 不占优,但中文方言深度碾压。

对做客服、会议记录、字幕、教育产品的人来说,Fun-ASR1.5 填了一个真空白:方言场景终于有可用的 ASR 了。广东客服中心、上海老年人语音交互、四川话会议记录——这些场景之前要么用普通话硬翻,要么靠人工。现在有了技术基础,但还需要结合业务流做定制。

古诗词 97% 的字级准确率,对教育、文化数字化、古籍整理有价值。但通用场景的精度要看实测——古诗词是"窄而深"的场景,不代表日常对话同等水平。

建议:如果你的产品涉及中文方言用户,现在就可以在百炼平台申请 API 测试。重点测两个:方言转写准确率和 Code-Switch 延迟。如果你的场景纯英语或纯普通话,Whisper V3 的生态更成熟,暂时不用换。纯 C 端语音输入法场景,精度差异用户感知不强,不必追新模型。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来