Skip to content

小米MiMo-V2.5语音大模型:自然语言调度声音,ASR开源方言识别领先

2026年4月25日

📰 概要

2026年4月24日,小米发布MiMo-V2.5语音大模型系列,覆盖TTS合成和ASR识别两大能力。核心卖点:用自然语言调度声音表现。

TTS系列包含三款模型:基础版(多音色精细控制)、VoiceDesign(一句话生成新音色)、VoiceClone(少量样本复刻)。

已上线MiMo开放平台,限时免费。

MiMo-V2.5-ASR正式开源。中英双语、方言、噪音场景识别性能业界领先,支持粤语、吴语、闽南语、四川话等。


🔍 解读

「自然语言调度声音」是这次的核心创新。过去调TTS要写参数(语速0.8、情绪悲伤),现在直接说「像演员读独白那样缓慢低沉」,模型就能理解。

这对非技术用户是大利好。但精细控制的稳定性还需要实测验证——自然语言的歧义性可能导致输出波动,批量生产时一致性是个问题。

ASR开源值得注意。语音识别在方言、噪音等真实场景下一直有瓶颈,小米敢开源说明对自己模型有信心。


💎 深挖

来看TTS三款模型的定位差异:

模型用途核心能力
MiMo-V2.5-TTS通用合成多音色+精细控制
VoiceDesign音色创作一句话定义新声音
VoiceClone音色复刻少样本高保真克隆

三个模型共享底层能力,但各有侧重。通用场景用基础版,定制需求用Design或Clone。

TTS的技术亮点在「导演剧本级输入」。把角色、场景、指导分层描述,各层独立更新、自由组合。这解决了一个痛点:长文本合成时风格飘移。

ASR的方言支持是差异化优势。粤语、吴语、闽南语、四川话,这些方言场景的公开数据集极少,小米有手机终端的用户数据做训练基础。

开源ASR的竞争格局:Whisper仍是基准,但中文方言场景Whisper表现一般。MiMo如果在这方面确实领先,对做语音交互的开发者有吸引力。

对开发者来说,TTS限时免费是试水的好时机。VoiceClone的复刻能力可快速验证——用你自己的几段录音,看克隆效果是否满足产品需求。

什么情况不建议用:对音色一致性要求极高的商业项目(如有声书批量生产),TTS指令遵循稳定性还没被大规模验证。

需要实时低延迟的场景(如游戏语音交互),大模型TTS推理速度可能不够。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来