Appearance
📰 概要
2026年4月24日,小米发布MiMo-V2.5语音大模型系列,覆盖TTS合成和ASR识别两大能力。核心卖点:用自然语言调度声音表现。
TTS系列包含三款模型:基础版(多音色精细控制)、VoiceDesign(一句话生成新音色)、VoiceClone(少量样本复刻)。
已上线MiMo开放平台,限时免费。
MiMo-V2.5-ASR正式开源。中英双语、方言、噪音场景识别性能业界领先,支持粤语、吴语、闽南语、四川话等。
🔍 解读
「自然语言调度声音」是这次的核心创新。过去调TTS要写参数(语速0.8、情绪悲伤),现在直接说「像演员读独白那样缓慢低沉」,模型就能理解。
这对非技术用户是大利好。但精细控制的稳定性还需要实测验证——自然语言的歧义性可能导致输出波动,批量生产时一致性是个问题。
ASR开源值得注意。语音识别在方言、噪音等真实场景下一直有瓶颈,小米敢开源说明对自己模型有信心。
💎 深挖
来看TTS三款模型的定位差异:
| 模型 | 用途 | 核心能力 |
|---|---|---|
| MiMo-V2.5-TTS | 通用合成 | 多音色+精细控制 |
| VoiceDesign | 音色创作 | 一句话定义新声音 |
| VoiceClone | 音色复刻 | 少样本高保真克隆 |
三个模型共享底层能力,但各有侧重。通用场景用基础版,定制需求用Design或Clone。
TTS的技术亮点在「导演剧本级输入」。把角色、场景、指导分层描述,各层独立更新、自由组合。这解决了一个痛点:长文本合成时风格飘移。
ASR的方言支持是差异化优势。粤语、吴语、闽南语、四川话,这些方言场景的公开数据集极少,小米有手机终端的用户数据做训练基础。
开源ASR的竞争格局:Whisper仍是基准,但中文方言场景Whisper表现一般。MiMo如果在这方面确实领先,对做语音交互的开发者有吸引力。
对开发者来说,TTS限时免费是试水的好时机。VoiceClone的复刻能力可快速验证——用你自己的几段录音,看克隆效果是否满足产品需求。
什么情况不建议用:对音色一致性要求极高的商业项目(如有声书批量生产),TTS指令遵循稳定性还没被大规模验证。
需要实时低延迟的场景(如游戏语音交互),大模型TTS推理速度可能不够。
