Appearance
📰 概要
小米AI团队只用了4个月,就从入场做到了开源第一梯队。
2026年5月1日,MiMo-V2.5系列正式开源,权重全量开放。 这次不是单点升级——Pro旗舰Agent、全模态基座、TTS语音合成、ASR语音识别,四个模型一起发。
成绩单挺能打。 在SWE-Bench Pro和GDPVal-AA等基准上,MiMo-V2.5-Pro逼近Claude Opus 4.6和GPT-5.4,大幅超越Gemini 3.1 Pro。 更夸张的是Token效率:单任务只用约7万Token,竞品普遍在12-18万。
省了40%-60%的成本,能力还差不多。
🔍 解读
MiMo-V2.5最大的升级不在benchmarks上,在长程任务能力。
官方数据显示它能稳定支撑超千次工具调用的长周期任务。 一个验证:北大SysY编译器项目,从零写一个完整编译器——词法分析、语法分析、中间代码生成、RISC-V后端、性能优化——全程由AI自己完成。 4.3小时、672次工具调用,中间不崩、不跑偏、不失忆,拿到233/233满分。
另一个验证更直观:MiMo-V2.5-Pro花了4个小时,无中断地肝出了一个macOS Sequoia系统。 不是做个截图,是真的React 18+TypeScript搭建,54个原生应用、窗口管理系统、Dock栏、Spotlight搜索全都有。 浏览器能打开网页,Grapher能画3D函数。
这4小时没有人类接管,全程自己跑完。
💎 深挖
MiMo-V2.5有几个值得关注的设计方向。
第一个是"Token效率优先"的路线。 小米没选择堆参数拼上限,而是把单任务Token消耗压到了7万,只有竞品的一半。 这意味着同样的预算可以做两倍的事。对于有高频Agent调用需求的开发者和企业,这种成本优势比单纯的能力提升更实用。
第二个是全链路布局。 四个模型覆盖了Agent、基座、语音输入、语音输出。 TTS支持文本描述造音色和零样本克隆,不用上传参考音频,用文字描述就能生成想要的声线。 ASR拿到中英SOTA,粤语、川语、吴语、闽南语都能识别。
这意味着小米瞄的不只是文本Agent,而是完整的语音交互场景——智能座舱、智能家居、语音助手都有了模型层支撑。
第三个是Orbit开发者和Token计划。 100万亿Token免费发放,不分地域,全球开发者都能申请。 这种做法跟当年Google发TensorFlow、Meta开源LLaMA的逻辑一样:先铺生态,再谈变现。 小米还承诺对新兴Agent框架提供接入技术和免费模型支持。
什么情况不建议用MiMo? 如果你的任务极其依赖某一个闭源模型的独有能力(比如Claude的超长代码理解,或GPT的特定工具链集成),迁移有成本。 另外MiMo-V2.5虽然Token效率高,但极端复杂任务的上限相比Claude Opus 4.6和GPT-5.4还有差距。
对开发者的启发:小米用4个月走了别人8-12个月的路,说明开源模型的迭代速度正在加速。 4个月前的V2到现在的V2.5,小米AI团队验证了一个模式:快比好更重要,但中途不能掉链子。 对于做Agent开发的人来说,MiMo-V2.5的Token效率优势让它成了API预算敏感场景下的一个实在选择。
