Appearance
面壁MiniCPM-o 4.5发布技术报告:12GB显存全双工多模态,端侧AI交互来了
📰 概要
2026年4月28日,面壁智能联合清华大学发布MiniCPM-o 4.5技术报告。公开了Omni-Flow流式全模态框架,这是业界首个端到端全双工全模态大模型。
MiniCPM-o 4.5仅需12GB显存就能在个人电脑上跑起来。它约9B参数,由0.4B视觉编码器、0.3B音频编码器、8B基座和0.3B语音解码器组成。
它最大的突破是"全双工"——AI能持续感知环境、随时回应、被自由打断。不是传统半双工的对讲机式交互。
🔍 解读
全双工是AI交互的下一个分水岭。此前几乎所有大模型都是半双工模式,你说一句AI回一句,不能并行交流。
MiniCPM-o 4.5通过Omni-Flow实现了类人对话——你说话时它能边听边看边思考。
技术细节上,Omni-Flow做了三件事。时分复用让音视频流共用计算资源,TAIL时间对齐保证语音生成与感知同步。模型无需外部VAD,自主判断何时该听何时该说。
但真正让开发者兴奋的是12GB的门槛。INT4量化后一张RTX 5070就能跑,Mac M1以上16G内存也能用。在这个参数级别做到端侧全双工,之前没有先例。
💎 深挖
面壁走了一条不同于多数大模型公司的路。当同行在拼千亿参数时,面壁死磕端侧——把模型做小、做快、做到消费级显卡上。
MiniCPM-o 4.5的下载量突破25万,说明这条路确实有需求。
在OpenCompass上综合77.6分,MMBench英文87.6分。Daily-Omni和Video-Holmes评测优于Gemini 2.5 Flash。
9B模型能和云端模型掰手腕,靠的是架构效率。
但什么情况不建议用?如果你的需求是长文本生成或复杂推理,9B参数天然受限。MiniCPM-o 4.5的强项是实时交互感知——生活陪伴、视障辅助、智能车载。
不是写论文或解数学题。
面壁团队在技术报告中坦诚列出了不足:长时间交互稳定性有待提升,主动行为丰富性不够,复杂场景鲁棒性有差距。这种诚实反而值得信任。
