Skip to content

Mano-P开源:纯视觉驱动操控桌面软件,一句话控制你电脑上的应用

2026年4月25日

Mano-P开源:纯视觉驱动操控桌面软件,一句话控制你电脑上的应用

操控浏览器方案成熟(CDP/Playwright),但操控桌面软件一直没好方案——没有统一协议、没有DOM、界面结构完全不一样。Mano-P纯视觉理解桌面上的任何软件界面,像人一样去操作,数据不上云。

项目简介

开源地址https://github.com/Mininglamp-AI/Mano-P

Mano-P是明略科技开源的GUI-VLA智能体模型。说白了,就是一个能看懂你电脑屏幕、自己动手操作桌面上任何软件的AI。

它不依赖CDP协议,不依赖HTML解析,也不需要开什么API。模型直接看屏幕截图,理解画面上有什么,然后决定该怎么操作。

OSWorld专项模型榜单排名第一:72B模型成功率58.2%,比第二名高13.2个百分点。在全球13个多模态基准榜单拿到SOTA。

核心亮点

① 纯视觉驱动,浏览器之外的世界也能操作

方案限制
CDP协议方案只能操控浏览器
Accessibility API需要调系统API,兼容性差
云端大模型截图传云端,隐私风险
Mano-P纯视觉✅ 桌面软件、网页、3D应用、专业工具都能操作

模型直接看截图,像人一样理解界面内容,然后执行操作。只要有图形界面就能操作。

② 数据不出设备,隐私有保障

本地模式下,所有截图和任务数据完全不出设备。不需要联网,不需要调API,断网也能跑。

4B量化模型在Apple M4 Pro上的表现

性能指标数据
预填充速度476 tokens/s
解码速度76 tokens/s
峰值内存仅4.3GB

4.3GB——一台普通M4 MacBook就能跑起来,不需要高端工作站。对企业用户来说,业务数据、客户信息、操作记录全部留在本地,不存在数据泄露风险。

③ Think → Act → Verify闭环推理

Mano-P不是简单的看到什么点什么。它的工作流程是:

Think(思考当前画面该做什么)

Act(执行操作)

Verify(验证操作结果是否正确)

比如:让它打开Excel并插入一个图表。

步骤行为
Think分析当前画面:Excel已打开,光标在A1单元格,目标是在这个表格里插入图表
Act点击"插入"菜单 → 选择"图表" → 选择柱状图
Verify检查画面变化:图表是否真的出现了?位置对不对?

如果验证发现问题(比如图表插入位置不对),它会自动修正。这种"思考-执行-验证"的闭环,让它的操作成功率远高于简单的一步到位式Agent。

④ 多模态理解,不只是"看图"

Mano-P不只是看截图识别按钮位置。它能理解画面里的语义内容:

  • 看到Word文档,知道这是文字编辑场景
  • 看到Excel表格,知道这是数据分析场景
  • 看到游戏界面,知道这是娱乐场景

理解语义的好处是:它不会把"关闭窗口"的按钮当成"保存"按钮,不会把"删除"当成"编辑"。它在操作前会先判断这个操作在当前语境下是否合理。

应用场景

场景示例
办公自动化打开Excel导入数据、生成报表、发送邮件
软件测试自动操作软件界面,验证功能是否正常
游戏辅助理解游戏界面,自动操作(如打麻将)
专业工具操作Photoshop、CAD、视频剪辑软件

与其他方案的对比

方案覆盖范围隐私保护硬件要求
CDP/Playwright仅浏览器本地
云端大模型所有GUI❌ 上云无本地要求
Accessibility API系统应用本地需兼容
Mano-P所有GUI✅ 本地4.3GB内存

总结

Mano-P解决的核心问题:桌面应用没有统一的协议可以调,没有DOM可以解析,不同软件的界面结构完全不一样

纯视觉路线的突破:

  • 不依赖任何协议或API
  • 只要能看见就能操作
  • 数据完全留在本地

一句话控制你电脑上的软件,终于有了真正可用的方案。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来