Appearance
Mano-P开源:纯视觉驱动操控桌面软件,一句话控制你电脑上的应用
操控浏览器方案成熟(CDP/Playwright),但操控桌面软件一直没好方案——没有统一协议、没有DOM、界面结构完全不一样。Mano-P纯视觉理解桌面上的任何软件界面,像人一样去操作,数据不上云。
项目简介
开源地址:https://github.com/Mininglamp-AI/Mano-P
Mano-P是明略科技开源的GUI-VLA智能体模型。说白了,就是一个能看懂你电脑屏幕、自己动手操作桌面上任何软件的AI。
它不依赖CDP协议,不依赖HTML解析,也不需要开什么API。模型直接看屏幕截图,理解画面上有什么,然后决定该怎么操作。
OSWorld专项模型榜单排名第一:72B模型成功率58.2%,比第二名高13.2个百分点。在全球13个多模态基准榜单拿到SOTA。
核心亮点
① 纯视觉驱动,浏览器之外的世界也能操作
| 方案 | 限制 |
|---|---|
| CDP协议方案 | 只能操控浏览器 |
| Accessibility API | 需要调系统API,兼容性差 |
| 云端大模型 | 截图传云端,隐私风险 |
| Mano-P纯视觉 | ✅ 桌面软件、网页、3D应用、专业工具都能操作 |
模型直接看截图,像人一样理解界面内容,然后执行操作。只要有图形界面就能操作。
② 数据不出设备,隐私有保障
本地模式下,所有截图和任务数据完全不出设备。不需要联网,不需要调API,断网也能跑。
4B量化模型在Apple M4 Pro上的表现:
| 性能指标 | 数据 |
|---|---|
| 预填充速度 | 476 tokens/s |
| 解码速度 | 76 tokens/s |
| 峰值内存 | 仅4.3GB |
4.3GB——一台普通M4 MacBook就能跑起来,不需要高端工作站。对企业用户来说,业务数据、客户信息、操作记录全部留在本地,不存在数据泄露风险。
③ Think → Act → Verify闭环推理
Mano-P不是简单的看到什么点什么。它的工作流程是:
Think(思考当前画面该做什么)
↓
Act(执行操作)
↓
Verify(验证操作结果是否正确)比如:让它打开Excel并插入一个图表。
| 步骤 | 行为 |
|---|---|
| Think | 分析当前画面:Excel已打开,光标在A1单元格,目标是在这个表格里插入图表 |
| Act | 点击"插入"菜单 → 选择"图表" → 选择柱状图 |
| Verify | 检查画面变化:图表是否真的出现了?位置对不对? |
如果验证发现问题(比如图表插入位置不对),它会自动修正。这种"思考-执行-验证"的闭环,让它的操作成功率远高于简单的一步到位式Agent。
④ 多模态理解,不只是"看图"
Mano-P不只是看截图识别按钮位置。它能理解画面里的语义内容:
- 看到Word文档,知道这是文字编辑场景
- 看到Excel表格,知道这是数据分析场景
- 看到游戏界面,知道这是娱乐场景
理解语义的好处是:它不会把"关闭窗口"的按钮当成"保存"按钮,不会把"删除"当成"编辑"。它在操作前会先判断这个操作在当前语境下是否合理。
应用场景
| 场景 | 示例 |
|---|---|
| 办公自动化 | 打开Excel导入数据、生成报表、发送邮件 |
| 软件测试 | 自动操作软件界面,验证功能是否正常 |
| 游戏辅助 | 理解游戏界面,自动操作(如打麻将) |
| 专业工具 | 操作Photoshop、CAD、视频剪辑软件 |
与其他方案的对比
| 方案 | 覆盖范围 | 隐私保护 | 硬件要求 |
|---|---|---|---|
| CDP/Playwright | 仅浏览器 | 本地 | 低 |
| 云端大模型 | 所有GUI | ❌ 上云 | 无本地要求 |
| Accessibility API | 系统应用 | 本地 | 需兼容 |
| Mano-P | 所有GUI | ✅ 本地 | 4.3GB内存 |
总结
Mano-P解决的核心问题:桌面应用没有统一的协议可以调,没有DOM可以解析,不同软件的界面结构完全不一样。
纯视觉路线的突破:
- 不依赖任何协议或API
- 只要能看见就能操作
- 数据完全留在本地
一句话控制你电脑上的软件,终于有了真正可用的方案。
