OSWorld第一、成功率58.2%:Mano-P的4B GUI自动化模型如何打赢72B大模型——基准数据深读
【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目,支持在 Mac mini/MacBook 上或通过算力棒本地运行推理,实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理,支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P
Mano-P 是一个开源的 GUI-VLA 视觉-语言-动作智能体项目,主打本地运行、数据不出设备的 GUI 自动化:在苹果 M4 Mac mini / MacBook 上直接推理,以 58.2% 的成功率拿下 OSWorld 专项模型榜第一,领先 72B 级的 opencua-72b 达 13.2 个百分点。这篇文章把项目里的关键基准数据拆开读一遍:OSWorld、WebRetriever、GUI 定位榜,以及"4B 小模型凭什么打赢 72B"背后的训练与工程细节。📊
📌 先看结论:Mano-P 的关键数字一览
| 基准 / 指标 | Mano 系列成绩 | 对比对象 |
|---|---|---|
| OSWorld(专项 GUI 智能体模型) | 58.2%,第 1 名 | opencua-72b:45.0%(第 2 名) |
| OSWorld(全部模型) | 58.2% | claude-sonnet-4-6:72.1%(第 1 名) |
| WebRetriever Protocol I | 41.7 NavEval | Gemini 2.5 Pro CU:40.9;Claude 4.5 CU:31.3 |
| ScreenSpot-V2 GUI 定位 | 93.5 | Mano-P 1.0,榜单前列 |
| MMBench-GUI | 87.5 | Mano-P 1.0,榜单前列 |
| 本地 100 任务真机实测(MacBook M5 16GB) | Mano-CUA-2.0-4B:56.0% | 云端 Qwen3-VL-Plus:39.0% |
| 本地推理速度 | ~80 tokens/s 解码(Apple M5 Pro) | 单步耗时 7.9s,快于云端方案的 9.3s |
这些数据的出处都可以对照仓库里的 README.md(Key Highlights 部分)和 README_CN.md 查看。
🖥️ Mano-P 是什么:一个纯视觉的本地 GUI 自动化智能体
Mano-P("Mano" 是西班牙语"手","P" 代表 Private/私密)的定位是面向边缘设备的 GUI 自动化代理:你只给它一句自然语言指令(比如"打开微信,告诉 FTY 会议推迟了"),它靠截图 + 纯视觉理解逐步完成点击、输入、滚动、拖拽等操作,不需要目标应用提供任何 API。
它的技术底座来自 Mano 技术框架,包含三个关键设计:
- Mano-Action 双向自强化训练:Text → Action 与 Action → Text 循环一致性学习,模型既会"从描述定位元素",也会"对元素做描述";
- 三阶段渐进训练:监督学习(SFT)→ 离线强化学习 → 在线强化学习;
- "think-act-verify" 循环推理:先思考、再动作、后验证,形成闭环。
配合 INT8 混合精度量化、视觉 token 剪枝等边缘优化,让模型能在 Mac mini / MacBook / 算力棒上高效运行。整体架构如下图所示:
项目采用分阶段开源策略:第一阶段开放 Mano-CUA Skills(供 Agent 爱好者搭建 CUA 工作流),第二阶段开放本地模型与 SDK(供高安全需求开发者自建 Skills/Tools),第三阶段开放训练方法与剪枝量化技术。详细说明见 README.md。
🏆 OSWorld 专项榜:58.2% 是怎么赢的
OSWorld 是目前公认的 GUI 智能体"硬考场"——任务在真实操作系统环境中执行,涉及多应用、多步骤操作。把 Mano 系列和同场专项模型放在一起看(数据取自 README.md 的 Benchmark 章节):
读这张图的三个要点:
- 58.2% vs 45.0%:Mano-CUA 1.1 以 13.2 个百分点的差距把 opencua-72b-preview 甩在身后,而对手是 72B 参数量的模型;
- 7B 模型全面落后:DART-GUI-7B(40.5%)和上一代 DeepMiner-Mano-7B(40.1%)都停在 40% 一线,说明 Mano 系列的增益不来自"参数堆料";
- 注意测试条件:榜首是 Max Steps=100 的单次运行成绩,opencua-72b 则是 3 次运行的均值(45.0±0.9%),Mano 的成绩并没有靠"多跑取均值"刷出来。
🌐 全部模型视角:与顶级通用大模型的差距有多大
如果把通用大模型的 Computer Use 也算进来,OSWorld 的完整格局是另一张图:
- 榜首 claude-sonnet-4-6 拿到 72.1%,其后是 Kimi K2.5(63.3%)等;
- Mano-72B(DeepMiner-Mano-72B)以 58.2% 排在第 5,与 claude-sonnet-4-5(58.1%)基本打平;
- 换句话说:Mano 在专项模型里是第一,放到全部模型里也稳居第一梯队,但距离最强通用方案仍有约 14 个百分点空间——这也是项目在"当前差距"小节里坦诚写明的迭代方向(模糊描述、跨应用、深层办公软件操作)。📝
🎯 Web 能力与 GUI 定位:41.7 NavEval 的细节
WebRetriever是 Mano 团队参与设计的大规模 Web Agent 基准。Protocol I 下 Mano-CUA 1.1 拿到41.7 NavEval,小幅超过 Gemini 2.5 Pro Computer Use(40.9),明显领先 Claude 4.5 Computer Use(31.3):
再往底层看,GUI Agent 的"手眼协调能力"(Grounding:看图找到该点的位置)是执行成功率的地基。Mano-P 1.0 在多个定位榜单上都是最高分:
挑几个代表性数字:ScreenSpot-Pro 66.4(超过 GPT-4o 的 1.4 和 SeedCUA-4B 的 60.0)、ScreenSpot-V2 93.5、MMBench-GUI 87.5、UI-Vision 46.6、OSWorld-G-Refine 49.5。定位准,后续的多步操作才不容易"第一步就点错"。
此外,在考察视频理解与注意力分配的 CL-bench 上,Mano-P 1.0 以 23.37 分仅次于 GPT-5.1(Thinking)的 23.75,说明它的"视觉注意力"分布接近人类专家水平:
🔍 核心问题:4B 小模型凭什么打赢 72B?
这是全文最值得深挖的部分。答案分三层:数据、训练、工程。
1. 数据层:闭环数据循环 + 领域特化
Mano 采用闭环数据生成体系自动构造高质量训练数据,并且是GUI 专用模型——它见过的是成百上千个交互元素的真实桌面界面,而非通用图文。仓库里的真机对比就印证了这一点:在 100 个真实 macOS 任务上,通用云端 VL 模型 Qwen3-VL-Plus 只有 39% 通过率,而专用 4B 模型拿到 56%(Mano-CUA-2.0-4B,详见 README.md 的实测章节)。"通用 VL 能力 ≠ GUI Agent 能力",专用微调的价值就在这里。
2. 训练层:双向自强化 + 三阶段渐进
- Mano-Action 双向学习:Text→Action(找元素)与 Action→Text(描述元素)互为教师,比单向预测更鲁棒;
- SFT → 离线 RL → 在线 RL:先用监督学习打底,再用强化学习在真实/仿真环境中打磨长程决策;
- think-act-verify:每步动作前推理、动作后验证,长任务中错误不累积。
3. 工程层:让 4B 在本地"跑得动、跑得快"
- INT8 激活量化(Cider SDK):MLX 原生只有权重量化,Cider 补上了 W8A8 / W4A8 在线激活量化算子,在 Apple M5 Pro 上相比 MLX W4A16 有1.4x–2.2x 的 prefill 加速,Mano-CUA-4B 解码速度约 80 tokens/s;
- 视觉 token 剪枝(GSPruning):把每图平均视觉 token 保留率压到12.57%(只保留约八分之一的画面 token),训练吞吐提升到 22.62 samples/s,而成功率损失极小——高分辨率截图不再是大开销;
- 部署成本:约 6.4 GB 内存占用,M4 芯片 + 32GB 内存的 Mac mini / MacBook 即可直跑;任何 Mac 也可通过 USB 4.0 接算力棒运行更大参数模型。
这三层叠加后,4B 本地模型在真实 macOS 任务上的单步耗时(7.9s)反而比云端方案(9.3s)更快——小模型 + 零网络往返,延迟天然占优。⚡
🔒 本地运行的附加价值:数据不出设备
对新手用户来说,这可能是比跑分更重要的部分:
- 本地模式零外发:截图与任务描述全部在设备内推理,无任何云 API 调用,断网也能跑长任务;
- 两种使用形态:CLI 工具
mano-cua(一条命令启动 GUI 自动化任务)和 Agent 技能形态(供 Claude Code 等 AI Agent 在推理中自动调用); - 安全约束内建:敏感操作需确认、可随时停止、屏幕右上角有实时状态面板。
隐私细节见 README.md 的"Data Privacy & Security"小节。
✅ 小结:这组基准数据说明了什么
- 58.2% 的 OSWorld 专项第一,证明 Mano 系列是目前最强的一档专项 GUI 智能体模型,且优势(+13.2pct)远超第二名与第三名之间的差距;
- 4B 打赢的不是"更大",而是"更专":领域数据 + 双向自强化训练 + 边缘工程优化,让本地 4B 模型在真实任务上超过 39% 的云端通用大模型;
- 本地化是差异化卖点:数据不出设备、断网可跑、单步更快,适合高安全场景;
- 差距同样诚实:与 72.1% 的顶级通用方案之间还有空间,项目方明确把模糊描述、跨应用、深层办公操作列为下一步方向。
想深入了解,建议从 README.md 的 Benchmark Performance 章节和 LICENSE(Apache 2.0 协议)读起,图片原始数据都在 pics/ 目录中。
【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目,支持在 Mac mini/MacBook 上或通过算力棒本地运行推理,实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理,支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考