news 2026/10/1 1:10:50

OSWorld第一、成功率58.2%:Mano-P的4B GUI自动化模型如何打赢72B大模型——基准数据深读

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OSWorld第一、成功率58.2%:Mano-P的4B GUI自动化模型如何打赢72B大模型——基准数据深读

OSWorld第一、成功率58.2%:Mano-P的4B GUI自动化模型如何打赢72B大模型——基准数据深读

【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目,支持在 Mac mini/MacBook 上或通过算力棒本地运行推理,实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理,支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P

Mano-P 是一个开源的 GUI-VLA 视觉-语言-动作智能体项目,主打本地运行、数据不出设备的 GUI 自动化:在苹果 M4 Mac mini / MacBook 上直接推理,以 58.2% 的成功率拿下 OSWorld 专项模型榜第一,领先 72B 级的 opencua-72b 达 13.2 个百分点。这篇文章把项目里的关键基准数据拆开读一遍:OSWorld、WebRetriever、GUI 定位榜,以及"4B 小模型凭什么打赢 72B"背后的训练与工程细节。📊

📌 先看结论:Mano-P 的关键数字一览

基准 / 指标Mano 系列成绩对比对象
OSWorld(专项 GUI 智能体模型)58.2%,第 1 名opencua-72b:45.0%(第 2 名)
OSWorld(全部模型)58.2%claude-sonnet-4-6:72.1%(第 1 名)
WebRetriever Protocol I41.7 NavEvalGemini 2.5 Pro CU:40.9;Claude 4.5 CU:31.3
ScreenSpot-V2 GUI 定位93.5Mano-P 1.0,榜单前列
MMBench-GUI87.5Mano-P 1.0,榜单前列
本地 100 任务真机实测(MacBook M5 16GB)Mano-CUA-2.0-4B:56.0%云端 Qwen3-VL-Plus:39.0%
本地推理速度~80 tokens/s 解码(Apple M5 Pro)单步耗时 7.9s,快于云端方案的 9.3s

这些数据的出处都可以对照仓库里的 README.md(Key Highlights 部分)和 README_CN.md 查看。

🖥️ Mano-P 是什么:一个纯视觉的本地 GUI 自动化智能体

Mano-P("Mano" 是西班牙语"手","P" 代表 Private/私密)的定位是面向边缘设备的 GUI 自动化代理:你只给它一句自然语言指令(比如"打开微信,告诉 FTY 会议推迟了"),它靠截图 + 纯视觉理解逐步完成点击、输入、滚动、拖拽等操作,不需要目标应用提供任何 API。

它的技术底座来自 Mano 技术框架,包含三个关键设计:

  • Mano-Action 双向自强化训练:Text → Action 与 Action → Text 循环一致性学习,模型既会"从描述定位元素",也会"对元素做描述";
  • 三阶段渐进训练:监督学习(SFT)→ 离线强化学习 → 在线强化学习;
  • "think-act-verify" 循环推理:先思考、再动作、后验证,形成闭环。

配合 INT8 混合精度量化、视觉 token 剪枝等边缘优化,让模型能在 Mac mini / MacBook / 算力棒上高效运行。整体架构如下图所示:

项目采用分阶段开源策略:第一阶段开放 Mano-CUA Skills(供 Agent 爱好者搭建 CUA 工作流),第二阶段开放本地模型与 SDK(供高安全需求开发者自建 Skills/Tools),第三阶段开放训练方法与剪枝量化技术。详细说明见 README.md。

🏆 OSWorld 专项榜:58.2% 是怎么赢的

OSWorld 是目前公认的 GUI 智能体"硬考场"——任务在真实操作系统环境中执行,涉及多应用、多步骤操作。把 Mano 系列和同场专项模型放在一起看(数据取自 README.md 的 Benchmark 章节):

读这张图的三个要点:

  1. 58.2% vs 45.0%:Mano-CUA 1.1 以 13.2 个百分点的差距把 opencua-72b-preview 甩在身后,而对手是 72B 参数量的模型;
  2. 7B 模型全面落后:DART-GUI-7B(40.5%)和上一代 DeepMiner-Mano-7B(40.1%)都停在 40% 一线,说明 Mano 系列的增益不来自"参数堆料";
  3. 注意测试条件:榜首是 Max Steps=100 的单次运行成绩,opencua-72b 则是 3 次运行的均值(45.0±0.9%),Mano 的成绩并没有靠"多跑取均值"刷出来。

🌐 全部模型视角:与顶级通用大模型的差距有多大

如果把通用大模型的 Computer Use 也算进来,OSWorld 的完整格局是另一张图:

  • 榜首 claude-sonnet-4-6 拿到 72.1%,其后是 Kimi K2.5(63.3%)等;
  • Mano-72B(DeepMiner-Mano-72B)以 58.2% 排在第 5,与 claude-sonnet-4-5(58.1%)基本打平;
  • 换句话说:Mano 在专项模型里是第一,放到全部模型里也稳居第一梯队,但距离最强通用方案仍有约 14 个百分点空间——这也是项目在"当前差距"小节里坦诚写明的迭代方向(模糊描述、跨应用、深层办公软件操作)。📝

🎯 Web 能力与 GUI 定位:41.7 NavEval 的细节

WebRetriever是 Mano 团队参与设计的大规模 Web Agent 基准。Protocol I 下 Mano-CUA 1.1 拿到41.7 NavEval,小幅超过 Gemini 2.5 Pro Computer Use(40.9),明显领先 Claude 4.5 Computer Use(31.3):

再往底层看,GUI Agent 的"手眼协调能力"(Grounding:看图找到该点的位置)是执行成功率的地基。Mano-P 1.0 在多个定位榜单上都是最高分:

挑几个代表性数字:ScreenSpot-Pro 66.4(超过 GPT-4o 的 1.4 和 SeedCUA-4B 的 60.0)、ScreenSpot-V2 93.5、MMBench-GUI 87.5、UI-Vision 46.6、OSWorld-G-Refine 49.5。定位准,后续的多步操作才不容易"第一步就点错"。

此外,在考察视频理解与注意力分配的 CL-bench 上,Mano-P 1.0 以 23.37 分仅次于 GPT-5.1(Thinking)的 23.75,说明它的"视觉注意力"分布接近人类专家水平:

🔍 核心问题:4B 小模型凭什么打赢 72B?

这是全文最值得深挖的部分。答案分三层:数据、训练、工程。

1. 数据层:闭环数据循环 + 领域特化

Mano 采用闭环数据生成体系自动构造高质量训练数据,并且是GUI 专用模型——它见过的是成百上千个交互元素的真实桌面界面,而非通用图文。仓库里的真机对比就印证了这一点:在 100 个真实 macOS 任务上,通用云端 VL 模型 Qwen3-VL-Plus 只有 39% 通过率,而专用 4B 模型拿到 56%(Mano-CUA-2.0-4B,详见 README.md 的实测章节)。"通用 VL 能力 ≠ GUI Agent 能力",专用微调的价值就在这里。

2. 训练层:双向自强化 + 三阶段渐进

  • Mano-Action 双向学习:Text→Action(找元素)与 Action→Text(描述元素)互为教师,比单向预测更鲁棒;
  • SFT → 离线 RL → 在线 RL:先用监督学习打底,再用强化学习在真实/仿真环境中打磨长程决策;
  • think-act-verify:每步动作前推理、动作后验证,长任务中错误不累积。

3. 工程层:让 4B 在本地"跑得动、跑得快"

  • INT8 激活量化(Cider SDK):MLX 原生只有权重量化,Cider 补上了 W8A8 / W4A8 在线激活量化算子,在 Apple M5 Pro 上相比 MLX W4A16 有1.4x–2.2x 的 prefill 加速,Mano-CUA-4B 解码速度约 80 tokens/s;
  • 视觉 token 剪枝(GSPruning):把每图平均视觉 token 保留率压到12.57%(只保留约八分之一的画面 token),训练吞吐提升到 22.62 samples/s,而成功率损失极小——高分辨率截图不再是大开销;
  • 部署成本:约 6.4 GB 内存占用,M4 芯片 + 32GB 内存的 Mac mini / MacBook 即可直跑;任何 Mac 也可通过 USB 4.0 接算力棒运行更大参数模型。

这三层叠加后,4B 本地模型在真实 macOS 任务上的单步耗时(7.9s)反而比云端方案(9.3s)更快——小模型 + 零网络往返,延迟天然占优。⚡

🔒 本地运行的附加价值:数据不出设备

对新手用户来说,这可能是比跑分更重要的部分:

  • 本地模式零外发:截图与任务描述全部在设备内推理,无任何云 API 调用,断网也能跑长任务;
  • 两种使用形态:CLI 工具mano-cua(一条命令启动 GUI 自动化任务)和 Agent 技能形态(供 Claude Code 等 AI Agent 在推理中自动调用);
  • 安全约束内建:敏感操作需确认、可随时停止、屏幕右上角有实时状态面板。

隐私细节见 README.md 的"Data Privacy & Security"小节。

✅ 小结:这组基准数据说明了什么

  1. 58.2% 的 OSWorld 专项第一,证明 Mano 系列是目前最强的一档专项 GUI 智能体模型,且优势(+13.2pct)远超第二名与第三名之间的差距;
  2. 4B 打赢的不是"更大",而是"更专":领域数据 + 双向自强化训练 + 边缘工程优化,让本地 4B 模型在真实任务上超过 39% 的云端通用大模型;
  3. 本地化是差异化卖点:数据不出设备、断网可跑、单步更快,适合高安全场景;
  4. 差距同样诚实:与 72.1% 的顶级通用方案之间还有空间,项目方明确把模糊描述、跨应用、深层办公操作列为下一步方向。

想深入了解,建议从 README.md 的 Benchmark Performance 章节和 LICENSE(Apache 2.0 协议)读起,图片原始数据都在 pics/ 目录中。

【免费下载链接】Mano-PMano-P: Open-source GUI-VLA agent for edge devices. #1 on OSWorld (specialized, 58.2%). Runs locally on Apple M4 Mac mini/MacBook — no data leaves your device.Mano-P 是一个开源 GUI-VLA 项目,支持在 Mac mini/MacBook 上或通过算力棒本地运行推理,实现纯视觉驱动的跨平台 GUI 自动化操作。数据完全本地处理,支持复杂多步骤任务规划与执行。项目地址: https://gitcode.com/gh_mirrors/man/Mano-P

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 1:10:18

DNF单机版搭建全流程:服务端架构、环境配置与连接排错实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/1 1:10:14

AI工程从零开始:数据契约、模型版本与确定性推理实战

1. 这不是“搭个LLM API”——AI工程从零开始的真实成本清单很多人看到“AI Engineering from Scratch”第一反应是:不就是调用OpenAI API、写个Flask后端、套个Streamlit前端?三小时搞定,发个GitHub仓库,标题一写“手把手教你构建…

作者头像 李华
网站建设 2026/10/1 1:09:46

基于YOLOv9的脑肿瘤检测系统:数据转换、训练与GUI部署实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/1 1:08:39

AI API安全实战:成本治理、限流与密钥管理的完整防线

1. 为什么先做这三块:AI接口安全的真实威胁模型先说一个我亲眼见过的事故。某个做内容审核的团队,接入大模型 API 做摘要提取,第一周风平浪静,第二周账单突然从每天几十块冲到上千块,月底一算超支七万。排了一整天&…

作者头像 李华
网站建设 2026/10/1 1:08:23

戴尔BIOS报错‘Invalid configuration information’深度解析与修复

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/1 1:07:50

SharedArrayBuffer未定义?一文搞懂COOP与COEP跨源隔离配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华