把点鼠标和跑流水线的活交给 AI:Agent-S 自动化,一条命令跑通
【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S
Agent-S 是开源的计算机代理框架。它把自然语言指令变成 Windows、macOS 和 Linux 上的实际操作,省掉手写 GUI 自动化脚本的活。Agent-S 自动化的核心是一条 ACI(Agent-Computer Interface):把"要做什么"翻译成可执行的 pyautogui 代码。
一规划、一执行、一记笔记:ACI 怎么把指令变成动作
把它当成一个三人小组。Manager 看任务、拆计划,Worker 按步执行,Grounding 负责盯着屏幕说出"点 (x, y)"。ACI 层是"手",接收描述性动作,落成鼠标点击、键盘输入或脚本调用。Memory 是笔记本,每次执行的经验都写进去,下次遇到相似任务先翻笔记,少踩重复的坑。
pip 一行装完,一条命令跑通第一个任务
环境两行装好 📦
pip install gui-agents brew install tesseract模型支持 OpenAI、Anthropic、Gemini、vLLM 等,把对应 key 设成环境变量即可。然后跑:
agent_s \ --provider openai \ --model gpt-5-2025-08-07 \ --ground_provider huggingface \ --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 \ --grounding_height 1080grounding 模型推荐 UI-TARS-1.5-7B,分辨率参数要对齐它的坐标输出。跑起来后循环就转起来了:截图、模型出动作、执行、再截图。把"关闭 VS Code"敲进去,agent 会自己跑完整个闭环。要改逻辑就 clone 仓库(https://gitcode.com/GitHub_Trending/ag/Agent-S)后pip install -e .,完整推理循环在 CLI 入口。
场景一:回归测试跑 N 遍,裁判挑出最好的一次
GUI 任务天然带随机性,单次失败不代表流程坏了。仓库里的 bBoN(Behavior Best-of-N)流程专门解这个问题:同一任务跑多次,先用 generate_facts.py 从截图对里提取"行为事实",再让裁判模型逐条对比,选出最贴合任务目标的那条轨迹。OSWorld 上单次跑 66%,加上 Best-of-N 到 72.6%,超过约 72% 的人类基线。
裁判入口在 Best-of-N 评判脚本。
场景二:一套指令验证三套系统,跨平台部署验证
同一套验收流程要在 Windows、macOS、Linux 上各跑一遍时,逐系统重写脚本很痛苦。Agent-S 把系统差异收在 ACI 层:agent 层逻辑不动,只换适配层。Windows 适配层源码 能看到同一套动作在 Windows 上如何翻译。做 Agent-S CI/CD 集成前记得:评估环境限定单显示器,CI 机器的分辨率要和 grounding 模型参数一致。
场景三:本地代码沙箱,Agent-S 本地部署的安全开关 🧪
批量文件处理、CSV 清洗这类活,靠鼠标点又慢又容易错。启动参数加--enable_local_env,agent 就能调 code agent 直接执行 Python 和 Bash,每个子任务自己选"走界面还是走脚本"。Bash 执行带 30 秒超时,防止挂起进程拖死整个流程,实现在 本地代码执行环境。
踩坑四条:权限、平台、开销
- ⚠️ 权限:开本地环境后,agent 以当前用户权限执行任意 Python/Bash,只在受信任环境开启。
- 平台:单显示器前提;Linux 与 macOS 依赖
/bin/bash,Windows 走独立适配路径。首步失败先核对系统类型和分辨率参数。 - OCR:没装 tesseract 时文字识别静默失效,表象是"agent 看不见屏幕上"。
- 开销:每步一次截图加一次模型调用,轨迹默认保留 8 帧截图,步数即成本;Best-of-N 还会把开销乘 N 倍。
适用边界不难判断:纯 API 调用或文件级批处理,写脚本更快。Agent-S 适合"GUI 密集、重复度高、可验证"的场景,建议先拿 evaluation_sets/ 里的小集合跑一轮感受能力边界,再决定放进流水线 💡
【免费下载链接】Agent-SAgent S: an open agentic framework that uses computers like a human项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考