UI-TARS Desktop 快速上手指南:5 分钟跑通桌面 GUI 自动化
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
UI-TARS Desktop 是一款开源的桌面 GUI 自动化应用:你输入一句自然语言,它就截图、看懂屏幕并完成鼠标与键盘操作。本文面向零基础用户,带你在 5 分钟内完成安装、连上模型,并跑通第一个真实任务。
先跑一个真实任务:看 UI-TARS Desktop 实际能做什么
以仓库 README 里的官方演示为例。你输入的指令是:
"Please help me open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds in the VS Code setting."
接下来的每一步都发生在你的屏幕上,全程可回看:
- UI-TARS Desktop 先截一张全屏截图,交给视觉语言模型识别界面元素;
- 模型输出第一个动作:点击 VS Code 的菜单入口;
- 执行器把动作落到真实界面上,再截一张图确认结果;
- 依次展开设置面板、定位到 Auto Save 选项、选中"延迟 500 毫秒"对应的档位;
- 核对无误后,模型发出结束信号,任务终止。
你最终拿到两样东西:对话流里逐步展示的"思考—动作—结果"记录,以及一份可下载的 HTML 报告。像"打开设置改参数"这类每天重复的机械操作,以后都可以直接交给它,你只负责下指令。
效果看明白了,接下来把应用装到自己的电脑上。
5 分钟装好 UI-TARS Desktop 并连上模型
整条最短可用链路是:下载安装包 → 授予系统权限 → 填三个模型参数 → 新建对话。
macOS 安装与权限授权
- 从 Release 页面下载 macOS 安装包;已装 Homebrew 的话也可以直接
brew install --cask ui-tars。 - 把UI TARS图标拖进 Applications 文件夹,完成安装。
- 进入"系统设置 → 隐私与安全性",为 UI TARS 同时勾选Accessibility(辅助功能)和Screen Recording(屏幕录制)两项权限——少一项,它要么点不动、要么截不到画面。
Windows 安装
- 双击
UI.TARS-0.1.0-preview.Setup.exe开始安装。 - 弹出 SmartScreen 安全提示时,点"仍要运行"即可继续。
装完打开应用,界面分三块,记住位置后面都用得上:左侧是新建对话和历史任务列表,中间是任务输入框,右侧面板放设置入口。
填对三个模型参数
点右侧设置面板,把模型服务接上:
- VLM Provider:选火山引擎 Ark(Doubao-1.5-UI-TARS)或 Hugging Face(UI-TARS-1.5)二选一;
- VLM Base URL / API Key / Model Name:从对应平台的模型接入页复制,Base URL 必须以
/v1/结尾; - 填完点Check Model Availability,绿色通过说明连通了。
两个前置条件:浏览器操作模式需要本机装好 Chrome、Edge 或 Firefox;当前版本只稳定支持单显示器,多屏环境可能让坐标错位。
参数填对后,新建对话并选择操作模式,任务就能发出去了。
端到端跑一个浏览器任务,报告在哪里看
选Use Local Browser模式,输入这条指令:"打开 GitHub 趋势页,记录前 10 个项目的名称和星标数,整理成表格存成本地文件。"
任务跑起来后,三处地方分别承担不同反馈:
- 对话流:每一步都按"截图 → 模型想法 → 动作 → 结果"的顺序追加,你能实时看到它点在哪里、输了什么;
- 实时画面:浏览器被自动打开并导航,鼠标移动和输入与对话流同步;
- 任务报告:结束后点Export as HTML,生成一份图文对照的执行报告,逐步展示每个动作对应的屏幕截图,方便复查或分享给同事。
报告之外还有一条观测链路:应用事件、你发送的指令、报告分享动作都会推送到 UTIO 观测服务端,整个流程见下图。
任务本身跑通了,再把你还没用到的其他能力一次讲清。
本地、浏览器、远程:三种执行环境怎么对照选
| 执行环境 | 能力 | 适合的任务 | 注意 |
|---|---|---|---|
| 本地计算机模式 | 直接操控本机桌面应用与文件 | 文件整理、软件设置修改 | 数据不离开设备;需要 macOS 权限 |
| 本地浏览器模式 | 驱动 Chrome / Edge / Firefox 执行网页操作 | 表单填写、页面导航、信息采集 | 先装好受支持的浏览器 |
| 远程模式 | 在云端虚拟环境中执行 | 不想占用本机资源、跨设备访问 | 在隔离环境运行,保护本地数据 |
架构上不用深究:UI-TARS 视觉模型负责读屏,动作解析器把模型输出转成结构化的点击、输入指令,执行器负责落地;三者循环到模型发出结束信号为止。想自己动手组装,可以看 packages/ui-tars/sdk/ 和 packages/ui-tars/operators/ 里的模块划分。
能力边界清楚了,下面这些卡点是大多数人第一次使用时真正会碰到的。
装完用不了?对照这张避坑速查表
| 问题现象 | 可能原因 | 解决方式 |
|---|---|---|
| 应用拿不到画面、点不动 | macOS 权限未勾选 | 系统设置里开启辅助功能 + 屏幕录制后重启应用 |
| 模型连不上、动作解析报错 | Base URL 未以/v1/结尾,或 Provider 与模型不匹配 | 对照平台接入页核对三项参数,再点 Check Model Availability |
| 浏览器模式起不来 | 缺 Chrome / Edge / Firefox,或版本过旧 | 安装并升级到受支持的最新版本 |
| 多屏任务点错位置 | 目前只支持单显示器 | 换回单显示器环境再执行任务 |
| 任务过慢或反复循环 | 网络延迟、Max Loop 过大 | 调小 Max Loop、增大 Loop Wait Time,复杂任务拆短句 |
三条实操建议:
- 单条指令只描述一个目标动作,长流程拆成多轮对话;
- 开始任务前确认目标应用窗口已在前台,减少模型找路的时间;
- 浏览器任务先关掉无关标签页,画面越干净,识别越稳。
问题清掉之后,同样的玩法可以铺到更长的流程里。
从个人效率到团队自动化
个人场景:固定一条指令,让浏览器模式每天抓取你关注的技术博客与 GitHub 动态,把标题、摘要整理进表格或笔记工具,并自动补上分类标签,周五再生成一份阅读摘要。执行链路就是"抓取 → 归类 → 成文",三步全部按同一套提示词跑。
团队场景:以每日销售报表为例——自动登录 CRM 系统、导出昨日数据、生成 Excel 报表、发送给团队群。过去占用 2–3 小时的手工链路压缩到几分钟,且每份任务的 HTML 报告可以存档,出问题时按图回溯到具体哪一步。配置统一靠预设管理:把模型端点、Key、报告上传地址写进 YAML,本地用文件导入,远程用 URL 拉取且每次启动自动同步,团队配置始终一致。
以上流程都可以从仓库文档和示例继续深入。
接下来读什么
UI-TARS Desktop 把"截屏—模型决策—执行器落地"这个循环装进了一个桌面应用,本地、浏览器、远程三种执行环境加上可复核的 HTML 报告,覆盖了日常自动化的大部分场景。
- 快速开始:docs/quick-start.md
- 设置配置:docs/setting.md
- 预设管理:docs/preset.md
- SDK 指南:docs/sdk.md
- 示例预设:examples/presets/default.yaml
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考