UI-TARS Desktop 快速上手:让视觉语言模型替你操作电脑的完整指南
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
如果你还在手动点菜单、逐条复制数据、一遍遍重复同样的界面操作,不如把鼠标交给 AI。UI-TARS Desktop 是一个开源的桌面 GUI Agent,用一句中文或英文指令,它自己看屏幕、找按钮、动手完成任务。下面这套流程从装应用到跑通第一个任务只要十来分钟,我们直接开始。
十分钟内跑起来:安装与首次运行
环境要求,先对一遍:
- macOS 或 Windows;想驱动本机浏览器还需要 Chrome / Edge / Firefox 之一
- 目前只保证单显示器稳定,多屏环境部分任务会失败
安装:
- 最省事:从项目 Releases 页下载最新桌面版,macOS 把图标拖进 Applications,Windows 按向导装完即可
- Mac 上装了 Homebrew 的话,一行命令也行:
brew install --cask ui-tars - 源码党:
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install pnpm run dev首次运行先过权限关(macOS):把应用拖进 Applications 后,去 系统设置 → 隐私与安全性,打开辅助功能和屏幕录制两项授权,然后打开应用:
模型怎么配:打开设置,把 VLM Provider、Base URL、API Key、模型名四样填齐(各平台的部署方法见 docs/deployment.md)。以火山引擎的 Doubao-1.5-UI-TARS 为例:
VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328Provider 下拉框务必选对应项,选错了模型的动作会解析失败;Base URL 结尾要带/v1。填完点Check Model Availability确认能连通再保存。
跑第一个任务:新建会话时选场景(Computer 操作本机 / Browser 驱动浏览器),输入指令、点启动:
之后它会自己截屏、规划、点击,你只管看着。任务结束还能把整段过程导出成 HTML 报告。
它是怎么工作的:截屏、思考、动手三步循环
把 UI-TARS Desktop 想成一位新来的实习生:先看清楚屏幕,再决定点哪里,做一步看一步,直到把活干完。它内部就是一个不断重复的循环:
- 截屏——拍一张当前屏幕的"快照"
- 规划——VLM(视觉语言模型)看一眼,输出下一步动作,比如"点击坐标 (812, 437)"
- 执行——驱动鼠标键盘把动作做掉
- 验证——再截一张屏确认结果,不对就继续下一轮
最关键的差别:模型读的是原始像素,不是 DOM 树或元素选择器。所以它对浏览器、IDE、原生应用一视同仁——就像一个真人盯着屏幕干活。每轮循环的步数上限由设置里的Max Loop控制,动作之间的停顿由Loop Wait Time控制,后面避坑部分会讲它们各自挡什么。
场景实战
用一句话改 VS Code 设置
官方演示里最经典的例子:
"请帮我在 VS Code 设置里打开自动保存,并让 AutoSave 延迟 500 毫秒生效。"
不需要你告诉它菜单在哪,AI 自己定位路径、找到选项、完成修改。把需求写成一句话,就是这类工具的全部使用门槛。
用浏览器 Agent 查资料
选 Browser 模式(前提:本机装了 Chrome / Edge / Firefox)。官方演示的指令是"查一下 UI-TARS-Desktop 项目在 GitHub 上的最新 issue",模型会自己开浏览器、导航、读屏、把结果汇报回来。搜索查资料、批量填表、跨系统抄数据这类重复浏览器工作,都适用。
把执行过程变成可分享的报告
每个任务都能导出带逐步截图的 HTML 报告:验收结果、排查"第几步点歪了"、或把操作记录发给同事,都靠它。这也是 UI-TARS Desktop 和普通"按键精灵"最大的区别——每一步都有据可查。
避坑指南:5 个最常见的坑和解法
| 坑 | 解法 |
|---|---|
| 点不动 / 识别不到界面 | macOS 的辅助功能(管动手)和屏幕录制(管看屏幕)权限都要开,缺一不可,改完重启应用 |
| 动作解析失败、模型"说不通" | Base URL 末尾必须带/v1;Provider 与模型版本严格对应,先点Check Model Availability |
| 多显示器任务失败 | 官方只保证单屏稳定,多屏先切单屏测试 |
| 任务卡死或点偏 | 检查 Provider 是否选错;Max Loop默认 100、长任务调大;Loop Wait Time默认 1000ms,页面加载慢就调到 2000 左右 |
| 首次跑不动 | 看 docs/quick-start.md 的安装检查项,对照 docs/deployment.md 确认模型服务真的起来了 |
UI-TARS Desktop 把"看屏幕、找按钮、做操作"这串重复劳动整个自动化了,你只需要交代目标和验收结果。更多参数说明在 docs/setting.md,桌面应用源码在 apps/ui-tars/src/,遇到问题可以去项目 issue 区或官方 Discord 社区提,欢迎边用边提反馈。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考