免费开源的UI-TARS桌面版快速指南:如何用一句自然语言让AI替你操作电脑
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
每天打开电脑,我们总要重复类似的动作:新建文件夹、整理文件、填写网页表单、逐条核对数据。这些操作本身不难,却要消耗大量时间和精力。UI-TARS桌面版(UI-TARS Desktop)正是为解决这个问题而生的开源多模态AI智能体桌面应用——你只需要用自然语言描述想做的事,它就能自己"看"屏幕、动鼠标、敲键盘,把任务一步步完成。更难得的是,它完全免费、支持中文、数据默认在本地处理,普通用户无需写一行代码就能上手。
一、它到底能帮你做什么:4项核心能力速览
在动手安装之前,先花一分钟了解这个AI桌面助手的能力边界,你才能判断它是否适合自己。
| 能力 | 具体表现 | 适合谁 |
|---|---|---|
| 自然语言操控 | 用中文说出需求,AI自动翻译成鼠标键盘动作 | 所有不想学脚本的普通用户 |
| 屏幕视觉理解 | 通过截图识别界面元素,不依赖页面代码 | 处理老软件、自研系统等场景 |
| 电脑+浏览器双模式 | 既可操作桌面应用,也可自动完成网页任务 | 需要兼顾办公软件与网页业务的用户 |
| 全流程操作报告 | 每个步骤生成可视化记录,可导出分享 | 需要留痕、复盘、交接工作的团队 |
它的工作逻辑并不神秘:AI先截取屏幕画面,用视觉语言模型理解当前界面,再规划"点击、输入、滚动、拖拽"等一连串动作,执行一步就重新截图确认一步,直到任务完成。整个过程你可以像看直播一样实时围观。
二、5步安装指南:Windows和macOS都能装
第1步:下载安装包
从项目的发布页面下载适合你系统的安装包即可。如果你用的是macOS且装有Homebrew,还可以直接通过命令行安装:brew install --cask ui-tars。
第2步:按系统完成安装
- Windows用户:双击安装包后,系统可能弹出"Windows已保护你的电脑"的安全提示。这是SmartScreen对未知发布者的正常拦截,点击"仍要运行"即可继续,无需担心。
- macOS用户:采用经典的拖拽安装方式,把UI-TARS图标拖入Applications文件夹即可完成。
第3步:macOS用户务必开启两项权限
安装完成后首次打开应用,系统会请求"辅助功能"和"屏幕录制"权限。这两项是AI"看得见屏幕、动得了鼠标"的前提,务必在系统设置→隐私与安全性中为UI-TARS开启。
第4步:准备一个支持的浏览器
如果你打算使用浏览器自动操作模式,请确保电脑上装有Chrome、Edge或Firefox,UI-TARS会调用它们来完成网页任务。
第5步:了解两个小限制
- 目前仅支持单显示器环境,多显示器配置可能导致部分任务失败;
- 建议使用前关闭可能遮挡屏幕的弹窗、通知,避免AI误判界面元素。
三、最快配置方法:5分钟接上AI大脑
安装只是开始,接下来需要为UI-TARS配置一个视觉语言模型(VLM),这是它"思考"的动力来源。下面以最省事的火山引擎Doubao方案为例,全程大约5分钟。
3.1 获取火山引擎模型的三个关键参数
- 打开火山引擎Ark平台的Doubao-1.5-UI-TARS模型页面;
- 点击右上角"立即体验",进入API接入面板;
- 在面板中依次找到并复制这三项:API Key、Base URL(形如
https://ark.cn-beijing.volces.com/api/v3)和模型名称(形如doubao-1.5-ui-tars-250328)。
3.2 在应用设置中填入参数
打开应用左下角的设置入口,进入VLM Settings面板,按下图对应关系逐项填写:
| 设置项 | 填写内容 |
|---|---|
| VLM Provider | 选择 VolcEngine Ark for Doubao-1.5-UI-TARS |
| VLM Base URL | 粘贴火山引擎的Base URL |
| VLM API Key | 粘贴你的API Key |
| VLM Model Name | 粘贴模型名称 |
填完后点击"Check Model Availability"按钮,显示可用就说明配置成功。VLM Provider提供了多个选项,你可以在设置里切换不同的模型服务商。
3.3 省钱小技巧:先体验30分钟免费额度
火山引擎为UI-TARS提供了一定时长的免费体验额度,你可以先用它验证效果,确认满意后再决定是否正式付费使用。
四、实战对比:一句话完成过去10分钟的手工操作
配置完成后,点击"New Chat"新建对话,选择操作模式,然后像跟朋友聊天一样说出你的需求即可。
场景1:本地文件整理
- 传统做法:手动打开文件夹→逐个查看文件→新建分类目录→拖拽移动→重命名,一套下来至少十几分钟;
- AI做法:在Computer Operator模式下直接说"把下载文件夹里的图片按日期分类整理到图片文件夹",剩下交给AI,边看边做,还会实时汇报进度。
场景2:网页信息查询
- 传统做法:打开浏览器→输入网址→找到搜索框→输入关键词→逐条浏览;
- AI做法:切换到Browser Operator模式,说"帮我查一下UI-TARS-desktop项目最新的开放issue",AI会自己打开浏览器、导航到项目页面、筛选信息并汇总给你。
场景3:云端浏览器托管任务
如果你不想占用本地资源,还可以使用远程浏览器模式。AI会在云端打开一个受控的浏览器页面,你同样用指令驱动它完成网页操作,界面上还能看到剩余免费时长和手动接管(Take Control)按钮。
五、新手最容易踩的5个坑与解决办法
结合大量使用反馈,以下问题出现频率最高,建议你提前避开:
- 配置后AI"听不懂指令":多半是VLM Provider选错了。务必选择与模型对应的提供商选项(如Doubao就选VolcEngine Ark for Doubao-1.5-UI-TARS),才能确保动作解析正确;
- Base URL填错导致连接失败:火山引擎的Base URL末尾不用加
/v1,而Hugging Face的端点则要求以/v1/结尾,注意区分; - AI点击位置偏移:多显示器、缩放比例异常都会导致坐标偏差,先切回单屏或调回100%缩放试试;
- 任务执行到一半卡住:把超大任务拆成几个小指令分步执行,并适当调大Max Loop(单轮最大步数,默认100)和Loop Wait Time(每步等待时间,默认1000毫秒);
- 担心隐私数据外泄:全部流程默认在本地完成,截图与操作数据不会自动上传;只有当你主动点击"导出报告/分享"时,数据才会按你的设置走。
六、进阶玩法:从会用到玩转
当你熟悉基础操作后,这三个进阶能力值得探索。
6.1 用预设(Preset)一键迁移配置
每次换电脑都要重新配置模型参数?你可以把整套设置导出为预设文件(YAML格式),既可以从本地文件导入,也可以从远程URL导入,远程预设还支持每次启动时自动同步更新。配置好预设后,新环境秒级恢复。
6.2 用操作报告复盘每一单任务
每次任务结束后,你都可以把完整操作过程导出为HTML报告,包含每一步的截图、指令和AI判断。这个功能对团队协作尤其有用——交接工作、排查问题、向客户展示成果都变得有据可查。
6.3 用SDK把AI能力嵌入自己的产品
如果你是开发者,项目还提供了跨平台SDK,可以快速构建自己的GUI自动化智能体。支持的执行器包括桌面(nut-js)、浏览器(Web)和移动端,你可以直接调用现成的算子,也可以继承Operator接口实现自定义执行器。此外,你还可以把规划/推理模型(如DeepSeek-R1)与执行Agent组合,先拆解复杂任务再逐步执行。
七、项目生态:一个正在生长的开源智能体栈
UI-TARS桌面版只是这个开源项目生态的一部分。整个项目以monorepo结构组织,关键模块包括:
- 桌面应用本体:
apps/ui-tars/,即你正在使用的客户端; - 智能体核心:
multimodal/agent-tars/,提供通用多模态AI智能体能力,同时支持CLI和Web UI两种使用方式; - 执行器集合:
packages/ui-tars/operators/,包含ADB、浏览器、nut-js等不同环境的操作实现; - 开发工具包:
packages/ui-tars/sdk/,用于构建GUI自动化智能体; - 官方文档:
docs/目录下提供快速上手、设置指南、预设管理等详细说明,遇到问题优先翻这里。
项目采用Apache 2.0开源协议,社区可以自由参与贡献:新的执行器、模型适配、界面改进、文档翻译都是很好的切入点。
八、现在就动手:你的第一步行动清单
与其反复犹豫,不如花15分钟体验一次"用嘴干活"的感觉。你可以这样开始:
- 克隆代码仓库:
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop,按docs/quick-start.md完成安装; - 准备模型密钥:注册火山引擎或Hugging Face账号,获取免费试用额度;
- 完成首个任务:从最简单的指令入手,比如"打开我的下载文件夹"或"帮我搜索明天的天气";
- 逐步加码:确认效果稳定后,再把日常重复性任务交给它。
UI-TARS桌面版的价值在于:它把"会看屏幕"的AI能力从实验室带到了每个人的电脑上。无论你是想偷懒的普通用户、需要提效的运营人员,还是想二次开发的工程师,都能从中找到属于自己的用法。从今天这个最小任务开始,你就能真切感受到"说话即执行"带来的效率变化。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考