UI-TARS GUI 自动操作模型实战指南:让电脑替你点鼠标、敲键盘
【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS
每天早上登录同一个内部系统、导同一份报表、点同一批按钮,这种重复劳动最消耗时间。这类活儿能不能干脆交给电脑自己干?
UI-TARS 是字节跳动开源的 GUI 自动操作模型:给它一张屏幕截图,它会输出"点击 (100,200)、输入 hello、滚动"这类可直接执行的动作。这篇指南带你跑通两种部署方式,把模型输出解析成真实点击,并看看它在公开基准上的真实成绩。
🖱️ 先认识 UI-TARS:看屏幕、想思路、出动作
UI-TARS 的工作闭环是"看屏幕 → 想 → 做":
- 感知:识别当前截图里的按钮、输入框、菜单等界面元素;
- 推理:先输出一段 Thought,说明它看到什么、为什么要这样点;
- 动作:再输出标准动作,如
click(start_box='(100,200)')、type("hello")、滚动等。
动作空间覆盖单击、双击、右键、拖拽、键盘快捷键和滚动;在 Android 端还支持长按、打开应用、按 Home/Back。仓库内置了三套现成的提示词模板,按场景选一个即可:
COMPUTER_USE:Windows、macOS、Linux 桌面任务,适合浏览器导航、办公软件、文件管理;MOBILE_USE:真机或 Android 模拟器;GROUNDING:只输出动作、不带思考,适合做纯定位评估。
模板源码见 codes/ui_tars/prompt.py。
版本线也简单:UI-TARS-72B-DPO 是研究用旗舰版,UI-TARS-1.5-7B 是开源可自部署的版本,2025 年 9 月又推出了 UI-TARS-2,在 GUI、游戏、代码和工具调用上做了整体升级。
☁️ 两条路径跑起来:云端推理端点或桌面版
云端部署:在 Hugging Face Inference Endpoints 平台导入 "UI-TARS 1.5 7B" 模型,关键配置如下:
- 硬件选
GPU L40S 1GPU 48G(Nvidia L4 或 A100 也可); Max Input Length (per Query)和Max Number of Tokens (per Query)都设到 65536 左右;- 加环境变量
CUDA_GRAPHS=0和PAYLOAD_LIMIT=8000000,避免部署失败和大图请求被拒。
部署完成后你会拿到一个 OpenAI 兼容的 API,几行 Python 就能发起第一次预测。完整截图步骤在 README_deploy.md。
本地部署:想直接在自己电脑上跑,官方另有 UI-TARS-desktop 桌面版项目,提供图形界面、开箱即用。本仓库本身也值得克隆下来看看结构:
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS里面主要是提示词模板和动作解析代码,这两部分合起来就是"模型输出 → 真实操作"的后处理管线。
🎯 把模型输出变成真实点击:ui-tars 三行解析
模型吐出的是字符串,要真正驱动电脑,还得把坐标换算回你的屏幕。官方封装在ui-tars包里:
pip install ui-tars # 或 uv pip install ui-tarsfrom ui_tars.action_parser import parse_action_to_structure_output response = "Action: click(start_box='(100,200)')" parsed = parse_action_to_structure_output( response, factor=1000, model_type="qwen25vl", origin_resized_height=1080, origin_resized_width=1920) print(parsed)两个容易踩的坑:
- Qwen2.5-VL 底座用的是绝对坐标定位,
origin_resized_width/height必须传你截图的真实分辨率,否则点击位置会整体偏移; - 拿到解析结果后,再调
parsing_response_to_pyautogui_code就能生成 pyautogui 代码,在本地直接执行。
坐标映射的完整推导见 README_coordinates.md,仓库附带了可视化示例,红点是否落在目标元素上一眼就能验证:
📊 基准成绩:真实桌面与游戏里有多能打
挑 README 里的几个数字:
- OSWorld(100 步,电脑操作):UI-TARS-1.5 得 42.5,OpenAI CUA 36.4,Claude 3.7 为 28;
- ScreenSpot-V2 / ScreenSpotPro(元素定位):94.2 与 61.6,两项均为表中第一;
- Android World(手机操作):64.2,此前 SOTA 是 59.5;
- Poki 网页游戏:14 款小游戏中 13 款拿到满分 100,而 CUA 和 Claude 3.7 在多款游戏上是 0 分。
下面这张论文配图展示了 UI-TARS-72B 与 7B 相对此前 SOTA 的多基准提升幅度:
也要说句实在话:大规模任务和长时间游戏很吃算力,陌生环境里偶有幻觉误点——README 的 Limitations 一节把这些都如实列了出来,参考后再决定使用边界。
从一个小任务开始试
建议先别碰复杂流程:用GROUNDING模板在一张 1080p 截图上跑"定位某个按钮",把坐标管线跑通;再换成COMPUTER_USE做单击、单输入这类一步任务。等你确认红点能稳定落在目标上,多步骤自动化自然就是水到渠成的事了。
【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考