☰
autoMate 开源程序配 TaoToken:本地 AI 自动化助手 settings.json 骨架与验证
2026/9/28 19:32:59 网站建设 项目流程

1. autoMate 是什么,为什么值得折腾 settings.json

autoMate 是一款 AI 驱动的本地自动化助手,核心思路和 Manus、Computer Use Agent(CUA)、OmniParser 属于同一类:让计算机自己看屏幕、自己点鼠标、自己敲键盘。你只需要用自然语言描述任务,比如「打开浏览器搜索今天的天气并截图保存」,它就会规划步骤、识别界面元素、执行操作。它基于 OmniParser 做视觉解析,把屏幕上的图标、按钮、输入框转成结构化信息,再交给大模型决策下一步动作。

它适合谁?适合每天被重复性桌面操作消耗时间的人:批量整理文件、跨软件搬运数据、定时填表、自动截图归档。传统 RPA 需要你拖拽流程、录制宏、写选择器,界面一改就崩;autoMate 用自然语言描述任务,界面变化由视觉模型重新识别,维护成本低很多。而且它支持本地部署,数据不出本机,隐私敏感场景也能用。

但真正落地时,很多人卡在第一步:模型通道怎么接。autoMate 默认走 OpenAI 系列模型,需要多模态加结构化输出能力,国内直连不稳定,自己维护多个厂商 Key 又很乱。我试过把 autoMate 的模型请求统一收到 TaoToken 的 API 通道上,一个 Key 管所有模型调用,settings.json 里改几行就能跑通。下面把配置骨架和验证动作完整拆开,你照着做就能跑起最小闭环。

2. 前置准备:TaoToken Key 与 autoMate 环境

在动 settings.json 之前,先把两件事准备好:TaoToken 的 API Key,以及 autoMate 的运行环境。

TaoToken 这边,你需要拿到一个可用的 API Key。登录控制台后进入 API Keys 页面创建,复制出来的字符串就是后面要填进配置的凭证。它的 API 入口是https://taotoken.net/api,兼容 OpenAI 的请求格式,所以 autoMate 这种按 OpenAI 协议发请求的程序可以直接对接,不需要改底层代码。模型对话、Coding Plan、控制台、API Keys、接入文档这些入口都在官网导航里能找到,建议先把接入文档扫一遍,心里有数。

autoMate 这边,官方推荐用 miniConda 管理依赖,Python 版本锁 3.12。完整流程如下:

# 克隆项目 git clone https://github.com/yuruotong1/autoMate.git cd autoMate # 创建 Python 3.12 环境 conda create -n "automate" python==3.12 # 激活环境 conda activate automate # 安装依赖 python install.py

安装脚本会拉取 OmniParser 相关的视觉模型和 OCR 依赖,这一步比较吃磁盘和网络,耐心等它跑完。装完后用python main.py启动,浏览器打开http://localhost:7888/就能看到配置界面。

注意:如果你机器上没有 NVIDIA 独显,视觉标注会走 CPU,速度明显变慢。官方建议至少 4GB 显存的 NVIDIA 卡,并且 torch 版本要和 CUDA 版本匹配。跑之前用pip list确认一下 torch 版本,不匹配就按官网命令重装。

3. settings.json 配置骨架:把模型通道指向 TaoToken

autoMate 的配置分两层:一层是 Web 界面里的基础设置,一层是落盘的settings.json。Web 界面适合快速试,但要做版本管理、多机同步、批量部署,直接改settings.json更靠谱。下面给出一份可复制的骨架,重点是把base_url和api_key指向 TaoToken。

先找到配置文件位置。autoMate 启动后会在项目目录或用户配置目录生成settings.json,常见路径是项目根目录下的config/settings.json,具体以你启动日志里打印的路径为准。用编辑器打开,结构大致如下:

{ "llm": { "provider": "openai", "base_url": "https://taotoken.net/api", "api_key": "sk-你的TaoToken密钥", "model": "gpt-4o", "temperature": 0.2, "max_tokens": 4096, "timeout": 120 }, "vision": { "enabled": true, "ocr_engine": "omniparser", "annotation_mode": "structured" }, "agent": { "max_steps": 30, "step_delay": 1.5, "screenshot_scale": 1.0, "save_screenshots": true }, "runtime": { "headless": false, "log_level": "info", "output_dir": "./runs" } }

几个关键字段逐个说明。provider保持openai,因为 TaoToken 走 OpenAI 兼容协议,autoMate 不需要知道背后是哪家模型。base_url填https://taotoken.net/api,注意不要带多余路径,程序会自己拼/v1/chat/completions。api_key填你在控制台创建的 Key,建议用环境变量注入而不是硬编码,后面会讲。model填gpt-4o,这是 autoMate 官方测试过、多模态加结构化输出都支持的型号;如果你在 TaoToken 上想换其他同能力模型,改这个字段即可,但务必确认它同时支持图片输入和 JSON 结构化输出,否则视觉解析那步会失败。

vision段是 autoMate 的核心,ocr_engine保持omniparser,annotation_mode用structured,这样屏幕元素会被转成带坐标和语义的 JSON,模型才能精准点击。agent段的max_steps控制单任务最大步数,新手先设 30,防止任务跑飞;step_delay是每步之间的等待秒数,机器慢就调大。runtime段的save_screenshots建议开着,排障时能回看每一步的屏幕状态。

如果你不想把 Key 写进文件,可以用环境变量覆盖:

export TAOTOKEN_API_KEY="sk-你的TaoToken密钥"

然后在settings.json里把api_key写成"${TAOTOKEN_API_KEY}",autoMate 启动时会做变量替换。这样配置文件可以进 Git,Key 留在本机环境里。

4. 连通性验证:从一条 curl 到一次真实自动化任务

配置写完别急着跑复杂任务,先做三层验证,逐层排除问题。

第一层,直接用 curl 打 TaoToken 的接口,确认 Key 和网络通:

curl https://taotoken.net/api/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-你的TaoToken密钥" \ -d '{ "model": "gpt-4o", "messages": [ {"role": "user", "content": "回复两个字:通了"} ], "max_tokens": 20 }'

返回里如果能看到choices数组和正常内容,说明 Key 有效、通道可达。如果返回 401,检查 Key 有没有复制全、有没有多余空格;返回 404,检查base_url是不是写成了带/v1的完整路径导致重复拼接。

第二层,启动 autoMate 后在 Web 界面http://localhost:7888/里点一次「测试连接」或等价的连通性按钮,看它能不能正常拉到模型列表或完成一次空对话。这一步验证的是 autoMate 读取settings.json的逻辑有没有生效。如果界面报错但 curl 通,多半是配置文件路径不对,或者 JSON 格式有语法错误,用python -m json.tool settings.json校验一下。

第三层,跑一个最小真实任务。在任务输入框里写:

打开记事本,输入 hello automata,然后截图保存到桌面

观察执行日志。正常流程是:autoMate 截当前屏幕 → OmniParser 解析出桌面图标和任务栏 → 模型规划「先找记事本图标」→ 执行点击 → 再截图 → 解析出编辑区 → 输入文字 → 截图保存。每一步在./runs目录下都有截图留档。如果卡在某一步,看那一步的截图和模型返回的 JSON,基本能定位是识别错了还是动作没执行。

提示:第一次跑建议把step_delay调到 2 秒以上,给视觉解析留足时间。机器性能一般时,OCR 标注是瓶颈,调大延迟比换模型更有效。

5. 常见报错与排查清单

配置和验证过程中,下面这几类问题出现频率最高,我按现象、原因、处理列出来。

报错一:openai.BadRequestError: model does not support image input。说明你选的模型不支持多模态。autoMate 的视觉解析会把截图作为图片消息发给模型,纯文本模型直接拒。回到settings.json把model换成gpt-4o这类支持图片输入的型号,别用gpt-3.5或纯文本模型。

报错二:JSONDecodeError或模型返回内容不是合法 JSON。autoMate 依赖结构化输出,模型如果返回带 markdown 代码块的文本,解析会失败。处理办法是把temperature降到 0.1 到 0.2,减少发散;同时在系统提示里已经内置了格式约束,不要自己再去改提示模板。如果换了模型后频繁出现,说明该模型的结构化输出能力弱,换回官方测试过的型号。

报错三:任务执行到一半卡住,日志停在「parsing screen」。这是 OmniParser 在跑 OCR,CPU 模式下可能几十秒没输出。先确认不是死机:看任务管理器里 Python 进程 CPU 占用是否在动。如果确实慢,检查 torch 和 CUDA 版本是否匹配,用pip list | grep torch看版本,再到 PyTorch 官网查对应 CUDA 的安装命令重装。显存不足 4GB 的话,把screenshot_scale降到 0.8,减少单帧像素量。

报错四:点击位置偏移,点到了隔壁按钮。多半是屏幕缩放比例问题。Windows 在高分屏下默认 125% 或 150% 缩放,截图坐标和实际点击坐标会对不上。把系统缩放临时调到 100% 再试,或者在settings.json里调整screenshot_scale让解析坐标和物理坐标对齐。这个坑我在多台机器上遇到过,统一缩放比例后就没再偏。

报错五:Connection timed out但 curl 能通。检查 autoMate 是不是走了系统代理设置,而 curl 没走。两者网络路径不一致会导致一个通一个不通。把settings.json里的timeout调大到 180,并确认程序运行环境没有额外的代理变量干扰。

排查顺序建议固定成:先 curl 验通道,再 Web 界面验配置读取,最后跑最小任务验全链路。这样任何一层出问题都能快速定位,不会在复杂任务里瞎猜。

6. 把 Key 管起来:长期跑 autoMate 的接入建议

跑通最小闭环之后,真正影响体验的是稳定性和 Key 管理。autoMate 这类 Computer Use Agent 的特点是请求密集:每一步动作都要发一次多模态请求,一个中等任务几十步很正常,Token 消耗比普通对话高一个量级。所以通道的稳定性和计费透明度比单次调用价格更重要。

我的做法是把 autoMate 的模型请求统一收在 TaoToken 的 API 通道上,一个 Key 覆盖所有模型调用,不用在多个厂商后台之间切换。settings.json里只维护一个base_url和一个api_key,换模型只改model字段,接入层不动。这样多台机器部署时,配置文件可以共用,Key 通过环境变量注入,安全性和可维护性都好。

如果你打算长期跑编码类或 Agent 类任务,可以看一下 TaoToken 的 Coding Plan,它针对高频调用场景做了额度规划,比按次零散调用更可控。接入文档里有完整的请求示例和参数说明,遇到协议层面的问题先查文档,大部分坑里面都写了。

最后给一个实用技巧:把./runs目录纳入定期清理。每次任务都会存截图,跑几天就是几个 G。写个定时脚本只保留最近三天的运行记录,磁盘不会爆。autoMate 的价值在于把重复操作交出去,配置一次、稳定运行,才是它真正省时间的地方。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询