从0到1玩转UI.Vision RPA开源自动化:视觉识别、OCR与AI三步接管你的重复工作
2026/8/30 20:49:24 网站建设 项目流程

从0到1玩转UI.Vision RPA开源自动化:视觉识别、OCR与AI三步接管你的重复工作

【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA

如果你每天要花一两个小时重复做同一件事——登录后台、填表单、传文件、点发布——那你需要的不是更快的双手,而是一个能"看着屏幕干活"的机器人。UI.Vision RPA 正是一款这样的工具:免费开源、跨浏览器运行,把计算机视觉、OCR 文字识别和 AI 大模型能力打包进一个浏览器扩展里,同时兼容 Selenium IDE 脚本。这篇文章不堆概念,直接带你从安装开始,跑通一个真实的自动化任务。

先别急着写脚本,想清楚你的任务卡在哪

大多数自动化失败的根源,不是工具不行,而是定位方式选错了。网页里的"元素"会变:按钮换个样式、前端框架升级、弹窗偶尔出现,CSS 选择器说崩就崩。而 UI.Vision RPA 的思路完全不同——它默认"看像素":给工具一张小截图当模板,它就在屏幕或网页上搜索相似区域,找到了就点击、输入、验证。界面布局变化?只要目标长得还像,就能命中。

这个思路在源码里被拆成四层定位能力:DOM 定位(uiv.$)、视觉定位(uiv.findImage)、文字定位(uiv.ocr.findText),以及 AI 定位(uiv.ai.find)。每一层都有各自的适用场景,下面我们逐个实战。

第一层实战:视觉定位,让宏"认图不认代码"

先看视觉定位的配置界面:

如上图所示,你可以在命令编辑器里给visionLimitSearchArea这类命令指定一张参考图作为 Target,再用 Select 按钮框选搜索范围。这样脚本运行时只在指定区域内找图,又快又准。视觉定位最经典的应用,是处理那些"没有 DOM 结构"的目标——比如 Canvas 画布、跨域 iframe,甚至桌面软件窗口。

从录制到跑通:5 分钟完成第一个宏

上手最快的路径是用内置录制器:点击工具栏图标 → 录制新宏 → 在页面上手动操作一遍 → 停止录制。你会得到一张命令表,和 Selenium IDE 完全同款:

open | https://example.com type | id=username | your_name type | id=password | your_password click | id=login waitForPageToLoad | 30000 verifyText | css=h1.title | 欢迎回来

每个命令三列:Command、Target、Value。录完点 Run 就能重放,还可以在"运行"面板里调整速度、设置循环次数,甚至配合command-line/目录下的 PowerShell、VBS、批处理脚本定时批量执行。

第二层实战:页面会变?用 OCR 按"文字"找目标

视觉模板怕一件事:目标区域经常变。这时候换个思路——认字。OCR 定位按"屏幕上渲染出的文字"来找目标,按钮、链接、文案都行,页面换主题、换字体、换 DPI 都不受影响。用它之前,建议先执行一行脚本,确认 OCR 到底认出了什么:

const seen = uiv.ocr.read(); // 把当前页面识别出的所有文字打出来 uiv.log(seen, 'blue');

确认文字出现在识别结果里,再用uiv.ocr.findText('确认订单')去点击它。这套"先读再找"的习惯,能帮你避开九成 OCR 坑。

下面是真实场景:某在线课程平台的内容发布流程,就是典型的"页面结构频繁变化、但文字稳定"的自动化对象。

如上图所示,左侧是课程大纲、中间是编辑区、右侧是媒体元素面板。这种编辑器的 DOM 结构随时可能变,但"Introduction""PUBLISH"这些文字一直在——用 OCR 或视觉模板,都比硬编码选择器稳定得多。

第三层实战:AI 接管——一句话描述目标,让大模型帮你找

从 10.x 版本开始,UI.Vision RPA 把大模型接进了宏。最常用的两个能力:

// 让 LLM 读图找按钮,返回坐标直接点击 uiv.browser.click(uiv.ai.find('页面右上角那个蓝色的Accept all按钮')); // 把当前画面发给模型,问一个问题,拿回文本答案 const total = uiv.ai.ask('这张截图里的合计金额是多少?', {images: 'current'});

uiv.ai.find解决了传统视觉的两大痛点:模板图需要手动维护,OCR 遇到花体字、反色字会认错。AI 直接"看懂"画面。项目还支持 Anthropic Computer Use——大模型可以像人一样操作鼠标键盘;在侧栏的 AI 对话里配好密钥后,你甚至可以直接用自然语言描述需求,让它自动生成并运行宏。相关实现可以参考src/services/ai/macro_agent/src/services/ai/computer_use/

越出浏览器:XModule 把自动化延伸到整个桌面

网页搞定了,还有桌面软件呢?UI.Vision RPA 用 XModule(原生消息宿主)打通系统层:XClick模拟真实鼠标、XType模拟真实键盘、uiv.desktop.*直接操作屏幕像素,还能读写本地文件。安装时需要在配置里填入你的扩展 ID,再运行批处理脚本完成注册:

![UI.Vision RPA安装XModule桌面自动化模块](https://raw.gitcode.com/gh_mirrors/rp/RPA/raw/06e44ecb5c1b72906789c2e1985ef7f3f611710e/xmodule install new ID in 4 json files.png?utm_source=gitcode_repo_files)

如上图所示,把扩展 ID 填进 4 个 JSON 文件,再运行对应的 .bat(Mac/Linux 上是对应 shell 脚本)即可。装好之后,一个宏就能横跨浏览器和桌面应用连续执行,连系统级文件对话框、上传窗口都能接管。

命令表不够用?直接写现代 JavaScript

宏不只可以是表格。项目提供了完整的uiv.*JavaScript API:每次调用自动等待、失败时抛出真实异常,try/catch直接可用。比如处理"弹窗偶尔出现"的场景:

const close = uiv.findImage('close.png', {required: false, timeout: 2}); if (close) uiv.browser.click(close); // 没弹窗就跳过,不报错、不空等

所有uiv.*方法都是"同步写法、内部等待",写起来像普通 JS 一样顺手。命令表和 JS 之间还能互相调用:脚本里用uiv.run('command', 'target', 'value')就能执行任意经典命令。从src/common/src/services/player/,整套播放器、解释器和脚本沙箱都是开源可读的。

免费到什么程度?以及你的下一步

UI.Vision RPA 采用 AGPL-3.0 协议,个人和商用都免费,源码完整可审计。普通用户去 Chrome、Edge 或 Firefox 商店直接安装即可;想改源码的开发者,可以克隆项目自行构建:

git clone https://gitcode.com/gh_mirrors/rp/RPA cd RPA npm install npm run build

构建产物在dist(Chrome/Edge)和dist_ff(Firefox)目录,加载为解压扩展即可。核心模块都有清晰入口:命令定义在src/actions/,视觉与 OCR 服务在src/services/vision/src/services/ocr/,想研究实现、想提 PR 都方便。

从识别一个按钮,到跑通一条完整流程,再到让 AI 替你写脚本——UI.Vision RPA 的价值不在于"自动化本身",而在于把开源 RPA 自动化的门槛降到了"会截图、会点录制"就能上手。找一个你最烦的重复任务,装好扩展,录一遍,剩下的交给它。解放双手的感觉,试过就知道。

【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询