从0到1玩转UI.Vision RPA开源自动化视觉识别、OCR与AI三步接管你的重复工作【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA如果你每天要花一两个小时重复做同一件事——登录后台、填表单、传文件、点发布——那你需要的不是更快的双手而是一个能看着屏幕干活的机器人。UI.Vision RPA 正是一款这样的工具免费开源、跨浏览器运行把计算机视觉、OCR 文字识别和 AI 大模型能力打包进一个浏览器扩展里同时兼容 Selenium IDE 脚本。这篇文章不堆概念直接带你从安装开始跑通一个真实的自动化任务。先别急着写脚本想清楚你的任务卡在哪大多数自动化失败的根源不是工具不行而是定位方式选错了。网页里的元素会变按钮换个样式、前端框架升级、弹窗偶尔出现CSS 选择器说崩就崩。而 UI.Vision RPA 的思路完全不同——它默认看像素给工具一张小截图当模板它就在屏幕或网页上搜索相似区域找到了就点击、输入、验证。界面布局变化只要目标长得还像就能命中。这个思路在源码里被拆成四层定位能力DOM 定位uiv.$、视觉定位uiv.findImage、文字定位uiv.ocr.findText以及 AI 定位uiv.ai.find。每一层都有各自的适用场景下面我们逐个实战。第一层实战视觉定位让宏认图不认代码先看视觉定位的配置界面如上图所示你可以在命令编辑器里给visionLimitSearchArea这类命令指定一张参考图作为 Target再用 Select 按钮框选搜索范围。这样脚本运行时只在指定区域内找图又快又准。视觉定位最经典的应用是处理那些没有 DOM 结构的目标——比如 Canvas 画布、跨域 iframe甚至桌面软件窗口。从录制到跑通5 分钟完成第一个宏上手最快的路径是用内置录制器点击工具栏图标 → 录制新宏 → 在页面上手动操作一遍 → 停止录制。你会得到一张命令表和 Selenium IDE 完全同款open | https://example.com type | idusername | your_name type | idpassword | your_password click | idlogin waitForPageToLoad | 30000 verifyText | cssh1.title | 欢迎回来每个命令三列Command、Target、Value。录完点 Run 就能重放还可以在运行面板里调整速度、设置循环次数甚至配合command-line/目录下的 PowerShell、VBS、批处理脚本定时批量执行。第二层实战页面会变用 OCR 按文字找目标视觉模板怕一件事目标区域经常变。这时候换个思路——认字。OCR 定位按屏幕上渲染出的文字来找目标按钮、链接、文案都行页面换主题、换字体、换 DPI 都不受影响。用它之前建议先执行一行脚本确认 OCR 到底认出了什么const seen uiv.ocr.read(); // 把当前页面识别出的所有文字打出来 uiv.log(seen, blue);确认文字出现在识别结果里再用uiv.ocr.findText(确认订单)去点击它。这套先读再找的习惯能帮你避开九成 OCR 坑。下面是真实场景某在线课程平台的内容发布流程就是典型的页面结构频繁变化、但文字稳定的自动化对象。如上图所示左侧是课程大纲、中间是编辑区、右侧是媒体元素面板。这种编辑器的 DOM 结构随时可能变但IntroductionPUBLISH这些文字一直在——用 OCR 或视觉模板都比硬编码选择器稳定得多。第三层实战AI 接管——一句话描述目标让大模型帮你找从 10.x 版本开始UI.Vision RPA 把大模型接进了宏。最常用的两个能力// 让 LLM 读图找按钮返回坐标直接点击 uiv.browser.click(uiv.ai.find(页面右上角那个蓝色的Accept all按钮)); // 把当前画面发给模型问一个问题拿回文本答案 const total uiv.ai.ask(这张截图里的合计金额是多少, {images: current});uiv.ai.find解决了传统视觉的两大痛点模板图需要手动维护OCR 遇到花体字、反色字会认错。AI 直接看懂画面。项目还支持 Anthropic Computer Use——大模型可以像人一样操作鼠标键盘在侧栏的 AI 对话里配好密钥后你甚至可以直接用自然语言描述需求让它自动生成并运行宏。相关实现可以参考src/services/ai/macro_agent/和src/services/ai/computer_use/。越出浏览器XModule 把自动化延伸到整个桌面网页搞定了还有桌面软件呢UI.Vision RPA 用 XModule原生消息宿主打通系统层XClick模拟真实鼠标、XType模拟真实键盘、uiv.desktop.*直接操作屏幕像素还能读写本地文件。安装时需要在配置里填入你的扩展 ID再运行批处理脚本完成注册![UI.Vision RPA安装XModule桌面自动化模块](https://raw.gitcode.com/gh_mirrors/rp/RPA/raw/06e44ecb5c1b72906789c2e1985ef7f3f611710e/xmodule install new ID in 4 json files.png?utm_sourcegitcode_repo_files)如上图所示把扩展 ID 填进 4 个 JSON 文件再运行对应的 .batMac/Linux 上是对应 shell 脚本即可。装好之后一个宏就能横跨浏览器和桌面应用连续执行连系统级文件对话框、上传窗口都能接管。命令表不够用直接写现代 JavaScript宏不只可以是表格。项目提供了完整的uiv.*JavaScript API每次调用自动等待、失败时抛出真实异常try/catch直接可用。比如处理弹窗偶尔出现的场景const close uiv.findImage(close.png, {required: false, timeout: 2}); if (close) uiv.browser.click(close); // 没弹窗就跳过不报错、不空等所有uiv.*方法都是同步写法、内部等待写起来像普通 JS 一样顺手。命令表和 JS 之间还能互相调用脚本里用uiv.run(command, target, value)就能执行任意经典命令。从src/common/到src/services/player/整套播放器、解释器和脚本沙箱都是开源可读的。免费到什么程度以及你的下一步UI.Vision RPA 采用 AGPL-3.0 协议个人和商用都免费源码完整可审计。普通用户去 Chrome、Edge 或 Firefox 商店直接安装即可想改源码的开发者可以克隆项目自行构建git clone https://gitcode.com/gh_mirrors/rp/RPA cd RPA npm install npm run build构建产物在distChrome/Edge和dist_ffFirefox目录加载为解压扩展即可。核心模块都有清晰入口命令定义在src/actions/视觉与 OCR 服务在src/services/vision/和src/services/ocr/想研究实现、想提 PR 都方便。从识别一个按钮到跑通一条完整流程再到让 AI 替你写脚本——UI.Vision RPA 的价值不在于自动化本身而在于把开源 RPA 自动化的门槛降到了会截图、会点录制就能上手。找一个你最烦的重复任务装好扩展录一遍剩下的交给它。解放双手的感觉试过就知道。【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考