Ui.Vision V10 是什么?浏览器与桌面自动化工具的能力与使用方式
Ui.Vision V10 是一款开源的浏览器与桌面自动化工具,核心用途是让你用可复用的“宏”自动完成网页操作、桌面操作、网页抓取和 UI 测试。它提供三种上手路径:用 AI 宏助手描述任务自动生成宏、通过 MCP 连接你自己的 AI 助手、或者用可视化录制和 Selenium 风格命令自己搭建。浏览器自动化在 Windows、macOS、Linux 上都可用;涉及桌面应用和本地文件访问时,需要额外安装 Desktop Automation 应用(XModules)。
它能做什么
根据官网说明,Ui.Vision 覆盖以下几类任务:
- 网页自动化:在浏览器中重复执行点击、输入、跳转等操作。
- 桌面自动化:操作本地桌面应用、访问本地文件(需装 XModules)。
- 网页抓取:从页面提取数据。
- UI 测试与测试自动化:用宏验证界面行为。
- 视觉与 OCR 结合:把浏览器命令与计算机视觉、OCR 组合使用,应对难以用选择器定位的元素。
宏是这里的核心单位——你描述或录制一次,就能保存下来反复编辑和运行。
三种创建宏的方式
1. 用 AI 宏助手描述任务
在 V10 的 AI 宏助手里描述你想自动化的内容,助手会检查页面、编写宏、运行它,并在失败时帮助修复。生成的宏可以保留下来继续编辑和复用。
官网明确写到:Ui.Vision AI 在免费方案上可用,无需注册、无需 API key。
2. 通过 MCP 连接你自己的 AI 助手
如果你已经在用支持 MCP 的 AI 助手,可以通过 MCP bridge 让它创建、运行和调试浏览器中的 Ui.Vision 宏。相当于给你的 AI 助手一套浏览器自动化工具。
3. 自己录制或写代码
- 可视化录制:像录制操作一样生成宏。
- Selenium 风格命令:支持 Selenium IDE 的导入/导出。
- V10 新增的 JavaScript 自动化 API:适合需要更复杂逻辑的场景。
安装与运行环境
| 项目 | 说明 |
|---|---|
| 浏览器扩展 | 支持 Chrome、Edge、Firefox,均为一键安装 |
| 操作系统 | Windows、macOS、Linux |
| 桌面自动化 | 需安装 Desktop Automation 应用(XModules Version 2) |
| 浏览器视觉 | V10 中 Chrome 和 Edge 的 Browser Vision 无需 XModules,即使浏览器窗口在后台也能工作 |
| 运行位置 | 宏在本地运行 |
如果你是从旧版本升级,官网提示:使用 Ui.Vision Version 10 的话,需要下载新的 Desktop Automation 应用(XModules Version 2)。
AI 与数据流向:需要先想清楚的一点
Ui.Vision 允许你选择 AI 的处理方式:
- 托管版 Ui.Vision AI:由官方服务处理。
- 你自己的 AI 提供商:接入你选择的第三方服务。
- 本地模型:在本地运行。
官网特别说明:使用托管 AI 时,聊天内容以及其中包含的页面数据或截图,会被发送到所选服务进行处理。也就是说,如果你处理的是敏感页面,选择本地模型或自建提供商是更可控的路径。官网另有关于 AI 提供商选择和自动化安全的说明可供参考。
适合谁用
- 需要重复操作网页、又不想写完整脚本的人:从 AI 宏助手或可视化录制入手。
- 已经在用 AI 助手、想让它直接操作浏览器的开发者:走 MCP 连接。
- 需要兼顾桌面应用和本地文件的自动化场景:加装 XModules。
- 做 UI 测试、需要视觉和 OCR 兜底的团队:把浏览器命令与视觉能力组合使用。
从哪里开始
- 安装浏览器扩展(Chrome、Edge 或 Firefox)。
- 先用 AI 宏助手描述一个简单任务,看它生成的宏是否符合预期。
- 需要桌面或本地文件操作时,再安装 Desktop Automation 应用。
- 想接入自己的 AI 助手,配置 MCP bridge。
价格方面,官网提供了 Pricing 和 AI PRO 两个入口页面,具体方案与费用需以这些页面为准;免费方案可用 AI 宏助手这一点已在官网说明中明确。