UI-TARS 桌面版:一句话 GUI 自动化,快速部署与配置指南
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
想"说句话"就操作自己的电脑,但传统 GUI 自动化脚本一旦界面变动就失效,写坐标和选择器又很烦。UI-TARS Desktop 是一个基于视觉语言模型的桌面 GUI 自动化应用,它通过查看屏幕截图来理解界面,把"帮我打开新标签页搜索"这样的一句话直接翻译成鼠标键盘动作,不用写代码,也不用记坐标。
能力概览:它能帮你做什么
- 桌面应用操作:打开本地软件、填写表单、调整设置,只要界面上"看得见"的控件,它都能定位并点击,适合没有开放接口的老软件。
- 浏览器任务:搜索、查数据、填表、导出结果,整个过程像真人浏览网页一样推进,布局变化后能通过视觉重新识别元素。
- 跨平台一致体验:同一套交互方式运行在 macOS 和 Windows 上,权限配置流程略有差异,但使用方式相同。
从零跑起来:部署配置的 4 个步骤
第 1 步,检查环境:需要 Node.js 20 及以上版本,使用 pnpm 管理依赖;如果要用浏览器操作模式,先装好 Chrome、Edge 或 Firefox 之一。
第 2 步,获取代码并安装依赖,克隆仓库后安装依赖即可:
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop cd UI-TARS-desktop pnpm install第 3 步,构建并运行。开发调试用 dev 模式启动,打包正式安装包用 build:
pnpm run dev pnpm run buildmacOS 上安装时把应用拖入 Applications 文件夹,并在"系统设置 → 隐私与安全性"中开启辅助功能与屏幕录制两项权限,前者负责模拟键鼠,后者负责截图识别:
macOS 安装界面,拖拽到 Applications 后还需授予屏幕录制与辅助功能权限
第 4 步,配置视觉语言模型。应用启动后进入设置页,填入模型服务的 Base URL、API Key 和模型名。注意 Base URL 需以/v1/结尾,提供商要选与模型版本匹配的选项,否则动作解析会出错:
VLM Provider: Hugging Face for UI-TARS-1.5 VLM Base URL: https://your-endpoint/v1/ VLM API KEY: your_api_key VLM Model Name: UI-TARS-1.5-7B以上四项是决定识别精度的关键参数,模型服务可用 Hugging Face 部署本地推理,也可以选火山引擎的云端推理服务。配置完成后界面如下:
模型设置界面,VLM 提供商、Base URL、API Key 与模型名是四个必填项
架构速览:主进程、operator 与 UTIO
应用采用 Electron 主进程 + 渲染进程的结构,核心逻辑集中在apps/ui-tars/src/main/:agent/负责任务执行与操作器调度,services/负责模型设置、窗口管理以及 UTIO 事件上传。UTIO 全称 UI-TARS Insights and Observation,是一套内部机制,用于采集和上报任务执行过程中的事件数据,方便回溯每次操作。可复用能力被抽成独立包放在packages/ui-tars/下,包括 SDK、动作解析器和多种 operator(本地电脑、浏览器、ADB 等)。整体主循环是:截取屏幕 → 交给视觉语言模型判断 → 解析出动作 → 执行并验证,流程图见下图:
指令接收、任务分发与结果记录的主循环流程
实战场景:用得最多的两个用法
浏览器查数与表单填写。比如输入"打开机票网站,查 7 月 20 日上海到北京的最低票价并截图",你不需要告诉它按钮在哪里,它看到当前页面截图后自行识别输入框和按钮,逐项填写点击,每步之后重新判断页面状态。界面改版时靠视觉理解重新定位元素,不会因为选择器失效而中断,适合定期查数据、批量导出报表这类重复劳动。
任务执行界面,左侧输入自然语言指令,右侧展示屏幕操作过程
本地应用的"菜单外"操作。也可以让它直接操控桌面软件:打开文档、整理窗口、在目录间移动文件。这类操作往往没有现成接口,只要界面上可见就能执行。两点提醒:macOS 下务必授予屏幕录制和辅助功能权限,否则既截不了图也点不动鼠标;多显示器环境可能让部分任务失败,建议先在单显示器上跑通关键流程再正式使用。
调优与排错:高频问题与性能建议
任务完全无响应或识别失败,优先检查三处:Base URL 是否以/v1/结尾、API Key 是否有效、VLM 提供商是否选对(模型版本与提供商不匹配是高频错误)。
鼠标键盘点了没反应,基本是权限问题。macOS 回到"隐私与安全性"确认辅助功能和屏幕录制都已开启 UI-TARS,改完权限后重启应用再试。
性能方面一组实用建议:
- 日常快任务用 7B 级别模型,响应快、成本低;复杂页面再考虑更大模型
- 把大任务拆成小指令分步下发,单步失败便于定位,也方便人工介入
- 保持单显示器环境,任务执行期间不要手动抢鼠标键盘
延伸资源
- 快速上手文档:安装、模型获取与配置的完整步骤
- 部署指南:自建模型推理服务的说明
- 设置参考:全部配置项的字段说明
- SDK 文档:用代码方式搭建自己的 GUI Agent
- 操作器源码:本地电脑、浏览器、ADB 等操作器的实现
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考