UI-TARS Desktop上手指南:从安装到用自然语言驱动桌面与浏览器操作
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
UI-TARS Desktop 是一个开源的 GUI Agent 桌面应用,基于 UI-TARS 视觉语言模型,你用一句中文或英文指令描述需求,它通过截屏理解画面,自动执行鼠标与键盘操作,控制本地计算机或本地浏览器完成图形界面任务。本文覆盖安装、接入模型服务、跑通首个任务、参数调优与预设分发,适合希望自动化重复桌面操作的用户,以及评估 GUI 自动化的开发者。
一个典型任务是这样完成的:输入"打开 VS Code,开启自动保存功能并将延迟设置为 500 毫秒",应用截屏,模型输出类似"点击坐标 (27, 496)"的动作,执行后再截屏核对,循环往复直到任务完成。全过程可以在会话面板里逐步观察。
📦 系统环境与两种获取方式
UI-TARS Desktop 支持 macOS 与 Windows,目前建议单显示器环境,多显示器配置可能导致部分任务失败。
| 项目 | 说明 |
|---|---|
| 操作系统 | macOS、Windows |
| 显示配置 | 单显示器(多屏可能失败) |
| 浏览器操作模式 | 需预装 Chrome、Edge 或 Firefox,stable / beta / dev / canary 通道均可 |
| 当前桌面应用版本 | v0.2.4 |
获取方式有两种:
- 到项目 Release 页面下载最新版本的对应平台安装包;
- 已安装 Homebrew 的 macOS 用户可直接执行:
brew install --cask ui-tars如需从源码构建,先克隆仓库:
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop🖥️ 配置 macOS 辅助功能权限与处理 Windows 安全提示
macOS 的准备工作最多,因为应用需要系统级的输入与截屏权限。
- 把 UI TARS 图标拖入 Applications 文件夹,这是 macOS 的标准安装方式。
- 在"系统设置"→"隐私与安全性"中,为 UI TARS 开启辅助功能和屏幕录制两项权限。
- 启动应用,进入首次打开的欢迎界面。
Windows 侧只需一步:双击安装程序,遇到安全提示时点击"仍要运行"继续安装。
🔌 接入模型服务:Hugging Face 或火山引擎两条路线
UI-TARS Desktop 不内置模型,需要接入一个 OpenAI 兼容接口的视觉语言模型服务。官方给出两条现成路线:在 Hugging Face 部署 UI-TARS-1.5-7B,或使用火山引擎的 Doubao-1.5-UI-TARS 接口。
在 Hugging Face 部署 UI-TARS-1.5-7B
- 在应用内点击
Deploy from Hugging Face按钮进入部署流程。
- 选择模型 UI-TARS-1.5-7B,按部署教程完成部署后,可拿到三样东西:Base URL、API Key、Model Name。
使用火山引擎 Doubao-1.5-UI-TARS
登录火山引擎控制台,进入 Doubao-1.5-UI-TARS 模型页,点击"API 接入"。在面板 STEP 1 获取 API Key,STEP 2 切换到 OpenAI SDK 页签读取 Base URL 与模型名:Base URL 为https://ark.cn-beijing.volces.com/api/v3,模型名为doubao-1.5-ui-tars-250328。
填写设置并验证连通性
打开设置页(左下角齿轮)填写五项参数:
| 字段 | 说明 |
|---|---|
| Language | VLM 输出语言,en或zh,默认en;只影响模型输出,不影响应用界面 |
| VLM Provider | 必须与模型匹配,如Hugging Face for UI-TARS-1.5或VolcEngine Ark for Doubao-1.5-UI-TARS,该选项决定动作解析格式 |
| VLM Base URL | 模型服务地址,Hugging Face 端点必须以/v1/结尾 |
| VLM API KEY | 服务的 API Key |
| VLM Model Name | 模型标识 |
填写完成后点击Check Model Availability验证连通性,通过后再开始任务。若所用模型支持 Responses API,可开启该选项以降低 token 消耗。
🎬 跑通第一个任务:本地计算机或本地浏览器
回到主界面点击New Chat,在输入框下方的模式下拉框中选择执行器。
| 模式 | 作用对象 | 适合的任务 |
|---|---|---|
| Computer Use(本地计算机) | 桌面应用与文件系统 | 修改软件设置、整理文件 |
| Browser Use(本地浏览器) | 本机浏览器 | 页面导航、表单填写、数据提取 |
输入指令后回车即可。执行期间,右侧面板逐步展示屏幕截图,左侧记录模型每一步的推理与动作,例如"查看 UI-TARS-Desktop 项目最新的 open issue"。
两点需要留意:
- 使用 Browser Use 前,确认本机已安装 Chrome、Edge 或 Firefox;
- 任务中途想停止时,用右上角 Terminate 按钮结束会话并释放资源。
另外,v0.2.0 曾提供免费的远程 Computer / Browser Operator,该服务已于 2025 年 8 月 20 日下线,需要远程环境的用户可按 docs/quick-start.md 的说明自行部署。
⚙️ 四个直接影响任务成败的参数
设置页的 Chat Settings 与 Operator Settings 中有几个参数直接影响成功率与速度,默认值即可覆盖多数场景。
| 参数 | 可选范围 | 默认值 | 作用 |
|---|---|---|---|
| Max Loop | 25–200 | 100 | 单轮对话最大执行步数,复杂任务可调高 |
| Loop Wait Time | 0–3000 ms | 1000 | 每步截屏前的等待时间,页面响应慢时调大 |
| Language | en / zh | en | VLM 输出语言 |
| Search Engine | Google / Bing / Baidu | 浏览器模式的默认搜索引擎 |
📋 用预设批量分发设置并导出执行报告
多台机器或团队共用同一套配置时,可以用预设(preset):把设置写成 YAML 文件,格式参考 examples/presets/default.yaml,在设置页导入本地文件或 URL。本地预设可读写、手动更新;URL 预设只读,应用每次启动时自动拉取。仓库暂未提供官方远程预设,社区可在 examples/presets/ 贡献。
任务结束后点击Export as HTML可导出完整执行报告。默认行为是直接下载报告文件;如果设置了 Report Storage Base URL(一个接收multipart/form-data上传、HTML 文件不超过 30MB 的 HTTP 服务),报告会上传并自动把链接复制到剪贴板。
下一步
- 通读 docs/quick-start.md,按完整流程安装并接入模型
- 查阅 docs/setting.md,了解全部 VLM、Chat 与 Report 字段
- 查阅 docs/preset.md,掌握预设导入与自动同步机制
- 面向开发者:阅读 docs/sdk.md,在 Node.js 或 Web 环境用
@ui-tars/sdk自建 GUI Agent
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考