10 分钟跑通 UI-TARS Desktop:用一句自然语言操作你的电脑
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
UI-TARS Desktop 是一款桌面端多模态 GUI Agent:给它一句自然语言指令,它会截图、识别屏幕,再在你的本地电脑或浏览器里执行鼠标和键盘操作。既能直接当自动化助手,也能拿仓库里的 SDK 去驱动自己的产品。
核心能力一屏速览
- 自然语言控制桌面:一句"打开 VS Code 并开启 Auto Save",模型负责把意图翻译成菜单点击、输入和滚动。
- 双本地操作器:Computer Operator 接管整机,Browser Operator 负责页面与表单,后者要求系统装有 Chrome、Edge 或 Firefox。
- 视觉化识别:不依赖 DOM 或辅助功能树,截图加视觉语言模型,复杂布局的界面也能认。
- 操作报告:每轮任务结束自动产出分步报告,支持下载文件或生成可分享链接。
工作原理 / 架构速览
核心链路是"感知 → 规划 → 执行"的循环:你发出指令后,操作器先截图完成感知,VLM 根据截图与指令产出下一步动作,操作器在真实电脑或浏览器上执行,新的屏幕状态回传作为下一轮输入,直到模型判定任务完成。报告环节是一条独立分支:任务结束后先检查是否配置了报告存储服务,有则上传报告文件并生成可访问链接,没有则直接下载到本地。桌面应用主进程在apps/ui-tars/src/main/,Agent 核心与环境抽象位于multimodal/目录。
从零跑通(分步实操)
第一步:安装
- macOS:
brew install --cask ui-tars,或从 Releases 页下载安装包拖入 Applications - Windows:下载安装包直接运行
- 前置条件:目前仅支持单显示器,多显示器环境部分任务会失败
第二步:授权与配置 VLM 模型
macOS 需要在"系统设置 → 隐私与安全性"里授予两项权限:辅助功能(控制鼠标键盘)和屏幕录制(识别屏幕内容)。
然后打开 Settings → VLM Settings,选择 Provider 并填写参数:
VLM Provider: Hugging Face for UI-TARS-1.5 # 或 VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://xxx/v1/ # HF endpoint 必须以 /v1/ 结尾 VLM API KEY: your_api_key VLM Model Name: your_model_name点击Check Model Availability确认端点连通即可。
第三步:发出第一条指令
点击开始按钮,选择Computer Operator(操作本机)或Browser Operator(操作浏览器):
在输入框填入任务,例如"打开浏览器查一下上海明天的天气",Agent 即开始截图并执行动作。
两个典型场景
场景一:查最新 Issue
- 角色:项目维护者
- 痛点:每天人工翻 issue 太慢
- 指令:"打开浏览器查看本仓库最新的 open issue,并总结给我"
- 结果:Agent 自行导航页面、读取 issue,汇总写入操作报告
场景二:改 VS Code 设置
- 角色:开发者
- 痛点:设置项藏得深,找起来烦
- 指令:"在 VS Code 中开启 Auto Save,延迟设为 500 毫秒"
- 结果:模型自己打开设置面板定位选项并改完
高频坑与解法
⚠️ 以下三条基本覆盖了新手的大部分失败案例:
- 模型检查不通过:根因是 Base URL 没以
/v1/结尾,或 Provider 与模型不匹配——UI-TARS-1.5 必须选对应 Provider,否则动作解析会出错。解法:换成 endpoint 页面展示的地址后重新验证。 - 动作打偏、识别不到界面:根因是 macOS 未授予屏幕录制权限,或多显示器环境。解法:系统设置里补齐权限,并切到单显示器运行。
- Remote Operator 无响应:根因是免费远程服务已于 2025 年 8 月 20 日下线。解法:改用本地操作器,或按 quick-start 文档 自行部署远程 Agent。
想深入改?看这里
- multimodal/agent-tars/core/ — Agent 主循环与环境抽象,
environments/目录下有 20 多个环境实现,想调整 Agent 与环境的交互方式从这里入手。 - packages/ui-tars/operators/ — 操作器层,nut-js(本地电脑)、browser、ADB 等实现都在这,新增执行环境就是在这里加一个 Operator。
- packages/ui-tars/sdk/ —
@ui-tars/sdk跨平台 GUI 自动化 SDK,Node.js 与浏览器端均可调用,适合嵌入自己的产品。 - examples/gui-agent-2.0/ — 最小可运行 demo,SDK 接 AIO sandbox 跑一个天气查询,熟悉 SDK 的最快路径。
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop,先跑examples/gui-agent-2.0/里的最小 demo,再回桌面版试试"打开记事本"。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考