news 2026/9/29 11:34:25

10 分钟跑通 UI-TARS Desktop:用一句自然语言操作你的电脑

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
10 分钟跑通 UI-TARS Desktop:用一句自然语言操作你的电脑

10 分钟跑通 UI-TARS Desktop:用一句自然语言操作你的电脑

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

UI-TARS Desktop 是一款桌面端多模态 GUI Agent:给它一句自然语言指令,它会截图、识别屏幕,再在你的本地电脑或浏览器里执行鼠标和键盘操作。既能直接当自动化助手,也能拿仓库里的 SDK 去驱动自己的产品。

核心能力一屏速览

  • 自然语言控制桌面:一句"打开 VS Code 并开启 Auto Save",模型负责把意图翻译成菜单点击、输入和滚动。
  • 双本地操作器:Computer Operator 接管整机,Browser Operator 负责页面与表单,后者要求系统装有 Chrome、Edge 或 Firefox。
  • 视觉化识别:不依赖 DOM 或辅助功能树,截图加视觉语言模型,复杂布局的界面也能认。
  • 操作报告:每轮任务结束自动产出分步报告,支持下载文件或生成可分享链接。

工作原理 / 架构速览

核心链路是"感知 → 规划 → 执行"的循环:你发出指令后,操作器先截图完成感知,VLM 根据截图与指令产出下一步动作,操作器在真实电脑或浏览器上执行,新的屏幕状态回传作为下一轮输入,直到模型判定任务完成。报告环节是一条独立分支:任务结束后先检查是否配置了报告存储服务,有则上传报告文件并生成可访问链接,没有则直接下载到本地。桌面应用主进程在apps/ui-tars/src/main/,Agent 核心与环境抽象位于multimodal/目录。

从零跑通(分步实操)

第一步:安装

  • macOS:brew install --cask ui-tars,或从 Releases 页下载安装包拖入 Applications
  • Windows:下载安装包直接运行
  • 前置条件:目前仅支持单显示器,多显示器环境部分任务会失败

第二步:授权与配置 VLM 模型

macOS 需要在"系统设置 → 隐私与安全性"里授予两项权限:辅助功能(控制鼠标键盘)和屏幕录制(识别屏幕内容)。

然后打开 Settings → VLM Settings,选择 Provider 并填写参数:

VLM Provider: Hugging Face for UI-TARS-1.5 # 或 VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://xxx/v1/ # HF endpoint 必须以 /v1/ 结尾 VLM API KEY: your_api_key VLM Model Name: your_model_name

点击Check Model Availability确认端点连通即可。

第三步:发出第一条指令

点击开始按钮,选择Computer Operator(操作本机)或Browser Operator(操作浏览器):

在输入框填入任务,例如"打开浏览器查一下上海明天的天气",Agent 即开始截图并执行动作。

两个典型场景

场景一:查最新 Issue

  • 角色:项目维护者
  • 痛点:每天人工翻 issue 太慢
  • 指令:"打开浏览器查看本仓库最新的 open issue,并总结给我"
  • 结果:Agent 自行导航页面、读取 issue,汇总写入操作报告

场景二:改 VS Code 设置

  • 角色:开发者
  • 痛点:设置项藏得深,找起来烦
  • 指令:"在 VS Code 中开启 Auto Save,延迟设为 500 毫秒"
  • 结果:模型自己打开设置面板定位选项并改完

高频坑与解法

⚠️ 以下三条基本覆盖了新手的大部分失败案例:

  • 模型检查不通过:根因是 Base URL 没以/v1/结尾,或 Provider 与模型不匹配——UI-TARS-1.5 必须选对应 Provider,否则动作解析会出错。解法:换成 endpoint 页面展示的地址后重新验证。
  • 动作打偏、识别不到界面:根因是 macOS 未授予屏幕录制权限,或多显示器环境。解法:系统设置里补齐权限,并切到单显示器运行。
  • Remote Operator 无响应:根因是免费远程服务已于 2025 年 8 月 20 日下线。解法:改用本地操作器,或按 quick-start 文档 自行部署远程 Agent。

想深入改?看这里

  • multimodal/agent-tars/core/ — Agent 主循环与环境抽象,environments/目录下有 20 多个环境实现,想调整 Agent 与环境的交互方式从这里入手。
  • packages/ui-tars/operators/ — 操作器层,nut-js(本地电脑)、browser、ADB 等实现都在这,新增执行环境就是在这里加一个 Operator。
  • packages/ui-tars/sdk/ —@ui-tars/sdk跨平台 GUI 自动化 SDK,Node.js 与浏览器端均可调用,适合嵌入自己的产品。
  • examples/gui-agent-2.0/ — 最小可运行 demo,SDK 接 AIO sandbox 跑一个天气查询,熟悉 SDK 的最快路径。

git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop,先跑examples/gui-agent-2.0/里的最小 demo,再回桌面版试试"打开记事本"。

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 11:31:14

网络安全应急处置流程图:从静态PDF到可执行响应机制

简介:一份面向企业网络安全管理的应急处置流程图文档,适用于信息安全负责人、IT运维及应急响应人员,用于规范从预防、预警到事件分类、分级和处置的完整流程。文档依据国家相关标准编制,明确了由董事长任组长的信息安全领导小组与…

作者头像 李华
网站建设 2026/9/29 11:29:54

PDF合并免费工具推荐!电脑+小程序全覆盖,无水印超好用

日常办公、学习中,经常需要把多个PDF文件合并成一个,比如整理毕业论文、工作报表、合同资料、证件扫描件等。但很多工具要么收费开会员,要么合并后自带水印,要么限制文件大小和次数,非常影响使用体验。今天给大家整理一…

作者头像 李华
网站建设 2026/9/29 11:29:49

Ubuntu安装Edge浏览器完全指南:从apt源配置到卸载清理

1. 装 Edge 之前,先给 Ubuntu 做一次三分钟体检前几天把一台闲置笔记本装成了 Ubuntu 系统,第一个想装回的应用就是 Edge 浏览器。原因很简单:公司电脑和主力机都是 Windows,书签、密码、收藏夹全躺在微软账号里,换到 …

作者头像 李华
网站建设 2026/9/29 11:27:41

CNN与RNN选型、原理与实战:图像分类到序列预测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华