news 2026/9/14 15:46:47

让AI看着你的屏幕干活:UI-TARS 桌面自动化从安装到跑通全记录

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
让AI看着你的屏幕干活:UI-TARS 桌面自动化从安装到跑通全记录

让AI看着你的屏幕干活:UI-TARS 桌面自动化从安装到跑通全记录

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

每天下班前,你都要花二十分钟把下载文件夹里的截图归档、重命名、挪进项目文件夹。这种重复劳动,现在可以交给 UI-TARS 桌面版——一个靠视觉语言模型做屏幕理解的桌面自动化开源项目。它直接看你的屏幕、听懂指令,然后像人一样点鼠标、敲键盘。这不是 demo 视频,是能装到本地、真的跑得起来的东西。

第一次打开开源桌面助手:它到底会做什么

启动界面:两个入口

装完启动,欢迎页只给你两个选择:Computer Operator(直接操控电脑桌面)和 Browser Operator(自动化浏览器)。这里选后者。

UI-TARS 桌面自动化启动界面:本地电脑 / 本地浏览器两个入口

输入第一句话

在输入框打:"帮我打开今日头条,把热榜前 3 条新闻标题整理给我",回车。左侧聊天区开始滚动输出它的思考过程,右侧弹出浏览器预览——AI 接管了标签页,自己滚动、点击、读取内容,右上角还挂着免费额度的倒计时。

AI 接管浏览器标签页,正在执行屏幕操作任务

拿到结果

任务跑完,应用自动生成报告:每步的截图、操作视频回放,报告链接还会自动复制进剪贴板,方便直接分享或存档。

任务完成报告:截图、视频回放,链接自动复制到剪贴板

"看→懂→动手":多模态GUI自动化的实现思路

:应用先对当前屏幕截图,把整屏当作一张"图"发给视觉语言模型。

:模型不猜你的意图,而是直接输出结构化动作——点哪个坐标、输入什么文本、滚多少。

动手:动作交给操作器层执行,真实落在鼠标和键盘上。

核心逻辑在multimodal/agent-tars/,执行层在packages/ui-tars/operators/。整体相当于你雇了个新来的实习生:你口头交代,他盯着屏幕边看边做,做完给你汇报。

五分钟跑通 AI 屏幕操作:装好、配好

:macOS 拖进 Applications,在系统设置开启"辅助功能"和"屏幕录制"权限即可;Windows 会弹 SmartScreen 提示,点"仍要运行"继续安装。

Windows 安装提示:点"仍要运行"继续即可

:打开设置页,选 VLM Provider,填 Base URL、API Key、模型名,保存。云端远程模式自带 30 分钟免费试用额度,够你把流程先跑通。

三个能直接抄的工作流

案例一:文件批量整理输入:"把下载文件夹里所有 PNG 和 JPG 图片,按创建日期移动到'素材-2025-09'文件夹"

  1. 打开下载文件夹
  2. 识别所有图片文件
  3. 创建目标文件夹
  4. 逐张移动文件
  5. 汇报完成情况 你拿到:整理好的文件夹,外加一句"共移动 N 个文件"的汇报。

案例二:网页信息采集输入:"打开 GitHub,搜索 UI-TARS-desktop 项目的未关闭 issue,把最新 5 条标题和状态列出来"

  1. 打开浏览器并访问 GitHub
  2. 搜索目标项目
  3. 进入 issue 列表页
  4. 读取前 5 条信息
  5. 汇总输出 你拿到:一份 5 条 issue 的标题 + 状态清单,可直接贴进周报。

案例三:定时重复任务输入:"打开邮箱,把今天的未读邮件按发件人分类,汇总成表格保存到我的文档"

  1. 启动邮箱应用
  2. 逐封读取未读邮件
  3. 按发件人归类
  4. 生成表格文件
  5. 保存到指定位置 你拿到:按发件人分好的邮件汇总表,每天重复同一句指令即可再生成。

接入云端视觉语言模型应用:四步配好

主流服务商:火山引擎(Doubao-1.5-UI-TARS)、Hugging Face(自部署 UI-TARS-1.5),二选一即可,详见 官方文档。

  1. 在服务商后台申请 API Key
  2. 打开应用设置的 VLM Settings 页
  3. 填 Base URL、API Key、Model Name
  4. 选对应的 VLM Provider 并保存(注意选带 UI-TARS 字样的选项,动作解析才正确)

VLM 设置界面:Provider、Base URL、API Key、模型名

想支持新平台?packages/ui-tars/operators/下已内置桌面(nut-js)、浏览器、ADB 等操作器,按同样接口加一个就能扩展新设备。

让 AI 屏幕操作更听话:三条指令写法

指令写法

  • ❌ "整理一下文件" → ✅ "把桌面上的 PDF 全移到'文档'文件夹,按日期重命名"(目标和规则说死,AI 不用猜)
  • ❌ "帮我看看 GitHub" → ✅ "打开 GitHub,列出 UI-TARS-desktop 最新 5 条 issue"(给具体页面和数量)
  • ❌ "处理一下这个表" → ✅ "打开'销售表.xlsx',把 D 列大于 10000 的单元格标黄"(落到具体单元格操作)

稳定性:分辨率偏高时适当调低,识别更稳;大任务拆小,一次只做一件事,成功率明显更高。

下一步

git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

先挑你最烦的那个重复任务试一次。有问题、有想法,欢迎去仓库提 issue 或 PR。

【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/14 15:45:21

基于SSM与Flask的校园事务自助指南服务系统设计与实现

不需要去行政楼跑三趟才知道要盖哪个章,也不用在公告栏前一张一张翻纸质通知——把你所在高校里所有办事流程整理成在线指南,按分类展示、按关键词检索、按步骤追踪,这就是这个校园事务自助指南服务系统在做的事。项目本身是典型的Java后端项…

作者头像 李华
网站建设 2026/9/14 15:43:29

Autoware 完整指南:从克隆仓库到跑通自动驾驶软件栈

Autoware 完整指南:从克隆仓库到跑通自动驾驶软件栈 【免费下载链接】autoware Autoware - the worlds leading open-source software project for autonomous driving 项目地址: https://gitcode.com/GitHub_Trending/au/autoware 想把一套完整的自动驾驶系…

作者头像 李华
网站建设 2026/9/14 15:40:52

web-print-pdf:从浏览器打印到专业PDF生成的分页与字体方案

在接触web-print-pdf之前,我花了大半年时间跟浏览器打印死磕:页面上布局好好的票据,一进打印预览就表头断页、边框缺线;font-family里明明写了中文字体,生成PDF后中文全部变成豆腐块;页码想放到页面底部居中…

作者头像 李华