让AI看着你的屏幕干活:UI-TARS 桌面自动化从安装到跑通全记录
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
每天下班前,你都要花二十分钟把下载文件夹里的截图归档、重命名、挪进项目文件夹。这种重复劳动,现在可以交给 UI-TARS 桌面版——一个靠视觉语言模型做屏幕理解的桌面自动化开源项目。它直接看你的屏幕、听懂指令,然后像人一样点鼠标、敲键盘。这不是 demo 视频,是能装到本地、真的跑得起来的东西。
第一次打开开源桌面助手:它到底会做什么
启动界面:两个入口
装完启动,欢迎页只给你两个选择:Computer Operator(直接操控电脑桌面)和 Browser Operator(自动化浏览器)。这里选后者。
UI-TARS 桌面自动化启动界面:本地电脑 / 本地浏览器两个入口
输入第一句话
在输入框打:"帮我打开今日头条,把热榜前 3 条新闻标题整理给我",回车。左侧聊天区开始滚动输出它的思考过程,右侧弹出浏览器预览——AI 接管了标签页,自己滚动、点击、读取内容,右上角还挂着免费额度的倒计时。
AI 接管浏览器标签页,正在执行屏幕操作任务
拿到结果
任务跑完,应用自动生成报告:每步的截图、操作视频回放,报告链接还会自动复制进剪贴板,方便直接分享或存档。
任务完成报告:截图、视频回放,链接自动复制到剪贴板
"看→懂→动手":多模态GUI自动化的实现思路
看:应用先对当前屏幕截图,把整屏当作一张"图"发给视觉语言模型。
懂:模型不猜你的意图,而是直接输出结构化动作——点哪个坐标、输入什么文本、滚多少。
动手:动作交给操作器层执行,真实落在鼠标和键盘上。
核心逻辑在multimodal/agent-tars/,执行层在packages/ui-tars/operators/。整体相当于你雇了个新来的实习生:你口头交代,他盯着屏幕边看边做,做完给你汇报。
五分钟跑通 AI 屏幕操作:装好、配好
装:macOS 拖进 Applications,在系统设置开启"辅助功能"和"屏幕录制"权限即可;Windows 会弹 SmartScreen 提示,点"仍要运行"继续安装。
Windows 安装提示:点"仍要运行"继续即可
配:打开设置页,选 VLM Provider,填 Base URL、API Key、模型名,保存。云端远程模式自带 30 分钟免费试用额度,够你把流程先跑通。
三个能直接抄的工作流
案例一:文件批量整理输入:"把下载文件夹里所有 PNG 和 JPG 图片,按创建日期移动到'素材-2025-09'文件夹"
- 打开下载文件夹
- 识别所有图片文件
- 创建目标文件夹
- 逐张移动文件
- 汇报完成情况 你拿到:整理好的文件夹,外加一句"共移动 N 个文件"的汇报。
案例二:网页信息采集输入:"打开 GitHub,搜索 UI-TARS-desktop 项目的未关闭 issue,把最新 5 条标题和状态列出来"
- 打开浏览器并访问 GitHub
- 搜索目标项目
- 进入 issue 列表页
- 读取前 5 条信息
- 汇总输出 你拿到:一份 5 条 issue 的标题 + 状态清单,可直接贴进周报。
案例三:定时重复任务输入:"打开邮箱,把今天的未读邮件按发件人分类,汇总成表格保存到我的文档"
- 启动邮箱应用
- 逐封读取未读邮件
- 按发件人归类
- 生成表格文件
- 保存到指定位置 你拿到:按发件人分好的邮件汇总表,每天重复同一句指令即可再生成。
接入云端视觉语言模型应用:四步配好
主流服务商:火山引擎(Doubao-1.5-UI-TARS)、Hugging Face(自部署 UI-TARS-1.5),二选一即可,详见 官方文档。
- 在服务商后台申请 API Key
- 打开应用设置的 VLM Settings 页
- 填 Base URL、API Key、Model Name
- 选对应的 VLM Provider 并保存(注意选带 UI-TARS 字样的选项,动作解析才正确)
VLM 设置界面:Provider、Base URL、API Key、模型名
想支持新平台?packages/ui-tars/operators/下已内置桌面(nut-js)、浏览器、ADB 等操作器,按同样接口加一个就能扩展新设备。
让 AI 屏幕操作更听话:三条指令写法
指令写法
- ❌ "整理一下文件" → ✅ "把桌面上的 PDF 全移到'文档'文件夹,按日期重命名"(目标和规则说死,AI 不用猜)
- ❌ "帮我看看 GitHub" → ✅ "打开 GitHub,列出 UI-TARS-desktop 最新 5 条 issue"(给具体页面和数量)
- ❌ "处理一下这个表" → ✅ "打开'销售表.xlsx',把 D 列大于 10000 的单元格标黄"(落到具体单元格操作)
稳定性:分辨率偏高时适当调低,识别更稳;大任务拆小,一次只做一件事,成功率明显更高。
下一步
git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop先挑你最烦的那个重复任务试一次。有问题、有想法,欢迎去仓库提 issue 或 PR。
【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考