news 2026/10/3 13:17:52

【ICML 2026】Video2GUI:从无标注视频到 1200 万条 GUI 交互轨迹|从 GUI 智能体数据供给视角

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【ICML 2026】Video2GUI:从无标注视频到 1200 万条 GUI 交互轨迹|从 GUI 智能体数据供给视角

摘要

本文解读 ICML 2026 论文《Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining》。该论文提出Video2GUI 全自动数据合成框架与 WildGUI 大规模预训练数据集,通过融合元数据粗筛 + 视频质量细筛的两级过滤、VLM 驱动的轨迹抽取与三帧原分辨率动作空间落点,把"人工关键词检索 + 人工标注"替换为"元数据分类器 + 多模态模型标注",其特别之处在于把时间推理与空间落点显式解耦——被压缩的视频帧只用于判断"发生了什么",坐标一律来自未被压缩的高分辨率截图。实验表明在 WildGUI 上持续预训练后,Qwen2.5-VL-7B 与 Mimo-VL-7B 在四类基准上一致提升 5–20%,Mimo-VL-7B 的 OSWorld-G 平均分达 67.6,超过 320 亿参数的 Qwen3-VL-32B(60.6),AndroidWorld 端到端成功率从基座 16.4% 翻倍到 31.9%,为 GUI 智能体的规模化数据供给提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机:GUI 智能体的天花板为什么是数据?
  • 研究主线:从问题到结论
  • 基准/方法设计:一条三段式数据流水线
  • 分类全景与方法细节:每一环都选"够用的最强"
  • 实验设计与结果:7B 模型追平 32B
    • 附录数据统计与定性案例
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • Video2GUI 的核心贡献是什么?
    • WildGUI 到底有多大?
    • 为什么要把时间推理和空间落点分开做?
    • 只用离线数据训练的模型,能用在线上交互环境吗?
    • 数据继续扩大还有收益吗?
    • 这个方法有什么风险或代价?
  • 参考链接

论文基本信息

项目内容
标题(英文)Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
标题(中文)从无标注视频到 1200 万条 GUI 交互轨迹
作者Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li†, Hao Tian†
机构北京大学 计算机学院 · 多媒体信息处理全国重点实验室 · 小米 LLM-Core · 香港大学 · 中国人民大学
会议ICML 2026(PMLR v306)
arXivhttps://arxiv.org/abs/2605.14747
项目网站https://weiminxiong.github.io/Video2GUI/

背景与动机:GUI 智能体的天花板为什么是数据?

GUI 智能体要跨网页、桌面与移动端完成任务,前提是模型见过足够多真实用户的操作轨迹。论文把交互形式化为 POMDP,智能体 π_θ 在时刻 $t$ 依据交互历史 $e_{t-1} = (u, a_1, o_1, \ldots, a_{t-1}, o_{t-1})$ 选择动作 $a_t = (\tau_t, b_t)$,其中 $\tau_t$ 是动作类型、$b_t$ 是坐标或输入文本等参数。要学好这个策略,数据必须同时满足三个条件:规模大、平台广、动作带精确空间落点。

而现有数据供给的两条路线各自卡死在不同的瓶颈上:

  • 人工标注与模拟环境:质量高但成本不可扩展。AITW 提供 30,378 条指令与 715,142 张图,AndroidControl 有 14,538 条指令,GUI-Odyssey 只有 7,735 条;模拟环境如 OSWorld 覆盖 369 个真实桌面任务,但环境数受限于人工搭建。
  • 从网络视频挖掘:TongUI 用前后景检测、VideoAgentTrek 用逆动力学,证明视频可以挖,但它们依赖低层视觉线索与短期推断,并且检索环节依赖人工枚举关键词,规模普遍停留在十万级、以单平台为主。

论文明确指出,网络视频的巨大异质性使得"从大规模开放域集合里可靠筛出高质量 GUI 教学录屏"本身就是难题;而原始视频又缺少显式交互标注,如何抽取结构化动作并精确落点到屏幕坐标,同样没有现成答案。这张表把 WildGUI 与既有数据集的差距摆得很清楚:

数据集平台覆盖环境数指令/轨迹数图像数平均轮数
MiniWoB++Web+Mobile11410017,9713.6
MIND2WEBWeb1372,3502,3507.3
AITWMobile35730,378715,1426.5
AndroidControlMobile83314,53815,2834.8
GUI-OdysseyMobile2017,735118,79115.4
GUI-NetWeb+Mobile+Desktop2801M1M4.7
WildGUI(本文)Web+Mobile+Desktop1,500+12.7M124.5M9.7

从附录的历史视角看,这正是数据供给的第四次迁移:2023–2024 年靠人工标注与模拟环境奠基,2024–2025 年 UI-TARS、Aguvis 把 HTML 解析换成像素级推理但数据仍靠人工采集,2025 年 TongUI 与 VideoAgentTrek 证明视频可挖,2026 年本文用元数据分类器取代关键词检索,把规模推到千万级。

图 1:WildGUI 的数据分布——平台、软件类别与网站类别的构成,多样性来自元数据分类器的自动检索而非人工枚举关键词

研究主线:从问题到结论

图 12:Video2GUI 研究主线——从数据瓶颈出发,经两级过滤、轨迹抽取与空间落点建成 WildGUI,再以两阶段训练验证其泛化价值(Mermaid 流程图)

基准/方法设计:一条三段式数据流水线

论文给出的答案是 Video2GUI:一个把原始互联网视频转成结构化交互轨迹 $\mathcal{D}={(u,e)^{(i)}}$ 的全自动框架。它由三段渐进式流水线组成,输出的是可直接用于训练的"指令–轨迹"序列。

图 13:GUI 预训练数据供给的四条路线——本文属于第四条,也是唯一同时做到千万级规模与跨三平台覆盖的一条(Mermaid 分类图)

三段流水线各自解决一个层面的问题:

  1. 粗到细视频过滤:先在元数据层面做低成本粗筛,再用内容级模型做细筛。前者保证规模可行,后者保证质量可用。
  2. 轨迹抽取:把视频转成"任务指令 + 操作时间戳 + 动作类型 + 动作理由"的结构化序列,并额外输出界面对齐友好的低层落点指令。
  3. 动作空间落点:把低层指令映射到精确的 UI 目标(坐标或包围盒),补上原始视频帧因压缩而缺失的像素级精度。

图 2:Video2GUI 流水线——(A) 粗到细视频过滤;(B) 轨迹抽取把视频片段转成指令–轨迹序列;(C) 动作空间落点把低层指令映射到精确 UI 目标

分类全景与方法细节:每一环都选"够用的最强"

元数据分类器(粗筛)。论文先用 DeepSeek-V3 标注 1 万条元数据样本(约 400 条正例、9K 条负例),再做上采样平衡,给 Qwen2.5-7B 挂一个二分类头,用交叉熵、学习率 $2\times10^{-5}$ 训练 3 个 epoch。分类器只需输入标题、描述、关键词、频道名、分类与字幕,就能把5 亿条元数据压到约 2,000 万候选——这是整条流水线里性价比最高的一环,避免了下载数百 PB 视频的存储与算力开销。

视频质量打分器(细筛)。元数据过滤无法识别"只有软件介绍或广告、或者录屏分辨率低"的视频,因此论文改用 Qwen2.5-Omni 做内容级打分:从每个候选视频取第一分钟,在主题相关、指令清晰、录屏质量三个维度打分,用 200 小时 Gemini-3-Pro 标注数据以 MSE 损失训练三个回归头。三维分数均需 ≥ 4.2 才保留,最终从 2,000 万候选筛到416 万条视频、约 30 万小时。

图 3:视频质量打分器在测试集上的表现——主题相关、指令清晰、录屏质量三个维度与人工标注高度一致,是细筛阶段的质量守门人

轨迹抽取与空间落点。抽取阶段由 Gemini-3-Pro 承担,采用4 分钟滑窗 + 历史记忆策略:处理第 $j$ 段时,把前序段落的抽取结果 $\mathcal{D}(S_{1:j-1})$ 作为文本上下文一并输入,因此跨越分段边界的任务、依赖前序操作的任务都不会断链。落点阶段则对每个动作取 $t-0.5$s、$t$、$t+0.5$s 三帧原分辨率截图,逐帧判断该动作能否在当前帧被定位,取第一个成功的结果;三帧全部失败就丢弃该动作。这种设计把"时间推理"与"空间定位"解耦,人工抽检 200 条随机动作,落点准确率超过 95%。

两阶段训练。Stage 1 在 WildGUI 上做持续预训练,混合三个互补目标:$\mathcal{L}{ground}$ 训练 UI 元素定位、$\mathcal{L}{action}$ 训练单帧动作预测、$\mathcal{L}{traj}$ 训练多轮交互建模,总目标为 $\mathcal{L}{pretrain} = \mathcal{L}{ground} + \mathcal{L}{action} + \mathcal{L}_{traj}$。Stage 2 再在 Rico、SeeClickWeb、OSWorld 系列、AndroidControl、AITW、GUI-Odyssey 等精选开源数据上做后训练。实现上用 Megatron 做分布式训练,AdamW 加余弦学习率,最大视觉 token 4,096、序列长度 32,768;Stage 1 训练 24,000 步、约 2,000 亿 token,Stage 2 训练 3 个 epoch、2,000 步、约 150 亿 token,总算力为 256 张 NVIDIA GPU。

实验设计与结果:7B 模型追平 32B

评测分三类。GUI grounding用 ScreenSpot-Pro(1,581 个专家标注任务、23 个专业应用、3 个操作系统)与 OSWorld-G(564 个样本,覆盖文本匹配、元素识别、布局理解、细粒度操作);离线智能体用 AndroidControl 的高/低两层加中文界面的 CAGUI;线上智能体用 OSWorld 的 369 个真实桌面任务与 AndroidWorld 的 116 个任务。骨干是 Qwen2.5-VL-7B 与 Mimo-VL-7B,均走完整两阶段训练。

模型ScreenSpot-ProΔOSWorld-GΔ
Qwen2.5-VL-7B26.8—27.3—
+ WildGUI41.9+15.153.7+26.4
Mimo-VL-7B41.2—54.7—
+ WildGUI56.9+15.767.6+12.9
Qwen3-VL-32B54.9—60.6—
Seed1.5-VL60.9—62.9—
模型AC-Low 类型准确率AC-Low 步级成功率AC-High 步级成功率CAGUI 类型准确率CAGUI 步级成功率
UI-TARS-7B98.090.872.588.670.3
Qwen2.5-VL-7B94.185.062.974.255.2
+ WildGUI94.990.364.588.365.4
Mimo-VL-7B92.987.965.682.263.4
+ WildGUI95.591.871.490.371.0

消融实验(Mimo-VL-7B)则说明三个预训练目标各司其职:

设置ScreenSpot-ProCAGUIAndroidWorld
完整方案56.971.031.9
w/o $\mathcal{L}_{ground}$49.869.828.4
w/o $\mathcal{L}_{action}$50.565.327.6
w/o $\mathcal{L}_{traj}$54.670.224.1
w/o Stage 149.364.223.3
w/o Stage 228.245.76.0

去掉 $\mathcal{L}{traj}$ 后静态任务几乎不掉(54.6)但 AndroidWorld 崩到 24.1,说明轨迹建模是长程规划的关键;去掉 $\mathcal{L}{ground}$ 则 grounding 掉到 49.8,验证了显式落点监督的必要性;而完全没有 Stage 2 时全面崩塌,AndroidWorld 只剩 6.0。

图 4:预训练数据规模的影响——token 从 0 增至 2,000 亿,ScreenSpot-Pro 由约 41% 升至 56.9%、OSWorld-G 由约 55% 升至 67.6%,约 500 亿 token 后即超越仅做 Stage 2 的基线

图 5:线上评测——加入 WildGUI 的 Stage 1 预训练后,桌面端 OSWorld 与移动端 AndroidWorld 均优于仅用开源数据后训练的基线

图 6:人工评测平均分——视频质量随过滤级别从 1.22 升到 2.12 再到 4.45;轨迹质量 WildGUI 达 4.62,高于 TongUI 的 3.35 与 VideoAgentTrek 的 4.05

附录数据统计与定性案例

附录的统计进一步支撑了上面的结论。WildGUI 的过滤漏斗是:5 亿条元数据 → 约 2,000 万候选 → 416 万条高质量视频(约 30 万小时)→ 1,270 万条轨迹,平均每条轨迹 9.7 轮,并覆盖 1,500 多个应用与网站。与既有数据集横向对比,它在轨迹数与平台覆盖上同时领先,也是少数同时覆盖网站、移动与桌面三类平台的预训练数据集。

图 7:WildGUI 数据统计——视频时长分布、轨迹步数分布,以及桌面 (c) 与移动 (d) 环境的动作类型分布

动作空间方面,论文沿用 OSWorld 与 CAGUI 的规范,为桌面定义 13 类动作(click、doubleClick、rightClick、press、input、hotkey、scroll、drag、moveTo、wait、finished 等),为移动定义 10 类(click、longpress、pinch、input、drag、open、multi_touch、finished 等)。附录中的定性案例展示了抽取得到的真实轨迹:

图 8:WildGUI 示例轨迹——每一步都能与具体时间戳和界面状态对齐,这是它能作为预训练监督信号的前提

图 9:WildGUI 示例轨迹——每步同时给出语义层面的低层描述与空间层面的落点坐标

图 10:WildGUI 示例轨迹——桌面专业软件场景下的交互序列,体现流水线对复杂界面的覆盖能力

图 11:WildGUI 示例轨迹——移动端场景下的交互序列,两套动作空间分开建模使同一数据集可服务两类平台

结果对比总结

图 14:从基座到 WildGUI——grounding 追平 32B 模型,线上成功率近乎翻倍(Mermaid 对比图)

关键发现

  1. 数据规模的确带来了跨平台泛化:Qwen2.5-VL-7B 在 ScreenSpot-Pro 上从 26.8 提升到 41.9(+15.1),在 OSWorld-G 上从 27.3 提升到 53.7(+26.4);Mimo-VL-7B 对应从 41.2 到 56.9、从 54.7 到 67.6。7B 规模靠数据补齐了与 32B 模型之间的参数量差距。
  2. 纯离线数据能迁移到需要闭环交互的线上环境:AndroidWorld 成功率从基座 16.4% 经仅 Stage 2 的 23.3%,提升到完整两阶段的 31.9%,几乎翻倍;OSWorld 从 10.4% 提升到 12.3%。这说明模型学到的是可迁移的界面操作先验,而非对特定环境的过拟合。
  3. 扩展曲线在 2,000 亿 token 处仍未见饱和:ScreenSpot-Pro 从约 41% 升到 56.9%,OSWorld-G 从约 55% 升到 67.6%,且大约在 500 亿 token 处就超过了仅做后训练的基线,之后持续上升——这为"继续扩数据"提供了直接依据。
  4. 中英文界面同时受益:CAGUI 中文界面下,Mimo-VL-7B 的类型准确率从 82.2% 提升到 90.3%,Qwen2.5-VL-7B 从 74.2% 提升到 88.3%,说明跨语言泛化并未被单语视频源限制。
  5. 三个监督目标各自承载一种能力:$\mathcal{L}{traj}$ 支撑长程规划(去掉后 AndroidWorld 31.9→24.1),$\mathcal{L}{ground}$ 支撑落点精度(去掉后 56.9→49.8),$\mathcal{L}_{action}$ 支撑单步决策(去掉后 CAGUI 71.0→65.3)。数据侧的三个目标都对应了明确的失败模式。
  6. 数据质量经过了独立验证:人工评测中,视频质量随过滤级别从 1.22 升到 2.12 再到 4.45,轨迹质量 4.62 高于 TongUI 的 3.35 与 VideoAgentTrek 的 4.05,五位标注员的 Krippendorff α 为 0.84,且落点人工抽检准确率超过 95%。论文的贡献重心落在可复用基础设施、跨领域适用性与大规模受控实验上,这也解释了它为何能拿到高评价。

局限性

  • 数据源单一:元数据与视频全部来自 YouTube,跨语言、跨地区的平台偏差没有被量化;1,500 多个应用相对真实软件生态仍然只是长尾的一小片。
  • 强依赖闭源标注器:轨迹抽取与空间落点的核心标注都使用 Gemini-3-Pro,单样本 API 成本约0.0763 美元(轨迹抽取 0.0653 + 落点 0.011,视频打分由自建 Qwen2.5-Omni 承担)。一旦标注模型升级或下线,复现性与成本都会受影响。
  • 验证是抽样而非全量:落点准确率来自 200 条随机动作,数据质量来自 5 位标注员、300 条样本,规模放大之后仍存在未量化的噪声。
  • 线上成功率仍然很低:即使完整两阶段,OSWorld 也仅 12.3%、AndroidWorld 为 31.9%,距离可用部署仍有明显差距。作者把"扩大离线交互数据 + 后续在线强化学习"作为下一步路径。
  • 写作层面也有可改进之处:论文用"让步转折 → 瓶颈命名 → 承诺兑现"的叙事弧推进,证据框架与新颖性立场都很强("consistent improvements of 5–20%"、"we propose Video2GUI"),但正文中 Qwen2.5-VL 在 ScreenSpot-Pro 的提升一处写作 41.2、主表为 41.9,图题把方法名写成 "VideoGUI"(漏掉数字 2),另有一处 "improves improves" 的重复词。

常见问题(FAQ)

Video2GUI 的核心贡献是什么?

一句话:把 GUI 预训练数据的获取从"人工关键词检索 + 人工标注"换成"元数据分类器 + 多模态模型标注",从而在成本可控的前提下把规模推到互联网级。产物是一套可复用的三段式流水线,以及 1,270 万条轨迹、1.245 亿张截图的 WildGUI 数据集。

WildGUI 到底有多大?

从 5 亿条 YouTube 元数据出发,经元数据粗筛留下约 2,000 万候选,再用视频质量打分器筛出 416 万条视频(约 30 万小时),最终产出 1,270 万条交互轨迹与 1.245 亿张截图,覆盖 1,500 多个应用与网站,平均每条轨迹 9.7 轮。横向看,它的轨迹规模约为 GUI-Net 的 12 倍、AndroidControl 的 800 倍以上。

为什么要把时间推理和空间落点分开做?

因为长视频输入必须压缩帧以满足上下文长度,压缩后的帧不足以支撑像素级定位。论文的做法是:让 Gemini-3-Pro 在压缩视频上判断"发生了什么",再回到 $t-0.5$s、$t$、$t+0.5$s 三帧原分辨率截图上去定位"点在哪儿"。这样既保住了长程理解,又拿到了精确坐标——人工抽检 200 条动作的落点准确率超过 95%。

只用离线数据训练的模型,能用在线上交互环境吗?

实验证明可以,而且增益明显。AndroidWorld 的端到端成功率从基座 16.4% 提升到 31.9%,OSWorld 从 10.4% 提升到 12.3%,两者都优于只用开源数据做后训练的基线。论文的解释是:WildGUI 提供的是可迁移的界面操作先验,而不是对特定环境的过拟合。

数据继续扩大还有收益吗?

有。论文的规模曲线显示,预训练 token 从 0 增到 2,000 亿时,ScreenSpot-Pro 从约 41% 升到 56.9%、OSWorld-G 从约 55% 升到 67.6%,且到 2,000 亿都没有出现饱和迹象,大约 500 亿 token 处就已超越只做后训练的基线。

这个方法有什么风险或代价?

主要是三点:一是数据源单一,全部来自 YouTube;二是核心标注强依赖 Gemini-3-Pro,约每样本 0.0763 美元;三是质量验证基于抽样(200 条动作、300 条数据),全量错误率未被量化。

参考链接

  • 论文 arXiv 摘要页:https://arxiv.org/abs/2605.14747
  • 项目主页(含数据与代码):https://weiminxiong.github.io/Video2GUI/
  • 开源仓库:https://github.com/WeiminXiong/Video2GUI
  • TongUI(从多模态网页教程构建通用 GUI 智能体):https://arxiv.org/abs/2504.12679
  • UI-TARS(原生 GUI 交互智能体):https://arxiv.org/abs/2501.12326
  • OSWorld(真实计算机环境智能体评测基准):https://arxiv.org/abs/2404.07972

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 13:17:42

合作博弈与Shapley值:综合能源系统优化调度及利益分配的MATLAB实现

简介:面向综合能源系统与电力市场方向的毕业设计,这里提供一套基于合作博弈的综合能源系统利益分配优化调度MATLAB源程序。代码覆盖P2G电转气、碳捕集、燃气轮机、热储能等设备建模,并实现三方主体合作联盟构建,利用Shapley值法对…

作者头像 李华
网站建设 2026/10/3 13:17:33

el-cascader懒加载动态加载:触发机制、踩坑排查与封装实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/3 13:16:35

NX二次开发Python实战:如何计算包络尺寸与坯料尺寸

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/3 13:16:28

DRV8818+STM32L4S5ZI工业级步进电机闭环控制方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/3 13:16:01

Orin NX系统迁移实录:从整盘克隆到环境重建的完整路线

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/3 13:14:35

基于fMRI分析思路的宽场光学成像数据处理工具箱

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华