摘要
本文解读 ICML 2026 论文《Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining》。该论文提出Video2GUI 全自动数据合成框架与 WildGUI 大规模预训练数据集,通过融合元数据粗筛 + 视频质量细筛的两级过滤、VLM 驱动的轨迹抽取与三帧原分辨率动作空间落点,把"人工关键词检索 + 人工标注"替换为"元数据分类器 + 多模态模型标注",其特别之处在于把时间推理与空间落点显式解耦——被压缩的视频帧只用于判断"发生了什么",坐标一律来自未被压缩的高分辨率截图。实验表明在 WildGUI 上持续预训练后,Qwen2.5-VL-7B 与 Mimo-VL-7B 在四类基准上一致提升 5–20%,Mimo-VL-7B 的 OSWorld-G 平均分达 67.6,超过 320 亿参数的 Qwen3-VL-32B(60.6),AndroidWorld 端到端成功率从基座 16.4% 翻倍到 31.9%,为 GUI 智能体的规模化数据供给提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机:GUI 智能体的天花板为什么是数据?
- 研究主线:从问题到结论
- 基准/方法设计:一条三段式数据流水线
- 分类全景与方法细节:每一环都选"够用的最强"
- 实验设计与结果:7B 模型追平 32B
- 附录数据统计与定性案例
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- Video2GUI 的核心贡献是什么?
- WildGUI 到底有多大?
- 为什么要把时间推理和空间落点分开做?
- 只用离线数据训练的模型,能用在线上交互环境吗?
- 数据继续扩大还有收益吗?
- 这个方法有什么风险或代价?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining |
| 标题(中文) | 从无标注视频到 1200 万条 GUI 交互轨迹 |
| 作者 | Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li†, Hao Tian† |
| 机构 | 北京大学 计算机学院 · 多媒体信息处理全国重点实验室 · 小米 LLM-Core · 香港大学 · 中国人民大学 |
| 会议 | ICML 2026(PMLR v306) |
| arXiv | https://arxiv.org/abs/2605.14747 |
| 项目网站 | https://weiminxiong.github.io/Video2GUI/ |
背景与动机:GUI 智能体的天花板为什么是数据?
GUI 智能体要跨网页、桌面与移动端完成任务,前提是模型见过足够多真实用户的操作轨迹。论文把交互形式化为 POMDP,智能体 π_θ 在时刻 $t$ 依据交互历史 $e_{t-1} = (u, a_1, o_1, \ldots, a_{t-1}, o_{t-1})$ 选择动作 $a_t = (\tau_t, b_t)$,其中 $\tau_t$ 是动作类型、$b_t$ 是坐标或输入文本等参数。要学好这个策略,数据必须同时满足三个条件:规模大、平台广、动作带精确空间落点。
而现有数据供给的两条路线各自卡死在不同的瓶颈上:
- 人工标注与模拟环境:质量高但成本不可扩展。AITW 提供 30,378 条指令与 715,142 张图,AndroidControl 有 14,538 条指令,GUI-Odyssey 只有 7,735 条;模拟环境如 OSWorld 覆盖 369 个真实桌面任务,但环境数受限于人工搭建。
- 从网络视频挖掘:TongUI 用前后景检测、VideoAgentTrek 用逆动力学,证明视频可以挖,但它们依赖低层视觉线索与短期推断,并且检索环节依赖人工枚举关键词,规模普遍停留在十万级、以单平台为主。
论文明确指出,网络视频的巨大异质性使得"从大规模开放域集合里可靠筛出高质量 GUI 教学录屏"本身就是难题;而原始视频又缺少显式交互标注,如何抽取结构化动作并精确落点到屏幕坐标,同样没有现成答案。这张表把 WildGUI 与既有数据集的差距摆得很清楚:
| 数据集 | 平台覆盖 | 环境数 | 指令/轨迹数 | 图像数 | 平均轮数 |
|---|---|---|---|---|---|
| MiniWoB++ | Web+Mobile | 114 | 100 | 17,971 | 3.6 |
| MIND2WEB | Web | 137 | 2,350 | 2,350 | 7.3 |
| AITW | Mobile | 357 | 30,378 | 715,142 | 6.5 |
| AndroidControl | Mobile | 833 | 14,538 | 15,283 | 4.8 |
| GUI-Odyssey | Mobile | 201 | 7,735 | 118,791 | 15.4 |
| GUI-Net | Web+Mobile+Desktop | 280 | 1M | 1M | 4.7 |
| WildGUI(本文) | Web+Mobile+Desktop | 1,500+ | 12.7M | 124.5M | 9.7 |
从附录的历史视角看,这正是数据供给的第四次迁移:2023–2024 年靠人工标注与模拟环境奠基,2024–2025 年 UI-TARS、Aguvis 把 HTML 解析换成像素级推理但数据仍靠人工采集,2025 年 TongUI 与 VideoAgentTrek 证明视频可挖,2026 年本文用元数据分类器取代关键词检索,把规模推到千万级。
图 1:WildGUI 的数据分布——平台、软件类别与网站类别的构成,多样性来自元数据分类器的自动检索而非人工枚举关键词
研究主线:从问题到结论
图 12:Video2GUI 研究主线——从数据瓶颈出发,经两级过滤、轨迹抽取与空间落点建成 WildGUI,再以两阶段训练验证其泛化价值(Mermaid 流程图)
基准/方法设计:一条三段式数据流水线
论文给出的答案是 Video2GUI:一个把原始互联网视频转成结构化交互轨迹 $\mathcal{D}={(u,e)^{(i)}}$ 的全自动框架。它由三段渐进式流水线组成,输出的是可直接用于训练的"指令–轨迹"序列。
图 13:GUI 预训练数据供给的四条路线——本文属于第四条,也是唯一同时做到千万级规模与跨三平台覆盖的一条(Mermaid 分类图)
三段流水线各自解决一个层面的问题:
- 粗到细视频过滤:先在元数据层面做低成本粗筛,再用内容级模型做细筛。前者保证规模可行,后者保证质量可用。
- 轨迹抽取:把视频转成"任务指令 + 操作时间戳 + 动作类型 + 动作理由"的结构化序列,并额外输出界面对齐友好的低层落点指令。
- 动作空间落点:把低层指令映射到精确的 UI 目标(坐标或包围盒),补上原始视频帧因压缩而缺失的像素级精度。
图 2:Video2GUI 流水线——(A) 粗到细视频过滤;(B) 轨迹抽取把视频片段转成指令–轨迹序列;(C) 动作空间落点把低层指令映射到精确 UI 目标
分类全景与方法细节:每一环都选"够用的最强"
元数据分类器(粗筛)。论文先用 DeepSeek-V3 标注 1 万条元数据样本(约 400 条正例、9K 条负例),再做上采样平衡,给 Qwen2.5-7B 挂一个二分类头,用交叉熵、学习率 $2\times10^{-5}$ 训练 3 个 epoch。分类器只需输入标题、描述、关键词、频道名、分类与字幕,就能把5 亿条元数据压到约 2,000 万候选——这是整条流水线里性价比最高的一环,避免了下载数百 PB 视频的存储与算力开销。
视频质量打分器(细筛)。元数据过滤无法识别"只有软件介绍或广告、或者录屏分辨率低"的视频,因此论文改用 Qwen2.5-Omni 做内容级打分:从每个候选视频取第一分钟,在主题相关、指令清晰、录屏质量三个维度打分,用 200 小时 Gemini-3-Pro 标注数据以 MSE 损失训练三个回归头。三维分数均需 ≥ 4.2 才保留,最终从 2,000 万候选筛到416 万条视频、约 30 万小时。
图 3:视频质量打分器在测试集上的表现——主题相关、指令清晰、录屏质量三个维度与人工标注高度一致,是细筛阶段的质量守门人
轨迹抽取与空间落点。抽取阶段由 Gemini-3-Pro 承担,采用4 分钟滑窗 + 历史记忆策略:处理第 $j$ 段时,把前序段落的抽取结果 $\mathcal{D}(S_{1:j-1})$ 作为文本上下文一并输入,因此跨越分段边界的任务、依赖前序操作的任务都不会断链。落点阶段则对每个动作取 $t-0.5$s、$t$、$t+0.5$s 三帧原分辨率截图,逐帧判断该动作能否在当前帧被定位,取第一个成功的结果;三帧全部失败就丢弃该动作。这种设计把"时间推理"与"空间定位"解耦,人工抽检 200 条随机动作,落点准确率超过 95%。
两阶段训练。Stage 1 在 WildGUI 上做持续预训练,混合三个互补目标:$\mathcal{L}{ground}$ 训练 UI 元素定位、$\mathcal{L}{action}$ 训练单帧动作预测、$\mathcal{L}{traj}$ 训练多轮交互建模,总目标为 $\mathcal{L}{pretrain} = \mathcal{L}{ground} + \mathcal{L}{action} + \mathcal{L}_{traj}$。Stage 2 再在 Rico、SeeClickWeb、OSWorld 系列、AndroidControl、AITW、GUI-Odyssey 等精选开源数据上做后训练。实现上用 Megatron 做分布式训练,AdamW 加余弦学习率,最大视觉 token 4,096、序列长度 32,768;Stage 1 训练 24,000 步、约 2,000 亿 token,Stage 2 训练 3 个 epoch、2,000 步、约 150 亿 token,总算力为 256 张 NVIDIA GPU。
实验设计与结果:7B 模型追平 32B
评测分三类。GUI grounding用 ScreenSpot-Pro(1,581 个专家标注任务、23 个专业应用、3 个操作系统)与 OSWorld-G(564 个样本,覆盖文本匹配、元素识别、布局理解、细粒度操作);离线智能体用 AndroidControl 的高/低两层加中文界面的 CAGUI;线上智能体用 OSWorld 的 369 个真实桌面任务与 AndroidWorld 的 116 个任务。骨干是 Qwen2.5-VL-7B 与 Mimo-VL-7B,均走完整两阶段训练。
| 模型 | ScreenSpot-Pro | Δ | OSWorld-G | Δ |
|---|---|---|---|---|
| Qwen2.5-VL-7B | 26.8 | — | 27.3 | — |
| + WildGUI | 41.9 | +15.1 | 53.7 | +26.4 |
| Mimo-VL-7B | 41.2 | — | 54.7 | — |
| + WildGUI | 56.9 | +15.7 | 67.6 | +12.9 |
| Qwen3-VL-32B | 54.9 | — | 60.6 | — |
| Seed1.5-VL | 60.9 | — | 62.9 | — |
| 模型 | AC-Low 类型准确率 | AC-Low 步级成功率 | AC-High 步级成功率 | CAGUI 类型准确率 | CAGUI 步级成功率 |
|---|---|---|---|---|---|
| UI-TARS-7B | 98.0 | 90.8 | 72.5 | 88.6 | 70.3 |
| Qwen2.5-VL-7B | 94.1 | 85.0 | 62.9 | 74.2 | 55.2 |
| + WildGUI | 94.9 | 90.3 | 64.5 | 88.3 | 65.4 |
| Mimo-VL-7B | 92.9 | 87.9 | 65.6 | 82.2 | 63.4 |
| + WildGUI | 95.5 | 91.8 | 71.4 | 90.3 | 71.0 |
消融实验(Mimo-VL-7B)则说明三个预训练目标各司其职:
| 设置 | ScreenSpot-Pro | CAGUI | AndroidWorld |
|---|---|---|---|
| 完整方案 | 56.9 | 71.0 | 31.9 |
| w/o $\mathcal{L}_{ground}$ | 49.8 | 69.8 | 28.4 |
| w/o $\mathcal{L}_{action}$ | 50.5 | 65.3 | 27.6 |
| w/o $\mathcal{L}_{traj}$ | 54.6 | 70.2 | 24.1 |
| w/o Stage 1 | 49.3 | 64.2 | 23.3 |
| w/o Stage 2 | 28.2 | 45.7 | 6.0 |
去掉 $\mathcal{L}{traj}$ 后静态任务几乎不掉(54.6)但 AndroidWorld 崩到 24.1,说明轨迹建模是长程规划的关键;去掉 $\mathcal{L}{ground}$ 则 grounding 掉到 49.8,验证了显式落点监督的必要性;而完全没有 Stage 2 时全面崩塌,AndroidWorld 只剩 6.0。
图 4:预训练数据规模的影响——token 从 0 增至 2,000 亿,ScreenSpot-Pro 由约 41% 升至 56.9%、OSWorld-G 由约 55% 升至 67.6%,约 500 亿 token 后即超越仅做 Stage 2 的基线
图 5:线上评测——加入 WildGUI 的 Stage 1 预训练后,桌面端 OSWorld 与移动端 AndroidWorld 均优于仅用开源数据后训练的基线
图 6:人工评测平均分——视频质量随过滤级别从 1.22 升到 2.12 再到 4.45;轨迹质量 WildGUI 达 4.62,高于 TongUI 的 3.35 与 VideoAgentTrek 的 4.05
附录数据统计与定性案例
附录的统计进一步支撑了上面的结论。WildGUI 的过滤漏斗是:5 亿条元数据 → 约 2,000 万候选 → 416 万条高质量视频(约 30 万小时)→ 1,270 万条轨迹,平均每条轨迹 9.7 轮,并覆盖 1,500 多个应用与网站。与既有数据集横向对比,它在轨迹数与平台覆盖上同时领先,也是少数同时覆盖网站、移动与桌面三类平台的预训练数据集。
图 7:WildGUI 数据统计——视频时长分布、轨迹步数分布,以及桌面 (c) 与移动 (d) 环境的动作类型分布
动作空间方面,论文沿用 OSWorld 与 CAGUI 的规范,为桌面定义 13 类动作(click、doubleClick、rightClick、press、input、hotkey、scroll、drag、moveTo、wait、finished 等),为移动定义 10 类(click、longpress、pinch、input、drag、open、multi_touch、finished 等)。附录中的定性案例展示了抽取得到的真实轨迹:
图 8:WildGUI 示例轨迹——每一步都能与具体时间戳和界面状态对齐,这是它能作为预训练监督信号的前提
图 9:WildGUI 示例轨迹——每步同时给出语义层面的低层描述与空间层面的落点坐标
图 10:WildGUI 示例轨迹——桌面专业软件场景下的交互序列,体现流水线对复杂界面的覆盖能力
图 11:WildGUI 示例轨迹——移动端场景下的交互序列,两套动作空间分开建模使同一数据集可服务两类平台
结果对比总结
图 14:从基座到 WildGUI——grounding 追平 32B 模型,线上成功率近乎翻倍(Mermaid 对比图)
关键发现
- 数据规模的确带来了跨平台泛化:Qwen2.5-VL-7B 在 ScreenSpot-Pro 上从 26.8 提升到 41.9(+15.1),在 OSWorld-G 上从 27.3 提升到 53.7(+26.4);Mimo-VL-7B 对应从 41.2 到 56.9、从 54.7 到 67.6。7B 规模靠数据补齐了与 32B 模型之间的参数量差距。
- 纯离线数据能迁移到需要闭环交互的线上环境:AndroidWorld 成功率从基座 16.4% 经仅 Stage 2 的 23.3%,提升到完整两阶段的 31.9%,几乎翻倍;OSWorld 从 10.4% 提升到 12.3%。这说明模型学到的是可迁移的界面操作先验,而非对特定环境的过拟合。
- 扩展曲线在 2,000 亿 token 处仍未见饱和:ScreenSpot-Pro 从约 41% 升到 56.9%,OSWorld-G 从约 55% 升到 67.6%,且大约在 500 亿 token 处就超过了仅做后训练的基线,之后持续上升——这为"继续扩数据"提供了直接依据。
- 中英文界面同时受益:CAGUI 中文界面下,Mimo-VL-7B 的类型准确率从 82.2% 提升到 90.3%,Qwen2.5-VL-7B 从 74.2% 提升到 88.3%,说明跨语言泛化并未被单语视频源限制。
- 三个监督目标各自承载一种能力:$\mathcal{L}{traj}$ 支撑长程规划(去掉后 AndroidWorld 31.9→24.1),$\mathcal{L}{ground}$ 支撑落点精度(去掉后 56.9→49.8),$\mathcal{L}_{action}$ 支撑单步决策(去掉后 CAGUI 71.0→65.3)。数据侧的三个目标都对应了明确的失败模式。
- 数据质量经过了独立验证:人工评测中,视频质量随过滤级别从 1.22 升到 2.12 再到 4.45,轨迹质量 4.62 高于 TongUI 的 3.35 与 VideoAgentTrek 的 4.05,五位标注员的 Krippendorff α 为 0.84,且落点人工抽检准确率超过 95%。论文的贡献重心落在可复用基础设施、跨领域适用性与大规模受控实验上,这也解释了它为何能拿到高评价。
局限性
- 数据源单一:元数据与视频全部来自 YouTube,跨语言、跨地区的平台偏差没有被量化;1,500 多个应用相对真实软件生态仍然只是长尾的一小片。
- 强依赖闭源标注器:轨迹抽取与空间落点的核心标注都使用 Gemini-3-Pro,单样本 API 成本约0.0763 美元(轨迹抽取 0.0653 + 落点 0.011,视频打分由自建 Qwen2.5-Omni 承担)。一旦标注模型升级或下线,复现性与成本都会受影响。
- 验证是抽样而非全量:落点准确率来自 200 条随机动作,数据质量来自 5 位标注员、300 条样本,规模放大之后仍存在未量化的噪声。
- 线上成功率仍然很低:即使完整两阶段,OSWorld 也仅 12.3%、AndroidWorld 为 31.9%,距离可用部署仍有明显差距。作者把"扩大离线交互数据 + 后续在线强化学习"作为下一步路径。
- 写作层面也有可改进之处:论文用"让步转折 → 瓶颈命名 → 承诺兑现"的叙事弧推进,证据框架与新颖性立场都很强("consistent improvements of 5–20%"、"we propose Video2GUI"),但正文中 Qwen2.5-VL 在 ScreenSpot-Pro 的提升一处写作 41.2、主表为 41.9,图题把方法名写成 "VideoGUI"(漏掉数字 2),另有一处 "improves improves" 的重复词。
常见问题(FAQ)
Video2GUI 的核心贡献是什么?
一句话:把 GUI 预训练数据的获取从"人工关键词检索 + 人工标注"换成"元数据分类器 + 多模态模型标注",从而在成本可控的前提下把规模推到互联网级。产物是一套可复用的三段式流水线,以及 1,270 万条轨迹、1.245 亿张截图的 WildGUI 数据集。
WildGUI 到底有多大?
从 5 亿条 YouTube 元数据出发,经元数据粗筛留下约 2,000 万候选,再用视频质量打分器筛出 416 万条视频(约 30 万小时),最终产出 1,270 万条交互轨迹与 1.245 亿张截图,覆盖 1,500 多个应用与网站,平均每条轨迹 9.7 轮。横向看,它的轨迹规模约为 GUI-Net 的 12 倍、AndroidControl 的 800 倍以上。
为什么要把时间推理和空间落点分开做?
因为长视频输入必须压缩帧以满足上下文长度,压缩后的帧不足以支撑像素级定位。论文的做法是:让 Gemini-3-Pro 在压缩视频上判断"发生了什么",再回到 $t-0.5$s、$t$、$t+0.5$s 三帧原分辨率截图上去定位"点在哪儿"。这样既保住了长程理解,又拿到了精确坐标——人工抽检 200 条动作的落点准确率超过 95%。
只用离线数据训练的模型,能用在线上交互环境吗?
实验证明可以,而且增益明显。AndroidWorld 的端到端成功率从基座 16.4% 提升到 31.9%,OSWorld 从 10.4% 提升到 12.3%,两者都优于只用开源数据做后训练的基线。论文的解释是:WildGUI 提供的是可迁移的界面操作先验,而不是对特定环境的过拟合。
数据继续扩大还有收益吗?
有。论文的规模曲线显示,预训练 token 从 0 增到 2,000 亿时,ScreenSpot-Pro 从约 41% 升到 56.9%、OSWorld-G 从约 55% 升到 67.6%,且到 2,000 亿都没有出现饱和迹象,大约 500 亿 token 处就已超越只做后训练的基线。
这个方法有什么风险或代价?
主要是三点:一是数据源单一,全部来自 YouTube;二是核心标注强依赖 Gemini-3-Pro,约每样本 0.0763 美元;三是质量验证基于抽样(200 条动作、300 条数据),全量错误率未被量化。
参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2605.14747
- 项目主页(含数据与代码):https://weiminxiong.github.io/Video2GUI/
- 开源仓库:https://github.com/WeiminXiong/Video2GUI
- TongUI(从多模态网页教程构建通用 GUI 智能体):https://arxiv.org/abs/2504.12679
- UI-TARS(原生 GUI 交互智能体):https://arxiv.org/abs/2501.12326
- OSWorld(真实计算机环境智能体评测基准):https://arxiv.org/abs/2404.07972
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)