GUI Universal Agent
基于 VLM + YouTube 数据飞轮的 GUI Agent 框架设计(修订版)
2026 年 4 月
1. 核心思路
将 OpenAI VPT(Video PreTraining)的训练范式从 Minecraft 迁移到 GUI 软件世界。核心创新不在架构,而在数据飞轮:通过 IDM(逆动力学模型)从海量 YouTube 教程视频中自动提取伪标注动作,覆盖市面上所有人类能操作的 GUI 软件。
与 UI-TARS(字节跳动)的核心差异:
-
UI-TARS 数据来自虚拟机自动跑任务,覆盖软件种类有限,但标注精确
-
本方案数据来自 YouTube 真实人类操作录屏,覆盖面极广(AE、PR、Blender、各类小众软件),是 UI-TARS 无法复制的数据分布
-
两者均使用 VLM 底座,架构上无本质差异;核心壁垒在数据规模与多样性
维度 UI-TARS(字节) 本方案
数据来源 虚拟机自动跑任务 YouTube 软件教程录屏
标注方式 程序直接记录(精确) IDM 推断伪标注(规模大)
软件覆盖 任务设计范围内 人类会用的所有软件
数据瓶颈 虚拟机数量 + 任务设计 YouTube 质量 + IDM 精度
架构 VLM fine-tune,单帧输入 VLM fine-tune,单帧输入
2. 系统架构
两层结构,上层决策,下层执行:
用户任务 → 上层 LLM(任务拆解 + 路由)→ 短指令 → 下层 VLA(看截图 + 执行动作)
上层 LLM
-
理解用户意图,将长任务拆解为短指令序列
-
判断每步是否需要视觉判断:可用 MCP / API 解决的直接执行,需要理解 GUI 状态的交给 VLA
-
接收 VLA 输出的置信度,低置信度时重新拆解指令粒度
下层 VLA
-
基于成熟 VLM 底座(如 Qwen-VL)fine-tune,继承基础视觉语言理解能力
-
单帧截图输入 + 文字指令 → 输出动作(坐标 + 操作类型)
-
直接预测归一化坐标,与 UI-TARS 保持一致,不引入额外检测模型
-
同时输出置信度供上层参考
3. IDM:数据飞轮的核心
逆动力学模型(Inverse Dynamics Model)解决了「有大量录屏但没有键鼠标注」的核心问题。
组件 说明
输入 [帧t] + [帧t+1] → 推断 t 时刻的键鼠动作
架构 双向 Transformer(推断动作可同时利用前后帧信息)
训练数据 少量自行录制 + pynput 记录的精确键鼠数据
用途 对海量 YouTube 视频逐帧打伪标注,无需人工标注
4. 数据工程
数据来源
-
主要来源:YouTube 软件教程视频(AE、PR、Excel、PS、Blender 等),画面清晰、操作规范
-
主播语音提供天然的语义标注(「现在我要点击这里」等)
-
少量高质量标注数据:自行录制操作 + pynput 记录键鼠,用于训练 IDM
数据处理流程
步骤 操作
Step 1 yt-dlp 按软件分类批量下载视频
Step 2 统一分辨率/帧率,过滤低质量片段(模糊、遮挡、无操作)
Step 3 用训练好的 IDM 逐帧推断伪标注动作
Step 4 过滤低置信度帧,对静止帧降采样
Step 5 按格式存储 {frames, actions, software_tag}
5. 训练流程(三阶段)
阶段一:行为克隆预训练
-
用全量 YouTube 伪标注数据在 VLM 底座上 fine-tune
-
目标:让模型学会跨软件的基本操作手感,覆盖广度是关键
-
不要求完成任务,只要求模仿人类操作的节奏
阶段二:有监督微调
-
用自行录制的高质量标注数据继续训练
-
按软件类型分别微调,少量精准数据对特定软件理解有显著提升
阶段三:强化学习微调(参考 UI-TARS 迭代训练)
-
在虚拟机环境中让模型自主跑任务,程序自动记录截图 + 动作
-
引入奖励信号:任务完成 → 正奖励;操作错误、超时 → 负奖励
-
用 VLM(如 GPT-4o)作为裁判判断任务是否完成
-
Reflection Tuning:分析失败案例,让模型从错误中学习
-
这是从「模仿」进化为「目标导向」的关键阶段
6. 模型规模建议
规模 参数量 能力 建议
小型 1B--3B 固定几个软件,泛化差 不推荐
中型 7B--13B 大多数常见软件,有泛化能力 起步推荐
大型 70B+ 强泛化,应对未见过的 GUI 验证后扩大
7. 主要挑战与应对
挑战 应对方案
IDM 伪标注噪声 置信度过滤 + 与少量精标数据混合训练
YouTube 视频质量参差 严格质量过滤:模糊、遮挡、无操作片段直接丢弃
虚拟机 RL 阶段成本 优先验证 7B 模型,跑通后再扩规模
坐标预测精度 VLM 底座视觉能力足够,参考 UI-TARS 直接预测归一化坐标
安全边界 沙盒环境测试 + 高危操作需人工确认机制
8. 核心功能:U Teach Me
用户录制一段自己的操作视频,Agent 学会这个工作流,之后可以随时复现。
核心价值:
-
现有宏录制工具(AutoHotkey 等)脆------界面稍微变化就崩。本方案有视觉理解能力,能处理界面变化、弹窗、加载等情况,鲁棒性完全不同
-
不是你学怎么用 AI,而是 AI 学你怎么工作------个人化工作流,Agent 不再在黑暗里乱猜
-
通用 GUI 能力 + 个人工作流库,两层叠加,越用越懂你
触发方式
-
主路径:用户主动触发「教我」模式,录制一段完整操作流程,意图明确,边界清晰
-
后期迭代:Agent 执行时发现不确定用户偏好,主动请求「能给我看一遍吗」
技术实现
步骤 实现方式
用户录屏 Agent 内置录屏触发,或用户上传本地视频
关键帧提取 过滤静止帧,保留有操作发生的帧
动作推断 复用 IDM 模型,逐帧推断键鼠动作序列
存储 保存为个人工作流库,附软件标签和用户描述
调用 Agent 执行任务时检索匹配的工作流,按图索骥
与 IDM 训练管道天然复用,不引入额外工程量。这个功能本身也会持续产生标注数据,反哺模型训练,形成数据飞轮闭环。
9. 核心判断
本方案与 UI-TARS 在架构上高度相似,竞争优势来自且仅来自数据层面------YouTube 覆盖的软件种类和操作多样性,是字节虚拟机方案难以复制的。
最小验证路径:
-
第一步:训练 IDM,在少量自录数据上验证伪标注质量
-
第二步:选 2-3 个 UI-TARS 表现一般的小众软件,用 YouTube 数据 fine-tune 7B 模型
-
第三步:与 UI-TARS 在同一软件上做 benchmark 对比
-
如果 YouTube 数据真的带来提升,数据飞轮的价值就得到验证,可以扩大规模
方向正确,核心壁垒在数据工程的执行质量,不在模型架构的创新。