Skip to content
This repository was archived by the owner on Jul 26, 2026. It is now read-only.

Repository files navigation

GUI Universal Agent

基于 VLM + YouTube 数据飞轮的 GUI Agent 框架设计(修订版)

2026 年 4 月

1. 核心思路

将 OpenAI VPT(Video PreTraining)的训练范式从 Minecraft 迁移到 GUI 软件世界。核心创新不在架构,而在数据飞轮:通过 IDM(逆动力学模型)从海量 YouTube 教程视频中自动提取伪标注动作,覆盖市面上所有人类能操作的 GUI 软件。

与 UI-TARS(字节跳动)的核心差异:

  • UI-TARS 数据来自虚拟机自动跑任务,覆盖软件种类有限,但标注精确

  • 本方案数据来自 YouTube 真实人类操作录屏,覆盖面极广(AE、PR、Blender、各类小众软件),是 UI-TARS 无法复制的数据分布

  • 两者均使用 VLM 底座,架构上无本质差异;核心壁垒在数据规模与多样性


维度 UI-TARS(字节) 本方案

数据来源 虚拟机自动跑任务 YouTube 软件教程录屏

标注方式 程序直接记录(精确) IDM 推断伪标注(规模大)

软件覆盖 任务设计范围内 人类会用的所有软件

数据瓶颈 虚拟机数量 + 任务设计 YouTube 质量 + IDM 精度

架构 VLM fine-tune,单帧输入 VLM fine-tune,单帧输入


2. 系统架构

两层结构,上层决策,下层执行:

用户任务 → 上层 LLM(任务拆解 + 路由)→ 短指令 → 下层 VLA(看截图 + 执行动作)

上层 LLM

  • 理解用户意图,将长任务拆解为短指令序列

  • 判断每步是否需要视觉判断:可用 MCP / API 解决的直接执行,需要理解 GUI 状态的交给 VLA

  • 接收 VLA 输出的置信度,低置信度时重新拆解指令粒度

下层 VLA

  • 基于成熟 VLM 底座(如 Qwen-VL)fine-tune,继承基础视觉语言理解能力

  • 单帧截图输入 + 文字指令 → 输出动作(坐标 + 操作类型)

  • 直接预测归一化坐标,与 UI-TARS 保持一致,不引入额外检测模型

  • 同时输出置信度供上层参考

3. IDM:数据飞轮的核心

逆动力学模型(Inverse Dynamics Model)解决了「有大量录屏但没有键鼠标注」的核心问题。


组件 说明

输入 [帧t] + [帧t+1] → 推断 t 时刻的键鼠动作

架构 双向 Transformer(推断动作可同时利用前后帧信息)

训练数据 少量自行录制 + pynput 记录的精确键鼠数据

用途 对海量 YouTube 视频逐帧打伪标注,无需人工标注


4. 数据工程

数据来源

  • 主要来源:YouTube 软件教程视频(AE、PR、Excel、PS、Blender 等),画面清晰、操作规范

  • 主播语音提供天然的语义标注(「现在我要点击这里」等)

  • 少量高质量标注数据:自行录制操作 + pynput 记录键鼠,用于训练 IDM

数据处理流程


步骤 操作

Step 1 yt-dlp 按软件分类批量下载视频

Step 2 统一分辨率/帧率,过滤低质量片段(模糊、遮挡、无操作)

Step 3 用训练好的 IDM 逐帧推断伪标注动作

Step 4 过滤低置信度帧,对静止帧降采样

Step 5 按格式存储 {frames, actions, software_tag}


5. 训练流程(三阶段)

阶段一:行为克隆预训练

  • 用全量 YouTube 伪标注数据在 VLM 底座上 fine-tune

  • 目标:让模型学会跨软件的基本操作手感,覆盖广度是关键

  • 不要求完成任务,只要求模仿人类操作的节奏

阶段二:有监督微调

  • 用自行录制的高质量标注数据继续训练

  • 按软件类型分别微调,少量精准数据对特定软件理解有显著提升

阶段三:强化学习微调(参考 UI-TARS 迭代训练)

  • 在虚拟机环境中让模型自主跑任务,程序自动记录截图 + 动作

  • 引入奖励信号:任务完成 → 正奖励;操作错误、超时 → 负奖励

  • 用 VLM(如 GPT-4o)作为裁判判断任务是否完成

  • Reflection Tuning:分析失败案例,让模型从错误中学习

  • 这是从「模仿」进化为「目标导向」的关键阶段

6. 模型规模建议


规模 参数量 能力 建议

小型 1B--3B 固定几个软件,泛化差 不推荐

中型 7B--13B 大多数常见软件,有泛化能力 起步推荐

大型 70B+ 强泛化,应对未见过的 GUI 验证后扩大


7. 主要挑战与应对


挑战 应对方案

IDM 伪标注噪声 置信度过滤 + 与少量精标数据混合训练

YouTube 视频质量参差 严格质量过滤:模糊、遮挡、无操作片段直接丢弃

虚拟机 RL 阶段成本 优先验证 7B 模型,跑通后再扩规模

坐标预测精度 VLM 底座视觉能力足够,参考 UI-TARS 直接预测归一化坐标

安全边界 沙盒环境测试 + 高危操作需人工确认机制


8. 核心功能:U Teach Me

用户录制一段自己的操作视频,Agent 学会这个工作流,之后可以随时复现。

核心价值:

  • 现有宏录制工具(AutoHotkey 等)脆------界面稍微变化就崩。本方案有视觉理解能力,能处理界面变化、弹窗、加载等情况,鲁棒性完全不同

  • 不是你学怎么用 AI,而是 AI 学你怎么工作------个人化工作流,Agent 不再在黑暗里乱猜

  • 通用 GUI 能力 + 个人工作流库,两层叠加,越用越懂你

触发方式

  • 主路径:用户主动触发「教我」模式,录制一段完整操作流程,意图明确,边界清晰

  • 后期迭代:Agent 执行时发现不确定用户偏好,主动请求「能给我看一遍吗」

技术实现


步骤 实现方式

用户录屏 Agent 内置录屏触发,或用户上传本地视频

关键帧提取 过滤静止帧,保留有操作发生的帧

动作推断 复用 IDM 模型,逐帧推断键鼠动作序列

存储 保存为个人工作流库,附软件标签和用户描述

调用 Agent 执行任务时检索匹配的工作流,按图索骥


与 IDM 训练管道天然复用,不引入额外工程量。这个功能本身也会持续产生标注数据,反哺模型训练,形成数据飞轮闭环。

9. 核心判断

本方案与 UI-TARS 在架构上高度相似,竞争优势来自且仅来自数据层面------YouTube 覆盖的软件种类和操作多样性,是字节虚拟机方案难以复制的。

最小验证路径:

  • 第一步:训练 IDM,在少量自录数据上验证伪标注质量

  • 第二步:选 2-3 个 UI-TARS 表现一般的小众软件,用 YouTube 数据 fine-tune 7B 模型

  • 第三步:与 UI-TARS 在同一软件上做 benchmark 对比

  • 如果 YouTube 数据真的带来提升,数据飞轮的价值就得到验证,可以扩大规模

方向正确,核心壁垒在数据工程的执行质量,不在模型架构的创新。

About

A GUI Agent based on IDM & OpenAI VPT.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Contributors

Languages