浙江大学重磅开源 ClawGUI:GUI Agent 领域首个全栈开源框架,2B 模型吊打 72B,95.8% 评测复现率终结"数据打架"时代

论文原标题:
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
论文链接:
https://arxiv.org/abs/2604.11784
项目主页:
https://zju-real.github.io/ClawGUI-Page/
代码地址:
https://github.com/ZJU-REAL/ClawGUI
Part.01
ClawGUI 的整体架构:
一个框架,三大模块

这个设计的巧思在于,作者把 GUI Agent 的开发拆成了三个阶段,每个阶段都对应一个模块,而且三个模块是打通的,你在 ClawGUI-RL 里训练出来的模型,可以直接用 ClawGUI-Eval 做标准化评测,最后通过 ClawGUI-Agent 部署到用户的手机上。
这听起来像是理所当然的事,但在此之前,整个社区里居然没有一套打通全流程的开源框架。
Part.02
ClawGUI-RL:
怎么让强化学习真正能跑起来?
为什么 GUI 的强化学习这么难?
先做一个小小的对比。你训练一个下棋的 AI,每一局结束就知道输赢,这个奖励信号很清晰。但训练一个 GUI Agent 完成"订机票"这样的任务呢?中间可能要经过 20 多个步骤,只有最后一步才知道是否成功。
更麻烦的是,你想让 20 个训练环境并行跑起来,结果跑着跑着某个安卓模拟器崩了,整个训练就乱套了;再或者你想在真实手机上训练,可是真实设备没有 root 权限,你根本无法自动判断任务是否完成。
ClawGUI-RL 就是针对这些痛点一个个解决的。

三个关键设计
第一个关键设计是"备用服务器轮换"机制
如果你跑过大规模的 RL 训练,一定遇到过这种痛苦:训练到第 20 小时,突然一个 Docker 容器卡死了,整个 rollout 队列全崩。
ClawGUI-RL 的做法很聪明:它维护一个"备用服务器队列",一旦检测到某个容器不健康,就立刻从队列里抽一个新的顶上去,被污染的任务直接迁移过去继续跑。这样训练过程就不会因为单个环境的意外而中断。这听起来像是工程小事,但对于动辄训练几天的大规模 RL 来说,就是救命稻草。
第二个关键设计是真实设备训练的支持
这是整个开源社区几乎没人做过的事情。虚拟环境当然方便,但它和真实 App 的行为其实是有偏差的,真实的微信会有实时网络延迟、真实的抖音会有登录验证、真实的淘宝会有推荐算法的随机性,这些都是模拟器无法完全复现的。
ClawGUI-RL 通过 ADB 控制器直接和真机对话,把真机也变成了训练环境的一员。只不过因为真机没有 root 权限,它没法像模拟器那样直接读数据库验证任务是否完成,所以这里用了一个多模态大模型当"裁判"(MLLM-as-judge),让它看最后一屏的截图,判断任务算不算完成。
第三个关键设计是"稠密奖励"
这是论文里最核心的技术贡献之一,值得我们花点时间理解。
为什么稠密奖励这么重要?
假设一个任务有 10 步。传统的做法(论文里叫 Binary Outcome Reward)只在最后一步给个 0 或 1。问题来了:如果第 3 步你做错了,但最后侥幸成功了,奖励是 1;如果第 3 步做对了,但最后一步失误,奖励是 0。这样的信号太粗糙,优化器根本搞不清楚哪一步做得好、哪一步做得差。
ClawGUI-RL 引入了一个 Process Reward Model(过程奖励模型,简称 PRM)。每执行一步操作,PRM 就会根据"操作前的截图 + 操作后的截图 + 历史动作序列"来判断:这一步是不是在朝着任务目标前进?然后给一个步骤级的奖励。最终的总奖励是:
有了每一步的细粒度反馈,模型就能学会区分"有效操作"和"死胡同操作"了。
Part.03
ClawGUI-Eval:
让 GUI 评测真正"可复现"
ClawGUI-Eval 的解决思路其实不复杂但很关键:把每个模型的每一个评测配置都钉死、公开,然后把整套流程拆成三个独立阶段。

Part.04
三阶段解耦设计的好处
ClawGUI-Eval 把流程拆成 Infer(推理)→ Judge(评判)→ Metric(指标)三个独立阶段。每个阶段的输入输出都被明确定义,任何一个阶段都可以独立重跑。
更妙的是,作者把所有模型的推理结果都公开了,这意味着别的研究者不需要重新跑推理,只要下载预测结果、用自己的 judge 脚本跑一遍,就能做对比实验。
Part.05
主实验结果:小模型也能打大模型
所有的框架设计最终都要用实验说话。论文训练了一个叫 ClawGUI-2B 的模型(基于 MAI-UI-2B 做 RL 训练),在 MobileWorld GUI-Only 基准上评测。

这张表里有三个很耐人寻味的观察。
观察一:基础设施直接决定了策略质量
ClawGUI-2B 和 MAI-UI-2B 用的是完全相同的基础模型权重,唯一的差别就是 ClawGUI-2B 用了 ClawGUI-RL 做了一轮 RL 训练。结果从 11.1% 拉到 17.1%,绝对提升 6 个点。这说明,在相同的模型容量下,训练基础设施的质量决定了你能把这个模型的潜力挖出多少。
观察二:训练好的小模型可以吊打没训练的大模型ClawGUI-2B 只有 2B 参数,但它打败了 Qwen3-VL-32B(11.9%)、UI-Venus-72B(16.4%),甚至比 Qwen3-VL-235B(12.8%)还强。这是一个非常重要的信号,在 GUI Agent 这个领域,"通过真实环境交互学习"比单纯堆参数更重要。
观察三:Agentic 框架是另一个赛道
你会发现 Claude-4.5 + UI-Ins-7B 这种组合能达到 47.8%,Gemini-3-Pro + UI-Ins-7B 更是到 55.6%。但这些都是闭源前沿模型配合独立定位模块的组合方案,它们不是"端到端训练的紧凑模型",和 ClawGUI-2B 属于不同的范式,不能直接对比。作者把它们单独列出来是为了说明:这两条路线是互补的,而不是竞争的。
Part.06
总结
ClawGUI 通过一个统一的开源框架把这三件事都解决了。它不是某个单点技术的突破,而是一整套工程实践的标准化。
这种"管道工"式的工作往往不如新算法那么抓人眼球,但它对领域的长期价值可能更大,因为它让后来的每一个研究者都能站在更高的起点上。
