MetaClaw:无需停机的“野生”进化智能体

资源入口
论文链接:
https://arxiv.org/abs/2603.17187
代码地址:
https://github.com/aiming-lab/MetaClaw?tab=readme-ov-file
2026年3月17日,一篇重磅工作悄然上线:MetaClaw: Just Talk – An Agent That Meta-Learns and Evolves in the Wild。作者团队来自 UNC-Chapel Hill、CMU、UC Santa Cruz 等顶级机构。
这不是又一个“让 LLM 代理更聪明”的工作,而是真正解决了生产级部署后代理无法持续进化的痛点。
论文标题里的“Just Talk”绝非营销噱头——用户只需正常聊天,代理就能边用边学、永不下线地自我升级。
为什么现有 LLM 代理“用着用着就废了”?
真实部署场景(如 OpenClaw 连接 20+ 消息渠道)下,任务分布会随用户需求漂移(task distribution drift)。传统方案三大致命缺陷:
记忆类(Reflexion、Mem0):只存原始轨迹,冗长且无提炼。
技能类(Voyager、ExpeL):技能库静态,与模型权重脱节。
RL 类(GRPO 等):能更新权重,但需要停机,且存在数据污染(旧轨迹奖励信号过时)。
MetaClaw 提出持续元学习框架,同时维护两个可进化部件:
元模型
:基础 LLM 策略参数(权重)
:可复用行为技能库(自然语言指令集合)
代理动作生成公式:

其中 Retrieve 通过嵌入余弦相似度动态拉取相关技能。
两大机制形成正向闭环:更好策略 → 更有信息量的失败 → 更优技能 → 更高奖励轨迹。

重点机制一:
Skill-driven Fast Adaptation
失败轨迹积累 → LLM Evolver 自动合成新技能 → 立即注入System Prompt。
核心公式:

新技能几秒生效,无需任何权重更新。
重点机制二:
Opportunistic Policy Optimization
OMLS(Opportunistic Meta-Learning Scheduler) 智能检测用户空闲(睡眠窗口 + HID空闲 + Google Calendar),触发云端LoRA + GRPO + PRM(过程奖励模型)更新θ。
核心公式:

架构亮点:
代理模式与防污染设计
它的代理架构 MetaClaw 构建在代理(Proxy)之上,拦截用户与LLM的通信。这意味着它可以适配任何OpenAI兼容的API,无需本地GPU即可实现对生产级大模型(如Kimi-2.5)的持续优化。
它还有版本化防污染设计,为了防止新策略学习旧数据导致性能回退,系统严格分离支持集(Support)和查询集(Query)数据,确保进化数据的纯净性。
实验结果
Kimi-K2.5基线21.4% → MetaClaw Full 40.6%(接近GPT-5.2),文件完成率提升8.25倍。

仅技能注入就提升复合鲁棒性18.3%。

总结
MetaClaw 标志着 Agent 部署从“发布成品”向“发布进化系统”的范式转变。它证明了Agent可以在真实世界的交互中,像生物一样通过“试错-总结-内化”的循环持续成长,真正实现了Just Talk即可进化的愿景。
这才是生产级代理的终极答案。
