技术博客
AI Agent

MetaClaw:无需停机的“野生”进化智能体

liam2026-07-09 14:41
MetaClaw:无需停机的“野生”进化智能体

资源入口

论文链接:

https://arxiv.org/abs/2603.17187

代码地址:

https://github.com/aiming-lab/MetaClaw?tab=readme-ov-file


2026年3月17日,一篇重磅工作悄然上线:MetaClaw: Just Talk – An Agent That Meta-Learns and Evolves in the Wild。作者团队来自 UNC-Chapel Hill、CMU、UC Santa Cruz 等顶级机构。


这不是又一个“让 LLM 代理更聪明”的工作,而是真正解决了生产级部署后代理无法持续进化的痛点。


论文标题里的“Just Talk”绝非营销噱头——用户只需正常聊天,代理就能边用边学、永不下线地自我升级。


为什么现有 LLM 代理“用着用着就废了”?


真实部署场景(如 OpenClaw 连接 20+ 消息渠道)下,任务分布会随用户需求漂移(task distribution drift)。传统方案三大致命缺陷:

  • 记忆类(Reflexion、Mem0):只存原始轨迹,冗长且无提炼。

  • 技能类(Voyager、ExpeL):技能库静态,与模型权重脱节。

  • RL 类(GRPO 等):能更新权重,但需要停机,且存在数据污染(旧轨迹奖励信号过时)。


MetaClaw 提出持续元学习框架,同时维护两个可进化部件:

元模型 

  • :基础 LLM 策略参数(权重)

  • :可复用行为技能库(自然语言指令集合)


代理动作生成公式:

其中 Retrieve 通过嵌入余弦相似度动态拉取相关技能。


两大机制形成正向闭环:更好策略 → 更有信息量的失败 → 更优技能 → 更高奖励轨迹。




重点机制一:

Skill-driven Fast Adaptation


失败轨迹积累 → LLM Evolver 自动合成新技能 → 立即注入System Prompt


核心公式:

新技能几秒生效,无需任何权重更新。



重点机制二:

Opportunistic Policy Optimization


OMLS(Opportunistic Meta-Learning Scheduler) 智能检测用户空闲(睡眠窗口 + HID空闲 + Google Calendar),触发云端LoRA + GRPO + PRM(过程奖励模型)更新θ。


核心公式:



架构亮点:

代理模式与防污染设计


它的代理架构 MetaClaw 构建在代理(Proxy)之上,拦截用户与LLM的通信。这意味着它可以适配任何OpenAI兼容的API,无需本地GPU即可实现对生产级大模型(如Kimi-2.5)的持续优化。


它还有版本化防污染设计,为了防止新策略学习旧数据导致性能回退,系统严格分离支持集(Support)和查询集(Query)数据,确保进化数据的纯净性。



实验结果


Kimi-K2.5基线21.4% → MetaClaw Full 40.6%(接近GPT-5.2),文件完成率提升8.25倍



仅技能注入就提升复合鲁棒性18.3%。




总结


MetaClaw 标志着 Agent 部署从“发布成品”向“发布进化系统”的范式转变。它证明了Agent可以在真实世界的交互中,像生物一样通过“试错-总结-内化”的循环持续成长,真正实现了Just Talk即可进化的愿景。


这才是生产级代理的终极答案。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发