技术博客
AI Agent

当 AI 学会自己改自己:解读 Hexo Labs 的 SIA

liam2026-07-09 14:41
当 AI 学会自己改自己:解读 Hexo Labs 的 SIA

论文链接:

https://arxiv.org/abs/2605.27276

项目主页:

https://hexolabs.com/sia

代码地址:

https://github.com/hexo-ai/sia






两个互不往来的"门派"




在 SIA 之前,自我改进的研究分成两条几乎不交叉的路线:

  • 改"外壳"派(harness / 脚手架):让一个 meta-agent 反复重写智能体的外层代码,提示词、工具分发、重试逻辑、答案解析,但模型权重一动不动。代表作有 Darwin Gödel Machine、Meta-Harness、Hyperagents。

  • 改"权重"派(测试时训练):用人工写好的强化学习流程,在测试时直接更新模型自己的参数,但外壳固定不变。代表作有 TTRL、Discover 系列。


一边锁死模型,一边锁死外壳,这就是 SIA 要弥合的裂缝。





SIA 怎么做:一个循环,两个杠杆




SIA 由三个 LLM 角色驱动:Meta-Agent(生成初始外壳)、Task-Specific Agent(真正执行任务、记录每一步)、Feedback-Agent(看完完整执行轨迹后做决定)。


关键在 Feedback-Agent。每跑完一轮,它读到的不是几个汇总数字,而是整条执行轨迹:每条提示、每个模型回复、每次工具调用、每个最终答案。然后它动态决定下一步,改外壳(权重冻结),还是更新权重(外壳冻结),若选更新权重,还会自己挑 RL 算法。


基础模型用开源的 gpt-oss-120b,权重更新走 LoRA(rank 32),两个 meta 角色用 Claude Sonnet 4.6。

值得注意的是,这两个动作不是"先改完外壳、再改权重"的固定阶段,而是可以自由交错的。





三个差异极大的任务




作者故意挑了三个八竿子打不着的领域,对比两个档位:SIA-H(只改外壳)与 SIA-W+H(外壳 + 权重)。



三个任务上,SIA-W+H 全面超过只改外壳的 SIA-H:

  • 中文罪名分类:外壳迭代搭出一个 TF-IDF + LinearSVC 流水线,停在 50.0%,之后用 PPO 更新权重,推到 70.1%。

  • GPU kernel:外壳改到 1.14× 加速就到顶,用 "熵优势加权" 更新权重后,运行时间从 12,483 µs 砍到 1,017 µs。

  • 单细胞去噪:外壳调参停在 0.241,用 GRPO 更新权重后升到 0.289。






最有意思的发现:两个杠杆改的东西不一样




这是论文真正的洞见(对应它的第二个研究问题):

  • 改外壳 = 软件工程层面的进步:更好的解析器、更聪明的重试、把报错整理成结构化信息喂给模型。模型本身没变,变的是"模型与环境之间的中间层"。

  • 改权重 = 注入模型本来不会的领域知识:在罪名分类上,梯度让模型学会区分相邻的细分罪名,在 kernel 上,模型内化了 H100 专属的优化技巧。


最生动的例子在去噪任务:第一个权重更新的检查点,自发加进了一个所有外壳迭代从没想到过的两行后处理,把插补出来的计数用 np.clip + np.rint 取整成非负整数。


这等于把一条生物学常识(基因计数不可能是负数或小数)直接刻进模型,而任何提示词都没教过它。


一句话:外壳决定模型怎么"找",权重决定模型"知道"什么。





作者自己点出的隐患




论文在局限里诚实地标了一个问题:耦合式的 Goodhart 风险。改外壳和改权重都在对同一个固定打分器优化,两者还会互相塑造对方看到的数据。


它们的联合最优点更像是两个"互相看不见对方更新历史"的优化器之间的纳什均衡,在训练用的打分器上看着很强,但只要换个外壳或换个策略稍加扰动,就可能很脆弱。





点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发