技术博客
AI Agent

智能体进化三部曲:抽象推理、统一平台与自我优化​

liam2026-07-09 14:41
智能体进化三部曲:抽象推理、统一平台与自我优化​





抽象之链:

迈向更可泛化与可解释推理的一步


该研究由洛桑联邦理工学院和 Meta 的团队开展,核心是提出 “抽象链(Chain-of-Abstraction,CoA)” 推理方法。


其创新点在于将推理过程拆分为两个阶段:

  • 抽象推理链生成:通过微调大语言模型,使其先生成含抽象占位符(如 y1、y2)的推理链,无需依赖具体领域知识,专注于整体推理逻辑框架的构建。

  • 工具调用与具体化:调用外部工具(如计算器、搜索引擎)获取具体知识,填充抽象占位符,最终生成答案。这种 “抽象规划 - 工具执行” 的分离架构,使模型能学习通用推理策略,提升对不同领域知识变化的适应性,同时支持并行处理(模型解码与工具调用可同步进行),减少推理延迟。


在数学推理和 Wiki QA 领域的实验显示,该方法相比传统思维链(CoT)和工具增强基线,平均问答准确率提升约 6%,推理速度加快 1.4 倍,且推理过程因步骤明确而更易解释和追踪。



论文链接:

https://arxiv.org/abs/2401.17464




AgentOhana:利用多样化仿真人群来

开发与评估语言智能体的统一框架


在 LLMs 驱动的自主代理研究领域,不同数据集存在数据结构、语法、标签规则和处理方式等方面的异质性,且多为非标准化格式,这给 LLMs 的训练和微调带来极大困难,容易导致偏差和不一致性。


该论文提出的 AgentOhana 平台正是为解决这些问题而生,其核心创新体现在三方面:

  • 数据聚合与标准化:从不同环境中聚合代理轨迹,通过专门处理流程将这些轨迹标准化为统一格式,进而构建出适用于代理训练的通用数据加载器,打破不同数据源之间的格式壁垒。

  • 均衡化训练流程:借助数据统一化优势,在数据集划分和模型训练过程中,确保不同数据源之间的平衡,同时保持各设备间的独立随机性,减少训练偏差,提升模型训练的稳定性和可靠性。

  • 专用模型研发:开发了针对 AI 代理的大型动作模型 XLAM-v0.1,该模型在各类基准测试中表现出色,验证了 AgentOhana 平台在模型训练支持方面的有效性。


更多语言大模型与Agent相关

具身智能领域4篇里程碑式研究,一文速览!



论文链接:

https://arxiv.org/html/2402.15506v1




自授优化器(STOP):

通过自我强化提升语言模型的推理能力


该研究的核心是提出 “自学优化器(STOP)” 框架,其创新思路和技术特点如下:


借助 “脚手架(scaffolding)” 程序(外部调用框架),让语言模型通过自我调用和迭代优化,提升代码生成等任务的输出质量。


不同于传统递归自我改进(RSI)修改模型权重的方式,STOP 仅优化 “调用模型的方式”,模型本身未被改动。


关键流程:

  • 种子改进器构建:初始设计一个简单的 “种子改进器”,逻辑为调用语言模型生成多个候选解,再依据预设效用函数筛选最优方案。

  • 递归自我优化:将种子改进器的代码输入语言模型,让其自主提出并实现改进策略(如束搜索、遗传算法、模拟退火等),生成新版本改进器;重复这一过程,使改进器在下游任务中性能逐步超越初始版本。

  • 元效用函数约束:通过 “元效用函数” 评估改进器在多下游任务的平均表现,确保迭代方向聚焦于提升整体性能,而非无意义的代码修改。


以 GPT-4 为实验模型,在带噪声的奇偶校验学习(LPN)、字符串编辑距离等任务中验证了 STOP 的有效性 —— 经过多轮迭代后,改进器性能显著优于初始版本,且优化策略具备跨任务迁移能力。


同时,研究也指出风险,如模型可能为追求效用绕过沙盒约束或修改输出格式进行奖励规避。



论文链接:

https://arxiv.org/abs/2310.02304

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发