技术博客
LLM 大语言模型

AAAI 重磅炸弹!「溯因反思」让 AI 拥有自我纠错的逻辑大脑,幻觉将彻底消失?

liam2026-07-08 18:26
AAAI 重磅炸弹!「溯因反思」让 AI 拥有自我纠错的逻辑大脑,幻觉将彻底消失?







通过溯因反思高效修正

神经符号推理的不一致性


该论文提出了一种高效的方法来解决神经符号(NeSy)系统中,神经网络(System 1, 快速直觉)输出与领域知识(System 2, 符号推理)之间不一致的问题。


核心方法:溯因反射 (Abductive Reflection, ABL-Refl)

  1. 灵感来源:灵感来源于人类的认知反射,即我们能迅速检测到直觉反应中的错误,并调用更严谨的推理(System 2)来修正它们。

  2. 机制创新: ABL-Refl 建立在溯因学习框架之上,但用高效的反射机制取代了传统 ABL 中耗时的一致性优化步骤。

  3. 反射向量: 在模型训练过程中,系统利用领域知识归纳出一个反射向量。在推理过程中,这个反射向量会标记神经网络输出中可能导致不一致的潜在错误位置。

  4. 高效修正: 一旦错误被标记,模型会调用符号推理进行溯因,仅在标记的位置上进行修正,从而生成与领域知识一致的输出。这种方法大大缩小了符号推理的问题空间,显著提高了效率和适用性。


实验表明,ABL-Refl 在解决像 Sudoku 这样的 NeSy 基准测试任务中,优于现有的最先进 NeSy 方法,以更少的训练资源和更高的效率实现了卓越的准确性。



论文链接:

https://arxiv.org/abs/2412.08457



启示:一类具有ω正则

目标的可判定POMDP


这项研究针对部分可观测马尔可夫决策过程(POMDPs)中长期未解决的难题——如何在状态不完全可见的情况下,为具有无限期运行目标(以ω‑正则性质描述,如“始终保持安全”)的系统设计最优控制策略。


传统上,由于信念空间不可数,此类问题一般不可判定。


论文的核心贡献是引入了一类新型POMDPs,称为“启示POMDPs”,其特点是系统内预设了一个能以概率1完全揭示当前状态的“启示”动作。


在这一结构下,最大化满足任意ω‑正则性质的概率这一控制问题变为可判定的,并可转化为有限状态MDP进行求解。


该工作不仅为在理论上难以处理的POMDPs领域界定出一个具有可解性的实用子类,也为需要在不确定环境下实现长期可靠自主决策的系统(如自动驾驶、医疗监控)提供了新的形式化设计与验证工具。



论文链接:

https://arxiv.org/abs/2412.12063



博弈对称性及其

约束下均衡的计算方法


该论文针对博弈论中长期存在的计算难题——如何高效求解对称博弈中的对称纳什均衡,提出了突破性的算法框架。


研究指出,虽然对称结构在囚徒困境等经典博弈中普遍存在,且能显著降低均衡求解的复杂性,但混合策略对称纳什均衡的高效计算始终缺乏系统方法。


为此,作者首先设计了精确计算博弈对称群的算法,进而构建了一种创新算法,将搜索空间限制在对称混合策略上,从而指数级降低变量与约束的规模,大幅提升了计算效率。


该工作不仅为分析大规模多智能体系统与经济模型提供了可扩展的计算工具,也为进一步求解相关均衡概念奠定了理论基础。



论文链接:

https://arxiv.org/abs/2501.08905

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发