如何让大模型学会“假如”?如何根治奖励作弊?如何实现搜索即思考?

本文为大家整理了LLM与RL方向的3篇前沿论文。
CounterBench:
大语言模型反事实推理评估基准

CounterBench是一个包含1000个反事实推理问题的新数据集,其关键技术细节在于通过设计多种因果图结构、不同难度级别,以及使用无意义的实体名称来消除LLM依赖先验知识或记忆化答案的可能性,从而严格评估LLM仅基于形式化规则进行多步逻辑推理的能力。
基于CounterBench基准与CoIn范式的成果,未来研究可从三个方向推动LLM反事实推理能力的发展:
扩展评估维度,构建融合真实知识冲突、多模态信息及概率性因果关系的更复杂基准,以贴近现实推理的模糊性与综合性。
创新方法范式,如在模型内部嵌入结构化回溯模块或引入外部因果推理工具,并探索解耦式微调策略,以提升推理的鲁棒性并避免知识退化
开拓实际应用,将反事实推理能力用于生成可解释的AI决策依据、增强机器人规划与对抗性鲁棒性,从而在可信AI、机器人学和安全领域发挥实质作用。
论文链接:
https://arxiv.org/abs/2502.11008
Preference As Reward:
缓解RLHF中奖励黑客问题的新方法

这篇论文主要针对RLHF过程中突出的奖励欺骗问题,提出了一种名为PAR的创新奖励整形策略。
传统RLHF依赖奖励模型的标量输出,容易导致语言模型生成在奖励分数上虚高、却偏离人类真实偏好的无效输出。
PAR方法的精髓在于,它将奖励模型学习到的潜在大写偏好概率直接转化为强化学习的奖励信号,而非使用原始分数。
基于PAR(Preference As Reward)论文提出的奖励重塑核心原则(有界性、中心化、数据高效),未来研究可从三大方向深入拓展:
理论深化与泛化,探索动态自适应奖励函数(如调整Sigmoid参数)以优化训练进程,并引入信息论等框架形式化约束奖励泛化,为方法提供坚实理论支撑。
应用扩展与融合,将PAR思想迁移至DPO等非PPO算法中革新损失函数设计,并发展多目标PAR(Multi-PAR)以实现可控、稳健的多维度对齐。
数据与参考点优化,重点研究在线参考奖励学习机制以提升环境适应性,并系统分析PAR在噪声与偏见环境下的鲁棒性,探索其补偿弱奖励模型缺陷的潜力。这些方向共同推动RLHF向更高效、稳健和可控的新阶段发展。
论文链接:
https://arxiv.org/abs/2502.18770
代码链接:
https://github.com/PorUna-byte/PAR
DeepRetrieval:基于强化学习与大语
言模型重构搜引擎与检索模型的新方法

DeepRetrieval 的核心创新在于将检索查询的优化问题重构为一个强化学习任务,其直接目标是通过近端策略优化算法,驱动大语言模型生成能最大化提升下游检索系统真实性能的增强查询,而非模仿已有的查询模式。
该方法摒弃了对昂贵标注数据的依赖,让模型通过试错直接学习以召回率、NDCG等最终指标为奖励信号的生成策略。
基于DeepRetrieval利用强化学习直接优化检索性能的突破性成果,未来研究可从三大方向实现进一步创新:
优化RL框架本身,设计细粒度、多目标的链式奖励函数以缓解稀疏奖励问题,并探索离策略与在策略的混合学习机制来大幅提升训练效率。
扩展检索智能体的自主能力,发展支持多轮对话交互的上下文感知检索策略,以及能自适应不同检索后端(如向量库、SQL数据库)的元检索智能体。
增强系统的鲁棒性与可信度,通过将反知识泄露作为负奖励信号内置到训练目标中来解决答案泄露问题,并将公平性等约束指标融入奖励函数,以引导生成更中立、全面的检索结果。这些方向共同推动检索系统向更高效、智能、可靠的新范式演进。
论文链接:
https://arxiv.org/abs/2503.00223
代码链接:
https://github.com/pat-jj/DeepRetrieval
