顶会聚焦:从安全到推理,三篇论文揭示 LLM 核心能力的未来趋势!

与更具说服力的
大语言模型辩论会产生更真实的答案

这篇论文的核心是探索如何通过多智能体辩论(Multi-Agent Debate)的机制,特别是通过提高辩论中说服力(Persuasiveness)的权重,来显著提高大型语言模型(LLM)生成答案的真实性和准确性。
大型语言模型(LLMs)处理复杂问题易产生幻觉,传统 RAG、CoT 方案存在局限。说服力增强的辩论框架创新引入多智能体辩论机制,由多个持不同观点的 LLM 智能体轮流论证、反驳并提供证据,再通过独立裁决模型评估双方说服力(不接触真实答案),最终采纳胜利方答案。
该机制能驱使智能体引用更真实准确的证据,实验显示其在常识性知识与推理任务中,真实性分数和鲁棒性均优于传统方法,为解决 LLM 幻觉、推动模型推理自我纠正及对齐研究提供了新路径。
论文链接:
https://arxiv.org/abs/2402.06782
模拟器链接:
https://app.llmxllm.com
代码地址:
https://github.com/ucl-dark/llm_debate
窃取生产级语言模型的部分参数

该论文提出一种针对黑盒生成式语言模型(如ChatGPT、PaLM-2)的高效窃取攻击,首次证明了从生产级模型API中恢复关键模型参数的可能性。
其核心在于通过自顶向下的线性代数方法,从模型输出的Logit信息逆向推导出Transformer最后一层的投影矩阵 W。
该攻击成本极低(例如,以低于20美元提取Ada/Babbage模型的全套矩阵,GPT-3.5 Turbo也仅需约2000美元),并成功揭示了模型的真实隐藏维度。
这项研究警示了黑盒API在模型安全方面存在的严重缺陷,为潜在的参数全面窃取攻击打开了突破口。
论文链接:
https://arxiv.org/abs/2403.06634
项目主页:
https://not-just-memorization.github.io/partial-model-stealing.html
代码地址:
https://github.com/dpaleka/stealing-part-lm-supplementary
基于扭曲序贯
蒙特卡洛方法的语言模型概率推理

这项论文通过扭曲序贯蒙特卡洛(TSMC),为大语言模型中复杂的概率采样任务(如RLHF对齐、红队攻击、文本生成控制等)提供了统一高效的解决框架。
其核心是引入可学习的扭曲函数,动态预估序列的未来潜在收益,从而在推理时将计算聚焦于高价值路径,显著提升采样效率与质量。
该方法不仅能生成更符合目标分布(如特定情感、安全性约束)的文本,还可用于评估不同推理技术的准确性。
实验证明,TSMC在不良输出采样、情感可控生成、文本填充等任务上均表现优异,为LLM的对齐与控制奠定了可理论解释、可高效计算的概率推断基础。
论文链接:
https://arxiv.org/abs/2404.17546
