技术博客
LLM 大语言模型论文解读

论文解读:DeepSeek-V3.2——让大模型更会推理,也更会使用工具

LSST2026-07-20 18:48
论文解读:DeepSeek-V3.2——让大模型更会推理,也更会使用工具

大语言模型不仅要“回答问题”,还需要处理长文本、调用搜索工具、运行代码,并在复杂任务中持续推理。

DeepSeek 团队在 2025 年发布的论文 《DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models》 中,重点解决了三个问题:长文本计算成本高、强化学习难以稳定扩展,以及模型使用工具时不够可靠。

一、论文基本信息

论文标题: DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
研究团队: DeepSeek-AI
发布时间: 2025 年 12 月
论文链接: arXiv 论文页面

二、DeepSeek-V3.2 想解决什么问题?

普通 Transformer 在处理长文本时,需要计算大量 Token 之间的注意力关系。文本越长,计算量和显存开销就越大。

同时,模型即使具备较强的数学和代码能力,也不一定能稳定完成“搜索资料—调用工具—分析结果—继续操作”这种多步骤任务。

因此,DeepSeek-V3.2 的目标可以简单概括为:

在降低长文本计算成本的同时,提高模型的推理能力和智能体能力。

论文主要提出了三项改进:DeepSeek Sparse Attention、可扩展强化学习框架,以及大规模智能体任务合成方法。

三、DSA:不再关注所有 Token

DeepSeek-V3.2 最重要的结构改进是 DeepSeek Sparse Attention,简称 DSA

传统注意力机制会让当前 Token 与前面大量 Token 进行计算。DSA 则先使用一个轻量级的“索引器”,快速判断哪些历史 Token 更重要,然后只选择得分最高的一部分参与正式注意力计算。

它的工作过程可以理解为:

输入问题 → 快速筛选重要内容 → 只关注相关 Token → 生成回答

例如,模型阅读一本很长的技术手册时,不需要在每次回答中重新关注全部文字,而是先找到与问题最相关的章节。

论文中的 DSA 主要包含两个部分:

  • Lightning Indexer:快速计算相关性分数。

  • Top-k Token Selection:选出最值得关注的 Token。

这种方法可以降低长文本中的核心注意力计算量,同时尽量保持原有模型能力。

四、强化学习:让模型学会更稳定地推理

DeepSeek-V3.2 在后训练阶段继续使用 GRPO 强化学习方法。

简单来说,模型会针对同一个问题生成多个答案,再根据正确性、长度、语言一致性和任务完成情况给予奖励。得分更高的回答会被鼓励,得分较低的回答则会被抑制。

论文还把数学、编程、逻辑推理、搜索和工具调用等不同任务放入统一的强化学习阶段,以减少模型训练新能力时遗忘旧能力的问题。

五、让模型一边思考,一边调用工具

过去的大模型调用搜索、代码执行器等工具时,经常会在每次工具返回结果后重新进行推理,导致重复思考并浪费 Token。

DeepSeek-V3.2 对工具调用过程中的上下文进行了管理:

  • 工具返回结果后,保留之前的推理信息。

  • 用户提出新问题时,再清理旧的推理内容。

  • 即使推理内容被清理,仍保留工具调用记录和返回结果。

这样,模型可以继续沿着已有思路完成任务,而不必每调用一次工具就从头开始。

六、智能体训练数据从哪里来?

训练智能体模型需要大量可以使用搜索、代码和其他工具的任务,但人工制作这些数据成本很高。

DeepSeek-V3.2 使用自动化方法生成了大量训练环境和任务。论文介绍的任务包括:

  • 搜索信息并核实答案

  • 修改代码并运行测试

  • 使用 Jupyter Notebook 计算结果

  • 根据多个条件制定计划

  • 连续调用多个工具完成任务

研究团队构建了超过 1,800 个合成环境,并生成了大量复杂任务,让模型在可以自动验证结果的环境中进行强化学习。

七、这篇论文有什么意义?

DeepSeek-V3.2 展示了大语言模型发展的三个新方向。

第一,模型不一定要关注全部上下文,可以先筛选最重要的信息,从而提高长文本处理效率。

第二,强化学习不再只用于数学推理,也可以同时训练搜索、代码和工具调用能力。

第三,大模型正在从单纯的“聊天助手”,逐渐发展为能够分析任务、调用工具并执行多步操作的 AI Agent。

八、它也有哪些局限?

DSA 需要额外训练索引器,并且筛选出的 Token 是否准确会直接影响最终效果。

智能体训练虽然能够自动生成环境,但合成任务与真实用户场景之间仍可能存在差异。此外,论文中的部分性能对比由研究团队自行完成,在不同工具环境和评测设置下,结果可能有所变化。

九、总结

DeepSeek-V3.2 的核心思路可以概括为:

稀疏注意力提高长文本效率,强化学习增强推理能力,智能体任务训练提升工具使用能力。

它说明未来的大语言模型不仅需要“知道答案”,还要能够从长文本中找到关键信息,并通过搜索、代码和其他工具完成复杂任务。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发