论文解读:DeepSeek-V3.2——让大模型更会推理,也更会使用工具

大语言模型不仅要“回答问题”,还需要处理长文本、调用搜索工具、运行代码,并在复杂任务中持续推理。
DeepSeek 团队在 2025 年发布的论文 《DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models》 中,重点解决了三个问题:长文本计算成本高、强化学习难以稳定扩展,以及模型使用工具时不够可靠。
一、论文基本信息
论文标题: DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
研究团队: DeepSeek-AI
发布时间: 2025 年 12 月
论文链接: arXiv 论文页面
二、DeepSeek-V3.2 想解决什么问题?
普通 Transformer 在处理长文本时,需要计算大量 Token 之间的注意力关系。文本越长,计算量和显存开销就越大。
同时,模型即使具备较强的数学和代码能力,也不一定能稳定完成“搜索资料—调用工具—分析结果—继续操作”这种多步骤任务。
因此,DeepSeek-V3.2 的目标可以简单概括为:
在降低长文本计算成本的同时,提高模型的推理能力和智能体能力。
论文主要提出了三项改进:DeepSeek Sparse Attention、可扩展强化学习框架,以及大规模智能体任务合成方法。
三、DSA:不再关注所有 Token
DeepSeek-V3.2 最重要的结构改进是 DeepSeek Sparse Attention,简称 DSA。
传统注意力机制会让当前 Token 与前面大量 Token 进行计算。DSA 则先使用一个轻量级的“索引器”,快速判断哪些历史 Token 更重要,然后只选择得分最高的一部分参与正式注意力计算。
它的工作过程可以理解为:
输入问题 → 快速筛选重要内容 → 只关注相关 Token → 生成回答
例如,模型阅读一本很长的技术手册时,不需要在每次回答中重新关注全部文字,而是先找到与问题最相关的章节。
论文中的 DSA 主要包含两个部分:
Lightning Indexer:快速计算相关性分数。
Top-k Token Selection:选出最值得关注的 Token。
这种方法可以降低长文本中的核心注意力计算量,同时尽量保持原有模型能力。
四、强化学习:让模型学会更稳定地推理
DeepSeek-V3.2 在后训练阶段继续使用 GRPO 强化学习方法。
简单来说,模型会针对同一个问题生成多个答案,再根据正确性、长度、语言一致性和任务完成情况给予奖励。得分更高的回答会被鼓励,得分较低的回答则会被抑制。
论文还把数学、编程、逻辑推理、搜索和工具调用等不同任务放入统一的强化学习阶段,以减少模型训练新能力时遗忘旧能力的问题。
五、让模型一边思考,一边调用工具
过去的大模型调用搜索、代码执行器等工具时,经常会在每次工具返回结果后重新进行推理,导致重复思考并浪费 Token。
DeepSeek-V3.2 对工具调用过程中的上下文进行了管理:
工具返回结果后,保留之前的推理信息。
用户提出新问题时,再清理旧的推理内容。
即使推理内容被清理,仍保留工具调用记录和返回结果。
这样,模型可以继续沿着已有思路完成任务,而不必每调用一次工具就从头开始。
六、智能体训练数据从哪里来?
训练智能体模型需要大量可以使用搜索、代码和其他工具的任务,但人工制作这些数据成本很高。
DeepSeek-V3.2 使用自动化方法生成了大量训练环境和任务。论文介绍的任务包括:
搜索信息并核实答案
修改代码并运行测试
使用 Jupyter Notebook 计算结果
根据多个条件制定计划
连续调用多个工具完成任务
研究团队构建了超过 1,800 个合成环境,并生成了大量复杂任务,让模型在可以自动验证结果的环境中进行强化学习。
七、这篇论文有什么意义?
DeepSeek-V3.2 展示了大语言模型发展的三个新方向。
第一,模型不一定要关注全部上下文,可以先筛选最重要的信息,从而提高长文本处理效率。
第二,强化学习不再只用于数学推理,也可以同时训练搜索、代码和工具调用能力。
第三,大模型正在从单纯的“聊天助手”,逐渐发展为能够分析任务、调用工具并执行多步操作的 AI Agent。
八、它也有哪些局限?
DSA 需要额外训练索引器,并且筛选出的 Token 是否准确会直接影响最终效果。
智能体训练虽然能够自动生成环境,但合成任务与真实用户场景之间仍可能存在差异。此外,论文中的部分性能对比由研究团队自行完成,在不同工具环境和评测设置下,结果可能有所变化。
九、总结
DeepSeek-V3.2 的核心思路可以概括为:
稀疏注意力提高长文本效率,强化学习增强推理能力,智能体任务训练提升工具使用能力。
它说明未来的大语言模型不仅需要“知道答案”,还要能够从长文本中找到关键信息,并通过搜索、代码和其他工具完成复杂任务。