技术博客
LLM 大语言模型强化学习论文解读训练

DeepSeek-R1 论文解读:大模型是如何学会“思考”的?

LSST2026-07-20 17:54
DeepSeek-R1 论文解读:大模型是如何学会“思考”的?

近几年,大语言模型已经能够完成聊天、写作和代码生成等任务,但面对复杂数学题或逻辑问题时,模型往往需要进行多步推理。

DeepSeek 团队在论文 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》 中,探索了一个重要问题:

能不能不直接告诉模型具体的解题步骤,而是通过奖励机制,让模型自己学会推理?

论文给出的答案是:可以。

一、DeepSeek-R1 解决了什么问题?

传统大语言模型通常会使用大量人工整理的数据进行监督微调,也就是给模型提供“问题、推理过程和答案”,让模型模仿这些示例。

这种方法虽然有效,但高质量推理数据的制作成本很高。

DeepSeek-R1 的核心思路是:

让模型自己生成多种解题方法,再根据答案是否正确给予奖励,从而不断强化正确的推理方式。

这和训练机器人有些类似。机器人完成任务会得到奖励,大语言模型正确解出问题也会得到奖励。

二、DeepSeek-R1-Zero:只靠强化学习学习推理

论文首先训练了一个名为 DeepSeek-R1-Zero 的模型。

它直接以 DeepSeek-V3-Base 为起点,没有先使用推理数据进行监督微调,而是直接进行大规模强化学习。训练过程中,模型会针对同一个问题生成多个回答,然后根据回答的正确性进行比较和优化。

论文主要采用两类奖励:

  • 正确性奖励:判断数学答案是否正确,或者代码能否通过测试。

  • 格式奖励:要求模型按照规定格式输出推理过程和最终答案。

随着训练进行,模型开始自动学会:

  • 延长推理过程

  • 检查之前的步骤

  • 发现错误后重新计算

  • 尝试不同的解题方法

这些能力不是研究人员逐条写入模型的,而是在奖励机制下逐渐出现的。论文将其中一次主动重新检查答案的现象称为 “Aha Moment”

三、为什么还需要 DeepSeek-R1?

虽然 DeepSeek-R1-Zero 的推理能力很强,但它也存在明显问题:

  • 推理内容不够整洁

  • 有时会混合多种语言

  • 回答不够适合普通用户阅读

因此,研究团队进一步设计了完整的 DeepSeek-R1 训练流程。

它主要包含四个阶段:

1. 冷启动微调

首先使用数千条高质量、可读性较好的长推理数据,对基础模型进行初步训练,让模型形成较规范的推理和回答格式。

2. 推理强化学习

在冷启动模型的基础上继续进行强化学习,重点提高数学、编程、科学和逻辑任务的推理能力。

3. 数据筛选与监督微调

模型针对每个问题生成多个回答,只保留正确且表达清晰的结果。

论文最终整理了大约:

  • 60 万条推理数据

  • 20 万条写作、翻译和知识问答等非推理数据

随后使用约 80 万条数据再次微调模型。

4. 全场景强化学习

最后再进行一轮强化学习,使模型不仅会推理,还能提高回答的有用性、安全性和可读性。

四、GRPO 是什么?

DeepSeek-R1 使用了一种名为 GRPO 的强化学习方法。

简单来说,面对同一个问题,模型会一次生成一组不同答案。系统比较这些答案的得分:

  • 高于平均得分的回答会被鼓励

  • 低于平均得分的回答会被抑制

传统强化学习通常还需要额外训练一个与语言模型规模接近的价值模型。GRPO 使用同组回答的相对得分作为参考,因此能够减少额外计算成本。

五、小模型也能拥有推理能力

论文还使用 DeepSeek-R1 生成的推理数据,对 Qwen 和 Llama 系列的小模型进行蒸馏训练。

实验表明,将大模型的推理过程蒸馏给小模型,通常比直接在小模型上进行大规模强化学习更加有效。论文开源了 1.5B、7B、8B、14B、32B 和 70B 等不同规模的蒸馏模型。

这意味着,在计算资源有限的情况下,也可以通过蒸馏获得具有一定推理能力的小型模型。

六、这篇论文的意义

DeepSeek-R1 最重要的意义,不只是训练出了一个性能较强的大模型,而是展示了一种新的思路:

大模型的推理能力不一定完全依赖人工编写的推理数据,也可以通过强化学习和可验证奖励逐渐形成。

这项工作说明,只要能够判断最终答案是否正确,模型就可能通过不断尝试,自己寻找更有效的推理过程。

不过,这种方法更适合数学、代码等答案容易验证的任务。对于文学创作、开放问答和主观判断等问题,如何设计可靠的奖励仍然具有挑战。

七、总结

DeepSeek-R1 的训练过程可以简单概括为:

基础模型 → 冷启动数据 → 推理强化学习 → 筛选优质数据 → 监督微调 → 全场景强化学习

它证明了强化学习可以显著提升大语言模型的推理能力,并让模型逐渐出现检查、反思和重新尝试等行为。

如果 Transformer 解决的是“大模型如何理解上下文”,那么 DeepSeek-R1 进一步探索的就是:

大模型如何通过奖励,逐渐学会更深入地思考。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发