论文解读:Qwen2.5——国产开源大模型是如何全面升级的?

大语言模型的发展并不只是不断增加参数量。训练数据是否优质、模型能否理解长文本、是否会正确执行指令,同样决定了最终的使用体验。
Qwen 团队在 《Qwen2.5 Technical Report》 中,系统介绍了 Qwen2.5 系列的模型结构、训练数据和后训练方法。相比上一代,Qwen2.5 在知识、数学、代码、长文本和结构化输出等方面进行了全面升级。
一、论文基本信息
论文名称: Qwen2.5 Technical Report
研究团队: Qwen Team
发布时间: 2024 年12月
论文原文: Qwen2.5 Technical Report
Qwen2.5 提供了0.5B、1.5B、3B、7B、14B、32B和72B共七种开源权重模型,同时包含基础版与指令微调版,方便用户根据显存和任务需求选择不同规模。
二、Qwen2.5 想解决什么问题?
很多大模型虽然能够聊天,但在实际使用时仍会出现一些问题,例如:
长文章写到一半就停止;
不能稳定输出表格或 JSON;
面对复杂系统提示词时容易忽略条件;
数学、代码和逻辑推理能力不够稳定。
Qwen2.5 的目标不只是提高测试分数,而是让模型在真实任务中更容易使用。论文重点提升了长文本生成、结构化数据理解、结构化输出、工具调用和指令遵循能力。
三、模型结构有什么特点?
Qwen2.5 的开源模型仍然采用主流的 Decoder-only Transformer 架构。
每个 Transformer 模块主要包含:
GQA 分组查询注意力:减少 KV Cache 占用,提高推理效率;
RoPE 位置编码:帮助模型理解 Token 的位置和顺序;
SwiGLU 前馈网络:提升模型的非线性表达能力;
RMSNorm:让训练过程更加稳定。
因此,Qwen2.5 并没有完全改变 Transformer,而是在成熟架构上继续优化数据、训练方法和使用体验。
四、18万亿 Token 是什么概念?
Qwen2 使用了约7万亿 Token 进行预训练,而 Qwen2.5 将数据规模扩大到了约 18万亿 Token。
但论文强调的不只是“数据更多”,还包括“数据更好”。研究团队使用模型对网页内容进行质量评分,过滤低质量和重复信息,并增加数学、代码、科学和专业知识等高价值数据的比例。
可以把它理解成:
不是把互联网全部塞给模型,而是先筛选、分类和调整比例,再让模型学习。
论文还使用 Qwen2 和 Qwen2-Math 等模型生成数学、代码与知识类合成数据,并通过奖励模型继续筛选质量。
五、Qwen2.5 是如何完成后训练的?
预训练主要让模型获得知识和语言能力,后训练则让模型变得更加“听话”。
Qwen2.5 的后训练大致包括三个阶段:
1. 监督微调(SFT)
研究团队使用超过100万条高质量样本,训练模型完成问答、数学、代码、长文本生成和结构化数据分析等任务。
2. DPO 离线偏好优化
模型通过比较较好和较差的回答,学习人类更偏好的输出方式。这一阶段重点提升推理、事实性和指令遵循能力。
3. GRPO 在线强化学习
模型生成回答后,由奖励模型从真实性、有用性、简洁性、安全性和相关性等方面进行评价,再根据奖励继续优化。
整个流程可以概括为:
18万亿 Token 预训练 → SFT → DPO → GRPO → Qwen2.5-Instruct
六、长文本能力是怎么提升的?
Qwen2.5 在预训练后期加入了专门的长文本训练。多数7B及以上的开源模型支持最长约128K Token 的上下文,并能够生成最长约8K Token 的回答。
为进一步扩展上下文,论文使用了 YaRN 和 Dual Chunk Attention 等方法。在报告中的特定 Qwen2.5-Turbo 版本上,上下文能力被扩展到最高100万 Token。
不过,支持更长上下文并不代表模型能够完美记住所有细节。文本越长,信息检索和事实一致性依然会变得更加困难。
七、Qwen2.5 为什么更适合实际应用?
相比只会输出普通文字的模型,Qwen2.5 特别强化了表格、JSON和系统指令的处理能力。
例如,用户可以要求模型:
按照固定 JSON 格式输出数据;
分析表格中的信息;
根据多个条件生成长文章;
调用外部工具完成任务;
按照指定角色和格式持续对话。
官方报告认为,这些改进让 Qwen2.5 更适合知识库问答、数据分析、代码助手和 AI Agent 等工程场景。
八、这篇论文有什么意义?
Qwen2.5 展示了一条比较完整的大模型升级路线:
模型架构保持稳定,通过更大且更高质量的数据、专业领域数据和多阶段后训练来提升能力。
它说明,大模型竞争不只取决于参数量,还取决于数据筛选、数据配比、长文本训练和人类偏好对齐等完整流程。
同时,从0.5B到72B的模型规模也让同一套技术能够覆盖手机端、小型服务器和高性能计算平台等不同场景。
九、总结
Qwen2.5 的核心升级可以概括为:
更多的高质量数据、更强的数学和代码能力、更长的上下文,以及更完善的 SFT、DPO 和 GRPO 后训练。
它没有提出一种完全不同的新架构,而是证明了只要对数据和训练流程进行系统优化,经典 Transformer 仍然能够获得明显提升。
简单来说:
Qwen2.5 不只是“读得更多”,还更加重视“读什么、怎么学,以及如何回答”。