技术博客
AI Agent

别再手动配数据了:让 AI 智能体自己学会"喂模型"

liam2026-07-09 14:41
别再手动配数据了:让 AI 智能体自己学会"喂模型"

原论文标题:

Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning

论文链接:

https://arxiv.org/abs/2606.24133

代码地址:

https://github.com/DANG-ai/LLM-Training-Holistic-Data-Schedule





Part.01

一个被低估的问题:数据怎么配比


预训练一个大模型,数据来自很多领域,网页、书籍、代码、论文、字幕……这些数据按什么比例喂给模型,直接决定了训练快慢和最终能力。


过去常见两种做法。一种是静态配比:训练前定好比例,全程不变(代表作 DoReMi、DoGE、RegMix)。问题是,模型的学习状态一直在变,一个"从头管到尾"的固定配方显然不够灵活。另一种是在线数据混合(ODM):训练过程中动态调整比例。


但作者指出,现有在线方法都只盯着单一指标,要么只看数据质量,要么只看某个领域的损失,要么只看领域间的相互影响,缺少一个"全局视角"。




Part.02

核心思路:

把"配数据"变成一个强化学习任务


HDS 的做法是把数据调度建模成一个强化学习问题,并用 Soft Actor-Critic(SAC) 这个算法来学策略。可以这样理解这套循环:

  • 环境:就是正在训练的大模型本身。

  • 状态(state):模型当前的"体检报告"——各领域的验证损失、损失的变化量、训练步数、被选中的层的权重范数及其变化等。

  • 动作(action):下一批数据里,每个领域各占多少采样概率。

  • 奖励(reward):这一步配比好不好,由下面要讲的"整体奖励"打分。





Part.03

真正的创新:一个"三合一"奖励


HDS 最关键的设计,是把三种视角揉进同一个奖励函数:


  1. 领域间影响奖励(r_align):衡量"训练某个领域,是否也帮到了其他领域"。具体做法是计算该领域的梯度与其他所有领域梯度之和的内积。内积大,说明这个领域的更新方向和大家一致,值得多采样。这是消融实验里贡献最大的一项。


  2. 调度式词汇多样性奖励(r_diversity):这是"课程学习"思想。训练早期偏好简单文本,后期逐渐转向复杂文本。论文用 MTLD 来度量文本复杂度(MTLD 是一种不受文本长度影响的词汇多样性指标),并让目标随训练进度 t' 漂移,早期 t' 小,低 MTLD 得分高,后期 t' 大,高 MTLD 得分高,自然形成"由简到难"。


  3. 模型稳定性奖励(r_stability):惩罚权重范数的剧烈抖动,相当于一个正则项,让训练别太"上头"。消融显示它影响最小,主要起兜底作用。


三者按权重相加,论文最终选用 [w_align=1, w_diversity=10, w_stability=10]。




Part.04

效果怎么样


在 The Pile 上训练 Pythia-1B(50B tokens),结论相当亮眼。



效率上,HDS 达到最强基线 AC-ODM 的最终困惑度只需约 44% 更少的步数,比静态基线快 57%,最终困惑度比 AC-ODM 低 5.3%、比静态基线低 13.6%。



下游能力也同步提升。



作者还在 Pythia-12B 上做了验证:末期 HDS 困惑度 4.89,相对 ODM 的 7.32 提升超 33%,说明方法能放大到更大模型。





Part.05

一句话总结


HDS 的价值不在于某个单点技巧,而在于一个理念:别再用单一指标决定数据配比,而是让一个强化学习智能体同时权衡"跨领域协同、课程难度、训练稳定"三件事


在它设定的实验框架内,这种多目标视角换来了更快的收敛和更强的下游表现。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发