技术博客
强化学习

清华北大+伯克利联手!RLinf重塑强化学习基建,大模型/具身智能都离不开它?

Truman2026-07-09 12:02
清华北大+伯克利联手!RLinf重塑强化学习基建,大模型/具身智能都离不开它?


RLinf 是2025年由清华大学、北京大学、伯克利等机构联合推出的强化学习训练系统,专为解决大模型时代RL工作流的异构低效问题而设计。





RLinf: 通过宏到微流变换实现灵活高效的大规模强化学习 


原文标题:RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

原文链接:[2509.15965] RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

项目代码:RLinf/RLinf: RLinf: Reinforcement Learning Infrastructure for Embodied and Agentic AI


简要总结



一句话总结:RLinf 通过创新的“宏-微流变换”(M2Flow)范式,将RL工作流的逻辑编程与物理执行解耦,在数学推理和具身智能任务中实现了1.07倍至2.43倍的训练加速。


核心方法:

  1. M2Flow范式:允许用户以粗粒度编写逻辑工作流,系统自动将其分解为细粒度执行计划,打破传统单一执行模式的限制。


  2. 弹性流水线与上下文切换:通过动态调整数据处理的粒度(弹性流水线)和硬件资源的时分复用(自动上下文切换),实现工作流组件的灵活调度。


  3. 分析驱动的调度策略:基于运行时性能分析,自动搜索最优的GPU分配和流水线配置,无需人工调优。


一、背景与问题:RL工作流为何难以高效? 



近年来,强化学习(Reinforcement Learning, RL)已成为推动大语言模型(LLM)对齐、推理和具身智能的关键技术。


但RL工作流包含高度异构的组件(如LLM生成、奖励模型、环境模拟器),各组件对硬件资源的需求差异巨大:


训练需大量GPU内存存储梯度和优化器状态,生成阶段因响应长度动态变化导致GPU利用率低,而模拟器可能依赖CPU进行物理计算。


这种异构性使得传统系统采用两种极端执行模式时效率低下:


  • 协同执行模式(Collocated):所有组件顺序占用GPU,易受长尾响应阻塞(如少数生成长文本拖慢整体进度)。


  • 分离流水线模式(Disaggregated Pipelining):组件并发运行于独立GPU,虽缓解长尾问题,但可能因内存或计算不均衡产生流水线气泡。


核心矛盾:如何在不修改用户编程逻辑的前提下,为动态多变的RL工作流自动匹配最优执行策略?


二、解决方案:M2Flow如何实现“逻辑与执行解耦”?  



RLinf 提出宏-微流变换(Macro-to-Micro Flow Transformation, M2Flow),其核心思想是:让用户以直观的“宏逻辑流”编写工作流,系统自动将其转换为优化的“微执行流”。这一过程通过三大机制实现:


1. worker抽象与自适应通信

Worker封装:每个RL组件(如生成器、训练器)被抽象为独立Worker,具备资源加载/卸载(onload/offload)和通信能力。

自适应通信协议:支持跨节点、跨设备的动态连接,自动选择最佳通信后端(如NCCL用于GPU间传输,cudaIPC用于同GPU零拷贝)。


2. 弹性流水线与上下文切换

弹性流水线(Elastic Pipelining):通过调整数据处理粒度(如将大批次拆分为小批次),控制流水线阶段间的数据流动节奏,实现空间维度调度。


例如:生成Worker可每完成16个响应就向下游发送数据,而非等待全部512个响应,减少下游等待时间。


自动上下文切换(Context Switching):通过分布式设备锁(device_lock)实现GPU资源的时分复用。当Worker需访问GPU时,先获取锁并加载资源;完成后释放锁并卸载资源,供依赖其输出的下游Worker使用。


3.分析驱动的调度策略 

系统首先分析各组件在不同GPU数量下的执行时间和内存占用,生成预估函数E。调度器基于工作流依赖图(DAG),递归划分组件子集,并对比两种策略:


时分调度(Temporal):子集共享GPU,总时间为各阶段执行时间加和。


空分调度(Spatial):子集分配独立GPU,以流水线并行,总时间由最慢阶段决定(公式:Tcritical+(M/m−1)×Tbottleneck)。


算法在数秒内即可为8–1024 GPU集群找到近最优解,误差低于5%。


三、关键实现:如何支撑灵活调度?  



编程接口设计

RLinf采用过程式编程范式,用户通过两类代码构建工作流:

Worker逻辑:继承基类实现各组件功能(如生成、训练)。

工作流编排器:通过Channel连接Worker,定义数据流。


混合调度模式实战

RLinf支持纯时分、纯空分及混合调度。以具身RL任务为例:


混合模式优势:在ManiSkill环境中,模拟器需多实例并行以降低单步时间,而训练需大量GPU内存。混合模式将模拟器与生成器分配至部分GPU流水线执行,完成后切换至训练阶段,利用率提升87.2%。


对比实验:在LIBERO任务中,RLinf的时分模式比SimpleVLA-RL快143.4%,因消除了冗余环境初始化并优化了计算链路。


四、实验效果:效率与模型性能双提升 



吞吐量对比 

  • 推理RL任务:在Qwen2.5(1.5B–32B)的GRPO和PPO训练中,RLinf相较veRL和Slime最高提升1.7倍吞吐量(单位:tokens/sec)。


  • 关键观察:PPO任务因组件依赖复杂,空分调度优势显著;而GRPO中时分模式更优。


  • 具身RL任务:在ManiSkill和LIBERO环境中,RLinf混合模式比基线速度提升1.05x–2.43x,且成功率达SOTA(如LIBERO任务从34.33%提升至97.83%)


模型性能验证

经RLinf训练后的模型在数学推理(AIME、GPQA基准)和具身任务(ManiSkill成功率)中均超越基线,证实系统不仅提升效率,还保障模型质量。



五、总结 



RLinf的突破在于通过系统级解耦将灵活性转化为效率。其M2Flow范式可视为未来AI运行时的雏形:一套能统一调度训练、推理、模拟等异构组件的执行框架。对于从业者,RLinf的价值在于:


易用性:100行内编写完整RL工作流,无需修改代码即可探索调度策略。


可扩展性:支持千卡级集群和多种RL算法(PPO、GRPO、DAPO等)。


点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发