RLDX-1 论文解读:让机器人不止「看得懂」,还要「有手感、有记忆、有反应」

论文原标题:
RLDX-1 Technical Report
论文链接:
https://arxiv.org/abs/2605.03269
项目主页:
https://www.rlwrld.ai/en/rldx-1
代码地址:
https://github.com/RLWRLD/RLDX-1
Part.01
VLA模型缺了什么?
在了解这个工作的技术细节之前,我们要先了解一下关于它的背景。这篇论文指出,VLA 有一个明显的短板。它们擅长「通用智能」(versatile intelligence),也就是场景理解和语言泛化,但在真实世界的复杂任务中却会卡住。
为什么?因为现实中的灵巧操作还需要几种「功能性能力」(functional capabilities)。论文具体点出了三个:
第一个是运动感知(motion awareness),理解事物随时间如何变化,比如一个杯子正在倒下,你得意识到它在动。
第二个是长期记忆(long-term memory),记住几分钟前发生过什么,而不只是当前一两帧画面。
第三个是物理感知(physical sensing),通过触觉、力矩等传感器感受接触力,这对灵巧操作尤其重要,因为你光看是看不出来「自己握得够不够紧」的。

Part.02
核心架构:MSAT
RLDX-1 的核心创新是 Multi-Stream Action Transformer(MSAT,多流动作 Transformer)。它的灵感来自图像生成领域的 MM-DiT(FLUX 模型用的架构),但把它扩展到了动作建模。
打个比方,你做菜的时候,大脑里其实有三条并行的「思考流」在工作:
认知流(Cognition Stream):理解「这道菜要加盐」(语义、场景)。
物理流(Physics Stream):感受「锅多烫、勺子多沉」(触觉、力矩)。
动作流(Action Stream):规划「手该怎么动」(关节角度、末端轨迹)。
这三条流既要各自保留专属信息,又要互相参考。
MSAT 做的就是这件事:每种模态有独立的 Stream(独立的归一化和 QKV 投影),但通过 Joint Self-Attention(联合自注意力)实现跨模态融合。当机器人没有触觉传感器时,Physics Stream 可以被屏蔽掉,非常灵活。


围绕 MSAT,论文还配了三个针对性的模块,分别对应前面三种功能能力:
第一,运动感知靠的是「多帧视频输入 + Motion Module」。视觉编码器中插入了一个计算「时空自相似性(STSS)」的模块,显式建模帧间动态。同时为了不让视频 token 把模型撑爆,在 VLM 的第 4 层之后把过去帧压缩成一个 token,既保留了时序上下文又大幅降低了算力。
第二,长期记忆靠一个独立的 Memory Module。它维护一个最近 3 个时刻认知特征的队列(每隔一个 action chunk 取一次),把过去的认知特征和当前的拼接起来,送进一个轻量 Transformer,产出「记忆增强」的特征给 MSAT。
第三,物理感知通过 Physics Stream 接入触觉和力矩信号。这里有个聪明的设计:模型不只是被动接收物理信号,还会被训练去预测未来的物理信号。这个辅助任务迫使模型真正「理解」接触动态,而不是把传感器数据当成噪声。
Part.03
训练数据
RLDX-1 的训练数据来自三个互补来源,公开真实数据、自采真实数据和合成数据。
合成数据这块特别值得讲讲。直接生成视频会有两个问题:一是和源视频太像、缺乏多样性,二是生成视频里的动作可能根本不符合物理。论文的解法是:两轴增强 + 两阶段过滤。

Part.04
推理优化
模型再聪明,跑不动也白搭。机器人推理的延迟有两个层次的浪费:
图级别(Graph-Level):PyTorch Eager 每个算子都要单独启动 kernel,launch overhead 累积起来很可观。Torch Compile 能捕获一部分 CUDA Grap,但因为 RoPE 和注意力掩码依赖运行时配置,前向传播会被切成多个子图,无法端到端捕获。RLDX-1 的做法是把运行时依赖的部分提前算好缓存,这样整个前向传播就能被捕获成一张 CUDA Graph,一次启动搞定。

Kernel 级别:即使有了静态图,算子间还是有不必要的全局内存读写。比如 RMSNorm → RoPE → Attention 这三个步骤,如果各跑各的 kernel,中间的 Q/K 张量要往全局内存写一次再读一次,IO 成本很高。论文针对 RLDX-1 的 short-prefill 工作负载手写了融合 kernel,把这一串操作合并到单个 kernel 内,中间结果留在片上内存。

最终,RLDX-1 在 RTX 5090 上做到了 43.7 ms / 步,相比 Eager 模式加速 1.63 倍,达到 22+ Hz 的实时控制频率。
Part.05
实验结果
仿真基准

ALLEX 人形真机实验

最有说服力的是 Object-in-Box Selection(人把物体放进三个盒子之一,机器人要选出含物体的盒子)π;₀.₅ 只有 33.3%、GR00T N1.6 只有 29.2%,而 RLDX-1 达到 91.7%。基线模型基本就是「随机猜」或「每次都选同一个」,而 RLDX-1 真的「记住了」之前发生的事,这正是 Memory Module 的功劳。
类似地,Card Slide-and-Pick(滑卡片到桌边再拿起来)的进度得分 RLDX-1 达到 97.2,而基线模型在「卡片太薄抓不住」「桌面高度变化检测不到」等问题上反复失败,这是 Physics Stream 提供力矩反馈的功劳。
