让机器人真正"看懂世界、动起来"的全栈引擎

代码地址:
GitHub - limxdynamics/FluxVLA
详细中文文档:
https://fluxvla.limxdynamics.com/zh/
详细英文文档:
https://fluxvla.limxdynamics.com
FluxVLA 是什么?
FluxVLA Engine 是面向具身智能应用的全栈端到端工程平台,依托统一配置、标准化接口、模块解耦与可部署性等设计原则,打通从数据到真机部署的完整工程闭环,为产学研提供标准化底座,显著降低 VLA 研发工程门槛。

核心设计理念:一套积木,拼出任意 VLA
理解 FluxVLA 最关键的一个概念是它的模块化主干设计。
所有模型均继承 BaseVLA——视觉编码器、语言编码器、向 LLM 嵌入空间的投影层与动作预测头——因此可在 OpenVLA、LlavaVLA、GR00T、Pi0 与 Pi0.5 之间切换,而无需重写整套训练流程。
这就好比搭乐高积木:每块积木(视觉编码器、语言模型、动作头)都有标准的接口,想换一种语言模型骨干,直接替换那块积木就行,其他流程纹丝不动。
具体来说:
语言模型骨干支持 LLaMA、Gemma、Qwen 等主流系列;
视觉侧使用 DinoSigLIP(结合了 DINO 的局部特征提取能力和 SigLIP 的视觉-语言对齐能力);
视觉-语言联合模型则支持 PaliGemma 和 QwenVL。
这意味着研究者可以非常低成本地做消融实验,比较不同骨干组合的效果。
数据怎么进来的?多数据集混合训练
真实机器人数据是稀缺且异构的——有的实验室用 Parquet 格式存储,有的用 RLDS(来自 TensorFlow Datasets 的机器人学习数据格式)。
FluxVLA 原生支持这两种格式,更关键的是它支持多数据集混合训练。
数据形态原生支持 Parquet 与 RLDS 流水线,以及面向异构数据的多数据集混合训练。
这在工程上是一个不小的挑战:不同数据集的机器人形态、相机视角、动作空间都可能不同,FluxVLA 通过统一的数据变换层(Transform)把它们规范化为模型可以消化的格式,再按比例混合 batch。
推理加速:
Flash 融合算子 + RTC 轨迹优化
训练好模型只是第一步,让它在真实机器人上以低延迟稳定运行才是工程挑战所在。
FluxVLA 的推理侧有两个核心机制。
第一个是 Flash 融合算子:融合 GPU 算子与图友好推理路径,面向机器人基座模型实现高吞吐、低延迟推理。这本质上是把多个 GPU 计算步骤"合并"成更少的内核调用,减少数据在 GPU 内存和计算单元间的搬运次数,从而压缩推理延迟。
第二个是 RTC(Real-Time Chunking)引导式轨迹优化:以 Guided RTC 的 prefix / guidance 等方式引导动作轨迹,提升平滑度与实时控制稳定性。简单理解:模型每次不是生成"下一个时刻的动作",而是生成一小段平滑的动作"块"(chunk),同时允许外部信号(比如力传感器反馈)来引导这个过程,避免机器人动作抖动或突变。
代码架构:如何快速上手
对于想二次开发的研究者,官方给出了一个很好的阅读顺序建议:先看 config(明确实验目标与关键超参数),再看 module interfaces(关注输入输出张量、loss 项与关键中间变量),最后看 execution loops(理解训练步、评测步和检查点保存逻辑),这样可以用最短路径建立"config → code → results"的因果关系。

FluxVLA 解决了什么痛点?
FluxVLA 的价值在于把这套"基础设施"标准化、开源化,让研究者可以把精力集中在真正的科学问题上。什么样的模型架构更适合操作任务?
思维链推理对哪类任务帮助最大?如何用最少的真机数据泛化到新环境?这些问题,现在有了一个共同的实验平台来回答。

