告别僵硬编舞!RoboPerform如何让机器人“听懂”音乐与语音并Freestyle?

论文链接:
https://arxiv.org/abs/2512.23650
项目主页:
https://gentlefress.github.io/RoboPerform-proj/
视频Demo:
https://www.youtube.com/watch?v=YAEdWPqXemQ
传统方法先用音频生成人体运动、再进行运动重定向(retargeting)到机器人,最后用控制器跟踪。这种多阶段流水线会产生级联误差、高延迟,且声学-动作映射不连贯。
论文提出“motion = content + style”原则:把内容(语义任务,如“跳舞”)固定为预训练运动潜在向量,把音频作为隐式风格信号(节奏、韵律),彻底省略显式运动重建和重定向,实现低延迟、高保真控制。
核心方法

音频-动作对齐模块(Audio-Motion Alignment)
为了让音频具备“动感”,研究团队训练了一个适配器(Adaptor)。通过 InfoNCE 对齐损失函数,将原始音频潜变量(Audio Latent)与动作潜变量(Motion Latent)在嵌入空间中对齐,。这意味着音频信号在输入模型前,就已经被赋予了运动学先验知识,确保了动作与节奏的高度一致。
ΔMoE 教师策略(Delta Mixture of Experts)
为了应对复杂多样的动作模式,教师策略采用了创新的 ΔMoE 架构。
分层专家设计:包含 4 个 MLP 专家,每个专家负责处理不同子空间的条件输入(如本体感知信息、历史观测、参考动作等)。
残差增量学习:不同于传统 MoE 的竞争机制,ΔMoE 借鉴了分类器自由引导(CFG)的思想,通过计算专家间的增量贡献(Δa)来消除冗余并增强互补性,。这种设计显著提升了动作的精确度和多样性。
扩散策略学生网络(Diffusion Student Policy)
研究团队利用 DAgger 算法将教师策略的知识蒸馏到基于扩散模型的学生策略中。
解耦控制:在扩散模型的去噪过程中,内容潜变量作为基础引导,而对齐后的音频潜变量作为风格信号,在多个层级被注入网络。
实时性能:通过两步 DDIM 采样方案,学生策略可以在 Unitree G1 等机器人硬件上实现超低延迟的实时部署。
实验结果
研究团队在 FineDance(舞蹈)和 BEAT2(语音动作)两个大型数据集上进行了验证,并直接在 Unitree G1 人形机器人上进行了实机部署。
数据集:FineDance(音乐舞蹈)、BEAT2(语音共言语势),10秒片段@30FPS。
基线:显式运动生成(EMAGE/FineNet)+ 重定向(PBHC)+ 跟踪策略。
关键指标(IsaacGym / MuJoCo 模拟器):

音频-运动对齐:R@1 达66.7%(音乐)/64.6%(语音)。
真实世界:成功部署在Unitree G1人形机器人上,50Hz控制,物理可行性与节奏对齐极佳。
消融实验证实:Adaptor、∆MoE残差融合、音频风格注入、固定内容潜在都显著提升性能。
总结
RoboPerform 用 “内容固定 + 音频风格注入” + ∆MoE教师蒸馏扩散学生,彻底终结了“生成→重定向→跟踪”的时代痛点,把音频变成人形机器人最自然的指挥棒。
