让 AI 视频生成真正"听懂"你 图像、音频、姿态全都要

论文链接:
https://arxiv.org/abs/2604.11804
项目主页:
https://correr-zhou.github.io/OmniShow/
代码链接:
https://github.com/Correr-Zhou/OmniShow
这篇论文在解决什么问题?
想象这样一个场景:你是一家电商公司的内容运营,想批量生成"真人拿着产品介绍"的短视频。你手头有:产品图、主播形象图、一段介绍语音、以及想要的动作姿态。你希望一个 AI 系统帮你把这些素材"融合"成一段自然流畅的视频。
听起来合理吧?但现实是,现有的视频生成模型没有一个能同时处理这四种输入。 AnchorCrafter 只能接受骨骼+手部网格+物体深度图;HunyuanVideo-HOMA 用稀疏姿态加物体轨迹;DreamActor-H1 需要身体网格和目标框。它们各有专长,但都是"偏科生",尤其是,没有一个能利用音频线索。
这类方法都受限于严格的输入要求,无法利用音频线索,难以实现令人满意的灵活性和生成质量。
OmniShow 的目标就是做那个"全科优等生":统一文本、参考图像、音频和姿态条件,合成高质量的人-物交互视频。
任务定义:HOIVG 是什么?
论文将这个任务命名为 HOIVG(Human-Object Interaction Video Generation,人-物交互视频生成)。上面的图已经展示了它的全貌:输入可以是文本(T)、参考图像(R)、音频(A)、姿态序列(P)的任意组合,输出是一段高质量视频。
最简单的设置是只给一张参考图像,让模型生成视频(R2V);最难的是同时给图像+音频+姿态,要求视频的视觉内容、人物动作、嘴型/节奏全都对齐(RAP2V)。OmniShow 是目前唯一支持完整 RAP2V 设置的模型。
应用场景为什么重要? 这项任务在现实应用中具有重要价值,包括电商演示、短视频制作和互动娱乐等场景的内容创作自动化。
OmniShow 的三大技术创新
创新一:统一通道级条件注入
(Unified Channel-wise Conditioning)
这是解决"可控性 vs 质量"矛盾的核心方案。
问题的本质:怎么把参考图像和姿态序列这两类视觉信息"喂"给一个扩散模型(Diffusion Model),同时又不破坏它原本学到的生成能力?
传统做法通常是引入大量额外的交叉注意力层(Cross-Attention)来注入条件信息,但这会引入大量新参数,容易影响基础模型的生成质量。
OmniShow 的做法更"轻":通过统一的通道拼接方式有效注入参考图像和姿态线索,并用伪帧(pseudo-frames)增强噪声视频 token,再通过参考重建损失来保留语义细节。
用一个比喻来理解:想象扩散模型在处理一段"噪声视频",OmniShow 不是在这个视频旁边另开一条"参考图像通道",而是把参考图像作为额外的帧直接拼接进去,让模型在去噪的同时自然地"看到"参考外观。这样改动最小,对原始生成能力的干扰也最小。

创新二:门控局部上下文注意力
(Gated Local-Context Attention)
这个模块专门解决音频-视觉同步的问题。
音频驱动视频生成的核心难点在于:音频是一个连续信号,而视频是离散的帧序列。说话时嘴型要对上音素,唱歌时节奏要踩准拍子,这都需要模型知道"当前帧对应音频的哪个片段"。
OmniShow 将音频特征打包为含有充足上下文信息的形式,通过掩码注意力注入,使视频帧与对应的音频片段对齐,之后再用自适应门控来稳定早期训练。
这里有个微妙之处值得关注:为什么要用"门控(Gating)"? 在训练早期,音频特征是嘈杂的,如果一开始就让音频信号完全作用于视频生成,会让训练不稳定。门控机制就像一个"节流阀",训练初期它关小,让模型先学基本的视觉生成;随着训练推进,门控逐渐开大,模型才开始精细对齐音视频。这是一种非常务实的工程智慧。
创新三:解耦-再联合训练策略
(Decoupled-Then-Joint Training)
这个策略直接针对"数据稀缺"问题。
核心思路:既然没有"全套"的五元组数据,那就分而治之——先在各自的子任务数据集上训练专才模型,再把专才模型的"知识"合并成一个通才。
具体做法:首先在各自的子任务数据集上分别训练专门的 R2V 模型和 A2V 模型,然后通过权重插值(Weight Interpolation)将二者融合,最后进行联合微调,实现多模态能力的统一。
这个策略的精妙之处在于:权重插值(即两个模型的参数加权平均)本质上是一种"模型融合",在大模型时代已经被反复验证是一种有效且低成本的能力整合手段。它避免了从头训练"全能模型"所需的海量五元组数据,用一种工程上更可行的路径达到了同样的目的。
这篇论文的意义与局限
意义方面,OmniShow 的贡献可以分为三个层次。在应用层面,它让电商、短视频、虚拟主播等场景的内容生产自动化变得真正可行,你只需要准备好素材,而不是手工拼接多个专用工具。
在技术层面,Gated Local-Context Attention 和 Unified Channel-wise Conditioning 提供了两个可复用的技术积木,未来其他视频生成工作可以直接借用。在社区层面,HOIVG-Bench 作为第一个该领域专属评测集,填补了长期缺失的空白。
局限方面,论文本身没有刻意回避一些固有挑战。HOIVG 任务中,手部与物体的精细交互(比如手指拨动琴弦、手捏精细零件)依然是视频生成的"硬骨头",OmniShow 虽然比前人有改善,但并未完全解决穿透和形变问题。
此外,RAP2V 任务作为最全面的设置,目前唯一能做的就是 OmniShow 自己,缺乏真正意义上的同类竞品对比,其优势的"天花板"还有待后来者共同检验。
总结
OmniShow 是第一个真正把"看图 + 听声 + 跟姿势"三种能力统一进同一个视频生成模型的工作,而且它不靠堆叠大量新模块,而是用三个设计精巧的轻量机制做到了这一点。
对研究者而言,这篇论文最值得学习的是它对"三元矛盾"(可控性、质量、数据稀缺)的系统性拆解方式,每个技术贡献都精准对应一个具体痛点,没有技术噱头,朴实而有效。
