InternVideo3深度解读:MCR 闭环推理 + M²LA 省显存注意力

论文链接:
https://arxiv.org/pdf/2606.12195
代码地址:
https://github.com/OpenGVLab/InternVideo
MCR:把"看视频"变成一个闭环
传统多模态问答是单向的:视频进,答案出。MCR(多模态情境推理)把它改成一个循环:观察 → 推理 → 选择动作 → 接收反馈 → 更新认知,直到能回答为止。
所有东西——画面、指令、推理痕迹、工具输出、记忆,都塞进一个不断增长的"共享上下文"里,这个上下文充当模型的信念状态,记录看到了什么、推出了什么、还有哪些不确定。

M²LA:不丢画面,只压缩缓存
长视频闭环推理最大的瓶颈不是输入有多长,而是 KV 缓存爆炸,视频本身就占大量 token,推理过程还会越积越多。常见省钱办法是丢帧、抽样、做摘要,但可能丢掉后面要用的关键信息。
M²LA 换了思路:token 一个不丢,只压缩注意力内部的缓存状态。它把每个 token 的键值(KV)存成一个紧凑的潜在向量,用到时再实时重建出各注意力头需要的形态。它建立在 DeepSeek 提出的 MLA(多头潜在注意力)之上,并额外解决了 Qwen3 的逐头 QK-Norm 带来的兼容问题。

效果很直接:KV 缓存约减半,长上下文解码最高提速约 5 倍,并能处理到 768K token 输入,而原始模型在 512K 就显存溢出(OOM)了。

训练:四步把能力补回来再强化
注意力一改,模型原有能力会"错位",所以训练分四步:
转换后继续预训练(恢复语言和多模态对齐)。
短到长的视频监督微调(从 512 帧逐步到 2048 帧、约 256K token)。
基于规则的强化学习(用 GSPO,一种 Qwen 团队提出的序列级 RL 算法,在视频问答和时间定位这类"答案可验证"的任务上训练)。
在线策略蒸馏(让 Qwen3-235B 当老师,针对学生自己生成的轨迹打分纠偏)。
实验结果
在开源同规模模型里,InternVideo3 在多个长视频基准上领先,尤其是 Video-MME、MLVU、VRBench、EgoSchema:

其中 EgoSchema 的 76.6 略微超过论文报告的人类水平 76,作者特意提醒,单一基准超人类要谨慎看待。短视频和时间定位任务上同样有竞争力。
论文还把模型实例化成视频智能体,能调用分割、语音识别、搜索、验证等工具反复取证;一个小实验显示,在 Video-MME 上加入 MCR 推理可从 73.1 提到 75.8。
总结
这种把局限写在明处的态度,反而让结论更可信:对长视频智能而言,高效的上下文处理 + 闭环推理,是比单纯堆更大模型更值得投入的方向。

