MiniCPM-o 4.5 论文解读:9B 全双工全模态大模型如何用 Omni-Flow 实现边听边看边说

论文原标题:
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
论文链接:
https://arxiv.org/abs/2604.27393
代码地址:
https://github.com/OpenBMB/MiniCPM-V
现有模型差在哪里
要理解这篇论文的价值,得先看清楚现有多模态模型的两个根本短板。
第一个短板是感知和响应被切成了两段。模型先把你的输入"吃完",再开始"吐出"回答,中间不会回头。这意味着你新说的话、画面里新出现的东西,它在生成回答时完全感知不到。想象你给一个人讲话,他一旦开口回答就闭上眼睛、捂上耳朵直到说完,这就是当前大多数多模态模型的状态。
第二个短板是模型只会被动反应。你不问,它不答。但真正自然的交互里,助手应该能主动说话:看到你忘了拿钥匙提醒一句,看到你做错一步主动指出来。当前模型完全不具备这种"主动性",它在等你按下"说话键"。
论文一针见血地指出:现在的瓶颈不再是模态覆盖度,也不再是延迟,而是交互范式本身。

核心思路:把时间轴变成"共享坐标系"
MiniCPM-o 4.5 提出的关键技术叫做 Omni-Flow(全模态流式框架)。它的核心想法说起来很优雅:让所有的输入流和输出流,沿着同一条时间轴对齐到毫秒级别。
我用一个比喻帮你理解。想象一个交响乐团:小提琴、钢琴、鼓各自演奏(对应视频流、音频流、文本输出流、语音输出流)。传统模型的处理方式是"等小提琴拉完一段,再让钢琴弹",严格的顺序执行。
Omni-Flow 的方式则是:指挥(LLM 主干)每隔几毫秒扫一眼每个乐器,把当前时间片内所有流的状态统一打包成一个"信息组",顺序送进 LLM 处理。
这种机制论文里叫做时分复用(Time-Division Multiplexing,TDM)。它把原本"并行不可调和"的多模态流,转换成 LLM 能消化的"顺序序列",同时保留了所有流的时间对齐关系。

关键设计权衡

结论非常清晰:时间块不是越小越好,块太小(0.1s)虽然反应更灵敏,但每块内能放的信息太少,导致模型决策不稳定。显式边界比隐式好,让模型清楚知道哪是输入哪是输出能减轻负担。把"是否说"和"说什么"解耦(LS 形式)比混在一起预测(LT)更稳定。
TAIL:解决"说慢半拍"的问题
还有一个微妙的难题:文本生成速度和语音播放速度不匹配。如果一秒钟生成的文字需要花两秒才能念完,语音就会越来越滞后于当下场景。
论文提出 TAIL(Time-Aligned Interleaving) 策略,让模型根据累积的播放进度动态调整每个时间块要生成多少文字,如果之前已经"欠"了一点时间,下一块就少生成一些,让语音赶上来。同时还保留少量"前瞻"上下文用于发音判断(比如"the apple"和"the car"中"the"的发音不同)。
性能表现

MiniCPM-o 4.5 用 9B 参数逼近了 Gemini 2.5 Flash,在 OmniDocBench 文档解析上甚至以 0.109 的成绩大幅领先(数值越低越好),全面超越了 3 倍大的 Qwen3-Omni-30B。
在全模态理解上(Table 7),它在 Daily-Omni(80.2)、Video-Holmes(64.3)、AVUT-Human(78.6)等 7 个基准中的 5 个上拿到第一。在视觉全双工流式基准 LiveSports-3K-CC 上,它达到 54.4 的胜率,比 LiveCC 高 12.9 分,比 StreamingVLM 高 8.8 分。
总结
这篇论文的意义不只是又一个 SOTA 模型。它代表了多模态交互范式的根本转变,从"轮流对话"走向"持续共存",从"被动响应"走向"主动参与"。Omni-Flow 框架提供了一个统一的时间轴视角,把感知、决策、生成都纳入同一个连续过程。
