技术博客
LLM 大语言模型论文解读

论文解读:Mamba-3——不用注意力,也能高效处理长文本?

LSST2026-07-20 18:56
论文解读:Mamba-3——不用注意力,也能高效处理长文本?

当前主流大语言模型大多使用 Transformer 架构。Transformer 的能力很强,但在文本不断变长时,自注意力需要处理大量 Token 之间的关系,推理计算量和显存占用也会随之增加。

2026 年发布的 Mamba-3 论文尝试从状态空间模型出发,设计一种更加注重推理效率的序列模型。它希望在降低推理成本的同时,解决以往线性模型表达能力不足、状态跟踪能力较弱等问题。

一、论文基本信息

论文名称: Mamba-3: Improved Sequence Modeling using State Space Principles
作者: Aakash Lahoti、Kevin Y. Li、Berlin Chen、Caitlin Wang、Aviv Bick、J. Zico Kolter、Tri Dao、Albert Gu
发布时间: 2026 年3月
论文地址: Mamba-3 arXiv 页面

这篇论文目前属于 arXiv 预印本,核心目标是从模型效果、状态记忆和实际推理效率三个方面改进 Mamba 架构。

二、Mamba 和 Transformer 有什么区别?

Transformer 处理当前 Token 时,会通过注意力机制查看前面的许多 Token,从中找到与当前内容相关的信息。

Mamba 的思路则有所不同。它会不断维护一个隐藏状态,把之前读到的重要信息压缩到状态中:

旧状态 + 当前 Token → 新状态 → 当前输出

可以把 Transformer 理解成“回答问题时重新翻阅聊天记录”,而 Mamba 更像是“一边阅读,一边更新自己的笔记”。

这种方式不需要在每一步重新计算全部历史 Token,因此更适合追求低延迟和较低内存占用的生成任务。不过,压缩状态也可能丢失细节,这正是 Mamba-3 想要进一步改善的问题。

三、Mamba-3 的三项核心改进

1. 更精确的状态更新

Mamba-3 提出了一种名为 指数—梯形离散化(Exponential-Trapezoidal Discretization)的状态更新方法。

此前的状态更新更偏向于使用当前时刻的信息,而新的方法可以同时考虑相邻时刻的输入,使状态变化更加灵活。

用大白话来说,就像估计一辆汽车的运动状态:

  • 只看汽车最后的位置,估计可能不够准确;

  • 同时参考前后两个位置,就能更好地判断汽车如何移动。

论文还发现,这种状态更新方式与偏置参数结合后,可以替代许多循环模型中常见的短因果卷积模块。

2. 使用复数状态增强跟踪能力

Mamba-3 将状态空间扩展为复数形式。

这里不需要深入理解复数公式,可以简单认为:普通状态主要记录信息的“大小”,而复数状态还可以记录类似“旋转方向和相位”的信息。

这种设计与数据相关的旋转位置编码相联系,能够帮助模型更准确地跟踪不断变化的状态。实验中,完整的 Mamba-3 能够解决部分奇偶判断和模运算任务,而移除相关机制的版本以及 Mamba-2 在这些任务上表现较差。

3. 从 SISO 升级到 MIMO

传统 Mamba 更接近 SISO,即单输入、单输出的状态空间系统。

Mamba-3 则进一步提出 MIMO,也就是多输入、多输出。它可以让多组信息共同进入状态,并同时生成多组输出。

更重要的是,MIMO 将部分外积计算转换成了更适合 GPU 的矩阵乘法。虽然实际执行的浮点计算变多了,但 GPU 的利用率也更高,因此模型能力提升的同时,生成延迟没有明显增加。

四、Mamba-3 的整体流程

Mamba-3 的运行过程可以简单概括为:

输入 Token → 输入投影 → 指数—梯形状态更新 → 复数状态空间 → MIMO 计算 → 输出 Token

它不会在每次生成时重新查看全部历史内容,而是持续更新内部状态,并利用这个状态生成下一个 Token。

因此,Mamba-3 的重点并不是单纯增加参数,而是研究如何用更少的状态保存更多有效信息。

五、实验结果怎么样?

论文使用统一的训练流程,在 FineWeb-Edu 数据集上训练了多个不同规模的模型,并与 Transformer、Mamba-2 和 Gated DeltaNet 等架构进行比较。

在约 15 亿参数规模下:

  • Mamba-3 SISO 的平均下游准确率比 Gated DeltaNet 高约 0.6 个百分点

  • MIMO 版本又比 SISO 版本提高约 1.2 个百分点

  • 总体比当时表现最强的对比线性模型高约 1.8 个百分点

  • 使用一半状态大小的 Mamba-3,可以获得与更大状态尺寸 Mamba-2 相近的困惑度。

在推理效率方面,Mamba-3 MIMO 在固定状态大小下执行了更多计算,但仍保持了与 Mamba-2 接近的实际解码延迟。论文同时提供了基于 Triton 和 CuTe DSL 实现的训练及推理内核。

六、Mamba-3 能取代 Transformer 吗?

目前还不能简单得出这个结论。

实验显示,Mamba-3 在关联回忆、问答和部分合成长文本检索任务上表现较好,但在半结构化或非结构化数据的信息提取任务中仍然存在不足。

论文作者也认为,固定大小的状态天然会限制信息检索能力。因此,未来更现实的路线可能不是完全去掉注意力,而是采用:

多层 Mamba + 少量自注意力层

这种混合架构既可以利用 Mamba 的高效状态更新,也可以利用注意力机制准确检索原始上下文。

七、这篇论文有什么意义?

Mamba-3 的意义在于,它说明大语言模型不一定只能依赖 Transformer。

过去,很多研究关注如何让注意力机制运行得更快;Mamba-3 则从另一个角度出发:重新设计模型保存和更新历史信息的方式。

这项研究尤其适合以下场景:

  • 长文本连续生成

  • 低延迟在线推理

  • 智能体长时间运行

  • 显存资源有限的模型部署

  • 需要频繁生成 Token 的应用

它并没有证明 Transformer 已经过时,而是提供了一条新的技术路线:通过更好的状态空间模型,在能力与效率之间寻找新的平衡点。

八、总结

Mamba-3 的核心改进可以概括为:

更精确的状态更新、更加丰富的复数状态,以及更适合 GPU 的 MIMO 结构。

它希望解决过去线性模型“虽然计算快,但能力不够强”的问题。实验结果表明,Mamba-3 在语言建模、状态跟踪和推理效率之间取得了更好的平衡,但在复杂信息检索方面仍然需要注意力机制或混合架构的帮助。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发