论文解读:Mamba-3——不用注意力,也能高效处理长文本?

当前主流大语言模型大多使用 Transformer 架构。Transformer 的能力很强,但在文本不断变长时,自注意力需要处理大量 Token 之间的关系,推理计算量和显存占用也会随之增加。
2026 年发布的 Mamba-3 论文尝试从状态空间模型出发,设计一种更加注重推理效率的序列模型。它希望在降低推理成本的同时,解决以往线性模型表达能力不足、状态跟踪能力较弱等问题。
一、论文基本信息
论文名称: Mamba-3: Improved Sequence Modeling using State Space Principles
作者: Aakash Lahoti、Kevin Y. Li、Berlin Chen、Caitlin Wang、Aviv Bick、J. Zico Kolter、Tri Dao、Albert Gu
发布时间: 2026 年3月
论文地址: Mamba-3 arXiv 页面
这篇论文目前属于 arXiv 预印本,核心目标是从模型效果、状态记忆和实际推理效率三个方面改进 Mamba 架构。
二、Mamba 和 Transformer 有什么区别?
Transformer 处理当前 Token 时,会通过注意力机制查看前面的许多 Token,从中找到与当前内容相关的信息。
Mamba 的思路则有所不同。它会不断维护一个隐藏状态,把之前读到的重要信息压缩到状态中:
旧状态 + 当前 Token → 新状态 → 当前输出
可以把 Transformer 理解成“回答问题时重新翻阅聊天记录”,而 Mamba 更像是“一边阅读,一边更新自己的笔记”。
这种方式不需要在每一步重新计算全部历史 Token,因此更适合追求低延迟和较低内存占用的生成任务。不过,压缩状态也可能丢失细节,这正是 Mamba-3 想要进一步改善的问题。
三、Mamba-3 的三项核心改进
1. 更精确的状态更新
Mamba-3 提出了一种名为 指数—梯形离散化(Exponential-Trapezoidal Discretization)的状态更新方法。
此前的状态更新更偏向于使用当前时刻的信息,而新的方法可以同时考虑相邻时刻的输入,使状态变化更加灵活。
用大白话来说,就像估计一辆汽车的运动状态:
只看汽车最后的位置,估计可能不够准确;
同时参考前后两个位置,就能更好地判断汽车如何移动。
论文还发现,这种状态更新方式与偏置参数结合后,可以替代许多循环模型中常见的短因果卷积模块。
2. 使用复数状态增强跟踪能力
Mamba-3 将状态空间扩展为复数形式。
这里不需要深入理解复数公式,可以简单认为:普通状态主要记录信息的“大小”,而复数状态还可以记录类似“旋转方向和相位”的信息。
这种设计与数据相关的旋转位置编码相联系,能够帮助模型更准确地跟踪不断变化的状态。实验中,完整的 Mamba-3 能够解决部分奇偶判断和模运算任务,而移除相关机制的版本以及 Mamba-2 在这些任务上表现较差。
3. 从 SISO 升级到 MIMO
传统 Mamba 更接近 SISO,即单输入、单输出的状态空间系统。
Mamba-3 则进一步提出 MIMO,也就是多输入、多输出。它可以让多组信息共同进入状态,并同时生成多组输出。
更重要的是,MIMO 将部分外积计算转换成了更适合 GPU 的矩阵乘法。虽然实际执行的浮点计算变多了,但 GPU 的利用率也更高,因此模型能力提升的同时,生成延迟没有明显增加。
四、Mamba-3 的整体流程
Mamba-3 的运行过程可以简单概括为:
输入 Token → 输入投影 → 指数—梯形状态更新 → 复数状态空间 → MIMO 计算 → 输出 Token
它不会在每次生成时重新查看全部历史内容,而是持续更新内部状态,并利用这个状态生成下一个 Token。
因此,Mamba-3 的重点并不是单纯增加参数,而是研究如何用更少的状态保存更多有效信息。
五、实验结果怎么样?
论文使用统一的训练流程,在 FineWeb-Edu 数据集上训练了多个不同规模的模型,并与 Transformer、Mamba-2 和 Gated DeltaNet 等架构进行比较。
在约 15 亿参数规模下:
Mamba-3 SISO 的平均下游准确率比 Gated DeltaNet 高约 0.6 个百分点;
MIMO 版本又比 SISO 版本提高约 1.2 个百分点;
总体比当时表现最强的对比线性模型高约 1.8 个百分点;
使用一半状态大小的 Mamba-3,可以获得与更大状态尺寸 Mamba-2 相近的困惑度。
在推理效率方面,Mamba-3 MIMO 在固定状态大小下执行了更多计算,但仍保持了与 Mamba-2 接近的实际解码延迟。论文同时提供了基于 Triton 和 CuTe DSL 实现的训练及推理内核。
六、Mamba-3 能取代 Transformer 吗?
目前还不能简单得出这个结论。
实验显示,Mamba-3 在关联回忆、问答和部分合成长文本检索任务上表现较好,但在半结构化或非结构化数据的信息提取任务中仍然存在不足。
论文作者也认为,固定大小的状态天然会限制信息检索能力。因此,未来更现实的路线可能不是完全去掉注意力,而是采用:
多层 Mamba + 少量自注意力层
这种混合架构既可以利用 Mamba 的高效状态更新,也可以利用注意力机制准确检索原始上下文。
七、这篇论文有什么意义?
Mamba-3 的意义在于,它说明大语言模型不一定只能依赖 Transformer。
过去,很多研究关注如何让注意力机制运行得更快;Mamba-3 则从另一个角度出发:重新设计模型保存和更新历史信息的方式。
这项研究尤其适合以下场景:
长文本连续生成
低延迟在线推理
智能体长时间运行
显存资源有限的模型部署
需要频繁生成 Token 的应用
它并没有证明 Transformer 已经过时,而是提供了一条新的技术路线:通过更好的状态空间模型,在能力与效率之间寻找新的平衡点。
八、总结
Mamba-3 的核心改进可以概括为:
更精确的状态更新、更加丰富的复数状态,以及更适合 GPU 的 MIMO 结构。
它希望解决过去线性模型“虽然计算快,但能力不够强”的问题。实验结果表明,Mamba-3 在语言建模、状态跟踪和推理效率之间取得了更好的平衡,但在复杂信息检索方面仍然需要注意力机制或混合架构的帮助。