技术博客
CV 计算机视觉

LoGeR:长上下文几何重建与混合记忆

Mr.黄先生2026-07-08 19:01
LoGeR:长上下文几何重建与混合记忆

论文主页:

https://arxiv.org/abs/2603.03269

项目主页:

https://loger-project.github.io/

代码地址:

https://github.com/Junyi42/LoGeR


用一个很聪明的混合记忆,把现代 feedforward 几何模型的局部强悍能力,线性扩展到了公里级、万帧级长视频,且不需要任何后处理。






简要总结




UC Berkeley等机构的研究团队提出LoGeR,一种结合了参数化测试时训练(TTT)记忆与非参数化滑动窗口注意力(SWA)的混合架构,成功将密集3D重建扩展到数千帧的长序列,在KITTI数据集上显著降低了轨迹误差。


核心方法

  1. 引入混合记忆模块:结合参数化TTT记忆(锚定全局坐标系,防止尺度漂移)与非参数化SWA机制(保留未压缩上下文,确保高精度相邻对齐)。

  2. 分块处理与课程学习:将视频流分块处理,利用强大的双向先验进行块内推理;采用渐进式课程学习策略,从简单序列逐步增加复杂性,稳定循环层优化。

  3. 克服数据壁垒:通过混合大规模场景数据集(如TartanAirV2)进行训练,提供长距离信号,帮助模型学习有效的几何压缩。






LoGeR 做了什么?




最近,基于前馈几何基础模型(如VGGT、π³)的3D重建工作取得了显著进展,但这些模型通常受限于短序列处理。


本文想要探索的核心是:如何在不进行后优化(Post-optimization)的情况下,将密集3D重建扩展到极长序列(如数千帧甚至上万帧)?


首先,现有的主流方法在长序列处理上存在明显短板。 基于Transformer的全局注意力机制计算复杂度是序列长度的平方(O(n²)),长序列根本无法承受;而基于循环神经网络(RNN)的设计虽然计算复杂度是线性的,但会将所有历史信息压缩到一个有损的隐藏状态中,导致细节丢失,无法保证相邻帧之间的高精度对齐,容易出现严重的尺度漂移(Scale Drift)。


因此,本文的路径选择是“分而治之”与“记忆互补”。 核心思路是:我们不试图一次性处理整个长序列,而是将其切分成多个有重叠的块(Chunk)。


在每个块内部,我们利用强大的双向几何骨干网络进行高精度密集预测。而为了解决跨块边界的一致性问题,我们设计了一个混合记忆模块,它既包含一个能锚定全局坐标系的“长期记忆”(TTT),也包含一个能保持局部细节的“短期记忆”(SWA)。


具体来说,LoGeR的实现分为三步:


第一步:分块处理与块内推理

我们做什么? 将输入的视频流分割成多个块(例如每块128帧),块与块之间有少量重叠。


目的是什么? 将无限长的序列转化为有限长的块,使得我们可以在每个块内部应用计算密集但精度极高的双向几何骨干网络(如VGGT或π³),进行高保真的密集深度和相机姿态估计。



第二步:

构建混合记忆模块(Hybrid Memory)

这是LoGeR最核心的创新。为了解决跨块边界的信息传递问题,作者设计了一个双组件系统:


参数化TTT记忆(Test-Time Training Memory):

  • 动作:维护一组“快权重”(Fast Weights),这些权重在训练和推理时都会更新。在推理时,TTT层先用存储的历史信息调整当前块的处理,然后用当前块的信息更新快权重。

  • 目的:锚定全局坐标系,防止尺度漂移。它具有无限感受野,能够压缩并存储长距离的全局上下文信息,但压缩是有损的。


非参数化SWA机制(Sliding Window Attention):

  • 动作:在相邻块之间(如当前块和前一个块)应用滑动窗口注意力,直接传播高保真特征。

  • 目的:保留未压缩的上下文信息,确保相邻块之间的高精度对齐。它保持局部细节无损,但计算和内存成本有限。


第三步:训练策略与数据混合

我们做什么? 采用渐进式课程学习(Curriculum Learning)策略,从简单序列开始训练,逐步增加序列的复杂性。同时,训练数据混合了大量大规模场景数据集(如TartanAirV2)。


目的是什么? 课程学习策略能促使模型从依赖SWA转向依赖TTT隐藏状态,从而稳定TTT层的优化。而大规模数据集的引入是为了克服“数据壁垒”,提供必要的长距离信号,帮助模型学习有效的几何压缩。






效果验证




研究在标准基准测试(KITTI)和新构建的长序列基准(VBR,包含长达19k帧的序列)上进行了评估。主要结果显示,LoGeR在长序列重建任务上显著优于现有方法。


最值得关注的对比项是绝对轨迹误差(ATE)尺度一致性。在KITTI数据集上,LoGeR将ATE降低了74%以上,平均性能甚至超过了最强的基于优化的方法VGGT-Long 32.5%。



在VBR数据集上,随着序列长度的增加,LoGeR表现出持续的改进,能保持全局尺度一致性,而基线模型则出现严重的尺度漂移。



消融研究也证实了混合记忆设计的必要性:移除TTT会导致全局一致性丧失,移除SWA则会导致局部平滑性变差。


点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发