收好这 5 篇 ICCV 2025 巅峰之作!从单图 3D 到多模态 Mamba,一文看清计算机视觉的未来


当大家还在卷模型参数时,这几篇来自 ICCV 2025 的顶尖论文已经悄悄改变了游戏规则!
以下论文都被ICCV收录为HighLight论文。
Diorama:零样本单视图
三维室内场景建模框架的提出

论文《Diorama: Unleashing Zero-shot Single-view 3D Indoor Scene Modeling》 介绍了一个创新性的系统,其技术核心在于无需端到端训练或人工标注,即可从单张 RGB 图像中实现结构化的 3D 场景建模。
该论文的技术方案主要通过将复杂的建模问题分解为以下四个关键子任务来实现:
架构重建:负责恢复房间的基础结构(如墙壁、地板和天花板的布局),为后续物体摆放提供空间框架。
3D 形状检索:利用现有的 CAD 模型库,为图像中识别出的物体检索出几何形状最匹配的 3D 模型,从而确保场景的可交互性和紧凑表示。
物体姿态估计:确定检索到的 3D 模型在三维空间中的准确位置、旋转角度和缩放比例,使其与 2D 图像中的观察结果对齐。
场景布局优化:通过全局优化的方式,调整物体与架构、物体与物体之间的关系,以消除物理冲突并提升 3D 场景的整体合理性。
技术优势:
• 零样本与开放世界能力:由于不依赖昂贵的真实世界标注或单调的合成数据进行训练,该系统对未见过的物体或领域具有极强的泛化能力。
• 多任务扩展:除了处理真实图像,Diorama 还能处理互联网图像,并支持文本到场景的转换任务。
论文链接:
https://arxiv.org/abs/2411.19492
项目主页:
https://diorama-scene.github.io/
代码地址:
https://github.com/theN some/Diorama
MambaFusion:高保真度高度感知的
多模态三维目标检测稠密全局融合方法

MambaFusion 首次证明纯状态空间模型(Mamba块)可在相机-LiDAR多模态3D检测中实现高效的全局稠密融合。
针对此前方法存在的计算效率、远程建模与信息保留难以兼顾的问题,本研究提出高保真高度LiDAR编码,通过连续空间体素压缩保留关键高度信息以优化模态对齐,并设计混合Mamba块同步学习局部细节与全局上下文。
在nuScenes验证集上,该方法以75.0 NDS达到先进性能,且推理速度更快,为多模态感知提供了高效且强性能的新架构。
论文链接:
https://arxiv.org/abs/2507.04369
CoMatch:基于动态共视感知Transformer
的双向亚像素级半稠密图像匹配

CoMatch 是一种新型的半稠密图像匹配方法,其技术核心在于利用动态共视感知和双向亚像素精度来提升匹配的准确性与效率。
该论文的技术部分主要包含以下三个创新模块:
共视引导的令牌压缩器:针对全图特征交互计算冗余的问题,该模块通过动态估计共视分数,自适应地聚合令牌(tokens)。这在确保计算效率的同时,增强了聚合令牌的特征表示能力。
共视辅助注意力机制:由于与大量非共视区域的特征交互会干扰特征的辨识度,该机制专门用于选择性地抑制来自非共视区域的无关信息。这使得注意力机制能够更聚焦于相关的区域,从而提高特征的稳健性和紧凑性。
双向亚像素精细化相关模块:传统的精细化阶段通常只将目标图的关键点调整到亚像素级别,而源图关键点仍停留在粗粒度级别。CoMatch 开发了一个强效模块,能够同时将源视图和目标视图的匹配候选点精细化至亚像素水平,显著提升了位置敏感型任务的性能。
论文链接:
https://arxiv.org/abs/2503.23925
ReME:面向无需训练
开放词汇分割的数据中心化框架

ReME 是一项针对无需训练的开放词汇分割的研究,其技术核心在于从“以模型为中心”转向“以数据为中心”的思路。
该论文的技术部分主要包含以下两个核心组件:
高质量参考集构建流水线:研究者发现,训练阶段的缺失可以通过高质量的参考数据来补偿。该流水线旨在构建一个包含高质量“片段-文本”嵌入对的参考集。通过解决数据质量问题,为稠密场景理解任务提供了更精准的参照基准。
简单的相似度检索机制:与以往设计复杂检索过程或依赖预训练模型(如 CLIP)内部注意力机制的方法不同,ReME 采用了一种简单的基于相似度的检索方法。这种设计旨在揭示高质量数据对分割结果的本质贡献,证明了即便没有复杂的模型微调,优秀的参考集也能显著提升性能。
该框架在十个基准数据集上的表现超过了所有现有的无需训练的 OVS 方法,证明了数据驱动的设计在推进开放词汇任务中的重要性。
论文链接:
https://arxiv.org/abs/2506.21233
代码地址:
https://github.com/xiweix/ReME
视觉表征学习中的区域聚类判别方法

这篇论文旨在增强视觉表示学习中的区域级(Region-level)感知能力,以弥补现有模型在密集预测任务中的不足。
虽然像 CLIP 和 SigLIP 这样的视觉语言模型在零样本学习上表现出色,但它们主要依赖全局表示,这限制了它们在 OCR(光学字符识别)、目标检测和语义分割等需要精细区域信息的密集预测任务中的效果。
大规模区域数据集:为了支持区域级学习,研究团队构建了一个十亿级的候选区域数据集,为模型提供了海量的局部语义信息。
Region Transformer 层:论文提出了一种专门的 Region Transformer 层,用于从图像的特定区域中提取丰富的语义特征,从而提升模型对局部细节的理解力。
统一的聚类判别损失:设计了一种统一的区域聚类判别损失函数。该损失函数能够在一个分类框架内同时支持物体识别和 OCR 学习,并支持在大规模数据上进行高效的分布式训练。
性能表现:RICE 在分割、密集检测以及多模态大语言模型的视觉感知任务上一致优于之前的算法。
论文链接:
https://arxiv.org/abs/2507.20025
预训练模型链接:
https://github.com/deepglint/MVT

诚邀各位创新者们和我们一起共创知识库实践板块!你只需将已在GM成功复现的项目,通过收集表花几分钟提交。
审核通过后,我们会在2天内将算力赠送金发到你的账户。这笔赠送金可以直接用来开启你的下一个实验。
你上传的优秀工程,也将被收录进平台知识库的实践板块,成为吸引更多同行与后来者的灯塔。
轻松一步,兑换资源,也沉淀足迹。
期待你的分享!
