AI 视觉进化到哪了?从 Molmo 的开源逆袭到 VGGT 的极速推断,读懂这四篇论文就够了

2025年视觉AI正通过Molmo模型的性能突破、VGGT的高效几何推理、离散扩散时间步Token的统一架构以及物理级逆渲染系统,集体推动视觉智能从像素理解迈向物理世界建模的根本性变革。
基于离散扩散时间步
标记的生成式多模态预训练方法

这篇论文提出了一种统一视觉理解与生成的创新多模态预训练方法。
针对传统基于空间顺序的视觉token难以被语言模型有效处理的局限,该方法创新性地引入离散扩散时间步token,将扩散过程中的时间步转化为具有递归结构的离散视觉“词汇”,使其能够像语言一样被自回归模型学习。
这些token可随噪声增加递归补偿图像属性损失,实现在任意扩散时间步精准重建图像。
该框架首次在单一模型中无缝整合了大语言模型的自回归推理能力与扩散模型的精细生成能力,在多项多模态理解与生成任务上达到领先性能,为构建真正的通用多模态模型提供了新路径。
论文链接:
https://arxiv.org/abs/2504.14666
项目主页:
https://ddt-llama.github.io/
代码地址:
https://github.com/selftok-team/SelftokTokenizer/
Molmo与PixMo:
开源权重与数据驱动的前沿视觉-语言模型

这篇论文的核心贡献在于论文推出了 Molmo 系列视觉-语言模型。其关键突破在于开发了一套名为 PixMo 的全新数据集,该数据集完全是在不使用外部闭源模型(如 GPT-4o)进行数据蒸馏的情况下收集的。
PixMo 包含了高度详细的图像描述(用于预训练)、自由形式的图像问答(用于微调)以及一种创新的 2D 点选(pointing)数据集。这种方法填补了社区在“如何从头开始构建高性能 VLM”方面的知识空白。
实验表明,通过精细的模型选择和高质量的原始数据,Molmo 取得了极佳的效果。其 72B 参数模型在学术基准和人类评估中,不仅超越了其他开源模型,甚至优于 Claude 3.5 Sonnet、Gemini 1.5 Pro 和 Flash 等闭源模型,性能仅次于 GPT-4o。
该论文通过实验证明了,数据质量(而非仅仅是数据量或蒸馏技术)是构建顶尖视觉语言模型的关键。
论文链接:
https://arxiv.org/abs/2409.17146
代码地址:
https://github.com/allenai/molmo
VGGT:视觉几何基础Transformer架构

传统 3D 计算机视觉模型通常受限于特定任务(如仅进行深度估计或仅估计相机姿态),而 VGGT 是一种通用的前馈神经网络,能够从单张、少量或数百张图像视图中,直接推断出场景的所有关键 3D 属性。
该模型能够同时处理并输出多种 3D 信息,包括:
相机参数;
点图与深度图;
3D 点轨迹。
该网络可以在 1 秒内完成图像重建,展现了极高的运行效率。尽管是纯前馈推理,其表现依然优于那些需要复杂后期处理和视觉几何优化技术的传统方法。
它在相机参数估计、多视图深度估计、密集点云重建以及 3D 点追踪等多项任务中均取得了最先进的结果。
研究表明,将预训练的 VGGT 作为特征骨干网络,可以显著提升下游任务的性能,例如:
非刚性点追踪;
前馈新视角合成。
论文链接:
https://arxiv.org/ab/s/2503.11651
项目主页:
https://vgg-t.github.io/
代码地址:
https://github.com/facebookresearch/vggt
基于传播光线的神经逆向渲染技术

该系统提出了一种具有时间分辨率的神经辐射缓存扩展技术。
这种技术通过存储从任何方向到达空间中任何点的无限次反弹辐射,极大地加速了逆渲染过程。
该模型能够精确地计算直接和间接光传输效应。当应用于闪光激光雷达系统捕捉的测量数据时,即使在存在强间接光干扰的情况下,它也能实现最先进的 3D 重建效果。
除了 3D 重建,该论文还展示了多项创新能力,包括:
光传播的视图合成:模拟光在场景中传播的视觉效果。
自动分量分解:将捕捉到的测量数据自动分解为直接光分量和间接光分量。
时空重照明:实现捕捉场景的多视角时间分辨重照明。
它是该领域内首个能够从光传播的多视角视频中进行物理驱动的神经逆渲染的系统。
论文链接:
https://arxiv.org/abs/2506.05347
