TriSplat:让"前馈式三维重建"一次性吐出能直接做物理仿真的网格

论文原标题:
TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction
论文链接:
https://arxiv.org/abs/2605.26115
项目主页:
https://lhmd.top/trisplat/#interactive
代码地址:
https://github.com/ziplab/TriSplat
1
它想解决什么问题
想象你给机器人几张随手拍的照片,希望它马上"看懂"这个房间,不只是看个大概,而是能在物理引擎里跑碰撞检测、抓取规划、行走仿真。
这就要求重建出来的不是一团模糊的点云或"软椭球",而是 NVIDIA Isaac Sim、Unity、Unreal 这些引擎能直接吃进去的三角网格(mesh)。
近几年很流行"前馈式(feed-forward)"重建:训练好一个网络,输入图片、一次前向传播就直接输出三维表示,不用对每个场景单独做耗时的优化。但绝大多数前馈方法用的是高斯基元(Gaussian Splatting)。
高斯是一团各向异性的"模糊椭球",它本身不是表面,要变成网格,得额外跑 TSDF 融合或泊松重建这类后处理步骤。这一步既慢、又有损,等于把"一次前向搞定"的承诺给打破了。

2
核心思路:换掉基元本身
TriSplat 的出发点很直接,如果最后想要网格,那就让渲染基元本身就是表面元素。它把高斯换成了带朝向的三角面片(oriented triangle primitives)。
三角形天生就是表面单元,网络输出的这堆三角形本身就构成网格,无需任何中间提取。这就是标题里 "simulation-ready"(开箱即可仿真)的含义。
给定若干张无位姿图片,网络在一次前向中同时预测:稠密的局部三维点图(point map)、每像素的三角形属性、相机位姿,以及可选的相机内参。

需要说明的是,三角形可微渲染这条路并非 TriSplat 首创,它建立在 Triangle Splatting 之上,但后者只做单场景逐一优化,TriSplat 的贡献是把它首次带进了前馈、无位姿的设定。哪条路"更优"取决于你更看重渲染保真度、几何质量还是仿真可用性,本文是站在"仿真可用性优先"的立场上做的选择。
3
三个关键技术设计
把三角形朝向"锚定"到几何上,而不是让网络瞎猜
这是全文最核心的洞见。论文指出:三角形对朝向误差比高斯敏感得多。一个稍微歪了的高斯,因为有平滑的径向衰减,footprint 大致还盖在对的地方,梯度仍然有用,而一个歪了的三角形会产生硬边伪影,误差越大越刺眼。所以,把朝向当成一个"自由变量"让网络从零回归,是不靠谱的。
TriSplat 的做法是:先从预测的点图用有限差分算出几何法向(相邻像素的横向、纵向导数做叉乘,再归一化、翻转朝向相机),再用一个轻量 U-Net(输入了 RGB、深度、法向、有效性掩码)去细化它。一个工程细节很关键,这个细化头的输出层初始化为零,使它一开始就是恒等映射,然后慢慢学修正量,避免训练初期还没积累有用梯度就乱扰动朝向。
单目法向 bootstrap:破解"鸡生蛋"的冷启动
训练最初有个死循环:点图还不准 → 算出的法向就不可靠 → 细化网络也还没学会修正。TriSplat 用一个调度(schedule)来破局,早期直接借助一个预训练的单目法向估计器(Omnidata 教师)。
一个随时间变化的系数 α(t) 把教师法向和模型自己的法向混合(公式 5),分三阶段:
接管期(α=1):完全用教师法向定朝向;
混合期:α 按余弦曲线衰减;
释放期(α=0):完全靠模型自己的几何。
论文特别强调一个区别,这个 bootstrap 作用在前向表示上(教师法向直接进入三角形构造、影响渲染结果和所有下游梯度),而不是只作为一个 loss 项。这与"教师匹配损失"(只提供一个附加优化信号)本质不同。实践中两者同时用以求最大稳定性。
渐进式表面锐化:从"软糊糊"到"脆边"
还有个问题:三角形是硬边的,训练早期预测粗糙时,一个三角形可能完全错过目标像素 → 梯度为零 → 学习停滞。高斯就没这毛病(柔和衰减总能盖到一点)。
TriSplat 的解法是调度两个"柔软度"参数,让表示从"宽松、模糊"逐渐过渡到"锐利、可成网格":
不透明度调度(公式 7):用一个指数 e(t) 随训练增大,把中间密度逐步推向 0 或 1,即逐渐二值化;
模糊度调度(公式 8):每个三角形带一个 blur 参数控制边缘的 alpha 衰减,系数 β(t) 线性衰减。初期大模糊 → 软 footprint 大量重叠、梯度覆盖密,后期收紧 → 每个三角形成为清晰的表面元素。
不透明度管"贡献强度",模糊度管"贡献的空间范围",两者配合构成比单用其一更平滑的"软到脆"课程表。
4
实验结果
在 DL3DV 上的表面质量对,TriSplat 全面领先于高斯前馈基线。注意基线用的是 TSDF 融合出的网格,而 TriSplat 直接导出原生三角形:

更关键的是网格渲染质量,当所有方法都导出网格、用同一个三角光栅器渲染时,高斯基线因为 TSDF 是有损的而质量大跌,TriSplat 因为"渲染基元本身就是网格"几乎没有损失。6 视图下 PSNR 达到 20.84,明显高于次优的 YoNoSplat(18.88)。

5
总结
TriSplat 把可微渲染的基元从"模糊高斯"换成"有朝向三角形",让前馈式稀疏视角重建第一次能在单次前向中直接输出可仿真的网格,省掉了昂贵且有损的 TSDF 后处理,其关键在于把三角形朝向锚定到几何法向上,并用单目 bootstrap 和渐进锐化稳住训练。
