技术博客
CV 计算机视觉

Sapiens2 解析:Meta 用 10 亿张人类图像炼出的视觉基础模型

Mr.黄先生2026-07-08 19:01
Sapiens2 解析:Meta 用 10 亿张人类图像炼出的视觉基础模型

论文链接:

https://arxiv.org/abs/2604.21681

代码地址:

https://github.com/facebookresearch/sapiens2




为什么要做"以人为中心"

的视觉基础模型?


当我们看一张人的图片时,我们其实在同时回答很多问题:他摆的什么姿势?哪些像素属于头发、哪些属于眼镜?他离镜头多远?他皮肤的真实颜色(去掉光照后)是什么?


这些任务过去往往需要各自专门的网络。Sapiens 系列的核心信念是:只要在足够多的人类图像上预训练一个足够强的视觉骨干,所有这些密集预测任务都可以共享同一套架构


Sapiens2 是这条路线在 2026 年的最新答卷,模型规模推到 50 亿参数,分辨率从原生 1K 扩展到层级化 4K,预训练数据从初代的 3 亿张扩到 10 亿张人类图像。但比规模更重要的,是它在预训练目标上的融合设计。




核心创新:把 MAE 的"细节"

和对比学习的"语义"焊在一起


要理解这篇论文最核心的贡献,你需要先理解视觉自监督学习里两条路线的根本权衡。


第一条路是掩码图像建模(MAE):把图像切成 patch,遮住 75%,让模型重建被遮住的部分。这是一种"压缩学习",模型必须把纹理、颜色、形状这些底层信息编码进特征里才能完成重建。好处是细节强,坏处是语义弱,你直接拿 MAE 特征做零样本任务效果不够好。


第二条路是对比学习(DINO 系列):对同一张图做不同的增强,让模型学会"无论怎么变换,这都是同一个东西"。这种"实例不变性"目标会迫使模型学到高层语义。好处是语义强,坏处是细节弱,为了保持不变性,模型会主动丢弃颜色、精细纹理这些"会被增强变化"的信号,而这些恰恰是密集预测最需要的。


打个比方,MAE 像素描师,对每根线条都敏感,但不太懂画的是谁,DINO 像漫画家,一眼能识别人物,但画出的细节是抽象化的。Sapiens2 想要的是既能精细描绘又能理解语义的画家。



总损失就是两者加权:ℒ = ℒ_MAE + λ · ℒ_CL。这里有一个非常关键的工程细节,全局视图不做颜色增强。因为全局视图同时要服务于 MAE 重建,如果做了颜色变换,重建目标就被污染了,会损害模型对真实颜色的敏感度,而这对下游的反照率(albedo)预测至关重要。


在数据上,Sapiens2 从约 40 亿张图像的网络规模池子里,通过多阶段过滤(人体检测、美学评分、CLIP 特征、去重、聚类平衡)筛出 10 亿张高质量人类图像。


预训练阶段不使用任何任务标签,也不注入任何人体先验,让数据本身决定模型学到什么。



要把 ViT 训到 5B 参数还能稳定收敛,Sapiens2 系统性地引入了一系列从语言大模型借来的工程经验:RMSNorm 替代 LayerNorm(更稳更快)、分组查询注意力 GQA(降低带宽压力)、SwiGLU 门控 FFN(表达能力更强)、QK-Nor(防止 logit 爆炸,长训练稳定性的关键)、以及 PixelShuffle 解码器(无棋盘格伪影的高分辨率上采样)。


而 4K 分辨率的挑战,我们可以算一笔账:4096×3072 在 patch size 16 下会切成 49152 个 token,标准注意力的 O(N²) 复杂度让它几乎无法直接训练。




五大任务的统一微调


预训练好的骨干保持不变,只在五个任务上加轻量任务头微调:308 关键点姿态估计、29 类身体部件分割、逐像素 XYZ 点图、表面法线、漫反射反照率


其中点图、法线、反照率三个几何/光学任务完全用合成数据训练,因为真实场景几乎不可能拿到这种像素级 ground truth,但模型最终对真实图像的泛化非常好。


后三个任务的损失普遍包含 L2 + 梯度差,梯度差项让边界更锐利,这对深度和法线这类有强空间结构的任务特别重要。



实验结果


最有说服力的实验是密集探针:冻结骨干,只用相同超参微调任务头,直接对比不同预训练方法学到的特征质量。



这张表透露出一个有意思的信号:初代 Sapiens 在反照率上很强、姿态偏弱(印证了 MAE 的特性),DINOv3 在姿态和几何任务上很强(印证了对比学习的优势),而 Sapiens2 在所有维度上同时领先,这就是融合两种范式的回报。



总结


读完这篇论文,有几个值得继续思考的开放问题。


Sapiens2 目前还是单帧模型,人类视觉应用大量需要时序连贯性,这套范式如何迁移到视频?它的语义特征已经很强但还没有和文本对齐,如果接到 CLIP 风格的文本编码器或 LLM 上会有什么新能力?以及 10 亿图像的多样性虽做了人工审计,但跨人种、年龄、文化的公平性如何系统性评估?


这些都是这篇论文之后值得继续探索的方向。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发