告别“手残”与“眼花”:这三大黑科技正让机器人拥有超越人类的精准操作力!

当机器人学会了“划重点”、看深度、控双臂,具身智能离进化出人类般的直觉还有多远?
DTP:一种面向视觉-语言动作
模型的简单高效干扰令牌剪枝框架

研究发现,VLA模型在处理机器人任务时,其注意力机制会过度分散到与任务无关的图像区域,产生大量“干扰Token”,严重影响动作生成的准确性与可靠性。
为此,团队提出DTP(干扰Token剪枝)框架,其核心特点是:
即插即用:无需修改模型架构或添加额外输入,可直接嵌入现有VLA系统。
动态剪枝:在推理过程中自动识别并剪除图像中的干扰Token。
注意力修正:通过消除视觉噪声,迫使模型注意力聚焦于任务相关区域,从而提升动作决策质量。
研究进一步揭示,任务成功率与模型在无关区域的注意力分配呈显著负相关。DTP通过抑制这些干扰,能够在不增加参数的情况下,充分释放现有模型的性能潜力。
该方法具有良好的通用性,可广泛适用于各类基于Transformer的VLA模型。
在标准评测集SIMPLER上的实验表明,DTP可稳定提升多种VLA模型的任务成功率。
总而言之,DTP是一种轻量、非侵入式的优化方案,其通过动态修剪视觉Token,有效抑制了注意力分散,为提升VLA模型的任务执行鲁棒性提供了简单而强大的新思路。
论文链接:
https://arxiv.org/abs/2601.16065
SPACE-CLIP:通过自适应CLIP
嵌入实现空间感知的单目深度估计

论文《SPACE-CLIP》提出了一种用于单目深度估计的新型架构。
该模型采用完全基于视觉的双通路设计,绕过了传统CLIP的文本编码器与文本提示,直接对视觉特征进行空间解析:
语义通路:聚焦于高层特征,通过特征线性调制技术,根据全局语义上下文自适应调整特征表达。
结构通路:专门从CLIP早期网络层中提取细粒度的空间结构信息,弥补CLIP模型在底层几何感知上的固有不足。
通过层级融合机制,模型将语义通路提供的全局上下文与结构通路提取的局部几何细节进行有效整合,实现对场景深度的鲁棒、高质量估计。
该方法在KITTI等标准深度估计基准上显著超越了以往基于CLIP的方案。
更重要的是,SPACE-CIP不仅是一个独立的深度估计器,更可作为一种即插即用的空间感知增强模块,直接集成到VLA等具身智能系统中,提升其对物理场景的几何理解能力。
论文链接:
https://arxiv.org/abs/2601.17657
PEAfowl:面向双手操作的
感知增强多视角视-言-动模型

论文《PEAfowl》提出了一种针对双臂操作(Bimanual Manipulation)的感知增强型多视图视觉-语言-动作(VLA)策略。
为了解决多视图特征融合弱的问题,该模型通过预测每个 Token 的深度分布并执行可微 3D 提升(Differentiable 3D lifting),聚合局部跨视图邻域信息,构建出具有几何基础且跨视图一致的空间表示。
该论文放弃了传统的全局文本条件注入,转而采用一种 Perceiver 风格的文本感知读取机制。这一机制在冻结的 CLIP 视觉特征上运行,支持迭代证据累积,从而实现更精准的任务指令理解。
为了在不增加推理计算开销的前提下获取高质量深度信息,模型在训练阶段引入了预训练深度教师模型,对深度分布头进行监督,从而为前端感知提供几何先验。
实验表明,该技术在 RoboTwin 2.0 仿真环境下将任务成功率提升了 23.0 个百分点,并展示了可靠的从仿真到现实(Sim-to-Real)的迁移能力。
论文链接:
https://arxiv.org/abs/2601.17885
