从视觉到接触感知:世界动作模型 N0-TWAM 论文解读

从视觉到接触感知:世界动作模型 N0-TWAM 论文解读
过去提到大模型,人们首先想到的通常是能够进行对话、生成文本和辅助编程的语言大模型。随着人工智能逐渐应用于具身智能领域,研究者开始关注一个更复杂的问题:智能设备能否在执行任务之前,先预测环境状态的变化,并据此选择更合适的动作?
世界模型正是围绕这一问题展开的研究方向。
2026 年 7 月,NeoteAI Team 与复旦大学 TEAI Team 发布了论文《N0-TWAM: Scaling Tactile-Native World Action Model for Contact-Rich Manipulation》。该研究尝试统一建模视觉信息、接触感知信息和设备动作,使模型不仅能够预测场景变化,还能够估计抓取稳定性、物体位移趋势以及接触状态是否合理。
一、什么是世界动作模型?
传统的智能设备控制策略通常采用较为直接的流程:
输入当前图像和任务指令,输出下一步动作。
例如,在零部件装配任务中,模型先观察摄像头画面,再生成机械臂的运动轨迹。
这种方法可以完成许多任务,但它通常不会显式模拟动作执行后的环境变化。模型更侧重于根据当前观测结果,直接选择一个可能有效的动作。
世界动作模型,也就是 World Action Model,在这一过程中加入了环境预测环节:
根据当前状态预测后续变化,再结合预测结果生成动作。
在真正执行动作之前,模型会先估计不同动作可能带来的视觉变化、接触变化和物体状态变化。
因此,世界动作模型可以被理解为一种面向智能控制的内部环境预测系统。
二、为什么仅靠摄像头还不够?
现有不少世界动作模型主要通过视频数据预测后续画面。
这种方式适用于移动、导航、场景理解和物体位置估计等任务,但在精细操作中仍然存在一定局限。
例如:
零部件在画面中的位置看似正确,但接触关系可能并不稳定;
设备已经抓取物体,但作用力不足时,物体仍可能发生位移;
清洁操作的运动轨迹正确,但接触强度可能不够;
处理柔性物体时,作用力过大可能影响物体形态。
这些状态仅通过普通摄像头画面往往难以准确区分,而接触传感器可以提供压力分布、接触位置和材料形变等信息。
因此,N0-TWAM 的核心观点可以概括为:
面向真实物理环境的世界模型,不仅要预测视觉变化,还需要预测接触状态变化。
三、N0-TWAM 的核心设计
N0-TWAM 主要建模三类信息:
后续视觉画面;
后续接触感知信号;
智能设备下一阶段的动作。
其整体流程可以简化为:
当前视觉与接触信息 → 预测后续状态 → 生成设备动作。
也就是说,系统并不是在获得画面后立即输出动作,而是先估计下一阶段的场景和接触状态,再决定机械臂如何运动。
1. 同时预测视觉与接触信息
N0-TWAM 将摄像头视频和接触传感器数据都表示为连续序列。
论文使用的接触传感器包含微型成像组件。当设备与物体接触时,传感器内部柔性材料会产生形变,模型可以根据图像变化估计接触位置和受力状态。
因此,模型在生成后续场景画面的同时,也能够生成对应的接触状态变化。
例如,在设备准备拿取杯子时,模型不仅会预测杯子的位置变化,还会估计当前抓取状态是否足够稳定。
2. 预测信息与实时信息双通路
论文没有将接触感知作为普通输入,而是设计了两条处理通路。
第一条是预测通路。模型提前估计下一阶段可能出现的接触状态,用来判断某个动作是否可能产生稳定抓取、位置偏移或意外碰撞。
第二条是实时通路。设备执行任务时,当前接触数据会直接输入动作模块,用于及时修正已经出现的偏差。
两条通路的作用可以概括为:
预测通路负责提前评估;
实时通路负责动态调整。
前者用于降低错误发生的概率,后者用于提高系统面对实际偏差时的适应能力。
3. 三专家 Transformer 架构
在模型结构上,N0-TWAM 分别为视觉、接触感知和动作设置了独立的 Transformer 专家模块。
三个模块拥有各自的参数,并通过共享注意力机制交换信息。这样既可以保留不同模态的特征,又能够建立视觉、接触状态与动作之间的联系。
为了控制计算量,论文采用了非对称结构:
视频专家保持较大的模型规模;
接触感知专家和动作专家使用较轻量的网络;
三个专家通过共享注意力层进行信息交互。
最终模型约为 71.6 亿参数。与三个完整规模专家组成的模型相比,该设计明显降低了整体参数量。
4. 利用接触事件划分长序列任务
在多阶段操作任务中,系统还需要判断当前步骤是否完成,以及何时进入下一阶段。
N0-TWAM 使用接触事件作为任务阶段转换的重要依据。
常见的接触事件包括:
设备首次接触物体;
物体进入稳定抓取状态;
接触状态发生明显变化;
零部件到达目标位置;
物体出现位移趋势。
当模型预测到某类接触事件即将发生,并通过实时传感器信息完成确认后,系统便可以切换到下一个子任务。
这种方式相比单纯依靠固定时间或视觉位置,更适合需要精细反馈的连续操作任务。
四、模型使用了多大规模的数据?
论文使用 NeoData 数据集进行训练。
该数据集包含超过 3 万小时的多设备操作数据,覆盖 6 种设备形态和 450 个接触操作任务。部分样本同时包含多视角视频、设备动作以及接触传感器数据。
为了统一不同设备之间的动作表示,研究人员将机械臂动作转换为统一的双臂末端执行器空间,使来自不同平台的数据可以在同一个模型中参与训练。
从数据规模来看,这项研究不再局限于单一设备或单一任务,而是尝试构建具有跨平台和跨任务能力的接触感知基础模型。
五、实验效果如何?
在仿真测试中,N0-TWAM 在 UniVTAC 基准上的任务成功率为 84.5%,在 NeoSim 基准上的任务成功率为 49.4%。
在包含 8 个接触密集型任务的真实设备测试中,N0-TWAM 的平均成功率为 46.3%,高于论文中对比的视觉语言动作模型和仅依赖视觉预测的世界动作模型。
该模型的优势主要体现在接触信息对任务结果影响较大的场景中,例如:
调整倾斜物体的姿态;
完成精细零部件装配;
稳定拿取不同类型的物体;
在清洁任务中保持合适的接触状态。
在主要依赖视觉定位的物体堆叠和整理任务中,其优势相对有限。
这一结果说明,模型性能的提升主要来自接触感知信息与视觉信息的协同建模,而不仅仅是模型参数规模的增加。
六、这篇论文有什么意义?
N0-TWAM 值得关注的地方,并不只是为模型增加了一类传感器信息。
它体现了一种新的具身智能研究思路:
智能设备不仅需要理解当前环境,还需要预测动作可能带来的视觉变化和物理接触变化。
语言大模型通过预测后续文本学习语言规律,而世界模型希望通过预测后续画面、接触状态和动作结果,学习物理环境中的变化规律。
当视觉、接触感知、语言和动作被统一到同一个预测框架中,智能设备就有可能从直接执行指令,逐渐发展为根据环境变化进行评估、规划和调整。
这一研究方向可应用于精密装配、柔性物体处理、家庭服务设备和人形智能设备等领域。
七、目前还存在哪些问题?
N0-TWAM 仍然存在一些需要继续研究的问题。
首先,模型规模较大。虽然论文通过轻量化接触感知专家和动作专家降低了计算量,但实时运行效率仍有进一步优化空间。
其次,目前模型更擅长预测较短时间范围内的接触变化。对于持续时间较长、步骤较多的复杂任务,其长期状态一致性仍需加强。
此外,不同接触传感器在结构、材料和数据形式上存在差异。模型能否在较少额外训练的情况下适配更多传感器类型,还需要更多实验验证。
论文也将提高运行速度、延长预测范围和扩展传感器覆盖范围作为后续研究方向。
总结
N0-TWAM 将世界动作模型从单纯预测视觉画面,扩展到了同时建模视觉、接触感知和动作信息。
该模型通过三个 Transformer 专家模块预测设备后续可能观察到的场景、接触状态以及需要执行的动作。同时,系统利用实时接触信息调整动作,并通过接触事件划分多阶段任务。
这项研究表明,未来的具身智能基础模型可能不再只是视觉语言模型,而是能够综合处理语言、视觉、接触感知、设备状态和物理环境变化的多模态系统。
从仅仅识别环境,到进一步预测环境变化,世界动作模型正在为更稳定、更灵活的智能控制提供新的技术思路。