WildWorld:面向生成式ARPG的世界建模大型数据集

原标题:
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
论文链接:
https://arxiv.org/abs/2603.23497
项目主页:
https://shandaai.github.io/wildworld-project/
代码地址:
https://github.com/ShandaAI/WildWorld
今天我们来看看这份刚上线不久的工作 WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG。
这不是又一个“堆数据”的普通数据集,而是一份专为生成式ARPG世界模型量身打造的工业级燃料。它直接瞄准当前视频世界模型(World Models)最核心的痛点:动作与像素深度纠缠、长期一致性崩坏。作者团队(Shanda AI + 北理工、清华等)从《怪物猎人:荒野》(Monster Hunter: Wilds)这款顶级photorealistic AAA游戏里,自动采集并标注了超过1.08亿帧的高质量数据,附带丰富的显式状态(explicit state)。
背景与动机:为什么
现有世界模型“玩不转”ARPG?
世界模型的核心思想来自强化学习和动态系统理论:把环境看作由动作驱动的隐状态(latent-state)动态系统,视觉观察只是部分投影。理想情况下,模型应该学会:
动作 → 底层状态转移 → 新观测(画面)
但现实中,大多数公开数据集(如OpenVid-1M、MiraData、GameGen-X、Sekai等)存在两大致命问题:
动作空间贫瘠:要么是简单移动/点击,要么直接把像素变化当动作,缺乏语义丰富的“攻击、技能、连招”。
动作与观测纠缠:模型只能看到RGB画面,无法得知“子弹还剩多少”“怪物血条”“骨骼位姿”等底层状态,导致生成时“抄像素”而非理解规则,长时序很快就崩(角色穿模、世界不一致)。
WildWorld正是为了解决这个“纠缠问题”,首次提供动作-显式状态-观测三者严格对齐的大规模游戏数据,专攻生成式ARPG(可交互、长期一致的开放世界游戏生成)。
技术核心:数据集构建管道(Pipeline)
整个数据集完全自动化采集,无需人工标注,效率极高。流程如下:
数据采集平台:
深度集成《怪物猎人:荒野》游戏引擎。记录玩家输入(动作ID)、底层状态(位置、旋转四元数、速度、动画ID、血量等)、观测(RGB帧 + 深度图 + 相机内外参)。并通过禁用HUD着色器,实现干净无UI的RGB输出。
自动化游玩引擎:
基于任务(quest)结构 + 程序化UI导航。战斗部分采用规则驱动的行为树(behavior tree) + 锁定相机,实现可重复、可扩展的自动化对战。
多流同步录制:
使用OBS Studio + ReShade,同时录制RGB(16Mbps HEVC)和无损深度(~20Mbps),嵌入时间戳,保证帧级精确同步。
后处理与过滤:
剔除异常片段(时长<81帧、卡顿、过曝、严重遮挡、角色重叠>30%等),且采用多维度阈值(相机-角色距离、角色-怪物距离、亮度等)过滤,确保数据质量。
最终得到108M+帧有效数据(原始记录超1.5亿)。每帧附带119列标注,规模和精细度在游戏类世界模型数据集里属于顶尖。
数据集亮点:动作 + 显式状态 + 多样性
动作空间方面,有超过450种语义动作(移动、普通攻击、技能释放等)。覆盖4种武器(大剑、太刀、弓、双刀)、4种玩家角色、29种怪物。动作分布自然长尾(前150种动作占58.49%),真实还原游戏玩法。
显式状态标注:
角色骨骼(Skeleton):玩家与怪物关键点。
世界状态(World State):位置、旋转、速度、HP、动画帧等(实体级 + 全局级)。
相机位姿:内外参、Plücker embedding友好。
深度图:像素级对齐。
还有5大开放世界场景(沙漠、雪山、森林、沼泽、荒原),天气/时间多样,66%战斗 + 34%探索,样本时长大多4k~28k帧,最长超40k帧(30+分钟)。动作级(Qwen3-VL + 真实状态上下文)和样本级(Gemini 3 Flash总结),便于文本-动作联合训练。
这些标注让模型能真正解耦动作与像素,实现“state-aware”生成。
WildBench基准:
专门测“动作执行”和“状态一致性”
光有数据不够,还得有评估标准。作者推出WildBench(200个精心挑选的测试样本,覆盖1v1与合作场景):
Action Following:按动作段(action ID不变的片段)评估生成视频是否忠实执行输入动作(Gemini 3 Flash二分类判断,准确率与人工85%一致)。
State Alignment:用骨骼关键点投影到2D轨迹,计算与真实状态的坐标匹配度(4/8/16/32像素阈值下的平均通过率)。
额外指标:VBench(运动平滑度、动态程度、美学、图像质量)、相机控制(ATE/RPE)。
实验中,作者在WildWorld上微调了多个基线(Wan2.2系列):
CamCtrl:注入真实相机位姿。
SkelCtrl:注入渲染骨骼视频。
StateCtrl:分层状态嵌入(离散+连续)+ Transformer + 状态解码器/预测器(支持自回归生成)。
结果显示显式状态控制显著提升Action Following和State Alignment,但也暴露了现有模型在长时序误差累积、语义复杂动作上的明显短板。这正是WildWorld的价值——它不仅提供数据,还明确指出了下一代世界模型的优化方向。
总结
WildWorld不是“又一个数据集”,而是把世界模型从“看视频”推向“懂规则、可交互”的关键一步。它证明了:用AAA游戏引擎自动化采集 + 显式状态标注,是构建高保真动态世界模型的最务实路径。
局限也很清晰,规则驱动的自动化游玩可能导致轨迹重复,自回归状态预测仍有误差累积,虽然数据集暂未完全开源。但这些正是社区下一步的发力点。
如果你在做视频生成、世界模型、游戏AI,或者对生成式ARPG感兴趣,这篇工作强烈推荐细读。数据集很快上线——赶紧准备好你的训练集群吧!
