一句话定位

新加坡国立大学(Xinchao Wang 组,Shuicheng Yan 挂名)给”世界行动模型”(World Action Model, WAM)这个近一年被滥用的标签立规矩:把凡是”预测的未来会反过来参与产生/打分/训练动作”的模型都收进 WAM 定义,用两套互补视角(三种设计哲学 + 四轴组件解剖)整理出一个 109 篇工作的普查表,再逐一审视这些模型在真实闭环控制里必须满足的五条属性,最后系统盘点数据来源与评测实践的缺口。全文没有自己的模型或实验,贡献是词汇表、分类学和普查表本身。

背景与定位

作者:Qiuhong Shen、Shihua Zhang、Yue Liao、Qi Li、Zhenxiong Tan、Shizun Wang、Shuicheng Yan、Xinchao Wang(通讯作者),全部署名新加坡国立大学(NUS)。注意:任务元数据里给的 country 是 China,但一手署名单位是 NUS,本页以论文页脚一手信息为准记成 Singapore。

论文要解决的问题是术语混乱:过去两年里,“世界行动模型”这个名字被视频生成、机器人学习、语言模型三条社区分别认领,“两个方法都叫 WAM,却几乎没有共同实现细节;另两个方法完全避开这个名字,却造出了同样的东西”。作者给出一个精确边界(Section 2):

  • VLA(如 RT-2、OpenVLA、π0 系列):p(a | o, l),观测+指令直接映射动作,不显式建模未来。
  • World model(PlaNet、DreamerV3、Dreamer 4、V-JEPA/V-JEPA 2、iVideoGPT、RoboDreamer、EnerVerse):p(o' | o, a, l),预测未来观测但不选动作。
  • Video generation model(Wan、CogVideoX、Cosmos-Predict2、NOVA、Sora、Latte、AnimateDiff、VideoPoet):p(o' | r),条件生成,未必带动作。
  • World Action Model(WAM):预测的未来 o' 必须留在动作路径里,三种落地形式——cascade 先测后用 p(o',a|o,l) = p(o'|o,l) q(a|o,o',l)(如 UniPi)、先提动作再测后果 p(o',a|o,l) = q(a|o,l) p(o'|o,a,l)(候选动作打分/规划)、以及一个模型联合建模 p(o',a|o,l)(GR-1/GR-2、PAD、UWM、WorldVLA、DreamZero、AIM)。判据很硬:一个只带辅助 future loss 的 VLA、只用作 RL 训练环境的模拟器、或者推理时被丢弃的 future head,都不算 WAM。

范式定位上,本文明确区分”设计哲学层”(谁在动作解码前必须生成什么,见下)和”组件层”四轴解剖,二者是互补而非重叠的视角。可与本库 π0.7(本综述里作为 chunked VLM-backbone WAM 的代表案例)、genie-envisioner(Latent-Only 代表案例)、Cosmos-Predict 系对照阅读。

模型架构

综述本身不训练模型,其”架构”贡献是两套并列的分类法。

三种设计哲学(Section 3,互斥穷尽)——按动作解码前视频生成骨干被推进到哪一步划分:

  • Render-and-Decode:视频生成骨干一路跑到像素输出才解码动作。代表:UniPi、AVDC、VLP(founding branch,视频即计划);GR-1/GR-2、WorldVLA(joint,动作 token 和图像 token 一个自回归流里出);PAD(DiT 联合去噪图像+动作);π0.7(BAGEL 级世界模型异步刷新多视角 subgoal 图像);DreamZero(Wan 级自回归视频扩散做成在线闭环策略,foundation-scale 代表)。
  • Latent-Only:保留视频世界模型血统,但推理路径在像素解码前止步,从 latent、去噪中间态、flow、mask、value map 里解码动作。代表:VPP(在 SVD 表征上接逆动力学)、Genie Envisioner(GE-Base 视频 DiT + GE-Act 从一步去噪 latent 缓存里 flow matching 出动作块)、UWM(独立扩散时间步让视觉分支可在推理时跳过)、Fast-WAM(保留视频协同训练但推理时屏蔽未来分支)。
  • Video-Generation-Free:彻底不用视频生成骨干,未来落在 LLM/VLM/JEPA/非视频扩散骨干的紧凑非像素子空间。代表:FLARE(策略 token 对齐冻结教师的未来观测 embedding)、DUST(Eagle-2 VLM + 双流扩散头联合出下一状态 token 和动作)、LDA-1B(Qwen3-VL 骨干上结构化 DINO latent 里联合学动力学/策略/预测)、PointWorld(Point Transformer V3 预测机器人点流条件下的 3D 场景点流,MPPI 里做 0.1 秒/rollout 的零样本规划)。

四轴组件解剖(Section 4,统一记号),任何 WAM 可表成 4 元组 (Φ, F, B, D)

  1. 预测子空间 Φ(4.2):pixel-grounded(解码观测或带固定解码器的 VAE/VQ latent)、feature(无固定解码器的学习状态/教师 embedding/VLM token)、geometric primitive(flow、点云、深度、位姿、motion vector)、affordance map(value/contact/segmentation/heatmap)。
  2. 动作耦合 F(4.3,三族互斥):action-conditioned rollout(外部动作源 q_ψ 提供动作,预测其后果,chunk-level 或 step-wise 两种子模式)、joint generation(一个耦合生成过程同时产出未来和动作,训练损失 L_gen(s) + λ L_act(a))、post-prediction head(先测未来,q_ψ 再从中解码动作,常见于 θ 冻结、q_ψ 单独训练/换本体)。
  3. 架构骨干 B(4.4,五族):iterative-denoising(视频扩散/flow matching,score-matching 损失)、autoregressive(next-frame/next-token,KV cache 复用前缀)、joint-embedding-predictive(JEPA 式,p_θ(s|c) 坍缩成对确定性预测器的 Dirac,从不反演目标编码器)、hybrid(共享 trunk 挂生成头+动作头)、LLM/VLM-backbone(未来即 VLM 词表里的 token block,接后置动作专家)。
  4. 部署机制 D(4.5,四种):open-loop rollout(H≈T 只调用一次,UniPi/AVDC 类)、chunked closed-loop(H=K 每 K 步重调,π0.7/GR-2/DreamZero 类,需满足 N_fwd(K)/K < 1/f_ctrl)、single-step closed-loop(H=1 每步都调,WorldVLA/VidMan/GR-1/PAD/DreamZero 贴近这一端)、interactive simulator operation(靠 KV cache 或持久 latent 无限延展 H,InteractiveWorldSimulator/EnerVerse/LingBot-VA)。

论文给出示例 4 元组:F1 = (pixel-decodable latent grid, joint generation, hybrid, chunked);WorldVLA = (pixel-decodable latent grid, joint generation, autoregressive, single);FLARE = (latent teacher-target, post-prediction head, joint-embedding, chunked);UWM = (pixel-decodable latent grid, joint generation, hybrid, chunked)。作者强调:纯视频生成骨干(Wan、CogVideoX)本身不是 WAM,只固定了 Φ 和 B,要加上 F 和 D 才成立——这正是 CosmosPolicy、VidMan、VideoVLA 这类”冻结骨干外挂 wrapper”的模式。

数据

普查表规模(Table 1 + Table 2,配套 GitHub 仓库 awesome-world-action-models 逐行维护):共 109 篇工作,三族拆分为 Render-and-Decode 58 篇、Latent-Only 38 篇、Video-Generation-Free 13 篇;其中 27 篇标注了明确的速度/显存/数据效率改进(⚡标记)。表内每行按 arXiv 首次提交月份排序,四列对应上述 4 元组。arXiv 全文表格独立验证:Table 1(Render-and-Decode+Latent-Only)99 行、Table 2(Video-Generation-Free)15 行,扣掉表头后与 96+13 的拆分一致。

训练数据五类来源(Section 6.1),各自在规模/动作标签精度/物理接地/可获取性上做不同取舍:

  • 机器人遥操作:动作标签最干净。Open X-Embodiment 是跨实验室、跨机器人平台聚合的规范资源;RoboMIND、RoboSet、RoboTurk、Robo360 补充不同平台/任务/相机配置;Human2Robot 给每条遥操作轨迹配一段同步的裸手视频;RoboNet 用脚本/随机策略采集真机轨迹换吞吐量。代价是每小时都要消耗机器人时间或操作员时间。
  • 便携式人类演示:把采集从机器人平台搬到可穿戴/手持设备。EgoMimic 用轻量可穿戴装置录第一人称视频+3D 手部轨迹;EgoVerse 用可穿戴+手机采集再跨本体重定向;EgoDex 用 Apple Vision Pro 头戴设备录灵巧双手位姿轨迹、全程无机器人参与。换来规模,代价是本体差距需要额外弥合。
  • 互联网规模自我中心/教学视频:Ego4D、Ego-Exo4D、EgoPAT3D 侧重第一人称活动和手部运动;EPIC-KITCHENS、HD-EPIC、EgoVid-5M、OpenEgo、IndEgo、EgoScale、Egocentric-10k 扩充教学/家庭/大规模自我中心视频池。缺陷是普遍没有动作通道,一条路是拿来预训练视频骨干(V-JEPA 2、Wan),另一条路是挂逆动力学/latent-action 模型从视频里恢复控制代理(AVDC 从无标签视频恢复 flow-conditioned 动作;LDA-1B、DUST 用无动作视频强化 latent 未来预测)。
  • 仿真:Robosuite、ManiSkill 2/3、MetaWorld、LIBERO 等经典物理平台,IsaacSim、CoppeliaSim、SimplerEnv 等通用后端;RoboCasa、RoboTwin、RoboTwin 2 程序化生成家庭/数字孪生演示;RoboCerebra 在仿真器里收集人类遥操作轨迹做长程评测;RoboVerse、RoboData 做跨后端/跨仿真-真机聚合。好处是标签质量可规模化,代价是 sim-to-real gap。
  • WAM 自产合成数据:IRASim 用可学习的动作条件扩散模型替代物理引擎产生 rollout;Cosmos-Transfer1、InteractiveWorldSimulator、Sora 类模型也被用来生数据;DreamGen 是具体案例——生成机器人视频、恢复伪动作/latent 动作、再用这些”神经轨迹”训练最终策略。代价是继承生成器自身的失败模式。

论文明确指出的获取性约束:Sora 类生成器和 EgoScale 数据集是闭源或尚未公开,独立复现无从验证其贡献。

训练方法

综述归纳的是 WAM 训练范式本身的分解,而非某个具体模型:

  • 联合损失(Eq. 19,Section 4.3.2):L_joint(θ) = L_gen(s) + λ L_act(a)L_gen 是未来子空间上的扩散/自回归损失,L_act 是动作侧的 flow-matching/回归/交叉熵损失。作者指出这类联合训练常见的不稳定性——生成损失和动作损失会把共享表征拉向不同方向,实践中常先在视频上预训练子空间头、再引入动作头,配合 λ 调度。
  • 扩散/flow matching 骨干(Eq. 21-22):反向去噪链 p_θ(s|c) = ∫ p(s^(N)) Π p_θ(s^(n-1)|s^(n),c) ds,标准 score-matching 损失 E[||ε - ε_θ(s^(n),n,c)||²];flow matching 是同一参数化下把噪声预测换成速度场回归,两者都满足 Eq. 21 的迭代反向链形式,不算独立的第六族骨干。
  • 自回归骨干(Eq. 25-26):p_θ(y_1:M|c) = Π p_θ(y_j|y_<j,c),next-element 交叉熵/回归/扩散混合损失,推理靠 KV cache 复用前缀。作者特别强调”自回归 ≠ 联合动作预测”的常见误区——自回归流可能只预测未来子空间,动作可能来自外部 rollout 或后置头。
  • JEPA 骨干(Eq. 28):L_jepa = E[||f_θ^pred(E_ctx(x_ctx)) - sg[E_tgt(x_tgt)]||²],预测器从不反演目标编码器,推理成本低,但 embedding 空间没有内在视觉质量度量,下游任务准确率是唯一的验证标准。
  • 动作表征与 chunk size(4.3.4):三种常见参数化——逐步连续控制(关节速度/末端位姿增量/夹爪指令,A=R^{d_a})、固定码本离散 token(如 WorldVLA 每维分箱后的自回归词表)、学习到的 latent action(A=R^{d_z}d_z≪d_a,如 Motus、ALAM、LDA-1B)。chunk 越长,单次生成摊薄骨干成本但推理期间不能反应;真机闭环控制会把方法推向更小 chunk 或更便宜骨干。
  • 数据分阶段分配(Section 7.2,开放问题但给出具体案例):预训练阶段广域视频有帮助(GR-2、VPP),但不能一概而论——VidMan 报告机器人域视频预训练有益而不匹配的自我中心源反而有害;对齐阶段 EgoScale 把广域人类预训练和对齐中训练分开、EgoVerse 发现场景多样性比原始量更重要;最终动作阶段的数据瓶颈最尖锐,LAPA/DUST/ALAM/LDA-1B 这类无动作方案能减少标注需求但去不掉,每个抽象动作最终仍需一个解码器/逆动力学模型/本体标定步骤才能变成可执行控制。

Infra(训练 / 推理工程)

综述本身未披露任何自有训练 GPU 数量、GPU-hours、并行策略或精度——它不训练模型。以下是它系统整理的、被收录工作在推理工程上披露的具体数字:

  • DreamZero:14B 参数自回归视频扩散 WAM,靠 KV-cache 观测替换(每执行完一个动作块就用真实观测替换想象观测再刷新 cache)达到 7 Hz 闭环控制
  • UD-VLA:同步联合离散去噪相比自回归对照报告约 4 倍推理加速。
  • DexWM:预测有限键点动作条件下的未来 latent 状态,维持有界测试时记忆(而非无界 cache),能在 900 小时人类+机器人交互数据上训练和运行。
  • π0.7:轻量级 BAGEL 初始化世界模型每 4 秒刷新一次多视角近未来 subgoal 图像,Gemma3-based VLA 编码观测+subgoal 后由 860M 参数的 flow-matching 动作专家出动作块。
  • 部署机制的显式代价公式(Section 4.5):open-loop 总成本 N_fwd(T)(每场景付一次,不随控制频率缩放);chunked closed-loop ⌈T/K⌉·N_fwd(K),可行条件 N_fwd(K)/K < 1/f_ctrl;single-step T·N_fwd(1),硬约束 N_fwd(1) < 1/f_ctrl;interactive N_fwd^cached(M(t)),attention 骨干下单步线性于持久状态大小 M(t),累计成本随 t 二次增长。
  • 其余侧面数字:GigaWorld-Policy 让因果 mask 阻止未来视频 token 影响动作 token,从而推理时可以不实例化未来视频 token 就采样动作块;PhysGen 组合因果 mask + lookahead multi-token prediction + KV cache,每步预测多个未来动作 token 但只消费领先的一个。

评测 benchmark

综述本身不做实验、不给自有定量榜单,贡献是把评测实践系统分层并指出结构性缺口:

  • 视觉保真度指标:FVD、FID、LPIPS、PSNR、SSIM、DreamSim,便宜但只奖励视觉逼真、和动作有效性弱相关——Fast-WAM 和 GigaWorld-Policy 的证据是:推理时丢掉渲染出的未来预测,控制能力不掉。WorldScore、WorldSimBench 尝试把感知分和闭环动作成功率并列。
  • 闭环 benchmark:仿真侧吞吐量最高——LIBERO 系列(含 LIBERO-Pro、LIBERO-X、LIBERO+)和 RoboMME 聚焦语言条件操作和多模态评测;robomimic、MetaWorld、ManiSkill 2/3 提供不同控制多样性/物理覆盖的操作套件;HomeRobot、VLABench、RoboEval、RoboVerse 拓展到导航、具身推理、多后端评测。真机 arena(RoboArena、RoboChallenge)用吞吐量换物理有效性。DWorldEval 干脆在学习到的世界模型内部闭环,从想象 rollout 里打分(其成功率与真实执行相关)。级联式 WAM(视频到 flow、视频到轨迹类方法,如 NovaFlow、Dream2Flow、TraceGen、RoboFlow4D)需要子空间检查和执行检查两层评测,因为生成的未来和动作翻译器可能分别失败。
  • 物理合理性与长程一致性:无统一标准指标——触觉/力预测误差(OmniVTA、AdaWorldPolicy)、运动学/几何一致性检查(DexWM、MVISTA-4D)各自为战;长程一致性通常退化成”固定重规划次数后的任务成功率”,现有 benchmark 不测控制频率下的小时级 rollout。
  • 评测缺什么:作者给出明确的成本排序——视觉保真指标便宜但弱预测性,仿真闭环更具预测性但消耗任务时长的 rollout,真机 arena 物理有效但难复现,物理合理性与长程指标仍不成熟。他们提出的方向是两阶段协议:廉价的视觉/表征筛查 + 在显式计算/显存/延迟预算下的选择性闭环测试,但”廉价筛查与昂贵测试之间的换算系数”仍是开放问题。

创新点与影响

贡献

  1. 给已经泛滥的”World Action Model”标签一个精确、可操作的边界定义(未来预测必须参与产生/打分/训练动作),把它和 VLA、广义世界模型、视频生成模型、video world model 明确切割。
  2. 提出两套互补分类法——三种设计哲学(哪一步之前必须生成什么)+ 四轴组件解剖((Φ,F,B,D) 4 元组),并把 109 篇工作逐一落到这套统一记号上。
  3. 系统检验五条具身控制必须满足的属性:interactability(动作何时进入预测环)、causality(未来不能泄漏进当前动作,否则会出现”训练时抓得完美、推理时对着空气收爪”的伪影)、persistence(drift/cost 增长/forgetting 三种失效模式的权衡)、physical plausibility(视觉-几何抽象阶梯:RGB→RGB-D/法线→flow→mask→纯 latent,每降一级都在拿外观换几何/接触/动力学容量)、generalization(细分成 video-prior transfer、substrate transfer、action-abstraction transfer 三条独立的迁移路径)。
  4. 把数据来源和评测实践并列组织成一张成本-质量权衡表,指出当前评测的结构性盲区。
  5. 配套持续更新的 GitHub 仓库(社区可提 PR 补充新论文),把综述做成活文档。

它改变了什么:给一个术语混乱、命名和实现脱钩的领域一套共享词汇,让”两个都叫 WAM 但没有共同实现细节”的问题变得可以通过 4 元组直接判定。核心论点——WAM 设计的主流方向不是生成更多未来,而是学会只生成动作真正需要的那部分未来(“dream less, act more”)——把 Fast-WAM、GigaWorld-Policy、UD-VLA、S-VAM 这批”跳过完整视频生成”的工作串成一条明确的技术演进线索,而不是零散的效率补丁。

作者自陈的局限与开放问题(Section 7)

  • Dream More or Act More?:还没有一条可控的保真度-延迟曲线,多数方法要么固定去噪步数、要么用二元的”执行/重规划”触发器,无法按预期动作价值连续调节生成算力。
  • 数据分阶段:预训练/对齐/最终动作三个阶段该用什么证据训练仍无联合 scaling law,加数据目前是工程选择而非可预测的设计决策。
  • 记忆能否跟上:自回归预测的时序漂移、固定上下文包、动态场景下的稀疏记忆退化都是尚未解决的记忆失效(而非单纯预测质量失效)。
  • 泛化:domain randomization 下 Act2Goal 陡降、FRAPPE 即便领先基线仍远低于实用水平;作者主张先声明目标偏移再设计子空间和适配器,而非训后才报告迁移结果。
  • 抽象动作的物理接地:2D flow 无法表示深度平移/离面旋转/接触力,刚体变换解码器在铰接或可形变物体上会失效;latent action 码本太粗时精细抓取仍困难。
  • 未来何时算”物理的”:单帧条件的 flow 世界模型编不出物体速度(推物体后物体继续运动这类惯性任务会失败);触觉世界模型的力代理未经标定;point-cloud 子空间省略了力大小、摩擦、表面顺应性。
  • 评测该报什么:MotuBrain 发现自己的世界模型质量分数和下游成功率只是弱相关;HarmoWAM 显示对”通过”有利的调度可能在”精确交互”阶段失败,单一成功率数字会把这种失效模式平均掉。

原始链接

一手源存档(sources/)

  • world-action-models-survey—project-page.md — 官方主页快照(WAM 定义示意、三种设计哲学时间线说明、论文列表元数据来源说明)
  • world-action-models-survey—github-readme.md — awesome-world-action-models 官方 README 快照(109 篇工作全表:58 Render-and-Decode + 38 Latent-Only + 13 Video-Generation-Free,逐条 backbone/substrate/TL;DR)
  • arXiv 全文 PDF(2606.20781v1)为 arXiv 原文,不入 git,见上方 PDF 链接