一句话定位
WoW 是一个 14B 参数的生成式世界模型,核心主张是”物理直觉必须从真实机器人交互中学出来,而不是从被动的互联网视频里学出来”:在 203 万段、7300+ 小时、约 6.33 亿帧的真实机器人交互视频上训练 DiT 视频生成骨干,再套一层 VLM 裁判-精炼闭环 SOPHIA 把生成结果拉向物理合理,最后用 Flow-Mask Inverse Dynamics Model(FM-IDM) 把想象的未来帧翻译成 7 自由度机械臂动作,闭合”想象→行动”回路。作者自建的 WoWBench(606 条样本)上,WoW+SOPHIA 全面超过 Cosmos-Predict1/2、Wan2.1、CogVideoX 等基座;真实机械臂上 FM-IDM 在 easy/medium 任务分别拿到 94.5%/75.2% 的成功率。
背景与定位
论文把自己放在两条谱系的交叉口。一条是模型驱动强化学习里的经典”世界模型”(dreamer-v3 一系工作用 RSSM/隐空间想象做 actor-critic),另一条是近两年的视频生成式世界模拟器(Sora、cosmos-predict、cosmos-predict2、Wan2.1)。作者的批评很直接:后者是”被动观察”范式——在网络规模视频上学统计相关性,物理直觉表面化、脆弱,遇到需要真正物理推理的场景会生成逻辑/物理不自洽的结果。他们援引 Piaget”To know an object is to act on it”和 Judea Pearl 因果阶梯(seeing-doing-imagining),提出必须靠大规模、因果丰富的真实交互数据才能让生成模型真正升级为世界模型。
WoW 因此把”具身世界模型”架在 Neisser 的知觉循环(Schemata→Perception→Action→Schemata)上,拆成三段:任务想象(SOPHIA 生成高层计划+像素级未来)、经验反思(VLM 裁判评估物理一致性并精炼)、行为提取(FM-IDM 把想象轨迹转成可执行动作)。论文同时给出了一个理论性的”语言完备性假设”(Hypothesis 1,借用 Xing et al. 2025 的框架):只要语言系统足够精细,就能唯一区分任意接近的连续物理序列——这是 SOPHIA 用语言反馈驱动视频再生成的理论辩护。
训练数据来自 agibot-world-colosseo、droid、robomind 三个公开机器人数据集加大量自采内部数据;对照基座覆盖 CogVideoX、cosmos-predict(Cosmos-Predict1)、cosmos-predict2(Cosmos-Predict2)、Wan2.1、SVD 共 5 个视频生成骨干。FM-IDM 的评测对比对象包括 ResNet-MLP、MaskDino-IDM、Flow-IDM 和 AnyPos。基准设计上借鉴了 RoboBench 的 DAG 规划打分和 videophy-2/EWMBench 一类”物理常识细粒度打分”思路。范式定位:具身交互驱动的视频世界模型 + agentic 自精炼闭环,是”生成方”阵营里少数明确把训练数据锚定在机器人真实交互(而非网络视频)上的工作。
模型架构
基础视频生成世界模型(Foundation Video Generation World Model)
- 骨干是标准 DiT(多头自注意力+前馈,adaLN 做时间步条件化),提供 3 个参数量级的开源检查点,均以既有视频扩散模型为初始化基座(据 GitHub README):2B(基于 Cosmos-Predict2 初始化)、7B(基于 Cosmos-Predict1)、14B(基于 Wan2.1,即摘要反复强调的旗舰”14B 参数”版本)。
- 文本条件化:用 InternVL3-78B 把粗粒度语言指令扩写成描述环境、相机位姿、机器人本体与目标动作的叙述性文本,再经预训练 T5 编码器编码后作为条件注入 DiT。
- 视觉编码:原始视频经时空自编码器压缩为紧凑隐表示;额外引入 3D Haar 小波变换,把视频立方体分解为低频(场景结构)与高频(碰撞/形变等精细运动)子带,让模型把容量更多分配给动态事件;再做时空下采样降维。
- 位置编码:同时用绝对 3D 位置编码(保全局连贯性,如轨迹)和相对 3D RoPE(强制局部像素级因果性,如接触与连续性)。
- 辅助感知(论文自称的核心创新之一):把自监督视觉表征模型 DINOv2 的特征注入 DiT 中间层(通过 token relation distillation loss 监督),用于加强物体边界/空间关系的像素级推理,弥补纯噪声重建目标学出的隐表示的弱点——论文称是首次把预训练自监督视觉特征整合进扩散式世界模型骨干。
- 解码器:镜像编码器的层级结构,逐步做空间上采样+小波逆变换+自注意力精炼,兼顾长时程时间一致性与物理精细细节(材质形变、碰撞恢复)。
SOPHIA 自优化闭环(Self-Optimizing Predictive Hallucination Improving Agent):不是新模型而是测试时的 agent 系统,由三部分组成——
- Refiner Agent:不需要重训底层视频模型的测试时 prompt 优化器,把 Critic 反馈当作”文本梯度”,在离散 prompt 空间做引导式搜索,逐轮细化物理约束描述(如”避免物体穿透固体表面”)。
- Dynamic Critic Model Team:在真实+模型生成的机器人视频构成的 QA 数据集上微调出的专用 VLM 裁判,从任务完成度、动作成功、物理合理性(稳定性/形变)、运动平滑度、整体质量 5 个维度打分——传统的 FVD/PSNR/SSIM 被认为不足以评估物理真实感。
- 闭环工作流:用户任务 → Refiner 展开为详细约束 prompt → WoW 生成候选视频 → Critic 判定 pass/incomplete/failed → 若失败则反馈回 Refiner 重新生成,直至收敛。论文把这套机制类比 Prover-Verifier/Solver-Critic 范式,称是首次把该范式从离散任务(数学证明、代码生成)用到连续、随机的视频生成域。
Flow-Mask Inverse Dynamics Model(FM-IDM):视频→动作的行为提取模块。
- 输入:预测视频中连续两帧 $(o_t, o_{t+1})$;先用 CoTracker3 估计帧间光流 $\mathcal{F}_{t\to t+1}$(捕捉平移+旋转运动)。
- 双分支编码器-解码器:一支用微调过的 SAM 处理被 mask 的当前帧提取场景与本体上下文;另一支用 CoTracker3 光流分支捕捉细粒度时序动态;再融合 DINO 特征,用 MLP 作动作头回归 7 自由度末端执行器动作(3 平移+3 旋转+1 夹爪)。
- 训练目标:末端执行器动作空间上的加权 smooth L1 损失;论文称这条”像素级解码”路线牺牲了实时性换取了通用性与精度(相对于依赖模型专属特征的方案)。
- 论文提到该模块的奖励反馈理论上可经 GRPO 反哺世界模型做生成式演化,但这部分停留在方法论讨论层面,未见对应的量化实验。
数据
基础世界模型预训练数据:203 万段视频片段,累计 7,300+ 小时交互录像,对应约 6.33 亿帧(24fps 采样);覆盖 5275 个任务、12 种机器人本体,来自 200+ 个仿真/程序化生成场景(家居环境如厨房/客厅、工业场景如仓库/流水线)。主力数据来自双臂 Franka FR3、单臂 UR5e、双臂 UR5e,另混入多台 Franka Emika Panda 及 ARK、AgileX、“Tienkung”系列机器人(论文正文两处对同一款人形机器人分别拼作 Tienkung 和 Tiangong,即天工,如实保留原文两种拼法)。原始素材原生分辨率 640×480,预处理后上采样到 720×1024。
数据来源:agibot-world-colosseo(AgiBot World)、droid(DROID)、robomind(RoboMIND)三个公开数据集 + 大量自采内部数据。
四阶段清洗流水线:
- Collection:多机器人平台采集,覆盖多样本体与任务场景;
- Filtering:只保留 RGB(BGR 半自动转 RGB)、强制最短 90 帧、限定头部/腕部/第三人称视角;该阶段总共剔除约 75% 的原始数据(含仿真不稳定、严重碰撞、任务失败、静止无效片段);
- Caption Refinement:用预训练 VLM(InternVL3-78B)把稀疏文本标注扩写成密集描述,均匀采样+顺序采样帧兼顾全局与局部时序转变,稀疏:密集文本比例约 1:4,并人工补充机器人型号标识;
- Rebalancing:对欠采样任务提高采样概率,避免稀有但重要的技能被忽视。
FM-IDM 专用动作数据集(Embodiment-Centric End-Effector Action Dataset):64.6 万图像-动作对,覆盖 219 个任务,密集覆盖机器人可达工作空间的动作空间。真实机器人评测阶段从这 219 个任务里精选出 20 个代表性任务做部署验证。
数据规模消融(Table 3,PBench 上):用 30k/200k/600k/2M 四档子集做监督微调对比 FVD 等指标的幂律曲线;论文正文表格给出 30k(VLM 0.3901 / Qual 0.3323 / Overall 0.3612)、200k(0.5920 / 0.3790 / 0.4855)、600k(0.6240 / 0.3914 / 0.5077)三档具体数字,文字部分声称 600k→2M 区间收益最大,但 Table 3 本身未列出 2M 那一行的具体数值(论文正文与表格之间存在这个不完整之处,如实标注)。
训练方法
- 文本条件化训练:InternVL3-78B 生成的密集叙述性 caption 经 T5 编码器嵌入,作为 DiT 的条件信号;DINOv2 特征通过 token relation distillation loss 监督 DiT 中间层表示(图 6b),用以加速收敛、提升生成保真度与物理一致性——这是论文强调的关键训练技巧,但具体的蒸馏损失权重、学习率、优化器等超参数论文未披露。
- SOPHIA 闭环是测试时(test-time)机制,不改变底层 DiT 权重,只通过反复重写 prompt + 重新采样视频来搜索更优结果,因此不涉及额外的梯度更新,代价是多轮推理开销(论文未给出平均迭代轮数或额外算力开销的量化数字)。
- FM-IDM 训练:在 64.6 万图像-动作对(219 任务)上用 SAM(微调)+ CoTracker3 光流 + DINO 特征联合训练动作头,损失为末端执行器空间的加权 smooth L1;真实部署阶段区分 with/without fine-tuning(w/o FT vs FT)两种设置对比,FT 版本全面碾压。
- 规模化实验:分别做了数据规模(30k→2M)与模型参数规模(2B/7B/14B)两条扫描线。模型规模上,7B 相对 2B 提升 19.22%,14B 相对 7B 仅再提升 5.91%(收益明显递减);推理速度上 7B 比 14B 快 44.16%,2B 比 7B 又快 56.21%(换句话说更大模型质量收益递减但推理代价线性增加,论文提示实际部署需要权衡)。
Infra(训练 / 推理工程)
- 训练硬件(GPU 型号/数量)、GPU-hours、训练精度(bf16/fp16)、并行策略、学习率/batch size/优化器等具体超参数:论文正文与已抓取的 GitHub/HF 材料均未披露,仅提到 2B/7B/14B 三档参数规模对应不同基座初始化(Cosmos-Predict2/Cosmos-Predict1/Wan2.1)。
- 推理效率(section 6.3,仅有相对量而非绝对 FPS/延迟数字):以 14B 为基准,7B 推理速度快 44.16%,2B 又比 7B 快 56.21%;绝对帧率、控制频率(control-Hz)、边缘设备部署延迟均未披露。
- FM-IDM 推理:论文明确说该模块”用像素级解码换取通用性和精度,牺牲了实时性”,但没有给出具体的推理延迟或 Hz 数字。
- 模型体量:开源检查点含 2B/7B/14B 三档 DiT 权重及 1.3B/14B 两档 Wan 权重(HF 组织
WoW-world-model,训练步数标注为 600k 或 2M)。
评测 benchmark
WoWBench:自建基准,4 大核心能力(感知理解、预测推理、决策规划、泛化执行)× 20 个子任务,共 606 条样本(每条含初始图像+文本指令),难度分层为 231 Easy / 237 Medium / 138 Hard。感知维度含物体属性(约 143 条:颜色/数量/形状/尺寸/类型各约 20 条+功能类 50 条)、空间理解(46 条)、可供性识别(60 条);预测推理维度含无遮挡/半遮挡视角(107/54 条)、碰撞动力学按单物体(83 条,刚性/可形变/关节/流体≈30/30/30/10)、多物体交互(63 条)、双臂协作(3 条,论文说明后续会扩充);规划维度 25 条长时程任务;泛化执行(OOD,含 GPT-5 风格迁移图与世界名画)20 条。评测指标覆盖视觉保真度(FVD/SSIM/PSNR/DINO/DreamSim)、Mask-guided 区域一致性(GroundedSAM2 分割背景/机械臂/被操作物体后分区域算 DINOv3 余弦相似度)、指令理解(GPT-4o 打 Caption Score/Sequence Match/Execution Quality)、物理与因果推理(SAM2 轨迹 MED/DTW/Fréchet 距离 + 微调 Qwen-2.5-VL 打 1-5 分物理常识)、规划分解(RoboBench 式 DAG,$S_{plan}=(0.5R_k+0.5R_s)\times P_k$)。
基座模型直接文生视频对比(Table 1,Human Eval 为人评 1-5 分制求和/Overall,Autonomous Eval 为自动评估综合分;论文有 v1/v2 两版数字,此处取 arXiv v2(2025-10-16 修订版)最新版本):
| 模型 | 基座 | Human VQ/IF/PL/Plan/Overall | Auto VQ/IF/PL/Plan/Overall |
|---|---|---|---|
| CogVideoX | cogvideo | 3.29/1.52/1.73/1.30/7.84 | 38.52/54.09/63.30/2.32/39.56 |
| Cosmos-Predict1 | cosmos1 | 2.84/2.60/2.41/2.49/10.34 | 39.06/61.46/59.05/7.47/41.76 |
| Wan2.1 | wan | 3.49/1.79/2.30/1.62/9.21 | 40.23/56.85/59.66/5.6/40.59 |
| Cosmos-Predict2 | cosmos2 | 3.18/2.33/2.31/2.27/10.09 | 46.81/56.80/60.56/6.67/42.71 |
| WoW-DiT | cosmos1 | 3.12/2.86/2.78/2.84/11.60 | 49.35/69.68/62.28/2.89/46.05 |
| WoW-DiT | wan | 4.09/2.60/3.16/2.52/12.37 | 55.38/62.16/63.75/4.74/46.51 |
| WoW-DiT | cosmos2 | 3.76/3.19/3.03/3.36/13.34 | 54.12/70.36/66.18/6.88/49.39 |
接入 SOPHIA 自优化闭环后(Table 2,自动评估):cosmos1+Agent 35.43/61.07/53.78/8.23/39.63;cosmos2+Agent 49.7/75.96/64.66/11.77/50.53;WoW+Agent(cosmos1) 59.39/72.54/69.71/4.26/51.47;WoW+Agent(wan) 60.53/50.83/67.48/6.75/46.40;WoW+Agent(cosmos2) 56.82/76.16/67.15/7.76/51.97(v2 中综合分最高的一档)。
需要如实指出一处论文自身的不一致:摘要仍然写着”WoW 在 Instruction understanding 上拿 96.53%、Physical law 上拿 80.16%“,这两个数字对应的是 v1 版本 Table 2 里 WoW+Agent(cosmos2) 的 IF/PL 列(v1:VQ75.26/IF96.53/PL80.16/Plan7.76/Overall46.11);但作者在 v2 修订版里改写了 5.4 节的评分归一化方法(从 ECDF 映射换成带绝对锚点的分段映射),导致 Table 1/2 的 Autonomous Evaluation 数值整体上调且排序发生变化(如上表),WoW+Agent(cosmos2) 在 v2 中的 IF/PL 变成 76.16/67.15,摘要却没有同步更新——这是原始论文自身的版本遗留问题,如实记录而非代为”修正”。
FM-IDM 视频回放成功率(Table 5,Easy/Mid/Hard):ResNet-MLP 基线 68.1%/20.1%/7.7%;MaskDino-IDM 84.3%/59.9%/12.1%;Flow-IDM 89.1%/61.1%/11.3%;AnyPos 86.9%/65.2%/13.8%;FM-IDM(本文)94.5%/75.2%/17.5%,全面领先。真实机械臂部署实验中,WoW-cosmos2 + 微调综合成功分数 0.64,显著优于未微调版本。
VLM 测试时规划的世界模型反馈实验(Table 6,Qwen-2.5-VL-7B-Instruct 做空间推理任务”按颜色分堆同色方块”):0 轮交互 Planning succ 1/3、Task succ 0;1 轮 4/9、0/3;2 轮 8/9(≈89%)、4/9(≈44%)——证明世界模型可作为 VLM 规划器的交互式沙盒,帮助其自我调试逻辑错误。
物理现象细分基准(Table 4,Rigid/Soft/Fluid/Gravity/Optics/Elasticity × FVD/PhyGen/WorldScoreBench/DreamSim/EQS):四个后训练版本(WoW-CogVideoX、WoW-SVD、WoW-Wan、WoW-Cosmos)对比中,WoW-Cosmos 在 6 个类别里的 5 个(Rigid/Soft/Fluid/Gravity/Elasticity)全面登顶,只有 Optics 类别被 WoW-SVD 反超。
创新点与影响
- 把世界模型的物理直觉来源明确锚定在真实机器人交互数据(2M 轨迹、5275 任务、12 种本体),而非互联网视频,直接对标 Sora/Wan 一类”被动观察”范式并给出量化反证。
- 首次把预训练自监督视觉特征(DINOv2)整合进扩散式世界模型骨干,论文称显著加速收敛并提升物理一致性。
- SOPHIA:首次把 Prover-Verifier/Solver-Critic 范式从离散任务(数学证明/代码)迁移到连续随机的视频生成域,用 VLM 裁判 + 测试时 prompt 精炼替代不可微的”物理真实感”损失函数。
- FM-IDM 打通了想象到动作的闭环:像素级两帧+光流→7-DoF 动作,跨模型架构可插拔,真实机械臂 easy/medium 任务成功率 94.5%/75.2%。
- WoWBench 提供了一套围绕感知/预测/规划/泛化四维度、带 mask 级区域一致性诊断的具身世界模型评测协议,并声称与人类偏好高度相关。
- 论文自陈的局限:模型对”hard”级物理推理任务仍需更大规模数据/参数才能突破(scaling 尚未饱和);双臂协作子任务样本量极小(仅 3 条,作者承认还在扩充);GRPO 反哺世界模型的闭环仅停留在方法论讨论,未见量化实验;训练硬件、GPU-hours、超参数等工程细节完全未披露;v1→v2 修订后评分方法变化导致摘要与正文表格数字不一致(本页已如实标注)。
原始链接
- arXiv 论文(v2,2025-10-16 修订):https://arxiv.org/abs/2509.22642 (PDF:https://arxiv.org/pdf/2509.22642)
- 项目主页:https://wow-world-model.github.io
- GitHub:https://github.com/wow-world-model/wow-world-model
- Hugging Face 模型/数据集组织:https://huggingface.co/WoW-world-model (旗舰权重 WoW-1-Wan-14B-2M;基准数据集 WoW-1-Benchmark-Samples)
- 数据来源:agibot-world-colosseo、droid、robomind
一手源存档(sources/)
- wow-world-omniscient-model—github-readme — GitHub README 快照(开源权重表、开源路线图 Phase 1-4),fetched 2026-07-16
- wow-world-omniscient-model—hf-card — HF 旗舰模型 WoW-1-Wan-14B-2M model card 快照(training data / mixture caption 策略、license),fetched 2026-07-16
- wow-world-omniscient-model—project-page — 项目主页快照(作者列表、摘要、链接),fetched 2026-07-16
- arXiv 原文全文(HTML,v1 2509.22642v1 + v2 2509.22642v2 均通读比对)已通读,正文 Table 1-6、Section 4/5/6 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。