一句话定位
MoWorld 是 Moxin Technology(KOKONI 3D,联合浙江大学)提出的”Flash World Model”(快闪世界模型):在 wan-2-2(Wan2.2-A14B MoE DiT)骨干上叠加 Plücker 射线相机适配器,用 3D 几何感知数据引擎 + 125→2000 帧渐进式课程预训练 + 历史检索式自回归蒸馏(50 步扩散压到 4 步因果 AR)把推理步数打下来,再靠流水线/并行/算子三级 NPU 原生工程把它跑到华为昇腾(Ascend CloudMatrix384)上最高 50 FPS、推理成本仅为现有世界模型的 30%–50%,号称首个面向 NPU 生态的实时交互世界模型。
背景与定位
论文开篇给”Flash World Model”下了一个明确的操作性定义:能持续以 ≥30 FPS 生成的交互式世界模型(引用《Real-Time Rendering》教科书对实时渲染帧率的定义),并指出包括 genie-3、“Advancing open-source world models”(Lingbot,arXiv:2601.20540)、skywork-matrix-game-2(Matrix-Game 2.0)在内的现有主流方案都达不到这条线。MoWorld 把自己定位成同时解决”能力—效率—成本—部署”四件事的全流程 co-design:数据引擎、预训练、蒸馏、推理系统四段全部围绕”不堆算力也能实时”这一个目标重新设计。
与同期的 dreamx-world-1(DreamX-World 1.0,高德地图/阿里)相比,两者都在做”相机可控 + 长时程记忆 + 少步蒸馏 + 推理工程”的组合拳,但落地硬件路线不同:DreamX-World 的加速数字全部建立在 NVIDIA H20 / RTX 5090 集群上,MoWorld 则把重心放在去 GPU 化——训练用昇腾 NPU 集群(CANN 算子、HCCL 通信),推理端专门做面向 NPU 的算子级优化(INT8 动态量化、融合 attention kernel),强调”不需要高端 GPU”也能做到 50 FPS。评测上沿用 vbench 的 I2V 分支协议,直接与 CameraCtrl、SEVA、Lingbot、WorldPlay(HunyuanWorld 系”Hy-World 1.5”)等基线对比。
模型架构
- 骨干:wan-2-2 的 Wan2.2-A14B(14B MoE Video DiT),完整继承其视频编码器、文本编码器、图像条件分支与高/低噪声 MoE 专家设计(高噪专家管全局结构/大幅运动,低噪专家管纹理/边缘/局部时序一致性);额外加一个 Camera Adapter 分支。
- 相机条件注入:把每帧内参 K_i、外参 T_c2w 转成逐像素 Plücker 坐标 r_{i,u,v}=[m_w; d_w]∈R^6(世界系下的射线方向 d_w 与矩向量 m_w),聚合成 R_cam∈R^{T×H×W×6};Camera Adapter A_φ 把 R_cam 投影到视觉 token 空间 C_cam∈R^{N×d},直接加到噪声潜变量的 patch embedding 上(X_cam^(t) = PatchEmbed(z_t) + C_cam),在 patch-token 级别把相机几何和去噪过程耦合。
- 预训练目标:标准 flow-matching/速度预测扩散损失 L_pre = E‖f_θ(x_0, c^txt, c^{1:T}_cam, t, z_t) − v_t‖²,以首帧、文本、逐帧相机轨迹为条件。
- 课程式跨帧训练(渐进式时空能力学习):Short-Clip(T∈{125,250},练稳定成像/首帧一致性/基础相机响应)→ Medium-Clip(T∈{500,1000},练中程漂移/物体位置/场景布局)→ Long-Clip(T=2000,练长时程空间记忆/重访一致性),每阶段继承上一阶段权重、复用同一套 cached 数据接口,大部分算力花在低成本的短/中段,长段只在最后阶段引入。
- 自回归蒸馏(教师 50 步 → 学生 4 步因果 AR):三件套——
- History Context Selection:不维护完整 KV Cache,只存一个”潜变量帧库”(History Bank),每个非首 chunk 取「最近帧 + 初始锚点帧 + 按相机潜变量距离检索出的相似视角历史帧」拼进当前 chunk 一起去噪;RoPE 用全局潜变量时间 ID 而非 chunk 内重新计数;History token 不算损失、不被当前 chunk 更新。
- AR Flow Matching 预训练(ODE-init-free):用 ground-truth 潜变量构造 prefix history 和锚点帧(非首 chunk 的锚点 = 前面 GT chunk 的最后一帧),只对当前 chunk 算 flow-matching 损失 L_FM,再加一个锚点损失 L_anchor=‖X̂_i^0 − X_i^anchor‖²(约束 chunk 边界重叠潜变量的连续性),总损失 L_AR = L_FM + λ_anchor·L_anchor,λ_anchor = 1.0;这一步绕开了其他蒸馏方法依赖的教师 ODE 轨迹/多步教师采样初始化,直接用缓存的 GT 潜变量适配学生到因果 chunk-wise 接口。
- Self-Forcing / DMD 式蒸馏:学生用自己真实推理时的 AR rollout 生成整段视频(而非替换成 GT),Fake Phase 冻结学生+教师、只训一个 Fake Model 拟合”当前学生分布”的速度场;Student Phase 冻结教师+Fake Model,用 g_DMD = v_real − v_fake 作为分布匹配的 proxy gradient(stop-gradient),只反传给学生 rollout;因为训练时的采样路径就是部署时的真实 AR pipeline,边界误差、history 检索误差、长程漂移在训练阶段就会暴露。
- 论文原文明确写”compress inference steps from 50 to 4”(Figure 4 caption),即扩散采样步数从教师的 50 步压到自回归学生的 4 步。
数据
- 几何感知数据引擎(四阶段):(1) 数据采集——开放域视频(视觉覆盖)+ 游戏场景数据(显式控制信号与几何真值)两路来源;(2) 几何补全与质控——修复缺失的相机条件、剔除几何/画质不可靠样本;(3) VLM 标注——只标场景级描述,刻意把相机运动排除在文本条件之外;(4) 预计算缓存——把处理后的多模态信号存成可直接喂训练的格式。
- 该协议”share the design of VGGT-Omega(arXiv:2605.15195)geometry-centric data construction”,在相机位姿真值之外还为每个场景标注稠密 3D 点云,为下游空间推理/重建/世界状态建模任务提供数据基础。
- 规模:“MoWorld is built entirely on proprietary data acquisition and in-house processing pipelines from up to 500 annotators”(多达 500 名标注员的自建数据采集+处理管线),涵盖真实拍摄与大规模合成生成;论文未披露具体的小时数/帧数/episode 数等规模数字。
- 额外评测数据:除官方 VBench-I2V 子集外,团队从互联网收集了”数百个测试样本”(AI 生成视频、游戏环境、真实世界视频),抽取首帧/文本描述/相机轨迹条件,构成 Table 2 的自建 camera/world-model 评测集。
训练方法
- 预训练:在 Wan2.2-A14B 上大规模训练相机可控数据,目标为公式 (1) 的 flow-matching 损失;课程按 125→250→500→1000→2000 帧渐进扩展序列长度(见”模型架构”)。
- 蒸馏三阶段:History Context Selection(推理侧的历史检索机制设计)→ AR Flow Matching Pretraining(ODE-init-free 的因果化适配,λ_anchor=1.0)→ Self-Forcing/DMD 式蒸馏(教师-Fake Model 分布匹配,学生按真实 AR rollout 训练)。最终把 50 步扩散采样压缩为 4 步自回归推理。
- 论文未给出学习率、batch size、单阶段具体训练步数等超参数(除 λ_anchor=1.0 外)。
Infra(训练 / 推理工程)
训练侧(昇腾 NPU 集群):
- 资源组织:沿用 Wan2.2 的高/低噪声 MoE 划分,部署在两个 NPU 资源池上;多模态信号离线编码成缓存的视频潜变量/文本 embedding/相机条件张量,训练直接消费缓存特征,避免长视频训练中的在线编码/几何重算瓶颈。
- 并行:FSDP 做参数/梯度/优化器状态分片;中等长度用 Ulysses SP(按 attention head 切分 + 融合 NPU attention kernel,通过 CANN runtime 做 QKV 投影/softmax/输出聚合的分块融合,跨卡通信走 HCCL);2000 帧的长片段训练改用 Unified Sequence Parallelism (USP)(token 级切分,比固定的 head 级 Ulysses SP 更灵活地随序列长度扩展)。
- 硬件:致谢中明确”Experiments are conducted on Huawei Ascend CloudMatrix384 Supernodes”(华为昇腾 CloudMatrix384 超节点),并致谢华为海思团队、华为计算产品线、华为云团队;具体 NPU 卡数、总训练 NPU-小时未披露。
推理侧(三级优化):
- Pipeline 级:On-demand Module Loading——编码器只在首步执行一次产出初始条件 embedding 后即释放显存,DiT 与解码器再依次加载,历史潜变量在自回归步间复用,避免编码器显存常驻。
- Parallelism 级:Hierarchical Sequence Parallelism——把 Encoder⊕DiT 和 Decoder 解耦到不同 NPU;Encoder⊕DiT 集群内先按 attention head 切(head-level),组内再按 token 切(token-level SP)二级切分;组内 ring 通信、组间 AllToAll,均经 HCCL 执行。
- Kernel 级:Dynamic Mixed-Precision Quantization——权重/激活以 BF16 加载,经一次 kernel warm-up 量化为 INT8(约 2× 显存下降),INT8×INT8 累加出 INT32 再反量化回 BF16;仅对 DiT blocks 做此量化,编码器因对精度敏感 + 执行时间短仍保持 BF16。HBM-efficient End-to-end Attention——RMSNorm 替代 LayerNorm 降低归一化开销,QKV 投影与 tiling 融合为单次 HBM 传输 + on-kernel 分解 + online softmax。
- 结果:摘要与结论明确给出”up to 50 FPS”(在 NPU 上、不需要高端 GPU)与”average inference cost is only 30%-50% of that of existing World Models”;论文未给出具体的绝对延迟(ms/帧)数字,也未披露达到 50 FPS 所用的 NPU 卡数/型号(仅泛称”NPU”及致谢中的 CloudMatrix384 平台)。
评测 benchmark
Table 1(官方 VBench-I2V 抽样子集,8 项指标:SC 主体一致性/BC 背景一致性/MS 运动平滑度/DD 动态程度/AQ 美学质量/IQ 成像质量/I2V-S 首帧主体保持/I2V-B 首帧背景保持;Quality = 前六项加权均值(DD 权重 0.5,其余权重 1);Average = 全 8 项算术均值):
- CameraCtrl:SC 95.44 / BC 95.36 / MS 98.92 / DD 38.00 / AQ 54.86 / IQ 66.27 / I2V-S 95.95 / I2V-B 97.48 / Quality 78.15 / Average 80.29
- SEVA:SC 87.07 / BC 90.18 / MS 97.62 / DD 62.00 / AQ 52.65 / IQ 61.40 / I2V-S 93.83 / I2V-B 95.64 / Quality 76.35 / Average 80.05
- Lingbot:SC 93.91 / BC 94.94 / MS 97.80 / DD 46.00 / AQ 57.54 / IQ 71.20 / I2V-S 97.27 / I2V-B 97.14 / Quality 79.71 / Average 81.97
- MoWorld:SC 95.47 / BC 95.68 / MS 98.13 / DD 60.00 / AQ 64.63 / IQ 71.11 / I2V-S 98.04 / I2V-B 98.68 / Quality 82.73 / Average 85.22(Quality、Average 均为四者最高)
Table 2(自建 camera/world-model 数据集,同 8 项指标):
- SEVA:SC 90.08 / BC 92.23 / MS 98.48 / DD 56.00 / AQ 53.53 / IQ 50.09 / I2V-S 96.40 / I2V-B 93.18 / Quality 74.98 / Average 78.75
- CameraCtrl:SC 84.31 / BC 93.17 / MS 97.86 / DD 100.00 / AQ 46.26 / IQ 54.78 / I2V-S 93.27 / I2V-B 95.05 / Quality 77.52 / Average 83.09
- WorldPlay(HunyuanWorld “Hy-World 1.5”):SC 95.88 / BC 94.84 / MS 99.29 / DD 88.00 / AQ 51.76 / IQ 70.92 / I2V-S 99.00 / I2V-B 99.12 / Quality 83.04 / Average 87.35
- Lingbot:SC 91.82 / BC 93.93 / MS 98.01 / DD 92.00 / AQ 57.09 / IQ 73.30 / I2V-S 97.08 / I2V-B 96.64 / Quality 83.66 / Average 87.48
- MoWorld:SC 95.46 / BC 96.33 / MS 98.12 / DD 100.00 / AQ 59.40 / IQ 76.65 / I2V-S 98.22 / I2V-B 98.33 / Quality 86.54 / Average 90.31(Quality、Average 均为五者最高)
论文强调 MoWorld 在两个评测集上都拿到最高 Quality 与 Average,且 I2V-S/I2V-B 分数高,说明相机可控训练没有明显牺牲首帧信息保持。定性实验(Fig.7–10)在图书馆、哥特大厅、古典街道、金字塔遗迹、商场走廊、夜间住宅区等场景下展示 WASD 式连续相机控制的响应。未见 FVD/FID 或专门的推理延迟/steps 消融数值表。
创新点与影响
- 3D 几何原生数据引擎:跳过”松散配对的 video-text clip”范式,沿用 VGGT-Omega 的几何中心数据构建协议,为世界模型训练同时提供相机位姿真值与稠密点云标注。
- 渐进式时空能力课程:不直接优化长上下文,而是 125→2000 帧分阶段解锁”局部交互与相机响应 → 中程物体/布局一致性 → 长时程空间记忆与重访一致性”,把大部分训练算力压在低成本的短/中段。
- ODE-init-free 的自回归蒸馏栈:History Context Selection(潜变量帧库替代 KV Cache)+ AR Flow Matching 预训练(用 GT prefix 而非教师 ODE 轨迹/多步教师采样做因果化适配)+ Self-Forcing/DMD 蒸馏(学生按真实部署 rollout 训练,边界误差在训练期就暴露),把 50 步扩散采样压到 4 步因果 AR。
- NPU 原生部署工程:流水线级 On-demand Module Loading、并行级 Hierarchical Sequence Parallelism、算子级 INT8 动态量化 + 融合 HBM-efficient attention 三层协同,论文称之为”首个面向昇腾 NPU 生态的实时交互世界模型”,在不依赖高端 GPU 的前提下达到 50 FPS、推理成本降到现有世界模型的 30%–50%。
- 下游应用矩阵:Video Transfer(风格迁移保运动/相机轨迹)、Video Editing(叙事一致的相机+内容联合编辑)、Point Cloud Reconstruction(SfM+单目深度)、3D Gaussian Splatting(含”先建 3DGS 场景背景、再用视频模型补前景动态事件”的 Camera-Story Joint Controlling 用法)、Navigation(作为具身智能体的环境模型,接收动作序列生成第一人称观测)。
- 论文自陈局限:全文没有单独的 Limitations 小节,Conclusion 只重申贡献未讨论不足;同时论文在多处关键量化指标上留白——训练数据的小时数/帧数/episode 规模、NPU 卡数与总训练 NPU-小时、达到 50 FPS 的具体绝对延迟(ms)与硬件配置均未披露,代码与在线体验在项目页上标注”Coming Soon”(截至抓取时未开源)。
原始链接
- arXiv abs:https://arxiv.org/abs/2607.06216
- arXiv PDF:https://arxiv.org/pdf/2607.06216
- 官方项目页:https://moxin-tech.github.io/moworld/
- 代码:Coming Soon(项目页标注,抓取时未发布)
一手源存档(sources/)
- 项目页快照:moworld-flash-world-model—project-page.md
- arXiv 正文(HTML 全文,2607.06216v1):未落盘(arXiv 原文 PDF/HTML,不入 git,见上方”原始链接”直接访问)