一句话定位
DreamX-World 1.0 是高德地图(AMAP-ML)DreamX 团队在 wan-2-2(Wan2.2-TI2V-5B)上打造的通用交互式世界模型:用 E-PRoPE 做高效相机控制、几何检索式记忆解决重访一致性、Event Instruction Tuning 支持多实体可组合事件、蒸馏后再做 RL 对齐,最终以 5B 参数在自建评测上超过 8B 的 HY-WorldPlay 1.5 与 14B 的 LingBot-World,并在 8×RTX 5090 上跑到 16 FPS 流式生成。
背景与定位
交互式世界模型这条脉络先由面向游戏场景的动作条件生成开创(Genie、GameNGen、GameGen-X),再演进为面向通用领域、支持相机导航/流式生成/物体交互的系统(HY-WorldPlay 1.5、LingBot-World、Matrix-Game 3.0、Yume-1.5)。论文把这些系统面临的问题归纳为三个耦合的技术难点:相机轨迹要转化成跨场景一致的视角变化而不显著增加骨干开销;场景内容要在离开局部上下文窗口后仍能被”记住”,否则重访会渲染出不同的合理场景;持续交互对延迟有硬约束,但激进蒸馏又会削弱画质、相机可控性与 rollout 稳定性。
DreamX-World 1.0 把自己定位为同时攻克这四件事(相机控制、长时程记忆、可组合事件、实时流式推理)的”全栈”系统:数据引擎融合 UE5 精确相机几何数据、动作丰富的游戏录像、以及带恢复相机位姿的真实视频;训练是渐进式五阶段流水线;推理侧做量化+算子融合+并行解码。评测上,论文认为现有基准(worldscore-benchmark、Omni-WorldBench)只覆盖短时程画质/可控性,因此自建了长时程 rollout 评测与”重访一致性”评测协议。
模型架构
- 骨干:初始化自 Wan2.2-TI2V-5B(wan-2-2 系列),DiT + rectified flow 目标,5B 参数,发布的检查点包括双向(Cam,仅 5s)和自回归(长时程)两个版本。
- 相机条件 E-PRoPE:在 PRoPE(Li et al. 2025a)投影式相对位置编码基础上做效率改造——PRoPE 本身把逐 token 矩阵 D^PRoPE 拆成 D^Proj(世界到图像投影几何)与 D^RoPE(标准 RoPE)两个 d/2×d/2 子块加到 attention 的 query/key 上;DreamX-World 只保留 D^Proj、去掉冗余的 D^RoPE 子块(认为 DiT 主干自带的注意力已提供足够时空归纳偏置),并且只对空间下采样后的 token 集合计算这个投影注意力:一段 5s 720P 视频经 Wan2.2 VAE 后是 S=18480 个 token,下采样到 N=4096 个 token 再算 E-PRoPE(下采样比 >4.5×),算完再上采样、直接加回原 DiT attention 输出。训练时冻结 DiT 主干、只反传梯度给 E-PRoPE 参数。实测(8×NVIDIA H20,5s 720P)训练时间降低约 50%、推理延迟降低约 30%(Table 1:PRoPE 80s → E-PRoPE 59s,相机控制分从 73.89 降到 73.75,基本无损)。有趣的是,论文提到推理时即便学生模型没显式训练 PRoPE 分支,也能”即插即用”地借用预训练 PRoPE 分量。
- 记忆:Memory-Conditioned Scene Persistence:把”检索到的记忆帧 z_M ∣ 最近历史帧 z_H ∣ 加噪目标帧 z_C^τ”拼接进同一条 DiT self-attention 序列,只对目标帧算 loss。记忆帧不是按时间距离选,而是按相机位姿 + 视野重叠的几何线索检索;打包时每个记忆帧带上对应其”原始时间位置”的 RoPE embedding(而非当前位置),避免把远处记忆误当作时间相邻帧;对时间跨度很大的记忆,采用类似 NTK-aware RoPE scaling / YaRN / randomized positional encoding 的轻量时间位置处理。比较过 cross-attention 和 VACE 式条件注入,效果均不如这种”打包进同一 attention 流”的方案。
- 曝光偏差缓解:借鉴 Stable Video Infinity (SVI) 的误差注入——只扰动条件 token(记忆/历史帧),保持监督目标干净,让模型学会”记忆有用时用记忆、记忆明显有误时退回学到的先验”。
- 事件控制:Event Instruction Tuning:全量微调 DiT,架构不变,事件语义完全通过 text-conditioning 接口注入(结构化事件指令被渲染成覆盖全局场景+逐实体动态的自然语言 prompt);训练混合事件样本和非事件样本,保守更新+严格梯度裁剪以避免破坏预训练的视觉/运动先验。论文给出的能力对比表(Table 2)显示,DreamX-World 是唯一同时具备 Promptable Events、Object-Level Events、Region-Guided Events、Multi-Entity Composition、Inter-Object Interaction 五项全勾选的系统(LingBot-World、HY-WorldPlay 1.5 只是部分/定性支持,Matrix-Game 3.0 不支持事件,Yume-1.5 不支持组合/互动)。
- 长时程生成/蒸馏:先用 causal forcing + DMD 把双向教师蒸馏成少步自回归学生;再仿照 LongLive,用长 rollout + Infinity-RoPE 在长序列局部时间窗口上继续训练,缓解长视频常见的身份漂移、背景突变、prompt/运动控制减弱。相机分支单独处理:把 E-PRoPE 分支接入长视频 T2V 学生,用 DMD-forcing(学生 rollout 在长视频采样出的局部时间窗口上,向双向 E-PRoPE 教师对齐)蒸馏出带相机控制的少步 AR 模型;I2V 质量则用双向 E-PRoPE 模型做教师,把每个 DMD 窗口首帧解码后喂给教师作为图像条件。最终可稳定推理到约 1 分钟。
- RL 对齐:DMD 蒸馏后用 DiffusionNFT 做后训练。当前模型对每个文本-图像-相机条件生成若干长时程 rollout 候选,从候选里采样短片段送两个奖励模型打分(一个衡量水平平移/旋转的相机跟随精度,一个评估视觉质量),融合后驱动 DiffusionNFT 软更新,KL 正则约束更新幅度不偏离 DMD 蒸馏后的模型太远;RL 反传只作用于采样出的短片段而非整段 rollout,控制显存开销;更新按步”温和”推进以避免少步模型 RL 训练不稳定/早期崩溃。
数据
三类来源拼成统一相机坐标系:
- UE5 合成数据:first-person 自由相机(用 UE NavMesh 导航系统探索场景、随机化朝向/俯仰、碰撞检测+最短时长/路径长度约束+防卡死检测过滤无效轨迹)、third-person 角色跟随(带跟踪/防碰撞/防遮挡的跟随相机)、event 交互子集三个观测模式,共享统一输出 schema;逐帧提供离散动作向量真值(WASD 平移 + IJKL 旋转的键盘式控制信号)和相机位姿(位置+欧拉角),third-person 片段还额外记录角色世界坐标与朝向。采用”先探索发现高质量轨迹、再离线渲染”的两阶段流水线,避免把算力浪费在无效/低运动片段上;渲染用 UE Movie Render Queue,多 GPU 分布式渲染+断点续渲+失败自动恢复。
- 真实世界数据:SpatialVID、RealEstate10K、Sekai、DL3DV。用 MegaSaM 在若干关键帧上稀疏估计相机位姿,再通过 SLERP(旋转)+ 线性插值(平移)稠密化。
- 游戏数据:Sekai-Game、OmniWorld-Game,其引擎导出位姿被转换到与 UE/真实数据一致的相机坐标系。
三阶段质量控制:(1) 基础过滤——剔除时长/帧率不足、文字水印过多、黑边、画面变化过小(用 CLIP 特征在首尾帧的余弦相似度衡量)的片段;(2) 几何位姿清洗——针对真实视频检查内参不一致、平移突变、快速旋转、竖直抖动、非法朝向;(3) 视频描述与属性打标——每段视频标注全局 caption(场景/主体/动作/时序变化),并打上美学质量、运动强度、场景类别、视觉风格、主体类型、运动类别(区分纯相机运动的”3D”场景与相机+物体都动的”4D”场景)标签,用于后续过滤和训练配比。Event Instruction 数据从清洗过的数据池里挑选含可见状态变化的高质量片段,按层级化 captioning 标注:全局描述总结静态场景背景与整体时序演变,每个事件记录包含实体指代、事件谓词、空间锚点、时间区间;可组合事件里每个参与对象各有一条事件记录,物体间交互(碰撞、交接等)写在全局描述里;数据集混合单物体事件与可组合事件。论文未披露具体的小时数/帧数/条目数等规模数字,仅描述来源构成与处理流程。
训练方法
初始化自 Wan2.2-TI2V-5B,渐进五阶段:(1) Camera-Aware Training(引入 E-PRoPE,标准去噪目标,冻结主干只训 PRoPE 参数)→ (2) Memory-Conditioned Scene Persistence(打包记忆/历史/目标帧,rectified flow 目标,只对目标帧计损失)→ (3) Event Instruction Tuning(全量微调 DiT,事件样本+非事件样本混合,保守更新+梯度裁剪)→ (4) Autoregressive Long Video Generation and Distillation(causal forcing + DMD 蒸馏成少步自回归模型,LongLive 式长 rollout + Infinity-RoPE 续训,相机分支单独 DMD-forcing 蒸馏,I2V 蒸馏用解码后的窗口首帧做图像条件)→ (5) Reinforcement Learning(DiffusionNFT 软更新,相机控制+视觉质量双奖励模型融合,KL 正则+温和更新schedule)。学习率、batch size、单阶段训练步数等具体超参数论文未披露。
Infra(训练 / 推理工程)
训练侧:GPU 数量与总训练 GPU-小时未披露。唯一给出的量化对比是 Table 1 的推理延迟消融——在 8×NVIDIA H20 上生成 5s 720P 视频,PRoPE 耗时 80s,E-PRoPE 耗时 59s(降约 26%,与摘要所称”~30%“基本吻合);E-PRoPE 还使训练时间降低约 50%(相对全量 PRoPE,具体训练卡时未给出绝对数字)。
推理侧(论文披露的加速部署系统):DiT 去噪端合并精度/并行/算子/时间步四类优化——attention 层用 INT8 SageAttention,FFN 层用 AngelSlim 做 FP8 量化;长时空 token 序列用 sequence parallelism 跨卡切分(只同步必要的 attention/归一化统计量);把高频 Transformer-block 算子重写为融合 Triton kernel;仿照 TeaCache,在相邻时间步残差变化很小的稳定区间复用去噪残差、跳过部分 block 前向。VAE 解码端采用 Matrix-Game 3.0 的 VAE 解码器并做 75% 剪枝,单 chunk 解码降到约 0.25 秒(首次迭代后 torch.compile 进一步降低延迟),并仿照 ParaVAE 按高度切分、多卡并行解码本地 patch 再拼接,降低单卡峰值显存。serving 层用异步流水线并行,让 chunk k 的 VAE 解码与 chunk k+1 的控制接收/KV-cache 更新/DiT 去噪重叠。综合效果:8×RTX 5090 上最高 16 FPS 流式生成。
开源检查点的单卡推理成本(GitHub README 实测,1×NVIDIA H20):DreamX-World-5B-Cam(双向,仅支持 5s)生成 5s@720P 耗时 509s / 峰值显存 38GB;DreamX-World-5B(自回归,支持长时程)生成 5s@720P 耗时 26s / 40GB,生成 60s@720P 耗时 342s / 72GB。这是未做上述全部加速优化的基线检查点单卡成本,与摘要里 8×RTX5090 16FPS 的工程加速数字不是同一套部署配置。
评测 benchmark
对比基线为 HY-WorldPlay 1.5(8B)与 LingBot-World(14B),DreamX-World-1.0-5B 参数量仅 5B。
5s 基础评测(Table 3,0–100 归一化,越高越好;相机控制误差用 e_camera=√(e_θ·e_t) 定义,视觉质量指标沿用 Omni-WorldBench 协议,另加 Gemini-3.1-Pro 做逐帧伪影检测):
- DreamX-World-1.0-5B:Camera 73.75 / Quality 66.75 / Trans 98.33 / Flicker 96.17 / Smooth 98.79 / Dynamic 85.83 / Artifact 73.75 / Overall 84.76
- HY-WorldPlay 1.5 (8B):Camera 65.12 / Quality 68.23 / Trans 98.33 / Flicker 96.45 / Smooth 99.05 / Dynamic 66.67 / Artifact 71.66 / Overall 80.79
- LingBot-World (14B):Camera 71.73 / Quality 67.76 / Trans 85.00 / Flicker 94.94 / Smooth 97.06 / Dynamic 88.33 / Artifact 58.33 / Overall 80.45
DreamX-World-1.0-5B 以最小参数量拿到最高相机控制分和最高总分。
~30s 长时程评测(Table 4,同一套指标):DreamX-World-1.0-5B Overall 70.41(Camera 62.03 / Quality 64.11 / Trans 80.00 / Flicker 96.35 / Smooth 98.41 / Dynamic 75.00 / Artifact 17.00),高于 HY-WorldPlay 1.5 的 68.85(Artifact 仅 14.00)与 LingBot-World 的 67.43(Artifact 仅 12.00)——三家伪影分在长时程下都大幅下滑,但 DreamX-World 相对最稳。
重访一致性评测(Table 5,10s 生成视频,三种轨迹模板:原路折返/平移+转向/闭环,所有增益相对非重访基线对照计算):DreamX-World-1.0-5B 在 ΔPSNR (3.92)、ΔSSIM (0.098)、ΔLPIPS (0.232)、ΔDINO-Sim (0.246)、ΔVPR-Sim (0.142) 五项均最高;HY-WorldPlay 1.5 在 ΔSP-Match (0.251) 与 CLIP-V (0.992) 上领先;LingBot-World 全项增益最低。
人类盲测偏好研究(Fig 12,双盲 A/B,以 DreamX-World-1.0-5B 视角报告 win/tie/loss %):总体偏好对 HY-WorldPlay 1.5 为 57.5/14.4/28.1,对 LingBot-World 为 61.9/10.6/27.5;视觉质量胜率 57.5% / 61.3%;伪影检测胜率 59.4% / 56.2%;相机控制维度胜负接近、平局率更高,说明三家感知可控性相当。
E-PRoPE 消融(Table 1,Omni-WorldBench,8×H20,5s 720P):PRoPE 相机控制 73.89 / 延迟 80s;E-PRoPE 相机控制 73.75 / 延迟 59s——控制精度基本无损,延迟降约 26%。
创新点与影响
主要贡献:(1) E-PRoPE——把相机感知注意力限制在空间下采样 token 上,用几乎无损的可控性换取显著更低的训练/推理开销;(2) 几何检索式记忆 + 误差注入 + 长 rollout 蒸馏三件套,针对性解决自回归长视频”重访不一致”和”漂移”两个此前少被专门评测的问题,并为此新设计了一套重访一致性评测协议;(3) Event Instruction Tuning 让模型成为作者对比表里唯一支持”多实体可组合事件+物体间互动”的交互世界模型;(4) 在 DMD 蒸馏之后再叠一层 RL(DiffusionNFT)找回蒸馏损失掉的相机控制力和画质,同时不改变少步推理接口;(5) 工程组合拳把服务侧推到 8×RTX5090 16FPS。
论文自陈的局限:长时程视觉/几何一致性仍是难题,扩展交互后物体外观或布局可能剧烈漂移;caption、相机、事件三种控制信号可能相互冲突(当某个事件产生的视觉内容与 caption 所指定的未来场景设定不兼容时);世界模型的自动化评测本身仍不完善,Omni-WorldBench V2 等基准很重要,但开放式交互场景下人工评测和任务型评测仍不可替代。后续方向:(a) 角色中心的世界模型——聚焦持久角色身份、自由移动相机下的角色动作协调、更丰富的多角色长时程互动;(b) 原生音视频联合世界模型——联合生成同步语音/环境声/动作相关音效,并把声音本身用作事件和场景动态的交互信号。
原始链接
- arXiv abs:https://arxiv.org/abs/2606.16993
- arXiv PDF:https://arxiv.org/pdf/2606.16993
- GitHub:https://github.com/AMAP-ML/DreamX-World
- 官方项目页:https://amap-ml.github.io/DreamX_World
- HuggingFace(DreamX-World-5B,自回归长时程版):https://huggingface.co/GD-ML/DreamX-World-5B
- HuggingFace(DreamX-World-5B-Cam,双向 5s 版):https://huggingface.co/GD-ML/DreamX-World-5B-Cam
- ModelScope:https://modelscope.cn/models/GD-ML/DreamX-World-5B
一手源存档(sources/)
- dreamx-world-1—github-readme — GitHub README 快照(含开源检查点单卡推理成本表,fetched 2026-07-16)
- dreamx-world-1—hf-card — HuggingFace 模型卡快照(fetched 2026-07-16)
- dreamx-world-1—project-page — 官方项目页文字快照(fetched 2026-07-16)
- arXiv 2606.16993 全文(arXiv 原文 PDF,不入 git,见上方链接)