一句话定位

腾讯混元的 RGB-D 视频扩散世界模型:从单张图像 + 用户指定相机轨迹出发,联合生成对齐的 RGB 与深度视频序列,用深度显式提供几何先验来抑制部分点云条件带来的视觉幻觉,并配合可扩展的世界缓存机制支持自回归式的长程/无限场景漫游,生成结果可直接用于 3D 重建而无需额外的 SfM/MVS 流程。

背景与定位

论文把”可探索 3D 场景生成”面临的既有路线分成两类并各自指出局限:数据驱动的 3D 生成方法(Trellis、CityGaussian 等)依赖稀缺的高质量 3D 场景数据,难以扩展到复杂场景;新视角合成(NVS)/视频生成类方法(CAT3D、CameraCtrl、MotionCtrl、ViewCrafter、See3D、FlexWorld、GEN3C 等)虽能生成视觉丰富的内容,但存在三个问题:(1) 长程空间不一致——缺乏显式 3D 结构锚定,长轨迹生成会逐渐漂移;(2) 视觉幻觉——即便用点云 warp 出的部分 RGB 图像作为条件,复杂遮挡关系仍会引入错误的遮挡关系,从而在训练时引入不准确的监督信号;(3) 需要额外的后处理式 3D 重建,耗时且引入几何伪影。

Voyager 的立场是:与其只 warp 部分 RGB 图像作为条件,不如额外估计并 warp 出对齐的部分深度图,联合 RGB 与深度一起生成——深度能准确表达遮挡关系(论文 Figure 2 定性对比:部分 RGB 图在复杂遮挡下有明显伪影,部分深度图则能准确呈现遮挡),从而消除视觉幻觉来源;同时生成的深度可直接用于 3D 重建,不必依赖训练后单独跑一遍 VGGT 之类的稀疏重建。方法建立在 hunyuanworld-1 同期使用的 HunyuanVideo 图生视频骨干之上,实验中直接对比的基线(SEVA/Stable Virtual Camera、ViewCrafter、See3D、FlexWorld)均只用点云 warp 出的部分 RGB 作为条件。

在腾讯混元自身的世界模型产品线里,Voyager(本文,arXiv 2506,2025-06)与同年 7 月发表的 hunyuanworld-1(文/图生全景 + 分层 3D 重建)互为补充:HunyuanWorld-1.0 负责生成持久、可导出的全景/分层 3D 场景资产,但全景本身只覆盖 360° 旋转视野,无法支持视点平移式的深度漫游;Voyager 则专门解决”沿任意相机轨迹持续扩展场景”这一问题,因此被 HunyuanWorld-1.0 集成为其长程世界扩展模块。GitHub 仓库披露该团队后续又相继发布了 HunyuanWorld-Mirror(1.1,视频/多视图重建)、HunyuanWorld-WorldPlay(1.5,实时世界创建与交互)、HY-World-2.0(新一代多模态世界模型),Voyager 是这条产品线中专攻”RGB-D 联合视频扩散 + 世界缓存自回归扩展”这一环的起点工作。

模型架构

骨干:基于 Hunyuan-Video(Kong et al., 2024)的图生视频(image-to-video)框架,代码中模型标识为 HYVideo-T/2。视频先由 3D-VAE 压缩为潜变量 z₀,形状为 (T/c_t+1)×C×(H/c_s)×(W/c_s)(c_t、c_s 为时间/空间压缩率);去噪网络是 FLUX 风格的”双流转单流”(Dual-stream to Single-stream)全注意力 DiT——图像/文本 patch 先在双流 Transformer block(f_D)中独立处理,再拼接进单流 block(f_S)联合处理;训练目标是预测速度场 u_t = dz_t/dt(flow-matching 范式),最小化预测速度与真值速度的 MSE,推理时用一阶 Euler ODE 求解器恢复 z₀ 再由 3D-VAE 解码。总参数量、注意力层数、hidden dim 等内部配置数字论文与仓库均未披露。

几何注入的帧条件(Geometry-Injected Frame Condition):给定首帧图像 I₀,先估计其深度 D₀ 与相机参数 c₀,反投影得到初始点云 p₀;对第 k 帧目标视角 c_k,用 render(p₀, c_k) 得到可见性掩码 M_k,据此把 I_k、D_k 掩码为部分图像 Î_k、部分深度 D̂_k 作为条件——与仅用部分 RGB 做条件的既有方法(ViewCrafter/See3D/FlexWorld)不同,Voyager 同时提供部分深度。

World-Consistent Video Diffusion(世界一致视频扩散)

  • Depth-Fused Video Generation:不是简单地把 RGB、深度潜变量在 channel 维拼接(原文指出这种做法对齐弱、难以覆盖不同幅度的缺失区域),而是把 RGB 图与深度图沿高度轴拼接为单张图 𝓘_k=[I_k, Φ, D_k]_h(Φ 为分隔用占位行,帮助模型区分两类内容),条件图 𝓘̂_k、掩码同样按此拼接(掩码经 max-pooling 下采样),再整体走 VAE→DiT 流程。这样 RGB 与深度在同一 DiT 全注意力结构内做像素级交互,而非仅在输入端粗浅融合。
  • Context-Based Control Enhancement:借鉴 VideoPainter(Bian et al., 2025)的做法,复制双流/单流的第一个 block 作为轻量 Control blocks(f̂_D、f̂_S),其输出经零初始化线性层 l_D、l_S 加回到每一层 DiT block 的特征上(z’{t,i} += l_D(z_D),z”{t,i} += l_S(z_S)),强化早期上下文信息对每层的几何引导。

Long-Range World Exploration(长程世界探索,推理期机制)

  • World Caching with Point Culling:维护一个跨帧累积的全局点云缓存 p̂;新增帧点云先渲染当前视角可见性掩码,不可见区域点直接加入缓存;可见区域中若已有点法向量与当前视角方向夹角超过 90°(说明该点在当前视角实际不可见/应被替换)也更新进缓存——此策略比”保留所有点”减少约 40% 存储量,同时避免多帧叠加带来的噪声累积。
  • Smooth Video Sampling:将长视频切成有 50% 重叠的相邻片段;每段推理时,重叠区域的噪声初始化直接取自前一段的生成结果;相邻两段各自完成推理后,对重叠区域做平均 + 注入轻微噪声,再做一轮去噪精修,以消除片段间的色彩/风格跳变。

训练/推理配置数字:单次生成帧数固定为 49 帧;训练时随机采样宽高比例 ∈ {1, 1.25, 1.5, 1.75} 以支持多种视频宽高比;官方单卡推理默认 infer-steps 50flow-shift 7.0embedded-cfg-scale 6.0(GitHub 推理示例给出的采样超参,非训练超参)。

数据

数据来源(Scalable Video Data Engine 训练集,合计 10 万+ 视频片段)

  • RealEstate10K(Zhou et al., 2018):74,766 个真实地产场景视频片段,以室内房屋场景为主,含部分室外。
  • DL3DV(Ling et al., 2024):原始约 10K 真实场景视频,因多数存在快速/抖动相机运动不适合深度训练,人工筛选出 3,000 个高质量视频,切分为约 18,000 个片段。
  • 自建 Unreal Engine(UE)渲染数据:收集 1,500 个 UE 场景模型,渲染出 10,000+ 视频样本,用于提升生成内容多样性(且天然带有 ground-truth 度量深度)。

数据标注(Scalable Video Data Engine,Appendix C)——为任意来源视频自动标注相机参数与度量深度,无需人工 3D 标注:

  1. VGGT(Wang et al., 2025)估计全部帧的相机参数与深度:相机位姿准但深度精度不足。
  2. MoGE(Wang et al., 2024a)作为更鲁棒的深度估计器;把两者深度转换为视差后,用最小二乘法对齐(式 5:min_{scale,bias} ‖M·(scale/d_MoGE + bias − 1/d_VGGT)‖²,M 为有效非天空区域掩码),得到与相机位姿对齐、且比 VGGT 更准的深度。
  3. Metric3D(Hu et al., 2024)估计场景的度量深度范围,再用分位数比例(式 6:s_metric = [q(0.8,d_Metric3D)−q(0.2,d_Metric3D)] / [q(0.8,d_MoGE)−q(0.2,d_MoGE)])把上一步深度整体映射到度量尺度(式 7:d_metric = s_metric·d_MoGE),相机平移量同步按 s_metric 缩放(式 8),从而让 UE 合成数据与真实视频数据的深度/相机尺度统一。

训练阶段与数据切分(Appendix A):三阶段训练中数据集使用范围不同——第一阶段(仅 RGB)用全部三个数据集;第二阶段(引入深度)剔除 DL3DV(快速相机运动不适合深度训练);第三阶段(冻结 DiT、只训练 Control blocks)只用带 ground-truth 深度的 UE 数据集。论文全文未披露具体的帧总数/小时数,只披露片段数(100,000+)。

训练方法

三阶段流水线(Appendix A)

  1. Stage 1:仅训练 RGB 视频模型(基于 HunyuanVideo 图生视频框架微调),用全部三个数据集。
  2. Stage 2:引入深度,训练 RGB-D 联合生成(4.2 节的高度轴拼接方案),数据集去掉 DL3DV。
  3. Stage 3:冻结 DiT 全部参数,仅训练新增的两个 Control blocks(Context-Based Control Enhancement),数据只用 UE 数据集(其 ground-truth 深度更可靠)。Control blocks 的聚合特征按像素逐点加回主干。

训练目标:沿用 HunyuanVideo 的 flow-matching 训练范式——预测速度场 u_t,最小化与真值速度的 MSE,一阶 Euler ODE 求解采样。

深度对齐不是学习式训练,而是数据引擎里的几何优化(最小二乘 + 分位数缩放,见”数据”节)。

学习率、batch size、优化器、训练步数等具体超参数论文全文未披露。

Infra(训练 / 推理工程)

训练侧:GPU 型号、GPU 数量、总训练 GPU-hours、训练精度(fp16/bf16)等均未披露(论文正文和附录均未给出)。

推理侧(GitHub README 披露)

  • 单卡推理(batch size=1,540p 分辨率)峰值显存 60GB;官方在单张 80GB GPU 上测试,推荐用 80GB 显存 GPU 以获得更好生成质量。
  • 支持通过 xDiT(Unified Sequence Parallelism, USP)做多卡并行推理;README 给出 8×H20 GPU 上生成 512×768、49 帧、50 步视频的延迟对照表:
GPU 数延迟 (秒)加速比
119251.00x
210181.89x
45343.60x
82886.69x
  • 依赖 flash-attention v2 加速单卡推理,xfuser==0.4.2(xDiT)做并行推理,CUDA 12.4/11.8 + PyTorch 2.4.0。
  • FPS / 端到端控制频率(control-Hz)等指标未披露(模型面向离线片段生成而非实时交互,repo 未给出逐帧生成速度)。

评测 benchmark

Table 1:RealEstate10K 新视角合成质量(随机取测试集 150 个片段,相机参数/深度用同款数据引擎估计,指标 PSNR↑/SSIM↑/LPIPS↓):

方法PSNR↑SSIM↑LPIPS↓
SEVA16.6480.6130.349
ViewCrafter16.5120.6360.332
See3D18.1890.6940.290
FlexWorld18.2780.6930.281
Voyager18.7510.7150.277

Table 2:RealEstate10K 上 3D Gaussian Splatting 重建质量(基线均需额外用 VGGT 做后处理重建;Voyager 额外报告了直接用自身生成深度重建的结果):

方法后处理重建PSNR↑SSIM↑LPIPS↓
SEVAVGGT15.5810.6020.452
ViewCrafterVGGT16.1610.6280.440
See3DVGGT16.7640.6330.440
FlexWorldVGGT17.6230.6590.425
VoyagerVGGT17.7420.7120.404
Voyager无需后处理(自身深度)18.0350.7140.381

Table 3:WorldScore 静态世界生成 benchmark(Duan et al., 2025;2,000 个静态测试样例,覆盖室内/室外、写实/风格化场景;对比 3D 方法 WonderJourney、WonderWorld,及视频方法 EasyAnimate、Allegro、Gen-3、CogVideoX-I2V):

方法AverageCamera ControlObject ControlContent Alignment3D ConsistencyPhotometric ConsistencyStyle ConsistencySubjective Quality
WonderJourney63.7584.637.135.5480.679.0362.8266.56
WonderWorld72.6992.9851.7671.2586.8785.5670.5749.81
EasyAnimate52.8526.7254.550.7667.2947.3573.0550.31
Allegro55.3124.8457.4751.4870.569.8965.647.41
Gen-360.7129.4762.9250.4968.3187.0962.8263.85
CogVideoX-I2V62.1538.2740.0736.7386.2188.1283.2262.44
Voyager77.6285.9566.9268.9281.5685.9984.8971.09

Voyager 在总分与多数子项上排名第一,但相机控制(85.95,弱于 WonderWorld 的 92.98)与 3D 一致性(81.56,弱于 WonderWorld 86.87、Gen-3 68.31 之后第三)两项并非最优——论文解释这是因为 Voyager 用度量深度构建条件,其测试轨迹的相机移动幅度普遍比其它方法更大、生成难度更高。

Table 4:世界一致视频扩散消融(WorldScore 子指标)——对比三阶段训练模型:

模型Camera ControlContent Alignment3D Consistency
Ours (RGB-only)74.9848.9268.86
Ours (RGB-D)85.0465.7278.58
Ours (full, +Control blocks)85.9568.9281.56

融合深度条件对相机控制提升最大(74.98→85.04,+10.06pt);追加 Control blocks 再小幅提升三项指标(+0.91/+3.2/+2.98pt)。

长程生成消融(定性,Figure 8,无量化表):点云剔除方面,存储全部点引入噪声,只存不可见区域点则信息不足,加入法向量检查的剔除策略视觉效果与”存储全部点”相当但节省约 40% 存储;平滑采样方面,不做平滑采样的片段相对首段出现明显不一致,平滑采样后过渡自然。

创新点与影响

  • 首个联合生成 RGB 与深度序列、且支持相机轨迹控制的视频模型(论文自述贡献之一):用深度替代/补充”部分 RGB warp”作为几何条件,从条件源头上消除视觉幻觉,而非依赖后处理修复。
  • 世界缓存 + 点云剔除 + 平滑采样三件套,把自回归视频生成从”只能条件化少量历史帧”扩展为”可条件化全部历史场景观测”,支持真正意义上的长程/无限世界探索,同时把存储开销控制在可接受范围(~40% 节省)。
  • 生成即重建:由于 RGB 与深度对齐生成,可跳过 SfM/MVS 或额外 VGGT 重建步骤直接做 3DGS 重建,且用自身深度重建效果优于基线借助 VGGT 的重建效果(Table 2)。
  • 可扩展数据引擎(VGGT + MoGE + Metric3D 三级流水线)把任意来源视频自动转成度量深度 + 相机位姿标注的训练对,规避了人工 3D 标注瓶颈,这也是论文强调的核心贡献之一。
  • 下游应用:长视频生成、Image-to-3D 组合生成(对比 Trellis / Rodin v1.5 / Hunyuan-3D v2.5,Voyager 能正确摆放物体间空间关系,如帐篷透过车窗可见)、深度一致的视频风格迁移(替换参考图像、保留深度条件即可换风格无需重新训练专用风格化模型)、单目视频深度估计(副产物能力)。
  • 后续被同团队 hunyuanworld-1 集成为其”长程世界扩展”模块,成为腾讯混元世界模型产品线(1.1/WorldMirror、1.5/WorldPlay、2.0)的早期基础工作之一。
  • 论文自述局限(无专门 Limitations 小节,取自正文表述):(1) 相机控制与 3D 一致性两项 WorldScore 子指标并非全场最优,作者将其归因于自身度量深度条件下的相机运动幅度更大、任务更难,但也说明该方法在这两个维度上仍有改进空间;(2) 训练依赖 VGGT/MoGE/Metric3D 三级深度标注流水线而非直接从原始视频学习,标注质量上限受制于这些现成模型;(3) 论文全文未披露训练所用 GPU 型号、数量与总训练时长,外部难以估算复现成本。

原始链接

一手源存档(sources/)