一句话定位
腾讯混元的 RGB-D 视频扩散世界模型:从单张图像 + 用户指定相机轨迹出发,联合生成对齐的 RGB 与深度视频序列,用深度显式提供几何先验来抑制部分点云条件带来的视觉幻觉,并配合可扩展的世界缓存机制支持自回归式的长程/无限场景漫游,生成结果可直接用于 3D 重建而无需额外的 SfM/MVS 流程。
背景与定位
论文把”可探索 3D 场景生成”面临的既有路线分成两类并各自指出局限:数据驱动的 3D 生成方法(Trellis、CityGaussian 等)依赖稀缺的高质量 3D 场景数据,难以扩展到复杂场景;新视角合成(NVS)/视频生成类方法(CAT3D、CameraCtrl、MotionCtrl、ViewCrafter、See3D、FlexWorld、GEN3C 等)虽能生成视觉丰富的内容,但存在三个问题:(1) 长程空间不一致——缺乏显式 3D 结构锚定,长轨迹生成会逐渐漂移;(2) 视觉幻觉——即便用点云 warp 出的部分 RGB 图像作为条件,复杂遮挡关系仍会引入错误的遮挡关系,从而在训练时引入不准确的监督信号;(3) 需要额外的后处理式 3D 重建,耗时且引入几何伪影。
Voyager 的立场是:与其只 warp 部分 RGB 图像作为条件,不如额外估计并 warp 出对齐的部分深度图,联合 RGB 与深度一起生成——深度能准确表达遮挡关系(论文 Figure 2 定性对比:部分 RGB 图在复杂遮挡下有明显伪影,部分深度图则能准确呈现遮挡),从而消除视觉幻觉来源;同时生成的深度可直接用于 3D 重建,不必依赖训练后单独跑一遍 VGGT 之类的稀疏重建。方法建立在 hunyuanworld-1 同期使用的 HunyuanVideo 图生视频骨干之上,实验中直接对比的基线(SEVA/Stable Virtual Camera、ViewCrafter、See3D、FlexWorld)均只用点云 warp 出的部分 RGB 作为条件。
在腾讯混元自身的世界模型产品线里,Voyager(本文,arXiv 2506,2025-06)与同年 7 月发表的 hunyuanworld-1(文/图生全景 + 分层 3D 重建)互为补充:HunyuanWorld-1.0 负责生成持久、可导出的全景/分层 3D 场景资产,但全景本身只覆盖 360° 旋转视野,无法支持视点平移式的深度漫游;Voyager 则专门解决”沿任意相机轨迹持续扩展场景”这一问题,因此被 HunyuanWorld-1.0 集成为其长程世界扩展模块。GitHub 仓库披露该团队后续又相继发布了 HunyuanWorld-Mirror(1.1,视频/多视图重建)、HunyuanWorld-WorldPlay(1.5,实时世界创建与交互)、HY-World-2.0(新一代多模态世界模型),Voyager 是这条产品线中专攻”RGB-D 联合视频扩散 + 世界缓存自回归扩展”这一环的起点工作。
模型架构
骨干:基于 Hunyuan-Video(Kong et al., 2024)的图生视频(image-to-video)框架,代码中模型标识为 HYVideo-T/2。视频先由 3D-VAE 压缩为潜变量 z₀,形状为 (T/c_t+1)×C×(H/c_s)×(W/c_s)(c_t、c_s 为时间/空间压缩率);去噪网络是 FLUX 风格的”双流转单流”(Dual-stream to Single-stream)全注意力 DiT——图像/文本 patch 先在双流 Transformer block(f_D)中独立处理,再拼接进单流 block(f_S)联合处理;训练目标是预测速度场 u_t = dz_t/dt(flow-matching 范式),最小化预测速度与真值速度的 MSE,推理时用一阶 Euler ODE 求解器恢复 z₀ 再由 3D-VAE 解码。总参数量、注意力层数、hidden dim 等内部配置数字论文与仓库均未披露。
几何注入的帧条件(Geometry-Injected Frame Condition):给定首帧图像 I₀,先估计其深度 D₀ 与相机参数 c₀,反投影得到初始点云 p₀;对第 k 帧目标视角 c_k,用 render(p₀, c_k) 得到可见性掩码 M_k,据此把 I_k、D_k 掩码为部分图像 Î_k、部分深度 D̂_k 作为条件——与仅用部分 RGB 做条件的既有方法(ViewCrafter/See3D/FlexWorld)不同,Voyager 同时提供部分深度。
World-Consistent Video Diffusion(世界一致视频扩散):
- Depth-Fused Video Generation:不是简单地把 RGB、深度潜变量在 channel 维拼接(原文指出这种做法对齐弱、难以覆盖不同幅度的缺失区域),而是把 RGB 图与深度图沿高度轴拼接为单张图 𝓘_k=[I_k, Φ, D_k]_h(Φ 为分隔用占位行,帮助模型区分两类内容),条件图 𝓘̂_k、掩码同样按此拼接(掩码经 max-pooling 下采样),再整体走 VAE→DiT 流程。这样 RGB 与深度在同一 DiT 全注意力结构内做像素级交互,而非仅在输入端粗浅融合。
- Context-Based Control Enhancement:借鉴 VideoPainter(Bian et al., 2025)的做法,复制双流/单流的第一个 block 作为轻量 Control blocks(f̂_D、f̂_S),其输出经零初始化线性层 l_D、l_S 加回到每一层 DiT block 的特征上(z’{t,i} += l_D(z_D),z”{t,i} += l_S(z_S)),强化早期上下文信息对每层的几何引导。
Long-Range World Exploration(长程世界探索,推理期机制):
- World Caching with Point Culling:维护一个跨帧累积的全局点云缓存 p̂;新增帧点云先渲染当前视角可见性掩码,不可见区域点直接加入缓存;可见区域中若已有点法向量与当前视角方向夹角超过 90°(说明该点在当前视角实际不可见/应被替换)也更新进缓存——此策略比”保留所有点”减少约 40% 存储量,同时避免多帧叠加带来的噪声累积。
- Smooth Video Sampling:将长视频切成有 50% 重叠的相邻片段;每段推理时,重叠区域的噪声初始化直接取自前一段的生成结果;相邻两段各自完成推理后,对重叠区域做平均 + 注入轻微噪声,再做一轮去噪精修,以消除片段间的色彩/风格跳变。
训练/推理配置数字:单次生成帧数固定为 49 帧;训练时随机采样宽高比例 ∈ {1, 1.25, 1.5, 1.75} 以支持多种视频宽高比;官方单卡推理默认 infer-steps 50、flow-shift 7.0、embedded-cfg-scale 6.0(GitHub 推理示例给出的采样超参,非训练超参)。
数据
数据来源(Scalable Video Data Engine 训练集,合计 10 万+ 视频片段):
- RealEstate10K(Zhou et al., 2018):74,766 个真实地产场景视频片段,以室内房屋场景为主,含部分室外。
- DL3DV(Ling et al., 2024):原始约 10K 真实场景视频,因多数存在快速/抖动相机运动不适合深度训练,人工筛选出 3,000 个高质量视频,切分为约 18,000 个片段。
- 自建 Unreal Engine(UE)渲染数据:收集 1,500 个 UE 场景模型,渲染出 10,000+ 视频样本,用于提升生成内容多样性(且天然带有 ground-truth 度量深度)。
数据标注(Scalable Video Data Engine,Appendix C)——为任意来源视频自动标注相机参数与度量深度,无需人工 3D 标注:
- 用 VGGT(Wang et al., 2025)估计全部帧的相机参数与深度:相机位姿准但深度精度不足。
- 用 MoGE(Wang et al., 2024a)作为更鲁棒的深度估计器;把两者深度转换为视差后,用最小二乘法对齐(式 5:min_{scale,bias} ‖M·(scale/d_MoGE + bias − 1/d_VGGT)‖²,M 为有效非天空区域掩码),得到与相机位姿对齐、且比 VGGT 更准的深度。
- 用 Metric3D(Hu et al., 2024)估计场景的度量深度范围,再用分位数比例(式 6:s_metric = [q(0.8,d_Metric3D)−q(0.2,d_Metric3D)] / [q(0.8,d_MoGE)−q(0.2,d_MoGE)])把上一步深度整体映射到度量尺度(式 7:d_metric = s_metric·d_MoGE),相机平移量同步按 s_metric 缩放(式 8),从而让 UE 合成数据与真实视频数据的深度/相机尺度统一。
训练阶段与数据切分(Appendix A):三阶段训练中数据集使用范围不同——第一阶段(仅 RGB)用全部三个数据集;第二阶段(引入深度)剔除 DL3DV(快速相机运动不适合深度训练);第三阶段(冻结 DiT、只训练 Control blocks)只用带 ground-truth 深度的 UE 数据集。论文全文未披露具体的帧总数/小时数,只披露片段数(100,000+)。
训练方法
三阶段流水线(Appendix A):
- Stage 1:仅训练 RGB 视频模型(基于 HunyuanVideo 图生视频框架微调),用全部三个数据集。
- Stage 2:引入深度,训练 RGB-D 联合生成(4.2 节的高度轴拼接方案),数据集去掉 DL3DV。
- Stage 3:冻结 DiT 全部参数,仅训练新增的两个 Control blocks(Context-Based Control Enhancement),数据只用 UE 数据集(其 ground-truth 深度更可靠)。Control blocks 的聚合特征按像素逐点加回主干。
训练目标:沿用 HunyuanVideo 的 flow-matching 训练范式——预测速度场 u_t,最小化与真值速度的 MSE,一阶 Euler ODE 求解采样。
深度对齐不是学习式训练,而是数据引擎里的几何优化(最小二乘 + 分位数缩放,见”数据”节)。
学习率、batch size、优化器、训练步数等具体超参数论文全文未披露。
Infra(训练 / 推理工程)
训练侧:GPU 型号、GPU 数量、总训练 GPU-hours、训练精度(fp16/bf16)等均未披露(论文正文和附录均未给出)。
推理侧(GitHub README 披露):
- 单卡推理(batch size=1,540p 分辨率)峰值显存 60GB;官方在单张 80GB GPU 上测试,推荐用 80GB 显存 GPU 以获得更好生成质量。
- 支持通过 xDiT(Unified Sequence Parallelism, USP)做多卡并行推理;README 给出 8×H20 GPU 上生成 512×768、49 帧、50 步视频的延迟对照表:
| GPU 数 | 延迟 (秒) | 加速比 |
|---|---|---|
| 1 | 1925 | 1.00x |
| 2 | 1018 | 1.89x |
| 4 | 534 | 3.60x |
| 8 | 288 | 6.69x |
- 依赖 flash-attention v2 加速单卡推理,xfuser==0.4.2(xDiT)做并行推理,CUDA 12.4/11.8 + PyTorch 2.4.0。
- FPS / 端到端控制频率(control-Hz)等指标未披露(模型面向离线片段生成而非实时交互,repo 未给出逐帧生成速度)。
评测 benchmark
Table 1:RealEstate10K 新视角合成质量(随机取测试集 150 个片段,相机参数/深度用同款数据引擎估计,指标 PSNR↑/SSIM↑/LPIPS↓):
| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|
| SEVA | 16.648 | 0.613 | 0.349 |
| ViewCrafter | 16.512 | 0.636 | 0.332 |
| See3D | 18.189 | 0.694 | 0.290 |
| FlexWorld | 18.278 | 0.693 | 0.281 |
| Voyager | 18.751 | 0.715 | 0.277 |
Table 2:RealEstate10K 上 3D Gaussian Splatting 重建质量(基线均需额外用 VGGT 做后处理重建;Voyager 额外报告了直接用自身生成深度重建的结果):
| 方法 | 后处理重建 | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|---|
| SEVA | VGGT | 15.581 | 0.602 | 0.452 |
| ViewCrafter | VGGT | 16.161 | 0.628 | 0.440 |
| See3D | VGGT | 16.764 | 0.633 | 0.440 |
| FlexWorld | VGGT | 17.623 | 0.659 | 0.425 |
| Voyager | VGGT | 17.742 | 0.712 | 0.404 |
| Voyager | 无需后处理(自身深度) | 18.035 | 0.714 | 0.381 |
Table 3:WorldScore 静态世界生成 benchmark(Duan et al., 2025;2,000 个静态测试样例,覆盖室内/室外、写实/风格化场景;对比 3D 方法 WonderJourney、WonderWorld,及视频方法 EasyAnimate、Allegro、Gen-3、CogVideoX-I2V):
| 方法 | Average | Camera Control | Object Control | Content Alignment | 3D Consistency | Photometric Consistency | Style Consistency | Subjective Quality |
|---|---|---|---|---|---|---|---|---|
| WonderJourney | 63.75 | 84.6 | 37.1 | 35.54 | 80.6 | 79.03 | 62.82 | 66.56 |
| WonderWorld | 72.69 | 92.98 | 51.76 | 71.25 | 86.87 | 85.56 | 70.57 | 49.81 |
| EasyAnimate | 52.85 | 26.72 | 54.5 | 50.76 | 67.29 | 47.35 | 73.05 | 50.31 |
| Allegro | 55.31 | 24.84 | 57.47 | 51.48 | 70.5 | 69.89 | 65.6 | 47.41 |
| Gen-3 | 60.71 | 29.47 | 62.92 | 50.49 | 68.31 | 87.09 | 62.82 | 63.85 |
| CogVideoX-I2V | 62.15 | 38.27 | 40.07 | 36.73 | 86.21 | 88.12 | 83.22 | 62.44 |
| Voyager | 77.62 | 85.95 | 66.92 | 68.92 | 81.56 | 85.99 | 84.89 | 71.09 |
Voyager 在总分与多数子项上排名第一,但相机控制(85.95,弱于 WonderWorld 的 92.98)与 3D 一致性(81.56,弱于 WonderWorld 86.87、Gen-3 68.31 之后第三)两项并非最优——论文解释这是因为 Voyager 用度量深度构建条件,其测试轨迹的相机移动幅度普遍比其它方法更大、生成难度更高。
Table 4:世界一致视频扩散消融(WorldScore 子指标)——对比三阶段训练模型:
| 模型 | Camera Control | Content Alignment | 3D Consistency |
|---|---|---|---|
| Ours (RGB-only) | 74.98 | 48.92 | 68.86 |
| Ours (RGB-D) | 85.04 | 65.72 | 78.58 |
| Ours (full, +Control blocks) | 85.95 | 68.92 | 81.56 |
融合深度条件对相机控制提升最大(74.98→85.04,+10.06pt);追加 Control blocks 再小幅提升三项指标(+0.91/+3.2/+2.98pt)。
长程生成消融(定性,Figure 8,无量化表):点云剔除方面,存储全部点引入噪声,只存不可见区域点则信息不足,加入法向量检查的剔除策略视觉效果与”存储全部点”相当但节省约 40% 存储;平滑采样方面,不做平滑采样的片段相对首段出现明显不一致,平滑采样后过渡自然。
创新点与影响
- 首个联合生成 RGB 与深度序列、且支持相机轨迹控制的视频模型(论文自述贡献之一):用深度替代/补充”部分 RGB warp”作为几何条件,从条件源头上消除视觉幻觉,而非依赖后处理修复。
- 世界缓存 + 点云剔除 + 平滑采样三件套,把自回归视频生成从”只能条件化少量历史帧”扩展为”可条件化全部历史场景观测”,支持真正意义上的长程/无限世界探索,同时把存储开销控制在可接受范围(~40% 节省)。
- 生成即重建:由于 RGB 与深度对齐生成,可跳过 SfM/MVS 或额外 VGGT 重建步骤直接做 3DGS 重建,且用自身深度重建效果优于基线借助 VGGT 的重建效果(Table 2)。
- 可扩展数据引擎(VGGT + MoGE + Metric3D 三级流水线)把任意来源视频自动转成度量深度 + 相机位姿标注的训练对,规避了人工 3D 标注瓶颈,这也是论文强调的核心贡献之一。
- 下游应用:长视频生成、Image-to-3D 组合生成(对比 Trellis / Rodin v1.5 / Hunyuan-3D v2.5,Voyager 能正确摆放物体间空间关系,如帐篷透过车窗可见)、深度一致的视频风格迁移(替换参考图像、保留深度条件即可换风格无需重新训练专用风格化模型)、单目视频深度估计(副产物能力)。
- 后续被同团队 hunyuanworld-1 集成为其”长程世界扩展”模块,成为腾讯混元世界模型产品线(1.1/WorldMirror、1.5/WorldPlay、2.0)的早期基础工作之一。
- 论文自述局限(无专门 Limitations 小节,取自正文表述):(1) 相机控制与 3D 一致性两项 WorldScore 子指标并非全场最优,作者将其归因于自身度量深度条件下的相机运动幅度更大、任务更难,但也说明该方法在这两个维度上仍有改进空间;(2) 训练依赖 VGGT/MoGE/Metric3D 三级深度标注流水线而非直接从原始视频学习,标注质量上限受制于这些现成模型;(3) 论文全文未披露训练所用 GPU 型号、数量与总训练时长,外部难以估算复现成本。
原始链接
- arXiv abs:https://arxiv.org/abs/2506.04225
- arXiv PDF:https://arxiv.org/pdf/2506.04225
- GitHub:https://github.com/Tencent-Hunyuan/HunyuanWorld-Voyager
- HuggingFace 模型:https://huggingface.co/tencent/HunyuanWorld-Voyager
- 官方项目页(现已更新为 HY-World 2.0 家族总览页,Voyager 专属内容不再单独展示):https://3d-models.hunyuan.tencent.com/world/
一手源存档(sources/)
- hunyuanworld-voyager—github-readme — GitHub README 快照(fetched 2026-07-16)
- hunyuanworld-voyager—hf-card — HuggingFace 模型卡快照(fetched 2026-07-16)
- arXiv 2506.04225 全文(arXiv 原文 HTML,不入 git,见上方链接)