一句话定位

Skywork AI 提出的全景(360°×180°)世界生成框架:先训练一个以场景网格渲染为条件的轨迹引导全景视频扩散模型(基于 Wan2.1-I2V-14B),再用两条互补管线(前馈大重建模型 / 逐场景优化)把生成的全景视频提升为可自由探索的 3D 高斯溅射场景,并配套自建的 Matrix-Pano 数据集(116,759 条带相机轨迹与深度标注的合成全景视频)。

背景与定位

3D 世界生成是”空间智能”的基础模块之一,此前主流路线是用视频扩散先验做新视角合成:给定单图/稀疏视图 + 相机位姿,两阶段生成新视角后逐场景优化(如 ViewCrafter、GenEx、CAT3D、Gen3C、Wonderland、TrajectoryCrafter)。这类方法的共同限制是只用**透视图(perspective image)**做条件,视场角有限,探索到画面边界外就会暴露几何/纹理断裂,不够沉浸。

Matrix-3D 的解法是换用全景图(panorama)作为中间表示:一张全景图天然覆盖完整 360°×180° 视野,把 3D 世界建模为”一系列沿轨迹运动的全景图序列”,从根本上避免透视图的视场限制。论文将自己定位为首个支持精确轨迹控制的全景视频生成方法——此前的全景数据集/模型(360DVD、GenEx、4K4DGen、DynamicScaler)要么没有相机位姿标注,要么不支持精确轨迹控制。

同源相关项目:Skywork 同期/后续还发布了面向实时交互式场景(键鼠逐帧驱动而非预定义轨迹)的 Matrix-Game / Matrix-Game 2.0,二者与 Matrix-3D 互为姊妹项目但目标不同(交互式流式生成 vs. 静态场景一次性重建)。同类”从图像/文字生成可探索 3D 世界”的竞品还包括腾讯 HunyuanWorld 1.0(网格+纹理路线)与 World Labs 的 Marble(论文用其 2025 年发布的演示做范围对比,见评测章节)。

模型架构

三阶段流水线:文本/图像 → 全景图 → 全景视频(轨迹引导)→ 3D 世界。

Stage 0:全景图生成(Appendix A)。文生全景:在 FLUX 上用 Matrix-Pano 数据集中精选的 1000 张全景图训练 LoRA;图生全景:管线直接基于 WorldGen 构建;推理阶段用 latent rotation + circular padding(借鉴 PanFusion)保证循环一致性(左右边界拼接无缝)。深度用 MoGe 预测。

Stage 1:轨迹引导全景视频生成

  • Backbone:Wan2.1-I2V-14B(图生视频扩散 Transformer,flow-matching 目标);额外训练一个基于 Wan2.2-TI2V-5B 的轻量 5B 变体(README 披露,非论文正文,兼顾速度与显存)。
  • 轨迹引导构造:给定输入全景图 I₀ 及其深度图 D₀,把深度反投影为世界坐标构建初始场景网格 S(而非点云),遮挡区域(深度剧变的相邻像素)标记为不可见并涂纯黑;沿预定义相机轨迹渲染出 Nf 帧的 (RGB 渲染图, 二值可见性 mask) 序列作为条件。论文强调网格渲染相比点云渲染(ViewCrafter/TrajectoryCrafter/Gen3C 等常用)能有效消除摩尔纹(Moiré)伪影与错误遮挡关系。
  • 条件注入:RGB 渲染 + mask 序列经 3D causal VAE 编码/下采样后与噪声 latent 沿通道拼接送入 DiT;输入全景图 I₀ 额外经 CLIP 编码为图像级 embedding,与文本 prompt embedding 融合后通过 cross-attention 注入,提供全局语义引导;引入 LoRA 模块做稳定快速训练,训练时冻结 base model 仅更新 LoRA 参数。
  • 训练目标:标准 flow-matching loss,L(θ)=E[‖u_θ(z_t,c,s,t) − v_t‖²₂],v_t = z₁ − z₀。

Stage 2a:优化式 3D 重建(optimization-based)。每 5 帧取一个关键帧;用 MoGe 估计关键帧全景深度做最小二乘配准对齐,得到世界坐标点云作为 3DGS 初始化;每张全景关键帧裁成 12 张透视图,先用 StableSR 超分,再喂入标准 3DGS 优化管线,以 L1 重建 loss 优化。

Stage 2b:前馈全景重建模型(Large Panorama Reconstruction Model, LRM)——参考 Wonderland 架构改造。

  • 输入:视频 latent z ∈ ℝ^{t×h×w×c},相机位姿编码为球面 Plücker embedding p ∈ ℝ^{T×H×W×6};两者各自经 patchify 模块(camera 分支用 3D 卷积,kernel/stride 均为 (4,16,16))对齐 token 长度,沿通道拼接、线性投影、归一化后送入 4 层 Transformer block 提取全局场景上下文。
  • 解码:两条独立分支——深度分支、其余 3DGS 属性分支(旋转/颜色/不透明度/尺度)——各含 4 层 Transformer,再接 DPT head(多尺度预测头,消融显示显著优于简单 3D 反卷积上采样)+ **3D 转置卷积(DeConv3D,kernel (5,1,1),stride (r_t,1,1))**沿时间维上采样,对齐原始视频帧数。
  • 输出:深度体 (B, 81, 240, 480, 1) + 属性体 (B, 81, 240, 480, 12)(12 通道 = RGB 3 + scale 3 + 四元数旋转 4 + opacity 1 + depth 1),合成完整 3DGS。
  • 监督:不直接对全景图算光度 loss(会导致透视 3DGS 光栅化器渲染稀疏伪影),而是每张全景图切成 12 张透视 patch,每次迭代随机采 1 patch 用标准透视光栅化器渲染,并额外加入插值/外推的新视角做监督(防止过拟合观测视角)。

数据

  • Matrix-Pano 数据集116,759 条高质量静态全景视频序列,全部用 Unreal Engine 5 合成,配套 3D 探索轨迹、深度图、文本标注,分辨率 1024×2048。是首个同时提供相机位姿 + 深度标注的全景视频数据集(对比 Imagine360 10K/Web360 2K/Argus 283K/360-1M 1076K/PanoWan 13K,均缺相机位姿或深度标注之一)。
  • 采集流程(4 步):
    1. 场景采集:504 个高质量 UE5 3D 场景,覆盖室内外、多种天气与光照。
    2. 探索路径采样:先识别可行走表面(道路/地面),Delaunay 三角化生成稀疏点上的非重叠三角网格;随机选两点 → Dijkstra 最短路径 → Laplacian 平滑消除急转弯;只保留长度 >18 米 的轨迹。
    3. 碰撞检测:用包围盒代理算法剔除几何穿模/物体相交的轨迹,逐步模拟轨迹并丢弃相交路径。
    4. 标注与质量过滤:自动过滤(Video-LLaMA3 评估画质/语义/运动丰富度)+ 人工筛查(逐视频首帧人工剔除渲染质量差或细节缺失样本);最终 Video-LLaMA3 自动生成文本标注。
  • 训练用切片:从 116K 视频序列中裁剪提取 200K 段视频片段,每段 81 帧,用于训练全景视频生成模型;每段片段都构建对应场景网格渲染与全景 mask/真值深度。
  • 评测集:从合成数据中另选 200 条全景视频作为测试集,与训练集无重叠。
  • 数据采集工程细节(Appendix C):六方向离线渲染(前后左右上下)严格同步相机变换,曝光补偿固定为常量 10.5 防止自动曝光波动,禁用 Local Exposure/Vignette/Bloom 等非线性后处理,精调 Lumen 全局光照的屏幕空间采样范围以保证六视图拼接一致性。

训练方法

  • 全景视频生成模型:基于 Wan2.1-I2V-14B 微调,训练两个分辨率版本:480×960 (480p)720×1440 (720p);每条训练视频 81 帧;在 200K 条全景视频片段上训练 6000 迭代,学习率 1×10⁻⁴,batch size 21
  • 前馈全景重建模型(LRM):架构大体沿用 Wonderland,关键改动为用 DPT head 预测 3DGS 属性 + 球面投影预测 3DGS 均值;基于已训练好的 480p 全景视频生成模型继续训练;每次从视频序列中以随机步长 1–3 抽取 81 帧作为上下文;每次迭代采样 32 个参考视角(上下文帧/插值帧/外推帧三类混合);学习率 1×10⁻⁴
  • 两阶段训练策略(消融验证必要性,见下):
    • 第一阶段:只预测深度(对齐真值绝对深度,而非 DepthPro 式的逆深度,因为更关注离相机近、对重建更关键的区域)+ 谐波损失(令预测 3 通道 RGB 与真值像素对齐,加速后续 GS 属性收敛):ℒ_first = ℒ_Smooth-L1(D̂,D) + λ₁·ℒ_L1(Ĥ,H)。
    • 第二阶段:冻结深度相关参数(含前 4 层 Transformer block),只更新其余 GS 属性,用 MSE + LPIPS 图像重建损失:ℒ_second = ℒ_MSE(Î,I) + λ₂·ℒ_LPIPS(Î,I)。每张全景视角裁成 12 张 512×512 透视图,FOV 在 60°–120° 间随机采样作为监督信号。
    • 消融显示:联合单阶段预测射线距离与其余 3DGS 属性无法可靠收敛;即使从第一阶段 checkpoint 初始化但不冻结深度参数,深度预测也会在第二阶段训练中逐步退化(Figure 11)。
  • 优化式重建的关键工程 trick:3DGS 初始化质量对最终效果影响很大,故用 MoGe 深度做最小二乘配准对齐后的点云初始化 3DGS blob(而非随机初始化)。

Infra(训练 / 推理工程)

  • 训练 GPU 数量、总 GPU-hours:论文与官方渠道均未披露
  • 推理硬件与速度(GitHub README/HF 卡片披露):单张 A800 GPU 生成一个 720p 全景视频约需 一小时;支持多 GPU 并行加速推理(VISIBLE_GPU_NUM 参数)。
  • 显存占用(不同模型组件,GitHub README 披露):
    • Text2PanoImage ~16G
    • PanoVideoGen-480p ~40G(低显存模式 ~15G)
    • PanoVideoGen-720p ~60G(低显存模式 ~19G)
    • PanoVideoGen-720p-5B(基于 Wan2.2-TI2V-5B) ~19G(低显存模式 ~12G)
    • PanoLRM-480p ~80G(无低显存模式;可选用显存需求约 10G 的优化式重建替代)
    • 整条流水线最低显存需求 16G;启用低显存模式后 720p 全流程可在 19G 显存运行。
  • 3D 重建耗时对比(Table 3,论文自测):ODGS(baseline) 745 秒;前馈式(Ours) 仅需 10 秒;优化式(Ours) 需 571 秒(质量更高但慢得多)。
  • Gradio demo 显存要求:单卡(--max_gpus=1)仅支持 text-video-3D 流程,需 ≥62GB 显存;多卡(--max_gpus=N, N≥2)同时支持 text/image-video-3D 两条流程。
  • 训练精度、并行策略(FSDP/DeepSpeed 等):未披露。

评测 benchmark

评测数据:从 Matrix-Pano 测试集(200 条,无训练集重叠全景视频)评测。指标:FID、FVD(视觉质量/时序一致性),WorldScore 定义的 R_err/T_err(旋转/平移误差,用 VGGT 估计相机位姿),以及 PSNR/SSIM/LPIPS。

Table 2 — 全景视频生成对比(vs. 360DVD、Imagine360、GenEx):

ModelPSNR↑SSIM↑LPIPS↓FID↓FVD↓
360DVD9.650.3490.8341122700
Imagine36011.60.3910.59966.71600
GenEx16.10.6000.38042.21110
Matrix-3D 480p23.70.7220.077615.4234
Matrix-3D 720p23.90.7470.090711.3140

Table 2 — 相机可控视频生成对比(vs. ViewCrafter、TrajectoryCrafter;Matrix-3D 输出裁成 90° FOV 透视视频评测):

ModelPSNR↑SSIM↑LPIPS↓FID↓FVD↓R_err↓T_err↓
ViewCrafter21.60.7010.16147.37620.09400.0453
TrajectoryCrafter21.80.6820.12633.16750.03380.0488
Matrix-3D 480p (Persp.)24.10.7500.11323.94380.03250.0310
Matrix-3D 720p (Persp.)24.30.7770.10812.51650.03060.0297

Table 3 — 3D 世界重建对比(vs. ODGS,全景专用 3DGS 优化方法基线):

MethodPSNR↑LPIPS↓SSIM↑Time(s)↓
ODGS22.040.4440.673745
Ours(前馈)22.300.3890.64710
Ours(优化式)27.620.2940.816571

Table 4 — 消融(网格 vs. 点云轨迹引导,5K 数据子集/480p 训练):网格渲染在全部 7 项指标上都优于点云渲染(如 FID 15.3 vs. 15.9, FVD 242 vs. 260, R_err 0.0359 vs. 0.0410)。

定性对比:与 WorldLabs(2025 发布的 3D 场景生成 demo,即 Marble 前身/同期产品)做”同一输入图、可探索距离”对比,Matrix-3D 生成场景的可探索范围明显更大(Figure 8);并展示”无限探索”能力——生成第一段场景后可转向、沿第二条轨迹继续生成,实现任意方向的连续探索(Figure 9)。

创新点与影响

  • 首个支持精确轨迹控制的全景视频生成方法:用场景网格渲染(而非点云)作为轨迹条件,系统性消除了此前方法(ViewCrafter/TrajectoryCrafter/Gen3C 等)在点云渲染中常见的摩尔纹与遮挡错误。
  • 全景表示 → 天然规避透视图视场限制:把 3D 世界生成问题转化为”沿轨迹的全景图序列生成 + 提升为 3D”,一次生成即覆盖 360°×180° 视野,不再受限于窄视角导致的边界伪影。
  • 双轨提升管线:前馈 LRM(10 秒级重建,质量略逊)与逐场景优化(571 秒,PSNR 27.62,质量最优)分别覆盖”快速预览”与”高保真交付”两种场景,是效率-质量权衡的显式设计。
  • Matrix-Pano 数据集:首个同时提供相机轨迹 + 深度标注的大规模(116,759 条)合成全景视频数据集,填补了此前全景数据集(360DVD/PanoWan 等)只有文本标注、缺几何信息的空白;论文详述了 UE5 六方向离线渲染同步、曝光锁定、Lumen 全局光照适配等工程细节,为同类数据合成提供了可复现的工程方案。
  • 论文自述局限(Limitation 一节原文):
    1. 生成速度慢——基于视频扩散模型,单场景生成需要”数十分钟”级别;
    2. Matrix-Pano 数据集中半透明/多孔区域(如树木、栅栏)偶发深度值不自然跳变;
    3. 从视频 latent 估计深度本质困难——latent 只编码外观线索(视频 VAE 训练目标不含几何监督),这一不完美的深度估计会拖累第二阶段 LRM 训练效果,最终影响渲染质量。
  • 未来方向(论文自述):生成当前不可见区域的内容(如通过特定轨迹设置或引入 3D 物体生成)、增强生成场景的可编辑性(支持”在房子旁加一棵树”这类语义级指令)、扩展到动态场景生成(物体可运动交互)。

原始链接

一手源存档(sources/)