一句话定位

PixWorld 是一个把 3D 场景生成重建统一到”像素空间扩散”的单一端到端模型:给定一组带位姿的多视角图,把它们切成 clean 子集(做重建)和 noisy 子集(做生成,可选文本条件),用一个双流 DiT 一次前向直接吐出 pixel-aligned 3D 高斯场,再把高斯渲染回图像、在渲染出的多视图上直接施加 flow-matching 损失——整条链路里没有 VAE/RAE,优化目标对齐的是 3D 场景本身的保真度而非某个中间 latent。它还加了一个 geometry perception loss,用冻结的 3D 基础模型(π³ / VGGT)特征做 3D 结构监督。约 1.04B 参数,在 RealEstate10K/DL3DV 的重建上追平 feed-forward SOTA,在 1/2-view 生成与 WorldScore 上超过此前 latent-space 生成方法(WorldScore 均分 71.04)。

背景与定位

3D 场景重建和生成长期是两条独立技术线。重建由 feed-forward 回归方法主导:LRM、pixelSplat、Splatter Image、MVSplat、DepthSplat 直接把稀疏/稠密多视角图一次前向映射成 3D 表示(多数目标是 3DGS);这类方法确定性、只依赖已观测视图,无法合成输入之外的未见内容。生成则从早期 per-scene 优化(DreamFusion/Magic3D/DreamGaussian 用 SDS 把 2D 扩散先验蒸到一个 3D 表示)演进到”先合成多视角图再重建”,再到当前主流的 latent-space 扩散(Prometheus、SplatFlow、Director3D、FlashWorld 冻结一个图像/视频 VAE 并训一个 latent→3DGS 解码器,在 latent 空间微调扩散主干),最近又进一步把扩散搬进 3D 基础模型 / 表征自编码器(RAE)的特征空间(OneWorld、VGGT-world、Repurposing geometric foundation models)。

这条谱系里,早期的对象级 3D 生成如 get3dwonder3dtrellis,以及 2026 年的场景/资产级工作 seed3d-2-0hunyuan3d-2-1、乃至交互世界模型 genie-generative-interactive-environments,各自都要处理”用什么表示、在哪个空间做生成”。PixWorld 的直接对手是 Gen3R——它试图在 latent 空间里用单模型统一重建和生成。PixWorld 论文点名批评这种 latent 统一的两个硬伤:其一,扩散目标定义在中间 latent feature 上而不是底层 3D 表示,导致 3D 输出无法被直接优化;其二,两条支线都要吃 VAE/RAE 编码引入的信息损失,而这个自编码器本身还得额外训练——对重建这种”保真度受限”的任务尤其致命。

PixWorld 的答案是把统一问题重新表述在像素空间扩散范式下。近两年 pixel-space 生成(Simple/Simpler diffusion、PixelFlow、PixNerd、JiT “Back to Basics”)已经证明:给足容量和数据,直接在像素空间扩散能追平甚至超过 latent 对应物。PixWorld 把这个视角搬到 3D:既然扩散变量和渲染输出都在同一个 RGB 域,扩散目标就能直接监督在渲染图上,从而对齐 3D 场景保真度。论文为 arXiv:2607.05373v1(06 Jul 2026),作者 Sensen Gao、Qihang Cao、Jia-Wang Bian(通讯)来自南洋理工大学,Zhaoqing Wang、Dongdong Yu、Changhu Wang 来自 AISphere;Sensen Gao 与 Zhaoqing Wang 为共同一作。frontmatter 沿用任务下发的 org 口径(“独立研究者(含 Changhu Wang)”),实际一手署名机构是 NTU + AISphere。

模型架构

整体是一个两流(two-stream)DiT 去噪器 f_θ(附录 Table 6 给出完整规格):

  • 主干:24 层 DiT,hidden width d=1024,16 个注意力头(head dim 64),FFN 用 SwiGLU,Q/K 上做 RMSNorm,调制用 adaLN-Zero,时间步条件注入。
  • 双流设计(SD3-style MMDiT):每个 block 里有两条拓扑相同的并行流,但各自维护独立的 pre-LayerNorm、QKV/输出投影、MLP、adaLN-Zero 权重。clean stream 处理条件视图(Ω_c 子集),noise stream 处理加噪视图(Ω_n 子集)。
  • 联合注意力:在注意力算子内部,两流各自的 Q、K、V 沿 token 轴拼接(共享 q、k-RMSNorm),对拼起来的 [Ω_c; Ω_n] 做一次 full attention——于是条件 token 和 noisy token 在每一层都相互 cross-talk,算完再 split 回各自的输出投影。这是”一个模型同时干重建和生成”的关键机械。
  • 共享条件:两流共享同一个 cross-attention 到文本 token、同一个 timestep embedder。timestep embedder 对 clean 流永远评估在 t=1(视为完全去噪),对 noise 流评估在采样到的 t——这样一个模型既能做 pose-only 生成也能做 text-conditioned 生成。
  • 相机与位置:相机参数通过 PRoPE(Cameras as relative positional encoding)注入;输入用 16×16 patchify 加 learnable 位置编码。
  • 输出与解码:最后一层通过 stream-specific 的多任务头,为每个视图输出 per-pixel 深度图和 3D 高斯属性。高斯中心不直接回归,而是用预测深度把每个像素反投影到世界坐标(μ = Π⁻¹(p, d̂, T)),跨所有像素和视图聚合成 scene-level 的 3DGS 表示 𝒢̂,再用可微渲染器渲回各视角图像。

参数量分解(Table 6,总计 1.044B):clean/noisy patch embed 各 0.79M;learnable 位置编码 0.60M(588×1024);timestep embedder 1.31M;text projection 5.24M(MLP 4096→1024→1024);每个 MMDiT block 41.98M,×24 层 = 1007.6M 的主干;depth head 2×2.36M(adaLN + linear 1024→16×16×1);3D-Gaussian head 2×11.28M(adaLN + linear 1024→16×16×35,即每像素 35 个高斯参数)。头部按流复制(clean/noise 各一份),所以带 2× 系数。

数据

多视角训练集:RealEstate10K + DL3DV-10K 混合,合计约 67K 个带位姿的多视角场景,模型从零训练。每个场景采样 N∈{4,…,8} 个 posed views,随机划分成 Ω_c(clean)和 Ω_n(noisy),并偏向小 |Ω_c|——这样容量主要花在”以少量条件视图生成”上,而 all-clean 情形(Ω_n=∅,退化为纯多视角重建)负责锚定 geometry head。

2D 外观先验:额外混入 BLIP-3o 语料里的 10M 单图,与扩散主干共享,作为 2D appearance prior。深度监督用的伪标签来自 DA3(Depth Anything 3)

NVS-Refined 数据集(GitHub/项目页披露,已在 HF 发布):从 RealEstate10K、ACID、DL3DV、SpatialVid 精选出”清晰高保真、相机运动大、美学分高”的 clip;对那些本身有价值但明显模糊的 clip,不丢弃而是用 Streaming FlashVSR(流式视频超分)修复回可用的高分辨率细节。这是配套开源的数据资产(论文正文训练用的是 Re10K+DL3DV,NVS-Refined 是仓库侧的精修版本)。

训练方法

总目标 L = L_render + λ_depth·L_depth + λ_geo·L_geo

渲染损失 L_render 分三块(Eq. 6):

  • L_recon:clean 视图(Ω_c)的渲染图对观测图做直接 MSE,clean 视图作为无噪声的重建锚点。
  • L_FM:noisy 视图(Ω_n)按流匹配(flow-matching)风格监督渲染速度场 v̄ 对齐真值速度 v;在图像空间等价于带 1/(1−t)² 权重的渲染-真值 MSE。纯重建情形(Ω_n=∅)用指示函数关掉这一项。
  • L_lpips:感知损失,只在 t>t_th=0.3 时激活(noisy 输入太接近纯噪声时 perceptual 不可靠)。此外每次迭代额外采 4–8 个 novel view,把它们的渲染对 GT 做 MSE + lpips 监督,正则 3DGS 从所有视角都渲得好。

深度损失 L_depth:预测深度对 DA3 伪深度,在 log 深度上做 element-wise Huber。

几何感知损失 L_geo(核心创新):L_render 本质是 photometric 的,不能完全约束底层 3D 结构——深度可以沿视线漂移只要投影外观不变、半透明 floater 可以平均出貌似合理的颜色、view-dependent 纹理能部分补偿几何错位,对没有直接 clean 监督的 noisy 视图尤其严重。对策是引入一个冻结的 3D 基础模型 Ψ(π³ 或 VGGT)作”结构 critic”:把 rendered 视图集和 GT 视图集在同一组相机下分别送进 Ψ 提多视角几何特征,最小化两者逐位置的 cosine 距离(Eq. 9),同样只在 t>t_th 时激活。训练时冻结 Ψ、对 reference 分支 stop-gradient、只回传 rendered 分支。因为 Ψ 是把所有视图连同相机联合处理的,它的特征编码的是 cross-view 3D 结构而非单图外观——于是两个各自 photo-consistent 但在 3D 上互不一致的渲染,仍会产生不同的特征图、招致大的 L_geo。超参:λ_depth=1.0,λ_lpips=λ_geo=0.1,实现里 Ψ 取 π³。

优化:完全从零训练(不做任何 image/video 模型预训练),AdamW,学习率从 1e-4 线性衰减到 1e-5,EMA decay 0.9995,梯度裁剪 1.0,classifier-free 文本 dropping 比例 0.2,训约 200K steps。

RL / 后训练 / 蒸馏:本作没有 RLHF 或偏好对齐环节。蒸馏在论文正文里被列为 future work(局限一节明确写”计划用蒸馏和量化加速推理”),但 GitHub/项目页披露作者已经做了 4-step 蒸馏,产出 PixWorld-480P-4steps,单场景约 0.6s(详见 Infra)——这是论文正文之外的后续更新,权重”即将放出”。

Infra(训练 / 推理工程)

  • 训练算力:32 张 NVIDIA A800-SXM4-80G,训练分辨率 336×448。每张 GPU 每个优化 step 交替跑一个 32 图的单视角 batch 和一个多视角 batch(最多 32 图,例如 4–8 视图 × 4–8 场景)——单视角流灌 2D 外观先验、多视角流学 3D。
  • 推理速度(附录 Table 9,单张 A100-SXM4-80G,未蒸馏 base 模型):PixWorld 生成一个场景用 8 个关键帧 / 100 NFE / 15s;对比 Gen3C(121 帧 / 70 NFE / 791s)、Gen3R(49 帧 / 100 NFE / 882s)、FlashWorld(24 帧 / 4 NFE / 10s)。作者坦承这不是严格 apples-to-apples:PixWorld 目前输出分辨率更低(省了 per-step 计算),更根本的是它不依赖 video-model 先验、也不需要 materialize 一整条稠密帧序列——只从最少 8 个关键帧重建出 3D 表示,之后任意 novel view 都由可微渲染高效渲出;而 video-diffusion pipeline(Gen3C/Gen3R/FlashWorld)要端到端去噪一长串帧。NFE 上 PixWorld 与 Gen3R 相当(100),FlashWorld 靠蒸馏把 NFE 压到 4 才拿到它的速度优势。
  • 蒸馏后(GitHub/项目页):4-step PixWorld-480P-4steps 单场景约 0.6s,作者称相对扩散式世界生成器最高约 1000× 加速(对 FantasyWorld 1041×、Gen3C 445×、Gen3R 148×、FlashWorld 5×)。蒸馏 + 后训练量化被列为下一步工程方向。

评测 benchmark

所有生成协议里每个 baseline 都喂相机位姿,除 LVSM 外还额外喂文本条件;RealEstate10K/DL3DV 各随机采 200 个”相机位姿跨度大”的测试场景(压 wide-baseline),WorldScore 用官方 static split 的 2000 场景。

3D 重建 / 新视角合成(Table 1,RealEstate10K + DL3DV-10K,4/8-view 输入):给 4 或 8 个 posed view,在 GT 位姿下渲 held-out 目标,PSNR/SSIM/LPIPS 评。

数据集/设置方法PSNR↑SSIM↑LPIPS↓
RE10K 4-viewYoNoSplat(with-pose)25.860.8410.143
RE10K 4-viewPixWorld26.210.8440.138
RE10K 8-viewYoNoSplat28.350.8890.107
RE10K 8-viewPixWorld28.580.8920.101
DL3DV 4-viewYoNoSplat22.890.7100.228
DL3DV 4-viewPixWorld23.180.7140.226
DL3DV 8-viewYoNoSplat21.920.6780.262
DL3DV 8-viewPixWorld22.460.6810.257

即便对手用的是更强的 with-pose YoNoSplat(喂了 GT 相机),PixWorld 在全部设置拿到最佳 PSNR 与 LPIPS、RealEstate10K 上最佳 SSIM,只有 DL3DV 的 SSIM 略输 DepthSplat。说明像素空间表述 + 几何感知监督带来了更强的 cross-view 一致性。

3D 场景生成(Table 2 单图 / Table 3 双图,averaged):三组指标——NVS 保真(PSNR/SSIM/LPIPS)、VBench 式生成质量(I2V Subject/Background、Image Quality、Aesthetic Quality)、相机控制精度(用 π³ 估位姿算 AUC@30°/15°/5°)。对比 LVSM、Geometry Forcing、Gen3C、FlashWorld、Gen3R。单图设置下 PixWorld 在两数据集几乎全指标居首:RealEstate10K PSNR 18.88(对 Gen3R 17.59、比 LVSM 17.82 高 +1.06 dB),DL3DV PSNR 16.50(+0.75 dB);收益在严格位姿阈值上最明显,AUC@5 从 0.546→0.614、0.420→0.485。双图设置下 PixWorld 拿到最佳 LPIPS(0.210/0.340)和 AUC@5(0.649/0.534),LVSM 只在裸 PSNR/SSIM 上有竞争力(反映其确定性回归目标)。

WorldScore(Table 4,2000 场景,七项官方指标 + 均分)

方法Camera CtrlObject CtrlContent Align3D ConsistPhoto ConsistStyle ConsistSubj Quality均分
WonderJourney84.6037.1035.5480.6079.0362.8266.5663.75
LucidDreamer88.9341.1875.0090.3790.2048.1058.9970.40
FlashWorld84.4350.2856.5485.8786.7279.3652.7570.85
PixWorld91.0846.2555.2791.3993.8467.1152.3671.04

PixWorld 拿到最佳均分,并在相机可控性、3D 一致性、光度一致性三项排第一(object control、content alignment、subjective quality 不是最强,属整体均衡取胜)。

消融(Table 5,RealEstate10K 1-view,去掉 geometry perception loss):为公平对比取 10K 序列子集、两个变体各训 30K steps,只开关几何感知损失。去掉后 PSNR 掉 1.13 dB(19.12→17.99)、SSIM 掉 0.105(0.717→0.612)、AUC@5 掉 0.080(0.642→0.562,相对约 12.5%),而 VBench 式分数几乎不动——正好印证动机:2D photometric/perceptual 损失让单帧看着还行,但底层 3D 几何无监督,于是 cross-view 一致性和位姿保真度垮掉。

创新点与影响

  1. 首个把 3D 场景生成与重建统一到像素空间扩散的单模型。通过 clean/noisy 子集划分 + 一次前向出 pixel-aligned 3DGS,把两个任务塞进同一次 forward,去掉了 latent 统一方案里的 VAE/RAE 中间层。
  2. 扩散目标经可微渲染直接监督 3D 表示。优化信号对齐的是 3D 场景保真度而非中间 latent target,同时消掉 latent 编码的信息损失和自编码器的额外训练成本——对”保真度受限”的重建任务价值最大。
  3. geometry perception loss:用冻结 3D 基础模型(π³/VGGT)的几何特征空间做 3D 结构监督,补上纯 2D 损失约束不了几何的缺口,是全文消融证明最关键的组件。
  4. 效率路径清晰:8 关键帧 + 可微渲染,不用去噪整条稠密帧序列;蒸馏后 4-step ~0.6s,指向实时 3D 世界生成。
  5. 把 pixel-space 生成的近期结论(够容量够数据就能追平 latent)成功迁到 3D,给”统一、可扩展的 3D 场景建模”提供了一个不依赖 VAE/RAE 的新范式基线。

已知局限(附录 F):① 只在 scene-level 常用数据集(RealEstate10K、DL3DV-10K)验证,更多样的 outdoor / object-centric 场景尚未系统评估;② 在有限分辨率和算力预算下训练,fine-grained 纹理保真和高分辨率多视角的可扩展性仍有空间;③ 蒸馏 + 量化列为未来工作(论文正文的 base 模型未蒸馏,15s/场景);④ 全程无 RLHF / 偏好对齐;⑤ 推理速度对比非严格同分辨率、同表示,需谨慎解读。

原始链接

一手源存档(sources/)