一句话定位

GenEx 从单张 RGB 图像出发,先用图生全景图模型初始化一个 360° 世界,再用动作条件的全景视频扩散模型让智能体在其中连续”探索”,构成一个 3D 一致的可探索想象世界;把这段想象观测接入决策后,GPT-4o 的单智能体决策准确率从纯多模态基线的 46.10% 提升到 85.22%,多智能体(需推断他人信念)场景从 21.88% 大幅提升到 94.87%(人类对照组呈同样趋势:单智能体 91.50%→94.00%,多智能体 55.24%→77.41%)。

背景与定位

GenEx 属于**生成式/想象式世界探索(generative world exploration)范式:单图 3D 建模(如 NeRF/3D 重建类工作)受限于渲染距离和视场角,视频生成模型(如 Stable Video Diffusion、Sora)逼真但通常缺乏物理接地;GenEx 把两条线接起来——用物理引擎(Unreal Engine 5 / Unity)curate 的数据,训练一个以全景(equirectangular panorama)**为表征、可长程闭环探索仍保持一致性的视频扩散模型,再用它服务具身决策。

论文自陈是团队 2024 年 11 月前作(Lu et al. 2024, arXiv:2411.11844《Generative World Explorer》)的延伸:前作只做”世界转移”(给定上一步全景 + 动作生成下一步全景视频),本文补上”世界初始化”——从单张任意输入图 i0 生成整张 360° 起始全景。全景视频扩散 backbone、Spherical-Consistent Learning 正则、GenEx-DB 训练数据、GenEx-EQA 评测集等具体技术细节,本文都显式引用前作(“detailed in Lu et al., 2024”)而未重复展开;本页因此在标注清楚的前提下,从该前作(同团队、同项目、arXiv:2411.11844)补齐了这些数字。附带说明一个文献学细节:截至核实时(2026-07),arXiv:2411.11844 已被作者修订到 v3(2025-09);其摘要页的官方 Title 字段仍显示 “Generative World Explorer”,但 v3 渲染出的正文文档标题/内容已经变成与本文相同的 “GenEx: Generating an Explorable World”,并新增了完整的超参/数据统计附录——这些数字即取自该 v3 渲染版本。

论文明确讨论了同期工业界工作的定位差异:与 WorldLabs 2024 年”从单图生成动画世界”的 demo、DeepMind 关于交互式世界模型的博客(即 Genie 2)方向一致,但强调自己公开了完整技术细节,并额外提出了 Imagination-Augmented Policy 这一具身决策机制。相比同期专注”可实时把玩的神经游戏引擎”的 GameNGenOasis,GenEx 的落点是具身决策(不追求实时帧率,见下文 Infra);相比同期 Navigation World Models(用扩散 Transformer 做导航规划的世界模型),GenEx 的独特贡献是全景表征 + 显式球面一致性正则,以及把”想象探索”推广到多智能体信念推断(theory-of-mind)

模型架构

GenEx 的生成过程分两步(world initialization → world transition),由两个独立模型 θ1、θ2 承担:

① 世界初始化 θ1(image-to-panorama)

  • 基于预训练文生图模型 FLUX.1-dev(Black Forest Labs)+ 现成的 FLUX.1-dev panorama LoRA v2(Bilcke 2024,仅文本条件 p_flux(x|l0))。
  • GenEx 将其扩展为同时条件于文本描述 l0 单张输入图 i0:x0 ∼ p_θ1(x|i0,l0),以保证生成的 360° 全景与参考图像内容一致(否则纯文本条件的全景与输入图无关)。

② 世界转移 θ2(全景视频扩散)

  • Backbone:Stable Video Diffusion(SVD,Blattmann et al. 2023a)——按 Blattmann et al. 2023b 的 Transformer-UNet 设计,每个空间卷积/注意力层后插入时序卷积/注意力层;图像条件 c 由 CLIP 图像 Transformer 编码 x0 得到(以上 backbone 细节来自同团队前作 arXiv:2411.11844,本文未重复给出)。
  • 动作 a_t=(α_t, d_t):旋转角 α_t 直接作为已知的球面几何变换 T 施加在等距柱状全景上(解析计算,非学习),得到旋转后全景 x’^S_{t-1};前进距离 d_t 由视频扩散模型生成对应的新全景视频帧序列 x_t=(x_t^0,…,x_t^S) ∼ p_θ2(x | x’^S_{t-1}, ε_t)。即”转向”是几何变换、“前进”才是生成模型的任务。
  • 表征:等距柱状全景(equirectangular,360°×180°)↔ cubemap(6 面,每面 90° FOV)↔ 球面,三者可互相转换;物理引擎里原生采集 cubemap,训练/生成时投影为等距柱状全景,旋转时投影到球面空间。
  • Spherical-Consistent Learning(SCL):直接在等距柱状图上训练会在全景左右边缘产生不连续。做法是对生成视频和真值视频都施加同一个随机球面旋转变换 T,用预训练时序 VAE 编码器 E 编码两者,最小化二者在(旋转后)隐空间的 MSE,作为附加正则 L_scl,与标准噪声预测损失 L_noise 加权相加(见”训练方法”)。
  • 输出分辨率 576(H)×1024(W),训练帧数 25 帧/条(来自前作 arXiv:2411.11844 附录 Table 5,本文未重复给出);模型总参数量未披露。

智能体探索循环:GPT-4o 作为”pilot”决定动作 a_t,支持三种模式——(a) 人类交互式控制;(b) GPT-4o 辅助自由探索(避免让智能体做出会导致模型崩坏的动作,如贴墙移动);(c) 目标导向导航(GPT-4o 依据自然语言指令 + 初始图做高层规划,逐步生成低层探索配置)。

Imagination-Augmented Policy:把常规具身策略 π_θ(A|o,g)(只看当前观测 o)扩展为 π_θ3(A|i0, x_{0:T}, g)——即额外条件于从 GenEx 采样出的整段想象 rollout x_{0:T}。Multi-Agent 版本:对每个其他智能体 k,用指令”导航到 agent-k 的位置”重复 Algorithm 1 得到 x_{1:T}^(k),重复 K 次后,策略同时条件于 i0 与全部 K 段想象 rollout {x_{1:T}^(k)},从而推断其他智能体各自能看到什么、可能怎么做。

数据

  • 训练数据全部来自物理引擎渲染:Unreal Engine 5(写实城市资产)+ Unity(动画风格世界资产),原生采集为 cubemap,再投影为等距柱状全景。
  • 本文未给出具体数据量数字;同一 diffuser/数据管线的具体规模披露在前作 arXiv:2411.11844(GenEx-DB,Table 7):引擎覆盖 UE5(City Sample)+ Unity(Low-Texture City、Animated)+ Blender(Geometry)共 4 种视觉风格;40,000+ 场景2,000,000+ 帧400,000+ 米累计移动距离、285,000+ 秒总时长,导航方向从近似无穷(|A|=∞)的连续动作空间采样;每条渲染片段沿 20 米无碰撞直线路径以恒定速度采集 50 帧,训练时从第 1–25 帧随机采一帧作条件图,真值为其后 25 帧。
  • Zero-shot 泛化测试集(不参与训练):Google Maps 街景(“Street”)与 Behavior Vision Suite(Ge et al. 2024,“Indoor”)——前者因图像质量不稳定/相机运动不可预测、后者因室内导航范围受限,均被排除在训练数据之外。
  • GenEx-EQA(具身问答评测集,同样来自前作):引擎 UE5 + Blender;200+ 场景500+ 智能体、平均每场景 2.7 个智能体、800+ 文本上下文、200+ 动作;分单智能体(仅需推断自身被遮挡的观测,如被树挡住的救护车)与多智能体(需推断他人信念,如行人与来车互相看不见对方)两类场景,每个场景配一个对照设置(如救护车驶向 vs 驶离智能体)。
  • 训练全程无真实世界视频/图像数据(纯 sim);动作即模拟器精确下发的相机变换,无需额外标注,不存在动作标注误差问题。

训练方法

  • 目标函数:L = λ·‖E(T(D(z_t−ε_θ(z_t,c))))−E(T(x0))‖²(=L_scl)+ (1−λ)·‖ε_θ(z_t,c)−ε_t‖²(=L_noise),D 为时序 VAE 解码器、E 为时序 VAE 编码器、T 为球面旋转变换、λ 为加权系数(数值未披露)。
  • 前作(arXiv:2411.11844 Table 5)披露的同一 diffuser 训练超参:学习率 1e-5,cosine 学习率调度,warmup 500 步,混合精度 fp16,训练帧数 25,输出分辨率 576×1024。
  • 世界初始化模型(FLUX.1-dev panorama LoRA + 图像条件扩展)与世界转移模型(SVD diffuser + SCL)分别训练/适配,非联合端到端训练。
  • 智能体侧(GPT-4o)不做微调,纯 zero-shot 用作规划/pilot 角色。
  • 人类研究:另外招募人类被试在 Text-only / Image / GenEx 三种条件下做决策对比(见评测),用于论证 GenEx 同样能提升人类的态势感知,而非只服务于模型。

Infra(训练 / 推理工程)

  • 本文(arXiv:2412.09624)未披露 GPU 数量、GPU 小时或推理延迟。
  • 前作(arXiv:2411.11844 Table 6,同一 GenEx-Diffuser)披露:总 GPU 用量 384 A100-hoursGPU 配置 = 2×A100/batch + 模型并行;训练耗时 0.12 分钟/步;推理耗时 0.031 分钟/帧(≈1.86 秒/帧)——即 GenEx 面向的是”先想象、后决策”的离线循环,不追求 GameNGen 那类 20+ FPS 实时可玩帧率。
  • 未见任何消费级硬件部署、蒸馏或量化相关讨论。

评测 benchmark

以下数字均取自本文(arXiv:2412.09624);标注”前作”的数字来自同团队 arXiv:2411.11844(本文 Table 1 只保留了下列 3 行,前作 Table 1 额外报告了 GenEx-DB 微调前的 zero-shot 基线:CogVideoX-panorama FVD 4307,SVD-panorama FVD 759.9)。

视频生成质量(Table 1)

ModelRepresentationFVD↓MSE↓LPIPS↓PSNR↑SSIM↑
Baseline(six-view cubemaps)6-view196.70.100.0926.10.88
GenEx w/o SCLpanorama81.90.050.0529.40.91
GenExpanorama69.50.040.0330.20.94

Imaginative Exploration Loop Consistency(IELC,§5.2):对 1000 条随机闭环路径(旋转/距离各异,剔除被阻挡路径)计算真实起始图与生成终止图之间的隐空间 MSE,即便 20 米闭环、多段视频连续拼接,IELC 仍稳定低于 0.1——归因于球面一致性正则。

3D 一致性 / 新视角合成(§5.4,定性对比):本文与 SV3D(Voleti et al. 2024)、TripoSR(Tochilkin et al. 2024)、Stable Zero123(StabilityAI 2023)定性比较,称 GenEx 新视角合成质量更高、背景一致性接近完美;本文未给出该对比的量化表格——量化表只见于前作 arXiv:2411.11844(GenEx: LPIPS 0.15 / PSNR 28.57 / SSIM 0.82 / MSE_obj 0.02 / MSE_bg 0.00,对比 Stable Zero123 的 LPIPS 0.50 / PSNR 14.12 / MSE_bg 0.06)。

Imagination-Augmented Policy——单智能体具身决策(Table 2)

MethodAcc.%Confidence%Logic Acc.%
Random25.0025.00
Human Text-only44.8252.1946.82
Human with Image91.5080.2270.93
Human with GenEx94.0090.7786.19
Unimodal Gemini-1.530.5629.4613.89
Unimodal GPT-4o27.7126.3820.22
Multimodal Gemini-1.546.7336.700.0
Multimodal GPT-4o46.1044.1012.51
GPT-4o with GenEx85.2277.6883.88

Multi-Agent Imagination-Augmented Policy(Table 3)

MethodAcc.%Confidence%Logic Acc.%
Random25.0025.00
Human Text-only21.2111.5613.50
Human with Image55.2458.6746.49
Human with GenEx77.4171.5472.73
Unimodal Gemini-1.526.0424.375.56
Unimodal GPT-4o25.8826.995.00
Multimodal Gemini-1.511.5415.350.0
Multimodal GPT-4o21.8821.166.25
GPT-4o with GenEx94.8769.2172.11

作者总结两个发现:(1) “没有想象力的视觉可能有误导性”——多模态(图+文)GPT-4o/Gemini-1.5 有时反而不如纯文本 unimodal 推理,因为缺少想象补全的自我中心视觉图像可能带来错误的空间推断;(2) 无论是人类还是 GPT-4o,配合 GenEx 想象都比只看单张图像有明显提升,多智能体(需 theory-of-mind)场景提升幅度最大。

创新点与影响

贡献

  1. 把”从单图生成可长程探索、360° 全景、3D 一致的想象世界”和”具身决策”直接打通:Imagination-Augmented Policy 把决策条件从单一初始观测 i0 扩展为 (i0, 完整想象 rollout x_{0:T})。
  2. Multi-Agent Imagination-Augmented Policy:让智能体”想象式”探索到其他智能体的位置来推断对方的信念/视野,是一种可操作的 theory-of-mind 机制。
  3. Spherical-Consistent Learning:显式解决等距柱状投影训练时的左右边缘不连续问题,是长程闭环探索仍保持低漂移(IELC<0.1 @ 20m)的关键。
  4. 补齐了自己前作的缺口——把”世界初始化”(单图→全景)和”世界转移”(全景→全景视频)统一进同一个框架。

影响:论文将自己定位为与同期工业界(WorldLabs 单图动画世界 demo、DeepMind Genie 2 博客)方向一致但公开了完整技术细节的工作;相对同期”神经游戏引擎”一支(GameNGen/Oasis 追求实时可玩),GenEx 把这条技术路线明确指向具身决策与真实世界探索/导航/VR-AR 应用。

作者自陈局限(Discussion):依赖物理引擎生成训练数据;sim-to-real 适配、真实传感器接入、动态环境条件、伦理安全防护仍是未解决的关键挑战;本文正文未讨论具体算力/推理延迟(这些数字仅见于同团队前作)。

无公开代码仓库、无公开权重——项目页与两版 arXiv 摘要页均未提供任何代码/模型下载链接。

原始链接

一手源存档(sources/)

  • genex—project-page — genex.world 项目页快照
  • arXiv 原文(PDF/HTML,不入 git):见上方 arXiv 链接(本文 2412.09624 及前作 2411.11844)