一句话定位
GenEx 从单张 RGB 图像出发,先用图生全景图模型初始化一个 360° 世界,再用动作条件的全景视频扩散模型让智能体在其中连续”探索”,构成一个 3D 一致的可探索想象世界;把这段想象观测接入决策后,GPT-4o 的单智能体决策准确率从纯多模态基线的 46.10% 提升到 85.22%,多智能体(需推断他人信念)场景从 21.88% 大幅提升到 94.87%(人类对照组呈同样趋势:单智能体 91.50%→94.00%,多智能体 55.24%→77.41%)。
背景与定位
GenEx 属于**生成式/想象式世界探索(generative world exploration)范式:单图 3D 建模(如 NeRF/3D 重建类工作)受限于渲染距离和视场角,视频生成模型(如 Stable Video Diffusion、Sora)逼真但通常缺乏物理接地;GenEx 把两条线接起来——用物理引擎(Unreal Engine 5 / Unity)curate 的数据,训练一个以全景(equirectangular panorama)**为表征、可长程闭环探索仍保持一致性的视频扩散模型,再用它服务具身决策。
论文自陈是团队 2024 年 11 月前作(Lu et al. 2024, arXiv:2411.11844《Generative World Explorer》)的延伸:前作只做”世界转移”(给定上一步全景 + 动作生成下一步全景视频),本文补上”世界初始化”——从单张任意输入图 i0 生成整张 360° 起始全景。全景视频扩散 backbone、Spherical-Consistent Learning 正则、GenEx-DB 训练数据、GenEx-EQA 评测集等具体技术细节,本文都显式引用前作(“detailed in Lu et al., 2024”)而未重复展开;本页因此在标注清楚的前提下,从该前作(同团队、同项目、arXiv:2411.11844)补齐了这些数字。附带说明一个文献学细节:截至核实时(2026-07),arXiv:2411.11844 已被作者修订到 v3(2025-09);其摘要页的官方 Title 字段仍显示 “Generative World Explorer”,但 v3 渲染出的正文文档标题/内容已经变成与本文相同的 “GenEx: Generating an Explorable World”,并新增了完整的超参/数据统计附录——这些数字即取自该 v3 渲染版本。
论文明确讨论了同期工业界工作的定位差异:与 WorldLabs 2024 年”从单图生成动画世界”的 demo、DeepMind 关于交互式世界模型的博客(即 Genie 2)方向一致,但强调自己公开了完整技术细节,并额外提出了 Imagination-Augmented Policy 这一具身决策机制。相比同期专注”可实时把玩的神经游戏引擎”的 GameNGen、Oasis,GenEx 的落点是具身决策(不追求实时帧率,见下文 Infra);相比同期 Navigation World Models(用扩散 Transformer 做导航规划的世界模型),GenEx 的独特贡献是全景表征 + 显式球面一致性正则,以及把”想象探索”推广到多智能体信念推断(theory-of-mind)。
模型架构
GenEx 的生成过程分两步(world initialization → world transition),由两个独立模型 θ1、θ2 承担:
① 世界初始化 θ1(image-to-panorama)
- 基于预训练文生图模型 FLUX.1-dev(Black Forest Labs)+ 现成的 FLUX.1-dev panorama LoRA v2(Bilcke 2024,仅文本条件 p_flux(x|l0))。
- GenEx 将其扩展为同时条件于文本描述 l0 和 单张输入图 i0:x0 ∼ p_θ1(x|i0,l0),以保证生成的 360° 全景与参考图像内容一致(否则纯文本条件的全景与输入图无关)。
② 世界转移 θ2(全景视频扩散)
- Backbone:Stable Video Diffusion(SVD,Blattmann et al. 2023a)——按 Blattmann et al. 2023b 的 Transformer-UNet 设计,每个空间卷积/注意力层后插入时序卷积/注意力层;图像条件 c 由 CLIP 图像 Transformer 编码 x0 得到(以上 backbone 细节来自同团队前作 arXiv:2411.11844,本文未重复给出)。
- 动作 a_t=(α_t, d_t):旋转角 α_t 直接作为已知的球面几何变换 T 施加在等距柱状全景上(解析计算,非学习),得到旋转后全景 x’^S_{t-1};前进距离 d_t 由视频扩散模型生成对应的新全景视频帧序列 x_t=(x_t^0,…,x_t^S) ∼ p_θ2(x | x’^S_{t-1}, ε_t)。即”转向”是几何变换、“前进”才是生成模型的任务。
- 表征:等距柱状全景(equirectangular,360°×180°)↔ cubemap(6 面,每面 90° FOV)↔ 球面,三者可互相转换;物理引擎里原生采集 cubemap,训练/生成时投影为等距柱状全景,旋转时投影到球面空间。
- Spherical-Consistent Learning(SCL):直接在等距柱状图上训练会在全景左右边缘产生不连续。做法是对生成视频和真值视频都施加同一个随机球面旋转变换 T,用预训练时序 VAE 编码器 E 编码两者,最小化二者在(旋转后)隐空间的 MSE,作为附加正则 L_scl,与标准噪声预测损失 L_noise 加权相加(见”训练方法”)。
- 输出分辨率 576(H)×1024(W),训练帧数 25 帧/条(来自前作 arXiv:2411.11844 附录 Table 5,本文未重复给出);模型总参数量未披露。
智能体探索循环:GPT-4o 作为”pilot”决定动作 a_t,支持三种模式——(a) 人类交互式控制;(b) GPT-4o 辅助自由探索(避免让智能体做出会导致模型崩坏的动作,如贴墙移动);(c) 目标导向导航(GPT-4o 依据自然语言指令 + 初始图做高层规划,逐步生成低层探索配置)。
Imagination-Augmented Policy:把常规具身策略 π_θ(A|o,g)(只看当前观测 o)扩展为 π_θ3(A|i0, x_{0:T}, g)——即额外条件于从 GenEx 采样出的整段想象 rollout x_{0:T}。Multi-Agent 版本:对每个其他智能体 k,用指令”导航到 agent-k 的位置”重复 Algorithm 1 得到 x_{1:T}^(k),重复 K 次后,策略同时条件于 i0 与全部 K 段想象 rollout {x_{1:T}^(k)},从而推断其他智能体各自能看到什么、可能怎么做。
数据
- 训练数据全部来自物理引擎渲染:Unreal Engine 5(写实城市资产)+ Unity(动画风格世界资产),原生采集为 cubemap,再投影为等距柱状全景。
- 本文未给出具体数据量数字;同一 diffuser/数据管线的具体规模披露在前作 arXiv:2411.11844(GenEx-DB,Table 7):引擎覆盖 UE5(City Sample)+ Unity(Low-Texture City、Animated)+ Blender(Geometry)共 4 种视觉风格;40,000+ 场景、2,000,000+ 帧、400,000+ 米累计移动距离、285,000+ 秒总时长,导航方向从近似无穷(|A|=∞)的连续动作空间采样;每条渲染片段沿 20 米无碰撞直线路径以恒定速度采集 50 帧,训练时从第 1–25 帧随机采一帧作条件图,真值为其后 25 帧。
- Zero-shot 泛化测试集(不参与训练):Google Maps 街景(“Street”)与 Behavior Vision Suite(Ge et al. 2024,“Indoor”)——前者因图像质量不稳定/相机运动不可预测、后者因室内导航范围受限,均被排除在训练数据之外。
- GenEx-EQA(具身问答评测集,同样来自前作):引擎 UE5 + Blender;200+ 场景、500+ 智能体、平均每场景 2.7 个智能体、800+ 文本上下文、200+ 动作;分单智能体(仅需推断自身被遮挡的观测,如被树挡住的救护车)与多智能体(需推断他人信念,如行人与来车互相看不见对方)两类场景,每个场景配一个对照设置(如救护车驶向 vs 驶离智能体)。
- 训练全程无真实世界视频/图像数据(纯 sim);动作即模拟器精确下发的相机变换,无需额外标注,不存在动作标注误差问题。
训练方法
- 目标函数:L = λ·‖E(T(D(z_t−ε_θ(z_t,c))))−E(T(x0))‖²(=L_scl)+ (1−λ)·‖ε_θ(z_t,c)−ε_t‖²(=L_noise),D 为时序 VAE 解码器、E 为时序 VAE 编码器、T 为球面旋转变换、λ 为加权系数(数值未披露)。
- 前作(arXiv:2411.11844 Table 5)披露的同一 diffuser 训练超参:学习率 1e-5,cosine 学习率调度,warmup 500 步,混合精度 fp16,训练帧数 25,输出分辨率 576×1024。
- 世界初始化模型(FLUX.1-dev panorama LoRA + 图像条件扩展)与世界转移模型(SVD diffuser + SCL)分别训练/适配,非联合端到端训练。
- 智能体侧(GPT-4o)不做微调,纯 zero-shot 用作规划/pilot 角色。
- 人类研究:另外招募人类被试在 Text-only / Image / GenEx 三种条件下做决策对比(见评测),用于论证 GenEx 同样能提升人类的态势感知,而非只服务于模型。
Infra(训练 / 推理工程)
- 本文(arXiv:2412.09624)未披露 GPU 数量、GPU 小时或推理延迟。
- 前作(arXiv:2411.11844 Table 6,同一 GenEx-Diffuser)披露:总 GPU 用量 384 A100-hours;GPU 配置 = 2×A100/batch + 模型并行;训练耗时 0.12 分钟/步;推理耗时 0.031 分钟/帧(≈1.86 秒/帧)——即 GenEx 面向的是”先想象、后决策”的离线循环,不追求 GameNGen 那类 20+ FPS 实时可玩帧率。
- 未见任何消费级硬件部署、蒸馏或量化相关讨论。
评测 benchmark
以下数字均取自本文(arXiv:2412.09624);标注”前作”的数字来自同团队 arXiv:2411.11844(本文 Table 1 只保留了下列 3 行,前作 Table 1 额外报告了 GenEx-DB 微调前的 zero-shot 基线:CogVideoX-panorama FVD 4307,SVD-panorama FVD 759.9)。
视频生成质量(Table 1)
| Model | Representation | FVD↓ | MSE↓ | LPIPS↓ | PSNR↑ | SSIM↑ |
|---|---|---|---|---|---|---|
| Baseline(six-view cubemaps) | 6-view | 196.7 | 0.10 | 0.09 | 26.1 | 0.88 |
| GenEx w/o SCL | panorama | 81.9 | 0.05 | 0.05 | 29.4 | 0.91 |
| GenEx | panorama | 69.5 | 0.04 | 0.03 | 30.2 | 0.94 |
Imaginative Exploration Loop Consistency(IELC,§5.2):对 1000 条随机闭环路径(旋转/距离各异,剔除被阻挡路径)计算真实起始图与生成终止图之间的隐空间 MSE,即便 20 米闭环、多段视频连续拼接,IELC 仍稳定低于 0.1——归因于球面一致性正则。
3D 一致性 / 新视角合成(§5.4,定性对比):本文与 SV3D(Voleti et al. 2024)、TripoSR(Tochilkin et al. 2024)、Stable Zero123(StabilityAI 2023)定性比较,称 GenEx 新视角合成质量更高、背景一致性接近完美;本文未给出该对比的量化表格——量化表只见于前作 arXiv:2411.11844(GenEx: LPIPS 0.15 / PSNR 28.57 / SSIM 0.82 / MSE_obj 0.02 / MSE_bg 0.00,对比 Stable Zero123 的 LPIPS 0.50 / PSNR 14.12 / MSE_bg 0.06)。
Imagination-Augmented Policy——单智能体具身决策(Table 2)
| Method | Acc.% | Confidence% | Logic Acc.% |
|---|---|---|---|
| Random | 25.00 | 25.00 | – |
| Human Text-only | 44.82 | 52.19 | 46.82 |
| Human with Image | 91.50 | 80.22 | 70.93 |
| Human with GenEx | 94.00 | 90.77 | 86.19 |
| Unimodal Gemini-1.5 | 30.56 | 29.46 | 13.89 |
| Unimodal GPT-4o | 27.71 | 26.38 | 20.22 |
| Multimodal Gemini-1.5 | 46.73 | 36.70 | 0.0 |
| Multimodal GPT-4o | 46.10 | 44.10 | 12.51 |
| GPT-4o with GenEx | 85.22 | 77.68 | 83.88 |
Multi-Agent Imagination-Augmented Policy(Table 3)
| Method | Acc.% | Confidence% | Logic Acc.% |
|---|---|---|---|
| Random | 25.00 | 25.00 | – |
| Human Text-only | 21.21 | 11.56 | 13.50 |
| Human with Image | 55.24 | 58.67 | 46.49 |
| Human with GenEx | 77.41 | 71.54 | 72.73 |
| Unimodal Gemini-1.5 | 26.04 | 24.37 | 5.56 |
| Unimodal GPT-4o | 25.88 | 26.99 | 5.00 |
| Multimodal Gemini-1.5 | 11.54 | 15.35 | 0.0 |
| Multimodal GPT-4o | 21.88 | 21.16 | 6.25 |
| GPT-4o with GenEx | 94.87 | 69.21 | 72.11 |
作者总结两个发现:(1) “没有想象力的视觉可能有误导性”——多模态(图+文)GPT-4o/Gemini-1.5 有时反而不如纯文本 unimodal 推理,因为缺少想象补全的自我中心视觉图像可能带来错误的空间推断;(2) 无论是人类还是 GPT-4o,配合 GenEx 想象都比只看单张图像有明显提升,多智能体(需 theory-of-mind)场景提升幅度最大。
创新点与影响
贡献
- 把”从单图生成可长程探索、360° 全景、3D 一致的想象世界”和”具身决策”直接打通:Imagination-Augmented Policy 把决策条件从单一初始观测 i0 扩展为 (i0, 完整想象 rollout x_{0:T})。
- Multi-Agent Imagination-Augmented Policy:让智能体”想象式”探索到其他智能体的位置来推断对方的信念/视野,是一种可操作的 theory-of-mind 机制。
- Spherical-Consistent Learning:显式解决等距柱状投影训练时的左右边缘不连续问题,是长程闭环探索仍保持低漂移(IELC<0.1 @ 20m)的关键。
- 补齐了自己前作的缺口——把”世界初始化”(单图→全景)和”世界转移”(全景→全景视频)统一进同一个框架。
影响:论文将自己定位为与同期工业界(WorldLabs 单图动画世界 demo、DeepMind Genie 2 博客)方向一致但公开了完整技术细节的工作;相对同期”神经游戏引擎”一支(GameNGen/Oasis 追求实时可玩),GenEx 把这条技术路线明确指向具身决策与真实世界探索/导航/VR-AR 应用。
作者自陈局限(Discussion):依赖物理引擎生成训练数据;sim-to-real 适配、真实传感器接入、动态环境条件、伦理安全防护仍是未解决的关键挑战;本文正文未讨论具体算力/推理延迟(这些数字仅见于同团队前作)。
无公开代码仓库、无公开权重——项目页与两版 arXiv 摘要页均未提供任何代码/模型下载链接。
原始链接
- 论文(arXiv abs,GenEx: Generating an Explorable World):https://arxiv.org/abs/2412.09624
- 论文 PDF:https://arxiv.org/pdf/2412.09624
- 论文 HTML 全文:https://arxiv.org/html/2412.09624v1
- 项目页(demo 视频、交互式演示):https://genex.world/
- 前作/技术细节来源(同团队,本文多处引用为 “Lu et al. 2024”):Generative World Explorer,arXiv:2411.11844 — https://arxiv.org/abs/2411.11844
一手源存档(sources/)
- genex—project-page — genex.world 项目页快照
- arXiv 原文(PDF/HTML,不入 git):见上方 arXiv 链接(本文 2412.09624 及前作 2411.11844)