一句话定位
Genesis(后更名 Genesis World)是 2024-12 由近 20 家机构学术团队开源的通用可微多物理仿真平台;它在”世界模型”谱系里的意义不是学出一个神经网络的环境动力学,而是把经典物理引擎当作精确的世界模拟器,再在其上挂一层 VLM 生成式 agent,把自然语言 prompt 转成可交互的 4D 物理世界(场景、物体/角色运动、机器人策略、镜头运动等)——是”生成式仿真”(generative simulation)路线在世界模型光谱上一个高调但也颇具争议的代表性节点。
背景与定位
2024 年底的”世界模型”讨论里存在两条并行路线:一条是神经视频/潜空间世界模型——用大规模视频/交互数据端到端学出隐式转移函数(如 deepmind-genie2、cosmos-predict 一类,动作以连续或离散 latent 条件注入);另一条是”经典仿真为真值 + 生成式前端做内容编排”——转移函数保持精确(刚体/MPM/SPH/FEM/PBD 求解器),生成模型只负责在这个精确物理基底上”编排内容”(提出场景、任务、动作、镜头轨迹)。Genesis 明确属于后者,且是这条路线里第一个把”通用物理引擎”与”生成式数据引擎”打包成同一个开源产品叙事的项目。
其学术血脉直接可溯源到同一批作者(Zhou Xian、Yufei Wang、Katerina Fragkiadaki 等)此前的工作:RoboGen(Wang et al., 2023,“生成式仿真”自动化机器人数据生产的雏形)与 Gen2Sim(Katara / Xian / Fragkiadaki, ICRA 2024)。Dec 2024 GitHub README 的”Papers behind Genesis”清单里还列出了 Architect(层级 2D inpainting 生成 3D 场景)、DiffuseBot(扩散模型驱动软体机器人协同设计)、EMDM / TLControl(动作生成)等——Genesis 本质是把这批分散的生成式仿真单点工作,收编进一套共享物理基底、覆盖视频 / 动作 / 场景 / 关节物体 / 语音多模态的统一系统愿景。
与神经世界模型的关键差异:deepmind-genie2 / cosmos-predict 这类模型把”世界”本身学成一个网络,代价是物理正确性没有保证、需要靠数据规模换泛化;Genesis 反过来把物理层锁定为精确数值解(求解器不学习),只让生成模型负责”决定发生什么”(脚本化调用仿真 API),代价是内容的多样性/真实感受限于经典物理引擎能表达的范围,且对未建模的物理现象(如复杂材料交互、真实光照统计)无能为力。这一权衡——精确但受限 vs. 近似但可泛化——正是 Dec 2024 前后世界模型研究里被反复讨论的核心张力,Genesis 是”精确但受限”一端里声量最大的样本之一。
物理引擎 / 渲染器 / infra 层的完整拆解(求解器覆盖、可微性状态、Taichi 后端、跨平台细节)见姊妹条目 genesis-physics-engine;本页聚焦其作为”生成式世界引擎”的定位与后续叙事演变。
模型架构
Genesis 不是 RSSM / DiT / AR-transformer / JEPA 这类神经世界模型,而是明确的两层架构:
第一层——世界本体(已开源):统一多物理求解器(Rigid / MPM / SPH / FEM / PBD / Stable Fluid + 显式耦合器),100% Python 前后端,Taichi 编译到 CPU / NVIDIA GPU / AMD GPU / Apple Metal,跨 Linux/macOS/Windows。这一层是确定性数值仿真,没有可学习参数,是”世界”本身而非对世界的学习近似(细节见 genesis-physics-engine)。
第二层——生成式 agent 层(Dec 2024 发布时未开源):官方原文表述为”a VLM-based generative agent that uses the APIs provided by the simulation infrastructure as tools to create 4D dynamic worlds”。即所谓”动作条件”在这里不是连续/离散 latent 注入一个学出来的 transition model,而是 VLM agent 生成代码/工具调用,直接操作仿真器的 Python API(生成资产、设定材质、编写镜头轨迹、指定动作/策略)。在此之上还叠加了针对具体模态的生成子模块:
- 角色动作生成(character motion generation);
- 机器人策略生成(沿 RoboGen 的任务提议 → 奖励 → TAMP/RL 生成演示数据路线);
- 3D 可交互场景生成;
- 开放世界关节物体生成(open-world articulated object generation);
- 语音 / 面部动画 / 情绪生成。
一致性机制:项目宣称能生成”physically-accurate and view-consistent videos”,其一致性来自直接从确定性物理+镜头状态渲染(一致性是仿真器状态本身自带的,不依赖专门的记忆/一致性模块),这与神经世界模型需要显式长程记忆(循环状态或 in-context 条件)来维持一致性是结构性不同的路径。
config 数字:物理层没有网络参数量可言;唯一披露的”能力状态”数字是可微性覆盖——Dec 2024 时仅 MPM 求解器与 Tool Solver 可微,刚体等其余求解器的可微化列为”soon”(未披露具体时间)。生成式 agent 层用的具体 VLM 型号、参数规模、prompt 结构等均未披露。
数据
Genesis 的物理引擎层不存在”训练数据集”——它是程序化数值方法,不是学出来的。“数据”维度只适用于(未随开源发布的)生成式 agent 层的产出目标:
- 目标产出模态(均为官方原文列出的清单):物理精确且视角一致的视频;镜头运动与参数;人类/动物角色动作;可部署到真机的机器人操纵与运动策略;完整可交互 3D 场景;开放世界关节物体;语音音频、面部动画与情绪。
- 实际展示形式:全部以逐条 prompt→demo 短片呈现,例如”一只举着棍子的迷你悟空在桌面上冲刺 3 秒后跃起,动作在最高点暂停,镜头 360° 环绕并缓慢拉远”、“一名日本武士打拳击”、“24 架无人机(4×6 排列)同时起飞并一起后空翻”、“一个移动 Franka 机械臂用碗和微波炉加热玉米”、“一个家居场景包含客厅(含餐区)、卫生间、书房与卧室”、“一个行走的茶壶(软硬混合体)“等(完整 prompt 列表见一手源存档)。
- 规模数字:Dec 2024 一手源里没有任何聚合规模数字(帧数/小时数/episode 数/轨迹数一律未披露)——因为官方原话是”Access to the generative framework will be rolled out gradually in the near future”,即该层当时根本没有随开源发布,无从谈数据规模、来源配比或筛选流程。
- 资产消费侧:物理引擎本身靠加载 URDF / MJCF / .obj / .glb / .ply / .stl 网格资产驱动场景,没有固定训练语料。
训练方法
物理仿真层没有”训练”这一概念——求解器是显式数值方法。生成式 agent 层(未开源)的方法学在 Dec 2024 一手源里只有高层引用,没有可执行细节:机器人策略生成模块的说明原文是”see RoboGen and our upcoming paper”,即方法论直接指向 RoboGen 的”LLM 提出任务 → 奖励函数 → TAMP/RL 生成演示数据”范式;开放世界关节物体生成模块则标注”see our upcoming paper (under submission now)“。截至本次调研(2026-07),未找到与这两处”upcoming paper”对应的已发表论文或补充材料。
因此本维度的诚实结论是:Genesis 在 landmark 发布时,其”训练方法”停留在对已发表前作(RoboGen)的引用和对”即将投稿论文”的预告层面,不构成一份可执行、可复现的方法说明。
Infra(训练 / 推理工程)
- 物理仿真吞吐:单张 RTX 4090,模拟单平面 + Franka 机械臂场景,官方口径 > 4300 万 FPS,约合比实时快 430,000 倍(无独立复现方法学)。
- 跨平台后端:CPU、NVIDIA GPU(CUDA)、AMD GPU、Apple Metal;编译经 Taichi。
- 生成式 agent 层的推理工程(VLM 调用延迟、批量生成吞吐、边缘设备部署等):未披露——该层 Dec 2024 未开源,无对应工程数字。
- 求解器级别更细的并行策略、显存占用、加速比声明(10~80× 快于 Isaac Gym/Sim/Lab 等)及其引发的社区质疑,见姊妹条目 genesis-physics-engine,本页不重复。
评测 benchmark
Dec 2024 landmark 版本没有任何正式量化评测。更关键的是:作为一个以”生成 4D 物理世界”为核心卖点的系统,官方一手源里完全没有该核心卖点对应的量化指标——没有生成视频的物理一致性/FVD 类分数,没有任务成功率,没有与 RoboGen、Gen2Sim 等同源前作或同期神经世界模型(如 Genie 系)的对照实验,只有一组按模态分类的演示视频。这与同期神经世界模型论文通常至少报告 FVD/PSNR/下游任务成功率的惯例形成明显反差,是这个 landmark 在”世界模型”意义上最大的证据缺口。
2026 年演进版(Genesis World 1.0 博客)确实给出了有方法学的量化数字——仿真评测与真机 rollout 相关性 89%、Pearson 相关 0.8996(95% CI [0.7439, 0.9314])、MMRV 0.0166(95% CI [0.0102, 0.0474],14 任务×200 episodes×1,000,000 次 bootstrap)、reality gap(FID 口径)比次优仿真器小 45%(详见 genesis-physics-engine)。但这些评测的对象已经变了:它衡量的是”经典物理仿真本身作为策略评测器的可信度”,而不是 Dec 2024 承诺的”生成式数据引擎”产出内容的质量——即评测填补的是另一个问题的空白,Dec 2024 那个”生成式世界模型”命题本身至今仍未获得对应的量化评测。
创新点与影响
贡献:
- 把”经典可微物理引擎 + VLM/LLM 生成式 agent”打包为一个通用、可复用、开源的”世界引擎”产品级叙事,将此前分散在 RoboGen / Gen2Sim / Architect / DiffuseBot 等单篇论文里的生成式仿真思路,统一到一套共享物理基底、覆盖视频/动作/场景/关节物体/语音多模态的单一系统愿景下。
- 在世界模型光谱上明确亮出”非神经、以物理为真值”一极的旗帜:转移函数不学习,只用生成模型做内容编排——为”要不要学习世界动力学”这一设计选择提供了一个高调的、跟神经视频世界模型(Genie/Sora 一代)同时期对照的公开样本。
- Apache-2.0 全开源 +
pip install genesis-world一行装,短期内迅速获得社区关注(GitHub star 快速攀升),把”生成式仿真造数据”从单篇论文 demo 提升为一个被广泛讨论的基础设施话题。
它改变了什么:在 2024 年底神经视频世界模型热度攀升的同一窗口期,向机器人/具身社区展示了另一条可选路径的可能性与局限,并促成了后续对”仿真到底该学习还是该精确建模”这一问题更系统的讨论(2026 年 Genesis World 1.0 博客里的”混合仿真器”方向即是对这一张力的直接回应)。
自陈局限 + 事实性缺口(研究库需如实标注):
- Genesis “世界模型”属性的核心——生成式 agent 层——在 Dec 2024 发布时并未随开源放出,只有 demo 视频,没有代码、权重或可调用 API,官方原话是”will be rolled out gradually in the near future”;
- 发布时无技术报告/论文(项目页链接写的是”Paper (Coming Soon)”),机器人策略生成与开放世界关节物体生成两个模块分别引用”see RoboGen”和”under submission now”,均非可复现说明;
- 截至写作时(2026-07)核心团队创立的 Genesis AI 已把叙事整体转向”仿真作为评测/迭代基础设施”,2026-05 博客明确写道其”zero-shot real-to-sim”评测准则下”policies we evaluate in simulation are trained on real-world data only”,且预训练阶段刻意”without relying on any simulation data in pretraining”——这与 Dec 2024 项目页”生成式数据引擎”(靠仿真生成训练数据)的核心愿景直接相悖,是这条技术路线在约一年半内发生方向性转折的一手证据;
- 截至本次调研(2026-07),Dec 2024 承诺的两篇”upcoming paper”(机器人策略生成方法、开放世界关节物体生成方法)均未发现对应已发表版本。
原始链接
- GitHub(发布时名 Genesis,现名 genesis-world,Apache-2.0):https://github.com/Genesis-Embodied-AI/Genesis
- 项目页(Dec 2024 原版内容已被替换,现重定向到 GitHub;历史内容见 Wayback 快照):https://genesis-embodied-ai.github.io/
- Dec 2024 项目页 Wayback 快照(2024-12-20):https://web.archive.org/web/20241220034529/https://genesis-embodied-ai.github.io/
- Dec 2024 GitHub README 原始 commit(73f9d2d2, 2024-12-18):https://raw.githubusercontent.com/Genesis-Embodied-AI/genesis-world/73f9d2d2ba958ebd64d57e18ebd9480d14346895/README.md
- 当前 GitHub 仓库(Genesis World,含 Nyx 渲染器 / Quadrants 编译器):https://github.com/Genesis-Embodied-AI/genesis-world
- Genesis AI 官方博客《The Role of Simulation in Scalable Robotics, Genesis World 1.0, and the Path Forward》(2026-05):https://www.genesis.ai/blog/the-role-of-simulation-in-scalable-robotics-genesis-world-10-and-the-path-forward
- 文档站:https://genesis-world.readthedocs.io/en/latest/
- 技术报告:截至 2026-07 仍无正式 arXiv 论文(“Paper (Coming Soon)” 从未兑现)
- 姊妹条目(物理引擎/infra 完整深度细节):genesis-physics-engine
一手源存档(sources/)
- genesis-generative-physics—dec2024-project-page — Dec 2024 项目页 Wayback 快照(2024-12-20),含完整作者名单/19 家机构、“Generating 4D dynamical & physical world” 章节全文、按模态分类的全部 demo prompt 列表
- genesis-generative-physics—dec2024-github-readme — Dec 2024 GitHub README 原始 commit(43M FPS / 430,000× 实时、六求解器清单、可微性状态、“Papers behind Genesis” 完整引用列表)
- genesis-generative-physics—github-readme-current — 当前 genesis-world README(Genesis World / Nyx / Quadrants 现状,供对照演进路径)
- genesis-generative-physics—genesis-world-1.0-blog — Genesis AI 官方博客 Genesis World 1.0(2026-05,“训练不依赖仿真数据”等叙事转折的一手证据、89% sim-real 相关性、Pearson 0.8996 等数字)