一句话定位

Genie Sim 是 AgiBot(智元机器人)开源的机器人仿真平台:把 LLM 驱动的场景/评测生成、3D 重建(3DGS)、VLM 自动打分、遥操作+自动化数据采集 串成一条流水线,目标是替代 VLA(vision-language-action)模型训练与评测中昂贵的真实机器人数据采集与人工评测。截至本次抓取(v3.2,2026-06),平台开源 5,140 个仿真资产(353 类)、200+ 任务、10,000+ 小时合成数据、100,000+ 评测场景,并在 π₀.₅ 基座上用受控 sim/real 对照实验验证了 R²=0.924 的 sim-to-real 一致性(arXiv 技术报告 2601.02078,2026-01)。

背景与定位

范式属于”高保真仿真作为 VLA 训练/评测基础设施”这一支线——arXiv 技术报告的 Related Work 把自己摆在 DROID/RoboNet/RH20T/Open X-Embodiment(真实数据集)与 RoboCasa/DexGraspNet 2/RoboTwin 2.0(合成数据集)之间:真实数据集规模受限于采集成本,既有合成数据集则普遍”场景碎片化、覆盖窄、或保真度不足以支撑有效 sim-to-real”。Genie Sim 的定位是同时解决这三个问题——3D 重建+生成式视觉合成保证高保真、LLM 驱动生成解决场景/任务规模化、VLM 自动打分解决评测规模化。同一批研究趋势里可对照 robocasa(MuJoCo + MimicGen + LLM 造任务)、curobo(本平台直接复用其 GPU 运动规划器)、以及 NVIDIA isaac-lab-orbit / isaac-sim(Genie Sim 的仿真后端正是 Isaac Sim)。

与同厂 agibot-world-colosseo(AgiBot World Colosseo,真实机器人数据集 + GO-1 策略,2025-03 同期发布)是两个独立的一手工作——Colosseo 论文全文未提及 Genie Sim,两者应视为 AgiBot 同一时期释出的并行生态组件,而非同一篇论文的两部分。Genie Sim 后来在评测侧承接了 GO-1、π₀.₅、UniVLA、RDT、X-VLA 等策略的标准化闭环评测(AgiBot World Challenge: Open-Session)。

版本与信息来源的说明:本条目在调研 wave 中标注日期为 2025-03;但 Genie Sim 项目本身没有为初次开源发布单独出过公告或论文——GitHub 仓库当前 README 中可见的版本变更日志从 v2.1(2025-06-25) 开始记录,Wayback Machine 对该仓库的最早存档也恰好是 2025-06-25,本次调研未找到更早的一手公告或存档能直接坐实”2025-03”这个具体时间点,故不做强断言,仅如实记录:v2.1(2025-06-25,新增 10 个操作任务+开源对应数据集)→ v2.2(2025-07-14,细化评测指标)→ **v3.0(2026-01-07,Isaac Sim 升级到 5.1、支持 RTX 50 系显卡、发布 Genie G2 机器人 USD/URDF、3DGS 场景重建、合成数据集与 LLM 场景/评测生成——同期首次发布 arXiv 技术报告 2601.02078,标题即《Genie Sim 3.0》)**→ v3.1(2026-04-08,新增 Genie Sim World 空间世界模型 + RLinf 强化学习支持)→ v3.2(2026-06-25,当前版本,新增 geniesim CLI、Agent SKILLs、RT Engine 实时 ROS 2 仿真)。以下六个维度中的量化数字,凡来自 arXiv 技术报告的按论文口径(对应 v3.0 时点),凡仅见于当前 README/项目主页的按 v3.2 口径标注。

模型架构

Genie Sim 不是一个训练出的模型,而是五个子系统组成的仿真平台(用第三方现成模型/求解器编排,而非自研权重):

1. Genie Sim Generator(LLM 驱动场景生成)——四阶段流水线,全程共享同一对话上下文:

  • Intention Interpreter:CoT LLM 把开放式自然语言指令解析为结构化 JSON(物体类别约束 + 两两空间关系,如 “on/adjacent/aligned”),消歧靠预训练世界知识;有冲突则回问用户。
  • Assets Index:RAG 资产检索。5,140 个物体的外观/几何/用途描述先经 Qwen text-embedding-v4 编码成 2048 维向量存入 ChromaDB;运行时同模型编码查询关键词(如 “yellow cube”),余弦相似度取 top-k,连同 USD 路径/碰撞体/质量属性/纹理变体一起注入 LLM 上下文;单次检索耗时约 200ms
  • DSL Code Generator:在 The Scene Language 语法基础上扩展,适配 Genie Sim 资产库后端,综合 Intention Interpreter + Assets Index 上下文,用预训练 LLM 合成双精度浮点、细粒度可控的场景规范(Python 代码);支持多轮迭代编辑与人工修正。
  • Results Assembler:实例化层级化 Scene Graph(节点=物体,带 asset id/语义/尺寸/位姿/任务标签;边=空间关系 on/in/adjacent/aligned/stacked),用随机函数在位姿/布局/物体选择上做域随机化,经 OpenUSD Schema + Isaac Sim API 合成仿真可用 USD 文件;号称”几分钟内生成数千个多样化场景”(未给精确速率)。

2. Genie Sim Benchmark(评测生成 + 闭环评测)——LLM 结合自研 Action Domain Evaluation Rule(ADER) 规则系统自动生成任务指令与可执行评测配置;VLM 依据格式化任务规格 + 执行过程的时序视觉观测,判定任务是否完成并给出可解释依据。闭环评测中仿真与推理服务通过 HTTP 解耦:仿真器推送观测图像+本体状态给推理服务,模型回传控制指令,周期性检查任务完成情况,超时则终止。已集成基线:π₀.₅、GO-1、UniVLA、RDT、X-VLA;支持机器人 Genie G1 / G2;末端执行器 omnipicker / omnihands / INSPIRE skillhands / zhixing gripper 等;支持本地/分布式推理框架。

3. 环境重建(3DGS 管线):用 SkylandX(项目主页作 “Skyland”)Innovation 的 MetaCam 手持三维激光扫描仪采集鱼眼图像 + 逐帧位姿 + 密集点云 → 相机位姿优化环节用 SuperPoint + LightGlue 替换 COLMAP-PCD 里原本的 DSP-SIFT 特征提取(降噪、增强弱纹理区域特征提取能力)→ 用 LiDAR SLAM 先验位姿做三角化 + 2D-3D 特征关联 + BA 优化 → 得到相机位姿与稀疏点后用开源 gsplat 训练 3DGS → 用 Difix3D+ 预训练模型外推补足视角覆盖不足的问题 → 最终用 PGSR 做表面重建得到高精度 mesh,输出可被 Isaac Sim 使用的 USD。

4. 数据生成(双模式采集)遥操作——PICO VR 头显把末端执行器目标位姿发给主控机,运动控制器驱动仿真中机器人执行轨迹,完整记录关节状态/视觉观测/物体位姿;用于长程复杂任务的类人示范。自动化采集——以 GPU 加速运动规划器 cuRobo 为核心;任务生成阶段用 LLM 检索资产并按预定义原子技能组装;关键路点候选来自 GraspNet 标注的抓取位姿,按运动学可达性/避碰/拟人可行性筛选,每个动作生成多条候选序列并逐一仿真执行+轨迹评估,失败则状态回滚重试;与多数”简化规划环境”(剔除任务无关物体)的做法不同,本系统保留场景完整性,靠网格简化在效率与完整性之间取得平衡。

5.(v3.1/v3.2 新增,仅见于 README,早于 arXiv 论文写作时点故论文未覆盖)RT Enginegeniesim_ros,v3.2)——物理/渲染/机器人作为 ROS 2 一等节点、共享同一 sim_time;可按场景选择物理后端(Isaac Sim PhysX / Isaac Sim Newton / 无需 Kit 的 Newton-standalone,后者支持布料/软体);配 MoveIt 2 + WBC RViz(面向 Genie G2)、三种 IK 插件;支持 URDF/xacro 自带机器人(含 Franka/UR5/Aloha/ARX/Agilex 参考 URDF)。Genie Sim World(v3.1)——多模态空间世界模型,输入等距柱状全景图(.png),经 DA360 深度估计 → SHARP 高斯溅射,几分钟内生成可探索的照片级 3D 世界(PLY/Gaussians);README 未给出方法细节,未与 RT Engine 打通(W.I.P.)。

配置数字:Isaac Sim 5.1(v3.0 起)并支持 RTX 50 系显卡;v3.2 起同时支持 Isaac Sim 5.1 与 6.0(共用一套 CLI);ROS 2 发行版 Jazzysource/geniesim_*data_collection 代码使用 Mozilla Public License 2.0

数据

  • 资产库5,140 个经验证的仿真可用 3D 资产,跨 353 个类别(arXiv 论文口径),README 另称覆盖零售/工业/餐饮/家居/办公五大真实作业领域;HF 资产库目录结构含 background / robot(G1_120s、G1_omnipicker、G2_omnipicker、curobo_robot)/ objects / interaction / real2sim / external 等子目录。
  • 合成数据集10,000+ 小时仿真交互数据,覆盖 200 个代表性任务(论文口径;README 用”200+”);用 AgiBot G1G2 两个机器人平台生成;系统性覆盖任务布局、初始机器人位姿、环境光照、场景配置、相机噪声、语义指令措辞等多维度变化。
  • 任务分类法(三轴):操作技能(原子技能:pick / place / pull / push / open / close);认知理解(空间推理如尺寸关系、属性理解如颜色、逻辑推断、常识推理);任务复杂度(按规划步长与协同需求分级,如”单臂清理单件垃圾”→“双臂协同清理”→“清空桌面所有垃圾”的复杂度递增序列)。
  • 评测场景100,000+ 仿真评测场景,由 LLM + ADER 自动生成任务指令与评测协议,VLM 自动打分。
  • AgiBot World Challenge 2025 专项数据(v2.1,2025-06-25):额外开源 10 个操作任务的合成数据集(HF: AgiBotWorldChallenge-2025/Manipulation-SimData)。
  • Sim2Real 受控实验数据(arXiv 论文):4 个代表性任务(Select Color / Recognize Size / Grasp Targets / Organize Items)× 4 种训练数据配置(200 条真实 episode / 500 条真实 episode / 500 条仿真 episode / 1500 条仿真 episode),均以 π₀.₅ 为基座后训练;每个配置在真实环境评测 50+ 次、仿真环境评测 250+ 次试验(论文原文 “over 50 trials” / “over 250 trials”),全文共称 32 组实验;4 任务 × 4 数据配置对应的 16 个训练模型均同时在 sim 与 real 两种环境下评测。

训练方法

Genie Sim 本身不产出可学习权重,“方法”体现为编排现成模型/求解器的流水线,而非训练目标函数:

  • 场景生成方法:CoT LLM 意图解析 → RAG 资产检索(Qwen text-embedding-v4 + ChromaDB)→ DSL 代码生成(扩展 Scene Language)→ Scene Graph 实例化 + OpenUSD/Isaac Sim API 编译,全程免微调,靠把资产库嵌入 LLM 上下文实现类别/位姿/光照/纹理的联合泛化。
  • 评测生成方法:LLM + ADER 规则系统自动生成指令与评测配置;VLM 对时序视觉观测做证据式判定,替代人工标注成功标准。
  • 环境重建方法:SuperPoint+LightGlue 特征匹配 → LiDAR 先验位姿三角化 + BA 优化(COLMAP-PCD 流程改造)→ gsplat 训练 3DGS → Difix3D+ 生成式补视角 → PGSR 表面重建,是一条确定性的多阶段流水线而非端到端训练。
  • 数据采集方法:遥操作(人类示范)与自动化采集(cuRobo 规划 + GraspNet 抓取位姿 + 候选序列筛选 + 失败回滚重试)互补,前者产人类风格长程数据,后者产大规模低成本数据。
  • Sim2Real 验证实验设计:受控 2×2 交叉设计(训练数据源 {仿真, 真实} × 评测环境 {仿真, 真实}),在同一基座策略 π₀.₅ 上对比,用于量化仿真评测与仿真数据训练的有效性(而非训练 Genie Sim 本身)。

Infra(训练 / 推理工程)

  • 资产检索延迟:约 200ms(嵌入编码 + ChromaDB 余弦检索),论文称对用户”完全透明”。
  • 场景生成吞吐:论文只定性描述”几分钟内生成数千个多样化场景”,未给精确场景/秒速率。
  • 仿真后端:Isaac Sim 5.1(v3.0)支持 RTX 50 系 GPU;v3.2 追加 Isaac Sim 6.0 支持;RT Engine(v3.2)另支持 Isaac Sim PhysX / Isaac Sim Newton / Kit-free Newton-standalone 三种物理后端可按场景切换。
  • 运动规划:自动化数据采集用 cuRobo(GPU 加速运动规划器)做轨迹规划;具体 GPU 型号/数量/规划耗时未披露。
  • 仿真速度优化:v2.1(2025-06-25)changelog 称”优化通信框架,仿真运行速度提升 2ד,未给优化前后的绝对 FPS 基线,故只能引用相对倍数、不能换算绝对吞吐。
  • 平台自身的 GPU 数量 / 总 GPU-hours / 端到端控制频率(control-Hz)/ 推理延迟:论文与 README 均未披露(论文的实验部分报告的是下游策略 π₀.₅ 的成功率,不是仿真器本身的计算成本)。
  • 部署形态:Docker 化(geniesim docker build/up),CLI 打包为标准 PEP 517/621 Python wheel(geniesim_cli),提供健康诊断(geniesim doctor/status)与一键 bootstrap。

评测 benchmark

主实验(arXiv 2601.02078 Table I,π₀.₅ 基座 + AgiBot G1 机器人,4 任务 × 4 数据配置,50 次真实试验 + 250 次仿真试验/配置)

训练数据Select Color (sim/real)Recognize Size (sim/real)Grasp Targets (sim/real)Organize Items (sim/real)
200 eps 真实0.45 / 0.530.50 / 0.560.34 / 0.390.25 / 0.30
500 eps 真实0.75 / 0.730.75 / 0.750.54 / 0.580.45 / 0.40
500 eps 仿真0.53 / 0.600.50 / 0.630.29 / 0.330.39 / 0.35
1500 eps 仿真0.86 / 0.850.93 / 0.940.80 / 0.710.52 / 0.60
  • 仅用 1500 条合成数据训练的模型在全部 4 个任务的真实环境零样本成功率上均达到最高(0.85 / 0.94 / 0.71 / 0.60),超过同等 500 条真实数据训练的模型。
  • 同规模对照(500 真实 vs 500 仿真,真实环境评测):真实数据全面占优(0.73 vs 0.60、0.75 vs 0.63、0.58 vs 0.33、0.40 vs 0.35),归因于真实数据更高的物理保真度(摩擦、接触动力学)。
  • 全部 16 个模型(4 任务 × 4 配置)同时在 sim / real 两种环境下评测,仿真-真实成功率相关性 R²=0.924,最佳拟合斜率 ≈1.045——支持”Genie Sim 评测结论与真实世界趋势一致”的结论。

AgiBot World Challenge: Open-Session 官方基线榜(README,v3.2,四榜均值,基线模型 π₀.₅ / ACoT-VLA / GR00T-N1.7 / π₀)

榜单π₀.₅ACoT-VLAGR00T-N1.7π₀
Instruction(10 任务均值)0.720.730.610.35
Robust(5 类扰动均值)0.4970.4930.4430.231
Manipulation(10 任务均值)0.580.480.440.35
Spatial(8 任务均值)0.300.360.250.04

GenieSim-Sim2Real(2×2 设计:训练数据{仿真,真实}×评测环境{仿真,真实},8 任务均值,均以 π₀.₅ 为基座后训练,仿真数据 500~1500 episode / 真实数据 500 episode):sim-to-sim 0.80、real-to-sim 0.75、sim-to-real 0.83、real-to-real 0.75——四种条件成功率接近,支撑”Genie Sim 评测是真实世界评测的可靠代理”。

官方项目主页另称整套 100,000+ 场景评测体系下”仿真与真实世界测试结果差异小于 10%“(定性表述,未见进一步拆解到具体任务/维度)。

创新点与影响

贡献(技术报告自陈五点):(1) Genie Sim Generator——LLM 驱动、支持多轮对话迭代的自然语言场景生成,可在数分钟内对光照/背景/布局/位姿/轨迹/传感器噪声/机器人形态做参数化泛化;(2) 首个把 LLM 用于自动化评测生成的基准——LLM+ADER 造任务/评测协议、VLM 打分,把评测规模推到 100,000+ 场景;(3) 3DGS + 生成式视觉合成 + 物理引擎三者深度整合的高保真环境重建,官方主页称为”业界首个深度整合三维重建、视觉生成与物理引擎的开源仿真平台”(公司自我表述,未见第三方验证);(4) 遥操作+自动化双模式采集,带错误恢复/回滚机制;(5) 验证了零样本 sim-to-real 迁移有效性(R²=0.924)并全量开源 5,140 资产 + 10,000+ 小时数据 + 100,000+ 评测场景 + 完整代码。

演进为生态:首次开源后,v3.1 追加了独立的空间世界模型(Genie Sim World)与分布式/人机协同强化学习支持(RLinf);v3.2 追加了 geniesim CLI 与”面向 Agent 的 SKILLs”(打包成 SKILL.md,可被 Claude Code 等编码 agent 直接调用驱动仿真流程而无需人先读文档);评测侧则孵化出常态化的 AgiBot World Challenge: Open-Session 竞赛榜单。这体现了具身仿真基础设施从”一次性论文产出”向”持续维护、面向 AI agent 可操作”的工具形态转变。

技术报告自陈局限(论文未设独立 Limitations 小节,据实验设计与讨论归纳):① 同等数据规模下合成数据训练模型仍不及真实数据(500 eps 对照中真实数据全面占优),说明仿真物理保真度(摩擦/接触动力学)仍有上限,不能完全替代真实数据;② sim2real 有效性验证只覆盖 4 个任务、单一机器人(G1)与单一基座策略(π₀.₅),未系统验证 G2 人形全身控制、双臂协同或其他策略族的迁移效果。

原始链接

一手源存档(sources/)