一句话定位
Genie Envisioner(GE)是 AgiBot(智元机器人)提出的机器人操作统一世界基础平台,由四件套构成,共享同一套视频生成 latent 空间:一个基于视频扩散的世界模型 GE-Base 承担感知-语义-时序建模,一个 160M 参数的轻量 flow-matching 解码器 GE-Act 把它变成可执行动作策略,一个动作条件神经模拟器 GE-Sim 把它反过来变成闭环评测/数据引擎,外加配套评测套件 EWMBench。
背景与定位
主流 VLA(vision-language-action)路线(如 pi0、groot-n1)依赖 VLM 把视觉输入映射到语言语义空间,再从这个语言中心表征学策略;机器人数据采集、策略训练、评测三个环节各自为战,衔接成本高。GE 反其道而行:不走”视觉→语言”这条线,而是构建一个以视频为中心的具身表征空间,用大规模视频扩散模型直接建模机器人-环境交互的时空规律,再从这个视觉 latent 空间派生出动作策略(GE-Act)和动作条件模拟器(GE-Sim),策略学习、闭环仿真、评测都在同一个视频生成框架里完成。
技术脉络上,GE-Base 延续通用视频扩散 DiT 范式(骨干可换 LTX-Video 2B 或 cosmos-predict 2B),把机器人操作视频生成问题形式化为”指令 + 初始观测 → 未来视频片段”的自回归预测任务,是 cosmos-predict 这类通用世界基础模型向机器人操作垂类的领域适配。GE-Sim 则是团队前作 EnerVerse-AC(arXiv:2505.09723)的动作条件模拟器思路的延伸,EWMBench 亦脱胎于团队同期发布的独立评测论文 EWMBench(arXiv:2505.09694)。GE-Act 的 baseline 对比对象包括 pi0、groot-n1 与 UniVLA。
模型架构
GE-Base(世界基础模型)
- 形式化:$\mathbf{x}{1:N}^{(t)}=\mathcal{W}(\hat{\mathbf{x}}{0:t-1},\mathbf{x}0,q)$,给定初始观测 $x_0$、稀疏记忆 $\hat{x}{0:t-1}$(历史帧稀疏采样)与语言指令 $q$,自回归生成下一个含 $N$ 帧的视频 chunk。
- 骨干:DiT 视频扩散模型,可插拔 LTX-Video 2B 或 COSMOS 2B;论文实验主用 LTX-Video 2B。
- 三视角:头部相机 $v^h$ + 双腕相机 $v^l, v^r$,各视角独立 VAE 编码后拼 2D RoPE 位置编码 + 视角可学习 embedding + 时间步编码送入 DiT。
- 跨视角注意力:标准空间自注意力从 $(H,W)$ 扩展到 $(N,H,W)$($N$=相机数),但只在部分 DiT block 稀疏插入跨视角注意力,其余 block 把视角维折进 batch 维独立处理,兼顾一致性与效率。
- 指令注入:冻结 T5-XXL 编码器产出文本 embedding,通过 DiT 内交叉注意力对齐视频生成与指令语义。
- 稀疏记忆机制:训练时从历史帧中随机采样记忆帧作为数据增强,增加未来预测难度、提升时序鲁棒性。
GE-Act(世界动作模型)
- 与 GE-Base 并行的轻量动作分支,镜像 GE-Base 的 DiT block 深度但降低隐藏维度,参数量约 160M。
- 视觉 token 走 GE-Base 的视觉 DiT block:$\mathbf{v}_i=\mathcal{B}^{\text{vis}}i(\mathbf{v}{\text{in}},\mathcal{T}(q))$;噪声初始化的动作 token 走独立的动作 DiT block,通过交叉注意力吸收对应层的视觉表征:$\mathbf{a}i=\mathcal{B}^{\text{act}}i(\mathbf{z}{\text{act}},\text{CrossAttn}(\mathbf{z}{\text{act}},\mathbf{v}_i))$。
- 动作输出头为 flow-matching 去噪,无需显式生成视频即可推理动作,实现纯 latent 空间内的闭环控制。
- Slow-Fast 异步推理:视频 DiT 每步只做 1 次 flow-matching 去噪(生成的视觉 latent 缓存复用),动作模型做 5 步去噪;视频 DiT 运行在 5Hz、动作模型运行在 30Hz(时间分辨率比 1:6),实现视觉稀疏预测 + 动作稠密生成的解耦。
GE-Sim(世界模拟器)
- 复用 GE-Base 生成能力,改造成动作条件视频生成器,作为脱离物理引擎的神经模拟器。
- 层级化动作条件机制:单臂每步动作编码为 7 维 $[x,y,z,\text{roll},\text{pitch},\text{yaw},o]$($o$=夹爪开合度),双臂拼接为 14 维,$K$ 步轨迹 $\mathbf{A}\in\mathbb{R}^{K\times14}$。
- Pose2Image 条件:用相机内外参把末端位姿投影到像素平面生成”位姿图像” $\mathbf{P}_i$(朝向用旋转矩阵正交轴投影表示方向,夹爪开合用单位圆明暗表示,左右臂用不同颜色区分),与对应历史帧 $\mathbf{I}_i$ 各自过共享 VAE 编码后逐元素相加融合:$\mathbf{v}_i=\mathcal{E}(\mathbf{I}_i)+\mathcal{E}(\mathbf{P}_i)$。
- 运动向量条件:相邻位姿差分 $\Delta\mathbf{a}_i=\mathbf{a}i-\mathbf{a}{i-1}$ 编码为运动 token,与参考图像风格 token(冻结 CLIP 编码)拼接,通过交叉注意力注入每个 DiT block,为动作条件视频生成提供时序运动先验。
数据
- 预训练主语料 AgiBot-World-Beta:约 100 万条真实世界双臂机器人操作 episode,累计 2,967 小时人类遥操作数据,含自然语言指令标注、多视角观测、结构化动作策略。三路同步相机视频流被抽取并与指令对齐,形成文本-视频配对。
- 跨具身适配数据(few-shot):
- Agilex Cobot Magic(叠衣、叠盒任务):每任务 250 条高质量遥操作演示(约 1 小时),经 Aloha 遥操系统采集。
- Dual Franka(叠布任务):同样 250 条 episode(约 1 小时),因无专用遥操接口改用空间鼠标采集。
- GE-Sim 训练数据增强:在全量 AgiBot-World-Beta 基础上,额外混入失败案例(执行错误、动作不完整、次优控制轨迹),来源包括人类遥操和真实机器人部署,以提升模拟器鲁棒性。
- 任务专项微调采样策略:视频适配阶段用「全量 AgiBot-World 语料 + 任务专项子集」组成的复合数据集,任务子集上采样 10 倍以加强任务对齐同时不牺牲泛化。
- EWMBench 评测集:从 AgiBot-World-Beta 测试集精选 10 个家用/工业代表性任务(与 1M 规模预训练任务不重叠),每任务拆解为 4–10 个原子子动作并标注分步描述,每任务均匀采样 100 个视频实例;轨迹多样性通过双臂末端轨迹体素化后计算 3D IoU 相似度矩阵、贪心选取重叠最小的轨迹来保证。
训练方法
GE 全流程分三大模块、共约 6 个训练阶段:
GE-Base 预训练(两阶段)
- Stage I 多分辨率时序适配(GE-Base-MR):57 帧视频片段,3–30Hz 随机帧率采样,4 帧稀疏记忆帧做数据增强,经预训练 VAE 压缩到 8 帧 latent 空间,标准去噪目标训练。
- Stage II 低频策略对齐(GE-Base-LF):固定 5Hz 采样 9 帧片段 + 4 帧稀疏记忆,压缩到 2 个 latent 帧,VAE 冻结只更新视频生成组件,对齐下游动作建模所需的时序粒度。
GE-Act 训练(预训练 + 两阶段任务适配)
- 动作空间预训练:以冻结的 GE-Base-LF 为世界模型初始化,只更新动作解码模块;视频生成在训练时被禁用(无需显式视频生成),4 帧 5Hz 稀疏记忆作条件,监督信号为 30Hz、54 步的真值动作序列。
- 任务专项适配(两阶段):① 视频适配,只更新视频生成组件(VAE/CLIP 冻结),复合数据集(全量语料 + 10× 上采样任务子集);② 动作专项化,GE-Base 骨干 + 动作模块整体在任务数据上联合微调,采样策略与①一致。
- 跨具身 few-shot 适配(新平台):① 视频 DiT 用少量新具身指令-视频演示微调(CLIP/视频编码器冻结),学习新平台视觉风格;② 因动作空间语义不兼容,从头训练新的动作 DiT(不复用预训练动作解码器),只复用 GE-Base 视觉骨干。
GE-Sim 训练:以高时序分辨率的 GE-Base-MR 为初始化,在全量 AgiBot-World-Beta(含失败轨迹增强)上用真值动作轨迹作条件,VAE/CLIP 冻结,其余参数以 flow-matching loss 优化。
Infra(训练 / 推理工程)
- GE-Base-MR:32× NVIDIA A100,约 7 天。
- GE-Base-LF:32× NVIDIA A100,约 3 天。
- GE-Act 动作空间预训练:16× NVIDIA A100,约 3 天。
- GE-Act 任务适配·视频阶段:8× NVIDIA A100,约 12 小时。
- GE-Act 任务适配·动作专项化阶段:8× NVIDIA A100,约 36 小时。
- GE-Sim 训练:GPU 数/时长未披露(论文只述训练流程未给具体算力)。
- 推理:Slow-Fast 异步推理下,视频 DiT 单步去噪 + 动作模型 5 步去噪,在机器人本体搭载的 NVIDIA RTX 4090 上完成 54 步动作轨迹推理仅需 200ms;视频 DiT 运行 5Hz、动作模型运行 30Hz(比例 1:6)。GE-Sim 支持通过分布式集群并行化实现每小时数千 episode的策略 rollout 评测吞吐。
评测 benchmark
AgiBot G1 同域任务(Step-wise SR / End-to-End E2E 成功率,对比 groot-n1、UniVLA):5 项任务(做三明治、倒茶、擦桌子、微波炉热食、传送带装洗衣液),GE-Act(Slow / Fast 两种推理模式)在全部任务的 SR、E2E 两项指标上一致优于 GR00T N1 与 UniVLA(论文 Fig.8,柱状图读数,如”做三明治”SR:GR00T≈0.01、UniVLA≈0.20、GE-Act-Slow/Fast≈0.62;E2E:GR00T≈0、UniVLA≈0.55、GE-Act-Slow≈0.83、GE-Act-Fast≈0.95。“传送带装洗衣液” SR 上 GE-Act-Fast≈0.72 显著领先 GE-Act-Slow≈0.25,体现 Fast 模式在动态抓取等低延迟场景的优势)。
跨具身泛化(对比 groot-n1、pi0、UniVLA,均在同一 few-shot 数据上微调):
- Agilex Cobot Magic:叠衣 SR π0=0.70 / GE-Act=0.80,E2E π0=0.73 / GE-Act=0.75;叠纸盒(更精细)SR π0=0.15 / GE-Act=0.50,E2E π0=0.48 / GE-Act=0.76。GR00T N1、UniVLA 在叠纸盒复杂任务上 SR/E2E 均为 0%(仅人工干预下 UniVLA 能完成部分步骤)。
- Dual Franka:叠布 SR π0≈0.72 / GE-Act≈0.80;E2E GR00T≈0.17、UniVLA≈0.05、π0≈0.60、GE-Act≈0.87。GE-Act 仅用 1 小时适配数据即超越在 Franka 具身上有大规模训练数据的 π0 与 GR00T N1。
EWMBench 世界模型评测(GE-Base vs. 5 个通用/具身视频生成基线:Kling、Hailuo、LTX-Video、COSMOS、OpenSora,论文 Fig.17 精确数表):
| Model | Scene | Motion | Semantics | Score |
|---|---|---|---|---|
| GE-Base | 0.9427 | 1.6676 | 2.0907 | 4.7010 |
| Kling | 0.8888 | 0.9440 | 2.0370 | 3.8698 |
| Hailuo | 0.8577 | 0.5362 | 2.0186 | 3.4125 |
| COSMOS | 0.7963 | 0.7085 | 1.7824 | 3.2872 |
| OpenSora | 0.9210 | 0.3442 | 1.8739 | 3.1392 |
| LTX | 0.9156 | 0.4002 | 1.6518 | 2.9676 |
GE-Base 在时序对齐(TA)与动态一致性(DYN)两项核心指标上优势最明显(论文原话),运动语义与通用视频生成模型相当。
GE-Sim 动作条件生成质量(EWMBench 度量,论文 Table 1):SA(空间对齐,基于对称 Hausdorff 距离)=0.9413,TA(时序对齐,NDTW)=0.9750,DYN(动态一致性)=0.7836,Scene(场景一致性)=0.9016,Logic(逻辑正确性)=0.9667,BLEU(全局语义对齐)=0.3255,CLIP(关键步骤一致性)=90.79,Diversity(固定动作输入下的多样性)=0.0111(低多样性在此场景下是期望特性,反映动作到视频的精确对应)。
指标-人类一致性验证:对 GE-Base、Kling-1.6、Hailuo I2V-01-live、OpenSora-2.0 四模型收集人类偏好排序,EWMBench 排序(GE-Base > Kling > Hailuo > OpenSora)与人类排序高度一致;而通用视频基准 VBench 排序与人类排序明显不一致(如 Hailuo 在 VBench 上得分反而略高于 GE-Base 和 Kling,但人类评价其倒数第二),论文以此论证 EWMBench 比 VBench 更贴合具身操作场景的评测需求。
创新点与影响
- 首次把策略学习、闭环仿真、评测统一进同一个视频生成 latent 空间,而非通用 VLA 依赖的”视觉→语言”中心表征,论文认为这样能保留更细粒度的空间时序线索。
- GE-Act 用 160M 参数的轻量 flow-matching 头,把视频世界模型的能力”转译”成实时动作策略(54 步/200ms @ RTX 4090),证明视频生成的预训练先验可以直接迁移到低延迟闭环控制,而非停留在离线规划/数据增广。
- GE-Sim 把同一世界模型反过来变成动作条件神经模拟器,作为传统物理引擎(MuJoCo、Isaac Gym)的替代方案,免去人工环境建模,支持每小时数千 episode 的分布式 rollout 评测。
- EWMBench 填补了”通用视频评测指标(FVD/MSE/VBench)不贴合机器人操作”的空白,把评测拆解为场景一致性、动作轨迹质量(空间/时序/动态)、动作语义(语义对齐/逻辑正确性/多样性)三层,并通过人类一致性实验验证有效性。
- 作者自述局限(论文 Limitations 节):① 训练数据仅来自 AgiBot-World-Beta 单一平台真实数据,未引入互联网规模或仿真数据,跨异构来源/低资源域的鲁棒性有待验证;② 目前仅限桌面级平行夹爪双臂操作,未覆盖灵巧手协调与全身运动;③ EWMBench 仍依赖代理指标与部分人工验证,在多样失败模式和语义模糊场景下的全自动可靠评测仍是未解难题。
- 论文致谢明确 GE 站在团队前作 EnerVerse(arXiv:2501.01895)、EnerVerse-AC(arXiv:2505.09723)与 EWMBench(arXiv:2505.09694)之上,GitHub 显示项目在 2025-08 发布后持续迭代,2025-10 更新技术报告并开源 GE-Sim(Cosmos2 版)权重,2025-12 追加 Calvin 仿真基准适配,2026-05 发布 GE-Sim v2.0。
原始链接
- arXiv: https://arxiv.org/abs/2508.05635
- PDF: https://arxiv.org/pdf/2508.05635
- GitHub: https://github.com/AgibotTech/Genie-Envisioner
- HF 模型: https://huggingface.co/agibot-world/Genie-Envisioner
- ModelScope: https://www.modelscope.cn/models/agibot_world/Genie-Envisioner
- 项目主页: https://genie-envisioner.github.io/
- 数据集 AgiBot-World-Beta: https://huggingface.co/datasets/agibot-world/AgiBotWorld-Beta
- 前作 EnerVerse: https://arxiv.org/abs/2501.01895
- 前作 EnerVerse-AC: https://arxiv.org/abs/2505.09723
- 前作 EWMBench 独立论文: https://arxiv.org/abs/2505.09694
一手源存档(sources/)
- github-readme.md (GitHub README,master 分支,含发布时间线/训练&部署流程)
- hf-card.md (HuggingFace 模型卡)
- project-page.md (项目主页文字快照)
- arXiv 原文 HTML/PDF(arXiv:2508.05635,不入 git,可用上方 arXiv 链接重取)