为什么把「仿真」和「数据」放在一页写
视觉靠爬网页、语言靠爬网页,机器人操作却没有一个可以爬的互联网——动作标签(关节角、末端位姿、夹爪开合)不存在于任何网页里,只能被采集或仿真出来。于是整个具身智能领域的底层基础设施,本质上是两台把别的东西转成「带动作标签的轨迹」的引擎:
- 仿真引擎:把 GPU 算力转成数据。物理引擎 + 渲染器让成千上万个并行世界在一块芯片上跑起来,再叠一层 RL / 生成式管线,就能”凭空”造出策略需要的经验。这条线的主旋律是加速器原生(accelerator-native)——把仿真从 CPU 搬到与训练同一块 GPU/TPU 上。
- 数据飞轮:把真实世界(和人)转成数据。遥操作硬件、免机器人手持采集器、人类第一视角视频、以及”用少量真数据倍增出大量合成数据”的各种引擎,共同构成一条越转越快的采集-训练-再采集回路。
这两台引擎不是对立的,而是在 co-training、sim-to-real、real-to-sim 上反复交汇。本页把 embodied 分类里 sim-infra 与 data 两大类的全部工作(74 个页面)拉到一起,按子范式分组,给出谱系时间线、逐组的横向对比表(抠具体数字)、共通设计模式,以及这个大家族正在往哪走。
阅读地图:Part A 讲仿真(物理引擎 → 操作 benchmark → 场景/家务仿真 → 合成数据引擎),Part B 讲数据飞轮(真机遥操作数据集 → 遥操作硬件 → 免机器人采集 → 人类视频 → 视觉表征),Part C 讲两条线的交汇(sim-vs-real、co-training、scaling law)。相关的策略侧工作(VLA、diffusion policy、RT/π0/GR00T 等)不在本页,见各自条目与其它 deep-dive。
谱系时间线(2017 → 2026)
一条清晰的技术主线贯穿始终:2017–2020 是 CPU 仿真 + 单实验室采集;2021 是分水岭——Isaac Gym / Brax 把物理搬上加速器,Ego4D 把人类视频做成基础设施;2022–2024 两条线各自规模化——仿真从”专用引擎”走向”通用可微多物理栈”,数据从”单机采集”走向”跨机构众包 + 免机器人 + 合成倍增”;2025–2026 走向融合与治理——Newton 把分裂的 GPU 物理阵营收进 Linux Foundation,MuJoCo Playground 把开源仿真做到真机零样本,AgiBot World 把真机数据推到百万级。
Part A · 仿真引擎:把算力转成数据
A.1 物理引擎谱系——一场”加速器原生”革命
整条物理引擎线的驱动力只有一个命题:消除 CPU 物理引擎↔GPU 训练器之间的数据搬运延迟。谁能把”环境仿真”和”策略优化”编译到同一块芯片上、批量跑成千上万个并行世界,谁就能把 RL 训练从需要 CPU 集群压进单卡分钟级。
起点:CPU 时代的事实标准。 mujoco(Todorov IROS 2012,DeepMind 2021 收购、2022 Apache-2.0 全量开源)用广义(关节)坐标 + 凸可逆接触模型解决了游戏引擎(笛卡尔坐标 + LCP 数值约束)与传统关节引擎(忽略接触)的两难,论文实测单台 12 核机对 18-DOF 人形跑到 ~40 万求值/秒、约 5000× 实时。它是运动控制与灵巧操作研究的事实底座,但纯 CPU——正是它要被”搬上加速器”。
2021 分水岭:GPU-resident 与 accelerator-native 同时诞生。 isaac-gym(NVIDIA,NeurIPS 2021)把 PhysX 整块搬进 GPU,新增 direct-GPU tensor API 让 rollout 的观测/奖励/动作 buffer 全程不回 CPU,单块 A100 并行几千到上万环境:Ant 20 秒、Humanoid 4 分钟、ANYmal 2 分钟、Shadow Hand 转方块 35 分钟学会——相对”CPU 仿真 + GPU 训练”提速 2–3 个数量级(复现 OpenAI 灵巧手:30 小时 / 6144 CPU 核 + 8×V100 → 单卡 <1 小时)。同年 brax(Google,JAX/XLA)走另一条路——全程 JIT + 可微 + 跨 TPU 拓扑,用 maximal 坐标 + 辛积分,单卡百万级 steps/s、8×8 TPUv3 数亿 steps/s,且引擎可微、打包进免费 Colab。两者一起把”数千并行环境 + 单卡分钟级”钉成 RL 默认范式。
MuJoCo 阵营的应答与合流。 mjx-mujoco-xla(DeepMind 2023,随 MuJoCo v3.0)用 JAX 重写 MuJoCo,官方口径”TPU 上百万级步/秒”,并事实上吸收取代了 Brax 自己的 generalized 物理管线(Brax 现依赖 mujoco-mjx)。MJX 的代价很典型:单场景比 CPU MuJoCo 慢 10×,只有批量到成千上万并行才划算;高接触场景吞吐下降快于 CPU——这些痛点严重到 DeepMind 在 2025-08 又基于 Warp 做了个 MJX-Warp 后端(放弃自动微分换性能)。
编译器层与批量仿真的两条侧翼。 warp(NVIDIA 2022,Miles Macklin)把普通 Python 函数 JIT 成 CUDA kernel、并自动生成反向 adjoint kernel 做可微仿真,是”Python 生产力 vs CUDA 性能”空隙的填补者,血脉接 difftaichi(MIT 2019,两尺度自动微分、3 小时写 10 个可微仿真器、比 TF 快 188×);Warp 现已被 122+ 篇论文引用,是后续几乎所有 NVIDIA 仿真栈的底座。madrona-engine(Stanford/GT 2023)则从另一个角度切入——把游戏业界的 ECS(实体-组件-系统)架构完整搬上 GPU,编译进单个 CUDA megakernel 批量跑上万世界,让人能”像写游戏一样写新环境”而不必为每个任务重造仿真器(OpenAI Hide-and-Seek 单张 4090 跑到 190 万步/秒,比强 CPU 基线快 11×)。
2024–2025 的两个野心与一次收口。 genesis-physics-engine(2024-12,20+ 机构学术协作)把刚体 / MPM / SPH / FEM / PBD / 流体六套求解器 + 光追 + 生成式数据引擎全塞进一个 100% Python 栈,官方宣称单张 4090 模拟 Franka 4300 万 FPS(43 万倍实时)、比 Isaac Gym 快 10–80×——但发布时无技术报告、无可复现 benchmark,这些声明在 apples-to-apples 上被社区(含 NVIDIA 研究者)质疑,是它作为 landmark 最大的争议点。newton-physics-engine(2025-03,NVIDIA + Google DeepMind + Disney,Linux Foundation 托管)则是对整个分裂的 GPU 物理阵营的收口:以 Warp 为底座、DeepMind 新开源的 MuJoCo-Warp 为主后端,8 种可插拔求解器共享 Model/State/Control、支持多物理耦合与可微,向 Isaac Lab(PyTorch)和 MuJoCo Playground(JAX)双栈供能(MJWarp 人形仿真 >70×、在手操作 100× 加速)。
表 1 · 物理引擎横向对比
| 引擎 | 年份/机构 | 后端/坐标 | 并行范式 | 峰值吞吐(一手口径) | 可微 | 许可 |
|---|---|---|---|---|---|---|
| mujoco | 2021/DeepMind | 纯 C,广义坐标 + 凸可逆接触 | CPU 多线程 | ~40 万求值/s(18-DOF 人形,24 线程),5000× 实时 | 部分(逆动力学) | Apache-2.0 |
| isaac-gym | 2021/NVIDIA | PhysX,reduced-coord + TGS | 单卡数千–上万 env,GPU-resident | Ant ~700K FPS(8192 env),Shadow Hand 150K | 否(OSC 任务空间可微) | 闭源(已 deprecated→Isaac Lab) |
| brax | 2021/Google | JAX/XLA,maximal 坐标 + 弹簧约束 | vmap+pmap 跨 TPU | 单卡百万级,8×8 TPUv3 数亿 steps/s | 是(APG 解析梯度) | Apache-2.0 |
| mjx-mujoco-xla | 2023/DeepMind | JAX/XLA 重写 MuJoCo | 万级并行 env | TPU 百万级;A100 Newton 求解器 Humanoid 1.02M steps/s | 是(JAX 版)/否(Warp 版) | Apache-2.0 |
| warp | 2022/NVIDIA | Python→CUDA/C++ JIT + adjoint | GPU SIMT 线程网格 | 无自有 benchmark(“与原生 CUDA 相当”) | 是(源码变换 AD) | Apache-2.0 |
| madrona-engine | 2023/Stanford | ECS + 单 megakernel | 上万并行 world(列存+PGO) | HideSeek 190 万步/s(单 4090),11× vs 强 CPU | 否 | 开源 |
| genesis-physics-engine | 2024/学术协作 | Taichi 后端,6 套多物理求解器 | 大规模并行(未披露 env 数) | 单卡 4090 Franka 4300 万 FPS(官方宣称,无方法学) | 部分(MPM/Tool) | Apache-2.0 |
| newton-physics-engine | 2025/NV+DeepMind+Disney | Warp + MuJoCo-Warp,8 可插拔求解器 | 海量并行 world,GPU 批渲染 | MJWarp 人形 >70×、在手 100×(无统一表) | 是(Warp 路径) | Apache-2.0(Linux Foundation) |
| difftaichi | 2019/MIT | Taichi 可微编程语言 | 单/多核 | 可微弹性体比 TF 快 188× | 是(两尺度 AD) | 开源 |
贯穿的取舍:GPU 批量仿真只在成千上万并行世界时才赢,单场景反而慢(MJX 慢 10×);可微性与接触精度/吞吐互斥(MJX-Warp、Newton 都为性能放弃了 Warp 后端的自动微分);加速器对分支代码(broad-phase 碰撞、动态实体)不友好,高接触/多智能体场景吞吐下降快于 CPU(Madrona 的 megakernel + 列存 EnvID 正是为此设计)。
A.2 操作 benchmark 栈——把引擎包成可训练的任务
物理引擎只是底座,要做研究还得有机器人 + 传感器 + 任务 + 演示数据 + 评测协议。这条线由 UC San Diego 的 Hao Su 组主导,从 SAPIEN 起一脉相承。
sapien(CVPR 2020)的关键贡献是把仿真粒度从”场景-物体”推进到**“场景-物体-部件”:基于开源 PhysX 4.1 + ROS,配自建 PartNet-Mobility(2,346 铰接物体 / 14,068 可动部件 / 46 类,带运动轴与运动范围标注),单机单卡引擎 5000 Hz / 渲染 700 Hz。maniskill(NeurIPS 2021)第一次把它包成”物体级泛化”benchmark——4 个铰接任务、162 物体、用 RL 分治自动生成 36K 条演示(~1.5M 帧),证明单个 RL agent 无法跨大量物体从零学(10 物体成功率骤降到 2%)。maniskill2(ICLR 2023)扩到 20 任务族 / 2000+ 物体 / 4M+ 演示帧,做出首个双向耦合的刚体-MPM 软体仿真**(基于 Warp)与异步渲染服务器(单 GPU 16 进程 2000+ FPS),并首创闭环演示动作空间转换让 TAMP 演示跨控制器复用。maniskill3(RSS 2025)终于全 GPU 并行——单张 4090 同时仿真+渲染 RGB/深度/分割 30,000+ FPS、比其它平台快 10–1000× 省 2–3× 显存,独有异构 GPU 仿真(每个并行环境跑完全不同的物体/DOF),并托管 SIMPLER 做 real2sim 评测。
另外两个 benchmark 走”用生成式资产 + 合成数据倍增”的路:robocasa(2024,基于 MuJoCo/RoboSuite)造 120 个厨房、2,509 个(多数 text-to-3D 生成的)物体、100 个(含 LLM 生成的)任务,用 mimicgen 扩到 100K+ 轨迹,后被 NVIDIA GR00T 采用;roboverse(RSS 2025)则往元层走——MetaSim 把 IsaacSim/IsaacGym/MuJoCo/PyBullet/SAPIEN/CoppeliaSim/Genesis 七种仿真器统一到一套配置系统与 Handler API 下,聚合 15 个既有 benchmark 成 276 任务类别 / 510.5K 轨迹 / 5.5K 资产,定义 4 级泛化评测协议。
表 2 · 操作 benchmark / 任务栈对比
| 平台 | 年份 | 物理后端 | 任务规模 | 物体/资产 | 演示规模 | 峰值 FPS | 独有能力 |
|---|---|---|---|---|---|---|---|
| sapien | 2020 | PhysX 4.1 | 门/抽屉 2 类 | PartNet-Mobility 2346/14068 部件 | — | 引擎 5000 / 渲染 700 | 部件级铰接、同步/异步双模式 |
| maniskill | 2021 | SAPIEN | 4 任务 | 162 物体 | 36K 轨迹 / 1.5M 帧 | state 112 / 视觉 48 | RL 分治自动生成演示、三评测轨道 |
| maniskill2 | 2023 | SAPIEN + 自研 MPM | 20 任务族 | 2000+ 物体 | 4M+ 帧 | 2000+(渲染服务器) | 2-way 刚-软耦合、动作空间转换 |
| maniskill3 | 2024 | PhysX GPU + SAPIEN 光栅 | 12 类 / 40+ 技能 | 2000+ 物体、20+ 机器人 | millions of frames | 30,000+(单 4090) | 异构 GPU 仿真、SIMPLER real2sim |
| robocasa | 2024 | MuJoCo/RoboSuite | 100 任务(25+75 LLM) | 120 厨房 / 2509 物体 | 100K+(MimicGen 扩增) | — | 生成式资产、GR00T 采用 |
| roboverse | 2025 | 7 仿真器统一(MetaSim) | 276 任务类别 | 5.5K 资产 | 510.5K 轨迹 | 随底层仿真器 | simulator-agnostic、4 级泛化协议 |
A.3 场景/家务仿真——从”能走”到”能碰”再到”能社交”
与操作 benchmark 平行,另一支仿真做的是房间/场景级具身导航与家务,主要在 Meta FAIR(Habitat)与 AI2(THOR)两条谱系上演进。核心张力是渲染吞吐 vs 物理交互保真的权衡。
ai2-thor(2017,Unity)是最早把”可交互物体”(能开关、加热、打碎、接水)当一等公民的仿真环境,衍生出整个 THOR 家族。habitat(2019,Meta)走另一极端——极致渲染吞吐(单卡多进程 10,000+ FPS,比同期快 2–3 个数量级),但只做静态扫描场景”能走不能碰”,把 PointGoal 导航训到 75M 步。habitat-2(2021)补上刚体物理(ReplicaCAD 92 件可开合物件 + 深度 C++ 集成的 H2.0 引擎,8-GPU 节点 25,734 SPS、850× 实时),并得出”整体 RL 学不动长程家务、层级 RL 更强但有交接问题”的结论。habitat-3(2023)加入逼真人形 avatar(刚性骨架 + 蒙皮 + 离线缓存 SMPL-X,双 Spot 1345 FPS → 人形+机器人 1190 FPS,代价几乎为零)与人机回环(HITL)工具,研究社交导航/社交重排。
物理状态维度上,igibson-2(CoRL 2021)给 PyBullet 交互仿真器加扩展物理状态(温度/湿度/清洁度/开关/切片)+ 逻辑谓词系统,第一次让”做饭/清洁/浸泡”可研究,是 BEHAVIOR-1K/OmniGibson 的前身;threedworld-tdw(2020,MIT-IBM)在 Unity + PhysX + Flex 之上首次把物理驱动碰撞音效合成做进实时回路,追求感知/物理/声音/导航同一仿真器闭环。规模化维度上,procthor(NeurIPS 2022 最佳论文)在 AI2-THOR 上做程序化生成万级房屋(1 万套房、1,633 物体实例),仅用生成数据预训练简单 CNN+GRU 就登顶三个挑战赛。
这几个新平台大多不再自研引擎,而是跑在 NVIDIA isaac-sim 上——那是构建在 Omniverse/OpenUSD 之上的 RTX 光追 + PhysX 合成数据生成平台(2025-08 以 Apache-2.0 开源),也是整个 NVIDIA 机器人栈(Isaac Lab / GR00T)的仿真底座。grutopia(2024,上海 AI Lab)建 10 万+ 可交互场景 + LLM 驱动 NPC + 三级 GRBench;genie-sim(2025,AgiBot)把 LLM 场景生成 + 3DGS 重建 + VLM 自动打分 + 遥操采集串成流水线(5,140 资产 / 200+ 任务 / 10K+ 小时合成数据,R²=0.924 sim-to-real 一致性);metaurban(ICLR 2025,UCLA)专攻城市微出行,程序化生成无限街区 + 1,100 绑定人体 × 2,314 动作,跨”移动机器”本体评测。
表 3 · 场景/家务/城市仿真对比
| 平台 | 年份 | 引擎 | 物理 | 吞吐 | 核心贡献 |
|---|---|---|---|---|---|
| ai2-thor | 2017 | Unity3D | 状态触发式交互 | — | 可交互物体作一等公民、THOR 家族起点 |
| threedworld-tdw | 2020 | Unity+PhysX+Flex | 刚体+软体+流体 | — | 物理驱动碰撞音效、多模态闭环 |
| habitat | 2019 | Habitat-Sim | 静态扫描(无交互) | 10,000+ FPS | 极致渲染吞吐、导航基准范式 |
| habitat-2 | 2021 | H2.0(C++) | 刚体物理 | 单进程 1200 SPS,8-GPU 25,734 SPS | ReplicaCAD、Home Assistant Benchmark |
| habitat-3 | 2023 | Habitat-Sim | 刚体 + 人形 avatar | 人形+机器人 1190 FPS | SMPL-X avatar、社交任务、HITL |
| igibson-2 | 2021 | PyBullet | 刚体 + 扩展物理状态 | — | 温度/湿度/清洁度、逻辑谓词、VR |
| procthor | 2022 | AI2-THOR | 交互 + 机械臂操作 | — | 万级程序化房屋、NeurIPS 最佳论文 |
| grutopia | 2024 | isaac-sim | 刚体 | — | 10 万+ 场景、LLM NPC、GRBench |
| genie-sim | 2025 | isaac-sim | 刚体 | — | LLM/3DGS/VLM 流水线、R²=0.924 sim2real |
| metaurban | 2024 | 自研 | 刚体 + 动态人群 | — | 城市微出行、跨移动本体、ICLR spotlight |
辅助基础设施还有 curobo(NVIDIA 2023)——不是学习模型,而是 CUDA 加速的经典运动规划库,把碰撞无关运动生成表述为大规模并行全局优化,单次查询 ~50ms(比 Tesseract 快 60×),在 15W Jetson Orin 上可落地,为操作 pipeline 提供实时运动生成。
A.4 合成数据引擎——让仿真”自产”训练数据
仿真的终极价值是”凭空造数据”。这条线从 sim2real 的方法学根基开始,逐步进化到用大模型自动化整个数据生成回路。
根基:domain-randomization(OpenAI/Berkeley 2017)——在 MuJoCo 里用随机纹理/光照/相机/干扰物渲染几十万张低保真图,只用仿真数据、零真实微调就让 CNN 真机定位到 ~1.5cm。核心直觉”仿真里变化足够大,真实世界就只是又一种变化”成了几乎所有仿真训练机器人的默认底座。
演示倍增(sim 内几何变换):mimicgen(NVIDIA 2023)把 ~200 条人类演示切成物体中心子任务段、按新场景物体位姿做刚体变换 + 插值重放、只留成功轨迹,10 条人类演示 ≈ 200 条(50K+ 演示 / 18 任务);dexmimicgen(2024)把它从单臂平行爪扩展到双臂灵巧手/人形(引入并行/协同/顺序三类子任务机制,60 条源演示 → 21K 仿真演示,GR-1 Can Sorting 从 0%→90%)。
生成式仿真(LLM 造任务/场景/奖励):robogen(ICML 2024,正式提出”Generative Simulation”范式名)用 GPT-4 驱动”提议任务→检索/生成资产→选算法→生成奖励→学技能”的可无限查询流水线,自动化”造仿真环境需大量人力”这一瓶颈。
用生成式基础模型补数据(不采新真机轨迹):rosie-scaling-robot-learning(Google 2023)把 rt-1(Everyday Robots 遥操)的 13 万演示喂给 OWL-ViT + Imagen Editor inpainting,凭文生图先验”凭空”造出策略没见过的物体/背景;autort(DeepMind 2024)用 VLM 描述场景 + LLM 生成任务 + LLM 自我批判(“机器人宪法”)驱动 20+ 台车队自主采集,7 个月 77K episode / 6650 指令;dreamgen-groot-dreams(NVIDIA 2025)把图生视频世界模型(WAN2.1/Cosmos)微调到目标本体、“造梦”出全新行为视频,再用 IDM/潜动作模型反标注出”神经轨迹”伪动作,仅凭单环境抓放数据学会 22 个新动词、迁移到 10 个新环境。
表 4 · 合成/生成数据引擎对比
| 方法 | 年份 | 数据来源 | 机制 | 倍增/产出(一手数字) |
|---|---|---|---|---|
| domain-randomization | 2017 | 纯仿真渲染 | 随机纹理/光照/相机 | 零真实数据 → 真机定位 ~1.5cm |
| mimicgen | 2023 | ~200 人类演示 | 物体中心子任务刚体变换重放 | 10 演示 → 1000;50K+ / 18 任务 |
| dexmimicgen | 2024 | 60 人类演示 | 双臂灵巧手三类子任务机制 | 60 → 21K 仿真;GR-1 0%→90% |
| robogen | 2023 | LLM 生成 | GPT-4 提议任务+资产+奖励 | 无限自动化流水线(Generative Simulation) |
| rosie-scaling-robot-learning | 2023 | RT-1 13 万演示 | OWL-ViT + Imagen inpainting | 合成新物体/背景,无新真机轨迹 |
| autort | 2024 | 车队自采 | VLM+LLM+机器人宪法 | 7 月 / 77K episode / 6650 指令 |
| dreamgen-groot-dreams | 2025 | 单环境遥操 | 视频世界模型造梦 + IDM 伪标注 | 22 新动词 / 10 新环境 |
Part B · 数据飞轮:把真实世界(和人)转成数据
B.1 真机遥操作数据集——从单机到百万级众包
真机数据不能爬,只能采。这条线是整个数据飞轮的主干,逻辑与 CV/NLP 的”大而多样催生泛化”一脉相承,主旋律是规模、多样性、跨机构标准化三者的持续扩张。
跨本体的第一次试探:robonet(2019)把 4 机构 7 平台自主随机采的 ~16.2 万轨迹(~1500 万帧)汇入统一末端动作空间,最早系统研究”跨本体预训练能否正迁移”。低成本可复现路线:bridge-data-original(2021)用 $2900 WidowX250 采 7,200 演示 / 71 任务,验证”结构相近的联合训练把成功率提约 2 倍”;bridgedata-v2(2023)扩到 60,096 轨迹 / 24 环境 / 13 技能 / 100+ 物体,首次做跨机构零样本评测(Lab1→Lab2 仍非零成功率),并证明技能多样性本身(而非单纯数据量)带来泛化(固定 27K 轨迹,3 技能 vs 13 技能,未见任务 0.30→0.65)。
聚合与统一格式的里程碑:open-x-embodiment(Google DeepMind + 34 实验室,ICRA 2024 最佳论文)把 60 个现成数据集汇成统一 RLDS——1M+ 轨迹 / 22 本体 / 527 技能 / 160266 任务,用 RT-1-X / RT-2-X 证明”不做任何跨本体对齐、只把数据池化共训”就产生正向迁移(小数据域 +50%、RT-2-X 涌现技能 ~3×),并揭示容量是迁移的闸门(只有 55B 的 RT-2-X 在数据充裕域也吃到红利)。它成了此后 Octo/OpenVLA/π0 等几乎所有通用策略的预训练底座与横向评测基准。
场景多样性取胜:droid(Stanford/Berkeley/TRI + 13 实验室,2024)用**统一硬件(18 台同款 Franka + Robotiq + 3 路 Zed 立体相机)**在 3 大洲 52 栋楼采 12 个月——76K 轨迹 / 350 小时 / 564 场景 / 86 任务 / 1417 相机视角,场景多样性比前作大一个数量级,简单 50/50 co-training 就把成功率与 OOD 鲁棒性抬高约 20%。
中国机构的规模化与质量化:rh20t(上海交大 2023)用力反馈遥操采 11 万+ 接触丰富序列(配对人类视频),同步录 RGB-D / 双目红外 / 6-DoF 力矩 / 触觉 / 音频,首个同时具备”人类配对+接触+深度+标定+力觉”五属性;robomind(2024)在统一平台采 107K 轨迹 / 305.5 小时 / 4 本体 / 479 任务,附 5K 失败轨迹 + 10K 帧级语言标注 + Isaac Sim 数字孪生;ario-all-robots-in-one(2024)定义一套数据标准把真机/仿真/开源三路缝进同一格式,聚出 ~3M episode / 五模态;agibot-world-colosseo(智元 2025,IROS)把真机推到极致——100+ 台同构人形 G1 在 4000㎡ 五大真实场景采 1,003,672 轨迹 / 2976 小时 / 217 任务,配人工在环质检与失败恢复数据,并提出 GO-1 / ViLLA(潜动作打通 VLM 与底层控制),喊出”ImageNet 时刻”。此外 roboagent-mt-act(CMU/Meta 2023)用 7,500 轨迹 + 语义数据增强训 MT-ACT,同步开源当时最大商用硬件数据集之一 RoboSet;roboturk(2018)则是这条线的史前史——iPhone ARKit + WebRTC 让众包工人远程遥操 Sawyer,22 小时采 2218 条成功演示。
表 5 · 真机遥操作数据集对比
| 数据集 | 年份 | 本体 | 轨迹数 | 时长/规模 | 任务/技能 | 场景 | 关键特色 |
|---|---|---|---|---|---|---|---|
| roboturk | 2018 | Sawyer(仿真) | 2218 成功 | 137.5 小时 | — | — | iPhone 众包遥操先驱 |
| robonet | 2019 | 7 平台 | ~162K | ~1500 万帧 | — | 4 机构 | 首个跨本体正迁移研究 |
| bridge-data-original | 2021 | WidowX250 | 7,200 | — | 71 任务 | 10 | $2900 低成本、联合训练 2× |
| bridgedata-v2 | 2023 | WidowX250 | 60,096 | — | 13 技能 | 24 | 跨机构零样本、技能多样性消融 |
| rh20t | 2023 | 7 配置 | 110K+ | 配对人类视频 | 147 任务/42 技能 | — | 力矩+触觉+音频、接触丰富 |
| open-x-embodiment | 2023 | 22 | 1M+ | 60 数据集聚合 | 527 技能/160266 任务 | ~300 | 统一 RLDS、RT-X 正迁移 |
| droid | 2024 | Franka×18 | 76K | 350 小时 | 86 任务 | 564 | 统一硬件、3 大洲 52 楼、场景多样 |
| robomind | 2024 | 4 本体 | 107K | 305.5 小时 | 479 任务/38 技能 | — | 失败+帧级标注、数字孪生 |
| ario-all-robots-in-one | 2024 | 多本体 | ~3M episode | 258 系列 | 321K 任务 | — | 数据标准、五模态 |
| agibot-world-colosseo | 2025 | 人形 G1×100+ | 1,003,672 | 2976 小时 | 217 任务/87 技能 | 106 | 人工在环质检、GO-1/ViLLA |
B.2 遥操作硬件——降成本、加沉浸、扩自由度
数据集背后是采集硬件。这条线的目标是让”每小时能采多少高质量演示”越来越高,三个演进方向:降成本、加沉浸感/精度、从单臂扩到双臂/全身/灵巧手。
低成本 leader-follower 路线:aloha-act(Stanford 2023)用两对现成 Trossen 臂(小臂 leader、大臂 follower)+ 3D 打印件搭出 <$2 万的双臂遥操平台,配 80M 参数的 **ACT(Action Chunking with Transformers)**策略——“预测下 k 步动作块” + CVAE 建模演示多模态,每任务 50 条演示就做到 80-90%。ACT 的动作分块后来成了 π0/OpenVLA 一代 VLA 的标配。gello(Berkeley 2023)更极致——3D 打印一个按 DH 参数缩放的”迷你复刻臂”当 leader(廉价舵机做编码器),单套 <$300,用户直接掰关节即可,用户研究成功率 0.92(vs 3D 鼠标 0.63、VR 手柄 0.72)。
沉浸式视觉路线:anyteleop(NVIDIA/UCSD 2023)做纯摄像头、机器人无关的通用视觉遥操,一套系统支持任意臂-手组合;open-television(UCSD/MIT 2024)给机器人头装可主动转动的立体相机、把双目视频流回 VR 头显,操作者”魂穿”进机器人、全链路 60Hz、跨美国东西海岸 3000 英里遥操;bunny-visionpro(2024)用 Apple Vision Pro 做双臂灵巧手遥操 + ERM 触觉反馈,全跑在单颗消费级 CPU。
移动/全身路线:mobile-aloha(Stanford 2024)把 ALOHA 装到可背驱移动底盘,$3.2 万、全身 16-DoF 同时遥操,配 50/50 co-training(825 条静态 ALOHA 演示)把复杂长程任务训到 >80%(co-train +34%);humanplus(Stanford 2024)走”从人学”——40 小时 AMASS 数据在仿真 RL 训全身低层策略,真机后操作者用单台 RGB 相机实时估计全身姿态”影随”操控 33-DoF 人形;twist2(Stanford/Amazon 2025)用消费级 PICO 4 Ultra + $250 自研 2-DoF 颈部模块做免动捕全身遥操(PICO 设置 ~1 分钟);ace-f-foldable-teleop(UCSD 2025)做可折叠跨本体系统,不加任何力传感器——纯靠”目标位姿-实际位姿”偏差推算虚拟力渲染回 leader,让操作者”摸到”接触力。
表 6 · 遥操作硬件对比
| 系统 | 年份 | 成本/设备 | 采集模态 | 自由度/本体 | 关键创新 |
|---|---|---|---|---|---|
| roboturk | 2018 | iPhone(ARKit) | WebRTC 视频流 | 单臂 Sawyer | 众包遥操、与 VR 无显著差异 |
| aloha-act | 2023 | <$2 万,Trossen×2 | RGB | 双臂 | leader-follower、ACT 动作分块 |
| gello | 2023 | <$300,3D 打印 | RGB | 单/双臂(UR5/xArm/Franka) | 运动学缩放复刻臂、掰关节即用 |
| anyteleop | 2023 | 纯摄像头 | 视觉 | 任意臂-手组合 | 机器人无关、多操作者协作 |
| open-television | 2024 | VR 头显 | 主动立体视觉 | 双臂灵巧手/人形 | 60Hz、3000 英里远程、主动视觉 |
| bunny-visionpro | 2024 | Apple Vision Pro | 手/腕位姿 + ERM 触觉 | 双臂灵巧手 | 单 CPU、loop joint 实时求解 |
| mobile-aloha | 2024 | $3.2 万 | RGB | 全身 16-DoF 移动双臂 | 移动底盘、50/50 co-train +34% |
| humanplus | 2024 | 单 RGB 相机 | 全身姿态影随 | 33-DoF 人形 | AMASS 训低层、单相机 shadowing |
| twist2 | 2025 | PICO 4 Ultra + $250 颈 | VR + 脚踝追踪 | 全身人形 G1 | 免动捕、第一人称视觉 |
| ace-f-foldable-teleop | 2025 | 可折叠 leader | IMU+手套 | 跨本体 | 无力传感器的虚拟力反馈 |
B.3 免机器人采集——UMI 家族的”不用机器人采机器人数据”
遥操作再便宜,也要机器人在场、要人训练。UMI 家族把这个约束彻底去掉:用手持采集器直接把野外人手演示变成可训练的机器人动作,采集速度和场景多样性因此解锁。
universal-manipulation-interface(Stanford/Columbia/TRI 2024,RSS 最佳系统论文入围)是这条线的原型——一把 780g、3D 打印、只装一台 GoPro 的手持平行夹爪(鱼眼 + 侧镜 + IMU-视觉 SLAM + 连续夹爪追踪),策略侧用推理期延迟匹配 + 相对轨迹动作表示 + Diffusion Policy,一份手持数据零样本部署到 UR5/Franka/ARX 三种本体,野外数据训出的策略对新环境/物体有 ~70% 零样本泛化。衍生工作沿三个方向扩展:umi-on-legs(2024)把桌面策略”装”到四足狗上——高层扩散策略只在任务坐标系里预测末端轨迹、底层纯仿真 RL 训的全身控制器跟踪,两者只靠”末端轨迹”握手;dexumi(Columbia/Stanford 2025,CoRL best paper finalist)从平行夹爪扩到多指灵巧手——给人手戴逐款优化的外骨骼读关节角、复刻同款触觉,再用”分割-修复-重渲染”把画面里人手换成机器人手像素;mv-umi(NYU 2025)加一路第三人称俯视相机 + SAM-2 分割补上手腕相机看不到的场景语境(大场景任务 +47%);vitamin-visuo-tactile-interface(清华/Berkeley 2025)把 UMI 升级为视觉-触觉双模态(Fin Ray 软夹爪内嵌摄像头),配”用触觉预测未来画面”的对比预训练做接触密集任务。
相邻的 dexcap(Stanford 2024)不是手持而是背包式 mocap(3.96 磅:EMF 手套测指关节 + SLAM 相机测手腕 6-DoF + 胸前 RGB-D LiDAR 测场景),配 DexIL(指尖 IK 重定向 + 点云 Diffusion Policy),让人不穿戴机器人、不遥操作就在野外直接采灵巧操作数据。
表 7 · 免机器人 / 手持采集对比
| 系统 | 年份 | 采集器形态 | 传感 | 本体扩展 | 关键机制 |
|---|---|---|---|---|---|
| universal-manipulation-interface | 2024 | 780g 手持平行夹爪 | GoPro + IMU-SLAM | UR5/Franka/ARX | 延迟匹配 + 相对轨迹 + Diffusion Policy |
| umi-on-legs | 2024 | UMI + 四足 | 相机 | 四足移动操作 | 任务坐标系末端轨迹握手 + 仿真 RL WBC |
| dexumi | 2025 | 灵巧手外骨骼 | 编码器 + 触觉阵列 | 多指灵巧手 | 视频 inpainting 换手像素 |
| mv-umi | 2025 | UMI + 俯视相机 | 手腕 + 第三人称 | 平行/三爪 | SAM-2 分割补场景语境 +47% |
| vitamin-visuo-tactile-interface | 2025 | Fin Ray 视触觉夹爪 | 内嵌摄像头触觉 | 软体夹爪 | 触觉预测未来帧对比预训练 |
| dexcap | 2024 | 3.96 磅背包 mocap | EMF 手套 + SLAM + RGB-D LiDAR | 双臂 LEAP 灵巧手 | DexIL:指尖 IK + 点云 Diffusion Policy |
B.4 人类第一视角视频——最”被动可扩展”的数据源
人类每天都在做操作,只要戴个相机就能被动采集——这是理论上最可扩展的数据源,代价是没有动作标签、有 embodiment gap。这条线分三层:底层视频语料、把人类动作转成机器人动作、以及把视频炼成视觉表征。
基础语料:ego4d(Meta + 13 大学 2021)产出 3,670 小时 / 931 佩戴者 / 74 城市 / 9 国家第一人称视频 + 五大 benchmark,是把”人类第一视角”做成研究基础设施的奠基之作;ego-exo4d(Meta + Aria + 15 大学 2023)加上第一+第三人称同步(740 名专家、5,035 takes / 1,286.3 小时、Aria 眼镜 + 4-5 台 GoPro),配首创的”专家点评”标注;egodex(Apple 2025)用 Apple Vision Pro 采当时最大人类灵巧操作数据集——829 小时 / 194 任务 / 338K 演示 / 90M 帧,配采集时同步产生的 3D 双手骨骼(每手 25 关节),主张”第一视角视频 + 配对 3D 手姿”这条被动可扩展的第三条路。
人类动作 → 机器人动作:egomimic(Georgia Tech 2025,ICRA)用 Aria 眼镜采人类视频 + 3D 手轨迹,把它当作与遥操作数据平等的训练源(硬件对齐 + 跨域对齐 + ACT 共享编码器),“多 1 小时人类数据比多 1 小时机器人数据更值钱”;humanoid-policy-human-policy-ph2d(UCSD/CMU 2025)建 302 万人类帧 + 66.8 万 H1 机器人帧的配对数据集 PH²D,用可微运动学重定向把人和人形统一到 54 维手腕-指尖空间联合训练 HAT;in-n-on-human0(UCSD 2025)把人类数据分”野生 in-the-wild”(1000+ 小时预训练)和”任务对齐 on-task”(20+ 小时后训练),训出的 flow matching 策略 Human0 涌现零样本语言跟随。此外 track2act(CMU/UW/Meta,ECCV 2024)用 ~40 万段网络视频训点跟踪扩散模型、把预测的 2D 点轨迹解算成 3D 刚体变换得开环动作,再用 ~400 条本体专属数据训小残差策略修正,实现零样本操作。
视频 → 视觉表征(冻结编码器喂给策略):r3m(Stanford/Meta 2022)在 Ego4D 3500+ 小时上用时间对比 + 视频语言对齐训冻结 ResNet,真机 20 条演示达 56%(vs CLIP 24%);mvp-masked-visual-pretraining(Berkeley 2022)用 MAE 在 450 万图上训 307M 编码器,981 次真机试验证明”模型与数据必须同步放大”;vc-1-cortexbench(Meta 2023)建 CortexBench(17 任务 7 基准)系统评测,发现无一”通吃”,遂用 MAE 在 4000+ 小时 / 562 万帧上训 VC-1(ViT-L 307M,冻结特征均值 68.7,超 MVP/R3M/CLIP),耗逾 1 万 GPU-小时。
表 8 · 人类视频数据源与表征对比
| 工作 | 年份 | 类型 | 规模(一手数字) | 用途 |
|---|---|---|---|---|
| ego4d | 2021 | 语料 | 3670 小时 / 931 人 / 9 国 | 五大 benchmark、human-video 预训练主力源 |
| ego-exo4d | 2023 | 语料 | 5035 takes / 1286 小时 / 740 专家 | ego-exo 同步、专家点评标注 |
| egodex | 2025 | 语料 + 3D 手姿 | 829 小时 / 338K 演示 / 90M 帧 | 被动可扩展、配对手部骨骼 |
| egomimic | 2025 | 人→机器人 | Aria 眼镜采集 | 人类数据与机器人数据平等训练(+34-228%) |
| humanoid-policy-human-policy-ph2d | 2025 | 人→机器人 | 302 万人类帧 + 66.8 万 H1 帧 | 54 维统一空间、HAT 联合训练 |
| in-n-on-human0 | 2025 | 人→机器人 | 1000+ 小时野生 + 20+ 小时任务 | 野生预训练 + 任务后训练、Human0 |
| track2act | 2024 | 视频→动作 | ~40 万网络视频 | 点跟踪 → 3D 变换 → 零样本操作 |
| r3m | 2022 | 视频→表征 | Ego4D 3500+ 小时 | 冻结 ResNet,20 演示 56% |
| mvp-masked-visual-pretraining | 2022 | 视频→表征 | 450 万图 / 307M 参数 | MAE 预训练、981 真机试验 |
| vc-1-cortexbench | 2023 | 视频→表征 | 4000+ 小时 / 562 万帧 | CortexBench、VC-1 68.7、1 万+ GPU-h |
Part C · 两条引擎的交汇
仿真和真实数据不是二选一。整个领域最有价值的结论恰恰出在两者的接口上。
co-training 是把两条数据流缝起来的默认配方。DROID 的核心实验是简单 50/50 混合(一半 in-domain 演示 + 一半完整 DROID),比只用 in-domain 或用 OXE 混合平均高约 20%;Mobile ALOHA 把新移动数据和 825 条静态 ALOHA 演示各按 50% 概率混采,平均 +34%;AgiBot World 用 RDT 做探针证明在 AgiBot 上预训练比在 OXE 上预训练 in-distribution +0.30。方法学上,OXE 揭示了一个反直觉的事实:不需要任何弥合 embodiment gap 的专门机制,直接把异构数据池化共训就有正迁移——前提是模型容量足够大。
“多样性 > 数量”是这条线最重要的经验律。data-scaling-laws-imitation(清华 2024,ICLR Oral)用 UMI 采 4 万+ 演示、跑 1.5 万+ 真机 rollout,发现泛化能力与物体数、环境数、环境-物体对数呈幂律(r=-0.98),而与每个环境/物体采多少条演示几乎无关,给出可照抄的配方——“在 32 个环境各放 1 个不同物体、每个采 50 条演示”就能对完全没见过的环境/物体零样本 ~90%。BridgeData V2 的技能多样性消融(3 技能 vs 13 技能、固定数据量、0.30→0.65)与 AgiBot World 的数据 scaling(9.2k→1M 轨迹幂律 r=0.97)都指向同一结论。
sim-to-real 的可信度正在从”定性演示”走向”定量相关”。早期 sim2real 靠 domain-randomization 的暴力随机化;如今领域普遍用仿真评测与真机 rollout 的相关系数衡量仿真价值:maniskill3 的 SIMPLER real2sim 相关系数 0.9284、MMRV 0.0147;genie-sim R²=0.924;Genesis World 1.0(genesis-physics-engine 商业重写版)Pearson 0.8996。而 mujoco-playground(MJX + Madrona,RSS 2025 最佳 demo)把这条线推到”完全开源栈也能真机零样本”——不到 8 周把状态与视觉策略部署到 6 个真实平台(Go1 平地 <5 min 训练、Franka 视觉 pick-cube 真机 12/12),且视觉 RL 借 Madrona 批渲染直接从像素端到端训练、不需要 teacher-student 蒸馏。
real-to-sim 让真实世界反哺仿真。数字孪生(RoboMIND 的 Isaac Sim 孪生、ManiSkill3 的 SIMPLER 移植、Genesis 的 NuRec、Isaac Sim 的 3DGUT 神经重建)把真实场景重建进仿真做快速可复现评测——SIMPLER 数字孪生能 60×–100× 真实世界速度、bit-exact 可复现地评测 Octo,把”数万 episode 一整轮评测从真机 200+ 小时压到仿真 <0.5 小时”。
共通设计模式
横看这 74 个工作,几条设计模式反复出现:
-
消除跨设备/跨介质的搬运延迟。仿真侧是”物理与训练同芯片”(Isaac Gym 的 direct-GPU API、Brax/MJX 的全程 JIT、Madrona 的零拷贝张量导出);数据侧是”手持采集器直接产机器人动作”(UMI 免去遥操作与真机在场)——本质都是把中间的转换/搬运环节压掉。
-
统一抽象层收编碎片化后端。物理引擎用统一数据结构支持可插拔求解器(Newton 的
Model/State/Control+ 8 求解器、Brax v2 四管线、MJX-JAX/Warp 双后端);benchmark 用 simulator-agnostic 配置收编多个仿真器(RoboVerse 的 MetaSim 统一 7 个);数据用统一格式收编异构来源(OXE 的 RLDS、ARIO 的数据标准、LeRobot)。 -
粗对齐而非精对齐。OXE 只把动作粗对齐成 7 维末端向量、坐标系不跨数据集对齐(同一向量在不同机器人上诱发不同运动),却仍产生正迁移;DROID 用统一硬件回避对齐问题。经验是:规模和多样性带来的收益,大于精确对齐的收益。
-
少量真数据 + 自动倍增。MimicGen(10→1000)、DexMimicGen(60→21K)、ManiSkill3(~10 遥操 → RFCL/RLPD → 海量 rollout)、DreamGen(单环境 → 22 动词)都是”少量高质量种子 + 引擎倍增”,把人力从”采集每条轨迹”挪到”采集种子 + 设计倍增机制”。
-
可微是一条始终在场但从未免费的支线。DiffTaichi/Warp/Brax/Genesis 都押注可微仿真(解析策略梯度、系统辨识),但可微性与接触精度/吞吐反复冲突——MJX-Warp、Newton 的主后端都为性能放弃了自动微分。可微仿真至今是”有潜力但难驯服”的方向。
-
人工在环质检成为一等目标。规模到百万级后,数据质量比数量更关键——AgiBot World 的”采一批→训→评→回改协议”闭环证明 528 条人工核验数据 > 482 条未核验数据(+0.18),把质检从事后清洗提升为采集回路的组成部分。
走向何方
-
仿真引擎在收口与融合。Newton 把 NVIDIA / DeepMind / Disney 的 GPU 物理阵营收进 Linux Foundation 中立治理,MJX 吸收了 Brax 的物理管线,Isaac Sim 5.0 开源、Isaac Lab 预告接入 Newton——分裂多年的”每家一套 GPU 物理”正在归并到少数几个可互操作的底座上,OpenUSD 成为共享资产层的事实标准。
-
数据从”堆规模”转向”堆质量与多样性 + 合成倍增”。真机数据集已到百万级(AgiBot World),但 scaling law 反复证明多样性 > 数量;未来增量更可能来自**免机器人采集(UMI 家族)+ 人类视频(被动可扩展)+ 生成式倍增(DreamGen/世界模型)**这三条”边际成本更低”的路,而非继续堆遥操作工时。
-
sim 与 real 的边界在模糊。co-training 成默认、real2sim 数字孪生做评测、生成式世界模型(Cosmos/WAN → DreamGen)直接”造”训练视频——“仿真数据”与”真实数据”正在合成一条连续谱,评价标准从”像不像真”转向”仿真评测与真机 rollout 的相关系数”。
-
未解的硬骨头:高精度接触密集装配(ManiSkill2 的 3mm/0.5mm 插孔任务 RL/IL 成功率仍接近 0)、可微仿真的驯服、对全新未见本体的泛化(OXE 明言未研究)、以及”何时会/不会发生正向迁移”的理论判据(至今仍是经验观察)——这些是下一代仿真与数据基础设施要啃的。
一句话收束:具身智能没有可以爬的互联网,于是它自己造了两台引擎——一台把 GPU 算力炼成数据,一台把真实世界和人炼成数据。过去五年这两台引擎各自完成了”加速器原生”与”跨机构规模化”的革命,而下一个五年的主战场,是它们在 co-training、sim-to-real、生成式倍增上的合流。