为什么把「仿真」和「数据」放在一页写

视觉靠爬网页、语言靠爬网页,机器人操作却没有一个可以爬的互联网——动作标签(关节角、末端位姿、夹爪开合)不存在于任何网页里,只能被采集仿真出来。于是整个具身智能领域的底层基础设施,本质上是两台把别的东西转成「带动作标签的轨迹」的引擎

  • 仿真引擎:把 GPU 算力转成数据。物理引擎 + 渲染器让成千上万个并行世界在一块芯片上跑起来,再叠一层 RL / 生成式管线,就能”凭空”造出策略需要的经验。这条线的主旋律是加速器原生(accelerator-native)——把仿真从 CPU 搬到与训练同一块 GPU/TPU 上。
  • 数据飞轮:把真实世界(和人)转成数据。遥操作硬件、免机器人手持采集器、人类第一视角视频、以及”用少量真数据倍增出大量合成数据”的各种引擎,共同构成一条越转越快的采集-训练-再采集回路。

这两台引擎不是对立的,而是在 co-training、sim-to-real、real-to-sim 上反复交汇。本页把 embodied 分类里 sim-infradata 两大类的全部工作(74 个页面)拉到一起,按子范式分组,给出谱系时间线、逐组的横向对比表(抠具体数字)、共通设计模式,以及这个大家族正在往哪走。

阅读地图:Part A 讲仿真(物理引擎 → 操作 benchmark → 场景/家务仿真 → 合成数据引擎),Part B 讲数据飞轮(真机遥操作数据集 → 遥操作硬件 → 免机器人采集 → 人类视频 → 视觉表征),Part C 讲两条线的交汇(sim-vs-real、co-training、scaling law)。相关的策略侧工作(VLA、diffusion policy、RT/π0/GR00T 等)不在本页,见各自条目与其它 deep-dive。


谱系时间线(2017 → 2026)

年份仿真侧关键节点数据侧关键节点
2017ai2-thor(Unity 交互场景)· domain-randomization(sim2real 底座)
2018–19difftaichi(可微编程语言)· habitat(10K+ FPS 导航)roboturk(iPhone 众包遥操)· robonet(跨本体 16 万轨迹)
2020sapien(部件级 PhysX)· threedworld-tdw(多模态+碰撞音)
2021isaac-gym(GPU-resident RL)· brax(JAX/TPU 可微)· mujoco 开源 · maniskill · habitat-2 · igibson-2bridge-data-original · ego4d(3670 小时人类视频)
2022warp(Python→CUDA JIT)· procthor(万级程序化房屋)r3m · mvp-masked-visual-pretraining(human-video 预训练)
2023isaac-lab-orbit(统一学习框架)· mjx-mujoco-xla(MuJoCo 上 GPU)· madrona-engine(ECS 批量仿真)· maniskill2 · habitat-3 · curoboopen-x-embodiment(60 数据集聚合)· droid 前身 · bridgedata-v2 · rh20t · aloha-act · gello · anyteleop · ego-exo4d · mimicgen · robogen · vc-1-cortexbench · rosie-scaling-robot-learning · roboagent-mt-act
2024genesis-physics-engine(多物理+生成式)· maniskill3(30K+ FPS)· robocasa · grutopia · metaurbandroid(564 场景)· robomind · ario-all-robots-in-one · universal-manipulation-interface · mobile-aloha · open-television · bunny-visionpro · humanplus · dexcap · egomimic · dexmimicgen · autort · data-scaling-laws-imitation · track2act
2025newton-physics-engine(跨厂商联合)· mujoco-playground(MJX+Madrona 真机零样本)· roboverse(7 仿真器统一)· genie-simagibot-world-colosseo(100 万轨迹)· egodex(829 小时)· twist2 · ace-f-foldable-teleop · dexumi · mv-umi · vitamin-visuo-tactile-interface · humanoid-policy-human-policy-ph2d · in-n-on-human0 · dreamgen-groot-dreams

一条清晰的技术主线贯穿始终:2017–2020 是 CPU 仿真 + 单实验室采集2021 是分水岭——Isaac Gym / Brax 把物理搬上加速器,Ego4D 把人类视频做成基础设施;2022–2024 两条线各自规模化——仿真从”专用引擎”走向”通用可微多物理栈”,数据从”单机采集”走向”跨机构众包 + 免机器人 + 合成倍增”;2025–2026 走向融合与治理——Newton 把分裂的 GPU 物理阵营收进 Linux Foundation,MuJoCo Playground 把开源仿真做到真机零样本,AgiBot World 把真机数据推到百万级。


Part A · 仿真引擎:把算力转成数据

A.1 物理引擎谱系——一场”加速器原生”革命

整条物理引擎线的驱动力只有一个命题:消除 CPU 物理引擎↔GPU 训练器之间的数据搬运延迟。谁能把”环境仿真”和”策略优化”编译到同一块芯片上、批量跑成千上万个并行世界,谁就能把 RL 训练从需要 CPU 集群压进单卡分钟级。

起点:CPU 时代的事实标准。 mujoco(Todorov IROS 2012,DeepMind 2021 收购、2022 Apache-2.0 全量开源)用广义(关节)坐标 + 凸可逆接触模型解决了游戏引擎(笛卡尔坐标 + LCP 数值约束)与传统关节引擎(忽略接触)的两难,论文实测单台 12 核机对 18-DOF 人形跑到 ~40 万求值/秒、约 5000× 实时。它是运动控制与灵巧操作研究的事实底座,但纯 CPU——正是它要被”搬上加速器”。

2021 分水岭:GPU-resident 与 accelerator-native 同时诞生。 isaac-gym(NVIDIA,NeurIPS 2021)把 PhysX 整块搬进 GPU,新增 direct-GPU tensor API 让 rollout 的观测/奖励/动作 buffer 全程不回 CPU,单块 A100 并行几千到上万环境:Ant 20 秒、Humanoid 4 分钟、ANYmal 2 分钟、Shadow Hand 转方块 35 分钟学会——相对”CPU 仿真 + GPU 训练”提速 2–3 个数量级(复现 OpenAI 灵巧手:30 小时 / 6144 CPU 核 + 8×V100 → 单卡 <1 小时)。同年 brax(Google,JAX/XLA)走另一条路——全程 JIT + 可微 + 跨 TPU 拓扑,用 maximal 坐标 + 辛积分,单卡百万级 steps/s、8×8 TPUv3 数亿 steps/s,且引擎可微、打包进免费 Colab。两者一起把”数千并行环境 + 单卡分钟级”钉成 RL 默认范式。

MuJoCo 阵营的应答与合流。 mjx-mujoco-xla(DeepMind 2023,随 MuJoCo v3.0)用 JAX 重写 MuJoCo,官方口径”TPU 上百万级步/秒”,并事实上吸收取代了 Brax 自己的 generalized 物理管线(Brax 现依赖 mujoco-mjx)。MJX 的代价很典型:单场景比 CPU MuJoCo 慢 10×,只有批量到成千上万并行才划算;高接触场景吞吐下降快于 CPU——这些痛点严重到 DeepMind 在 2025-08 又基于 Warp 做了个 MJX-Warp 后端(放弃自动微分换性能)。

编译器层与批量仿真的两条侧翼。 warp(NVIDIA 2022,Miles Macklin)把普通 Python 函数 JIT 成 CUDA kernel、并自动生成反向 adjoint kernel 做可微仿真,是”Python 生产力 vs CUDA 性能”空隙的填补者,血脉接 difftaichi(MIT 2019,两尺度自动微分、3 小时写 10 个可微仿真器、比 TF 快 188×);Warp 现已被 122+ 篇论文引用,是后续几乎所有 NVIDIA 仿真栈的底座。madrona-engine(Stanford/GT 2023)则从另一个角度切入——把游戏业界的 ECS(实体-组件-系统)架构完整搬上 GPU,编译进单个 CUDA megakernel 批量跑上万世界,让人能”像写游戏一样写新环境”而不必为每个任务重造仿真器(OpenAI Hide-and-Seek 单张 4090 跑到 190 万步/秒,比强 CPU 基线快 11×)。

2024–2025 的两个野心与一次收口。 genesis-physics-engine(2024-12,20+ 机构学术协作)把刚体 / MPM / SPH / FEM / PBD / 流体六套求解器 + 光追 + 生成式数据引擎全塞进一个 100% Python 栈,官方宣称单张 4090 模拟 Franka 4300 万 FPS(43 万倍实时)、比 Isaac Gym 快 10–80×——但发布时无技术报告、无可复现 benchmark,这些声明在 apples-to-apples 上被社区(含 NVIDIA 研究者)质疑,是它作为 landmark 最大的争议点。newton-physics-engine(2025-03,NVIDIA + Google DeepMind + Disney,Linux Foundation 托管)则是对整个分裂的 GPU 物理阵营的收口:以 Warp 为底座、DeepMind 新开源的 MuJoCo-Warp 为主后端,8 种可插拔求解器共享 Model/State/Control、支持多物理耦合与可微,向 Isaac Lab(PyTorch)和 MuJoCo Playground(JAX)双栈供能(MJWarp 人形仿真 >70×、在手操作 100× 加速)。

表 1 · 物理引擎横向对比

引擎年份/机构后端/坐标并行范式峰值吞吐(一手口径)可微许可
mujoco2021/DeepMind纯 C,广义坐标 + 凸可逆接触CPU 多线程~40 万求值/s(18-DOF 人形,24 线程),5000× 实时部分(逆动力学)Apache-2.0
isaac-gym2021/NVIDIAPhysX,reduced-coord + TGS单卡数千–上万 env,GPU-residentAnt ~700K FPS(8192 env),Shadow Hand 150K否(OSC 任务空间可微)闭源(已 deprecated→Isaac Lab)
brax2021/GoogleJAX/XLA,maximal 坐标 + 弹簧约束vmap+pmap 跨 TPU单卡百万级,8×8 TPUv3 数亿 steps/s(APG 解析梯度)Apache-2.0
mjx-mujoco-xla2023/DeepMindJAX/XLA 重写 MuJoCo万级并行 envTPU 百万级;A100 Newton 求解器 Humanoid 1.02M steps/s是(JAX 版)/否(Warp 版)Apache-2.0
warp2022/NVIDIAPython→CUDA/C++ JIT + adjointGPU SIMT 线程网格无自有 benchmark(“与原生 CUDA 相当”)(源码变换 AD)Apache-2.0
madrona-engine2023/StanfordECS + 单 megakernel上万并行 world(列存+PGO)HideSeek 190 万步/s(单 4090),11× vs 强 CPU开源
genesis-physics-engine2024/学术协作Taichi 后端,6 套多物理求解器大规模并行(未披露 env 数)单卡 4090 Franka 4300 万 FPS(官方宣称,无方法学)部分(MPM/Tool)Apache-2.0
newton-physics-engine2025/NV+DeepMind+DisneyWarp + MuJoCo-Warp,8 可插拔求解器海量并行 world,GPU 批渲染MJWarp 人形 >70×、在手 100×(无统一表)(Warp 路径)Apache-2.0(Linux Foundation)
difftaichi2019/MITTaichi 可微编程语言单/多核可微弹性体比 TF 快 188×(两尺度 AD)开源

贯穿的取舍:GPU 批量仿真只在成千上万并行世界时才赢,单场景反而慢(MJX 慢 10×);可微性与接触精度/吞吐互斥(MJX-Warp、Newton 都为性能放弃了 Warp 后端的自动微分);加速器对分支代码(broad-phase 碰撞、动态实体)不友好,高接触/多智能体场景吞吐下降快于 CPU(Madrona 的 megakernel + 列存 EnvID 正是为此设计)。

A.2 操作 benchmark 栈——把引擎包成可训练的任务

物理引擎只是底座,要做研究还得有机器人 + 传感器 + 任务 + 演示数据 + 评测协议。这条线由 UC San Diego 的 Hao Su 组主导,从 SAPIEN 起一脉相承。

sapien(CVPR 2020)的关键贡献是把仿真粒度从”场景-物体”推进到**“场景-物体-部件”:基于开源 PhysX 4.1 + ROS,配自建 PartNet-Mobility(2,346 铰接物体 / 14,068 可动部件 / 46 类,带运动轴与运动范围标注),单机单卡引擎 5000 Hz / 渲染 700 Hz。maniskill(NeurIPS 2021)第一次把它包成”物体级泛化”benchmark——4 个铰接任务、162 物体、用 RL 分治自动生成 36K 条演示(~1.5M 帧),证明单个 RL agent 无法跨大量物体从零学(10 物体成功率骤降到 2%)。maniskill2(ICLR 2023)扩到 20 任务族 / 2000+ 物体 / 4M+ 演示帧,做出首个双向耦合的刚体-MPM 软体仿真**(基于 Warp)与异步渲染服务器(单 GPU 16 进程 2000+ FPS),并首创闭环演示动作空间转换让 TAMP 演示跨控制器复用。maniskill3(RSS 2025)终于全 GPU 并行——单张 4090 同时仿真+渲染 RGB/深度/分割 30,000+ FPS、比其它平台快 10–1000× 省 2–3× 显存,独有异构 GPU 仿真(每个并行环境跑完全不同的物体/DOF),并托管 SIMPLER 做 real2sim 评测。

另外两个 benchmark 走”用生成式资产 + 合成数据倍增”的路:robocasa(2024,基于 MuJoCo/RoboSuite)造 120 个厨房、2,509 个(多数 text-to-3D 生成的)物体、100 个(含 LLM 生成的)任务,用 mimicgen 扩到 100K+ 轨迹,后被 NVIDIA GR00T 采用;roboverse(RSS 2025)则往元层走——MetaSim 把 IsaacSim/IsaacGym/MuJoCo/PyBullet/SAPIEN/CoppeliaSim/Genesis 七种仿真器统一到一套配置系统与 Handler API 下,聚合 15 个既有 benchmark 成 276 任务类别 / 510.5K 轨迹 / 5.5K 资产,定义 4 级泛化评测协议。

表 2 · 操作 benchmark / 任务栈对比

平台年份物理后端任务规模物体/资产演示规模峰值 FPS独有能力
sapien2020PhysX 4.1门/抽屉 2 类PartNet-Mobility 2346/14068 部件引擎 5000 / 渲染 700部件级铰接、同步/异步双模式
maniskill2021SAPIEN4 任务162 物体36K 轨迹 / 1.5M 帧state 112 / 视觉 48RL 分治自动生成演示、三评测轨道
maniskill22023SAPIEN + 自研 MPM20 任务族2000+ 物体4M+ 帧2000+(渲染服务器)2-way 刚-软耦合、动作空间转换
maniskill32024PhysX GPU + SAPIEN 光栅12 类 / 40+ 技能2000+ 物体、20+ 机器人millions of frames30,000+(单 4090)异构 GPU 仿真、SIMPLER real2sim
robocasa2024MuJoCo/RoboSuite100 任务(25+75 LLM)120 厨房 / 2509 物体100K+(MimicGen 扩增)生成式资产、GR00T 采用
roboverse20257 仿真器统一(MetaSim)276 任务类别5.5K 资产510.5K 轨迹随底层仿真器simulator-agnostic、4 级泛化协议

A.3 场景/家务仿真——从”能走”到”能碰”再到”能社交”

与操作 benchmark 平行,另一支仿真做的是房间/场景级具身导航与家务,主要在 Meta FAIR(Habitat)与 AI2(THOR)两条谱系上演进。核心张力是渲染吞吐 vs 物理交互保真的权衡。

ai2-thor(2017,Unity)是最早把”可交互物体”(能开关、加热、打碎、接水)当一等公民的仿真环境,衍生出整个 THOR 家族。habitat(2019,Meta)走另一极端——极致渲染吞吐(单卡多进程 10,000+ FPS,比同期快 2–3 个数量级),但只做静态扫描场景”能走不能碰”,把 PointGoal 导航训到 75M 步。habitat-2(2021)补上刚体物理(ReplicaCAD 92 件可开合物件 + 深度 C++ 集成的 H2.0 引擎,8-GPU 节点 25,734 SPS、850× 实时),并得出”整体 RL 学不动长程家务、层级 RL 更强但有交接问题”的结论。habitat-3(2023)加入逼真人形 avatar(刚性骨架 + 蒙皮 + 离线缓存 SMPL-X,双 Spot 1345 FPS → 人形+机器人 1190 FPS,代价几乎为零)与人机回环(HITL)工具,研究社交导航/社交重排。

物理状态维度上,igibson-2(CoRL 2021)给 PyBullet 交互仿真器加扩展物理状态(温度/湿度/清洁度/开关/切片)+ 逻辑谓词系统,第一次让”做饭/清洁/浸泡”可研究,是 BEHAVIOR-1K/OmniGibson 的前身;threedworld-tdw(2020,MIT-IBM)在 Unity + PhysX + Flex 之上首次把物理驱动碰撞音效合成做进实时回路,追求感知/物理/声音/导航同一仿真器闭环。规模化维度上,procthor(NeurIPS 2022 最佳论文)在 AI2-THOR 上做程序化生成万级房屋(1 万套房、1,633 物体实例),仅用生成数据预训练简单 CNN+GRU 就登顶三个挑战赛。

这几个新平台大多不再自研引擎,而是跑在 NVIDIA isaac-sim 上——那是构建在 Omniverse/OpenUSD 之上的 RTX 光追 + PhysX 合成数据生成平台(2025-08 以 Apache-2.0 开源),也是整个 NVIDIA 机器人栈(Isaac Lab / GR00T)的仿真底座。grutopia(2024,上海 AI Lab)建 10 万+ 可交互场景 + LLM 驱动 NPC + 三级 GRBenchgenie-sim(2025,AgiBot)把 LLM 场景生成 + 3DGS 重建 + VLM 自动打分 + 遥操采集串成流水线(5,140 资产 / 200+ 任务 / 10K+ 小时合成数据,R²=0.924 sim-to-real 一致性);metaurban(ICLR 2025,UCLA)专攻城市微出行,程序化生成无限街区 + 1,100 绑定人体 × 2,314 动作,跨”移动机器”本体评测。

表 3 · 场景/家务/城市仿真对比

平台年份引擎物理吞吐核心贡献
ai2-thor2017Unity3D状态触发式交互可交互物体作一等公民、THOR 家族起点
threedworld-tdw2020Unity+PhysX+Flex刚体+软体+流体物理驱动碰撞音效、多模态闭环
habitat2019Habitat-Sim静态扫描(无交互)10,000+ FPS极致渲染吞吐、导航基准范式
habitat-22021H2.0(C++)刚体物理单进程 1200 SPS,8-GPU 25,734 SPSReplicaCAD、Home Assistant Benchmark
habitat-32023Habitat-Sim刚体 + 人形 avatar人形+机器人 1190 FPSSMPL-X avatar、社交任务、HITL
igibson-22021PyBullet刚体 + 扩展物理状态温度/湿度/清洁度、逻辑谓词、VR
procthor2022AI2-THOR交互 + 机械臂操作万级程序化房屋、NeurIPS 最佳论文
grutopia2024isaac-sim刚体10 万+ 场景、LLM NPC、GRBench
genie-sim2025isaac-sim刚体LLM/3DGS/VLM 流水线、R²=0.924 sim2real
metaurban2024自研刚体 + 动态人群城市微出行、跨移动本体、ICLR spotlight

辅助基础设施还有 curobo(NVIDIA 2023)——不是学习模型,而是 CUDA 加速的经典运动规划库,把碰撞无关运动生成表述为大规模并行全局优化,单次查询 ~50ms(比 Tesseract 快 60×),在 15W Jetson Orin 上可落地,为操作 pipeline 提供实时运动生成。

A.4 合成数据引擎——让仿真”自产”训练数据

仿真的终极价值是”凭空造数据”。这条线从 sim2real 的方法学根基开始,逐步进化到用大模型自动化整个数据生成回路。

根基domain-randomization(OpenAI/Berkeley 2017)——在 MuJoCo 里用随机纹理/光照/相机/干扰物渲染几十万张低保真图,只用仿真数据、零真实微调就让 CNN 真机定位到 ~1.5cm。核心直觉”仿真里变化足够大,真实世界就只是又一种变化”成了几乎所有仿真训练机器人的默认底座。

演示倍增(sim 内几何变换)mimicgen(NVIDIA 2023)把 ~200 条人类演示切成物体中心子任务段、按新场景物体位姿做刚体变换 + 插值重放、只留成功轨迹,10 条人类演示 ≈ 200 条(50K+ 演示 / 18 任务);dexmimicgen(2024)把它从单臂平行爪扩展到双臂灵巧手/人形(引入并行/协同/顺序三类子任务机制,60 条源演示 → 21K 仿真演示,GR-1 Can Sorting 从 0%→90%)。

生成式仿真(LLM 造任务/场景/奖励)robogen(ICML 2024,正式提出”Generative Simulation”范式名)用 GPT-4 驱动”提议任务→检索/生成资产→选算法→生成奖励→学技能”的可无限查询流水线,自动化”造仿真环境需大量人力”这一瓶颈。

用生成式基础模型补数据(不采新真机轨迹)rosie-scaling-robot-learning(Google 2023)把 rt-1(Everyday Robots 遥操)的 13 万演示喂给 OWL-ViT + Imagen Editor inpainting,凭文生图先验”凭空”造出策略没见过的物体/背景;autort(DeepMind 2024)用 VLM 描述场景 + LLM 生成任务 + LLM 自我批判(“机器人宪法”)驱动 20+ 台车队自主采集,7 个月 77K episode / 6650 指令;dreamgen-groot-dreams(NVIDIA 2025)把图生视频世界模型(WAN2.1/Cosmos)微调到目标本体、“造梦”出全新行为视频,再用 IDM/潜动作模型反标注出”神经轨迹”伪动作,仅凭单环境抓放数据学会 22 个新动词、迁移到 10 个新环境

表 4 · 合成/生成数据引擎对比

方法年份数据来源机制倍增/产出(一手数字)
domain-randomization2017纯仿真渲染随机纹理/光照/相机零真实数据 → 真机定位 ~1.5cm
mimicgen2023~200 人类演示物体中心子任务刚体变换重放10 演示 → 1000;50K+ / 18 任务
dexmimicgen202460 人类演示双臂灵巧手三类子任务机制60 → 21K 仿真;GR-1 0%→90%
robogen2023LLM 生成GPT-4 提议任务+资产+奖励无限自动化流水线(Generative Simulation)
rosie-scaling-robot-learning2023RT-1 13 万演示OWL-ViT + Imagen inpainting合成新物体/背景,无新真机轨迹
autort2024车队自采VLM+LLM+机器人宪法7 月 / 77K episode / 6650 指令
dreamgen-groot-dreams2025单环境遥操视频世界模型造梦 + IDM 伪标注22 新动词 / 10 新环境

Part B · 数据飞轮:把真实世界(和人)转成数据

B.1 真机遥操作数据集——从单机到百万级众包

真机数据不能爬,只能采。这条线是整个数据飞轮的主干,逻辑与 CV/NLP 的”大而多样催生泛化”一脉相承,主旋律是规模、多样性、跨机构标准化三者的持续扩张。

跨本体的第一次试探robonet(2019)把 4 机构 7 平台自主随机采的 ~16.2 万轨迹(~1500 万帧)汇入统一末端动作空间,最早系统研究”跨本体预训练能否正迁移”。低成本可复现路线bridge-data-original(2021)用 $2900 WidowX250 采 7,200 演示 / 71 任务,验证”结构相近的联合训练把成功率提约 2 倍”;bridgedata-v2(2023)扩到 60,096 轨迹 / 24 环境 / 13 技能 / 100+ 物体,首次做跨机构零样本评测(Lab1→Lab2 仍非零成功率),并证明技能多样性本身(而非单纯数据量)带来泛化(固定 27K 轨迹,3 技能 vs 13 技能,未见任务 0.30→0.65)。

聚合与统一格式的里程碑open-x-embodiment(Google DeepMind + 34 实验室,ICRA 2024 最佳论文)把 60 个现成数据集汇成统一 RLDS——1M+ 轨迹 / 22 本体 / 527 技能 / 160266 任务,用 RT-1-X / RT-2-X 证明”不做任何跨本体对齐、只把数据池化共训”就产生正向迁移(小数据域 +50%、RT-2-X 涌现技能 ~3×),并揭示容量是迁移的闸门(只有 55B 的 RT-2-X 在数据充裕域也吃到红利)。它成了此后 Octo/OpenVLA/π0 等几乎所有通用策略的预训练底座与横向评测基准。

场景多样性取胜droid(Stanford/Berkeley/TRI + 13 实验室,2024)用**统一硬件(18 台同款 Franka + Robotiq + 3 路 Zed 立体相机)**在 3 大洲 52 栋楼采 12 个月——76K 轨迹 / 350 小时 / 564 场景 / 86 任务 / 1417 相机视角,场景多样性比前作大一个数量级,简单 50/50 co-training 就把成功率与 OOD 鲁棒性抬高约 20%。

中国机构的规模化与质量化rh20t(上海交大 2023)用力反馈遥操采 11 万+ 接触丰富序列(配对人类视频),同步录 RGB-D / 双目红外 / 6-DoF 力矩 / 触觉 / 音频,首个同时具备”人类配对+接触+深度+标定+力觉”五属性;robomind(2024)在统一平台采 107K 轨迹 / 305.5 小时 / 4 本体 / 479 任务,附 5K 失败轨迹 + 10K 帧级语言标注 + Isaac Sim 数字孪生;ario-all-robots-in-one(2024)定义一套数据标准把真机/仿真/开源三路缝进同一格式,聚出 ~3M episode / 五模态agibot-world-colosseo(智元 2025,IROS)把真机推到极致——100+ 台同构人形 G1 在 4000㎡ 五大真实场景采 1,003,672 轨迹 / 2976 小时 / 217 任务,配人工在环质检与失败恢复数据,并提出 GO-1 / ViLLA(潜动作打通 VLM 与底层控制),喊出”ImageNet 时刻”。此外 roboagent-mt-act(CMU/Meta 2023)用 7,500 轨迹 + 语义数据增强训 MT-ACT,同步开源当时最大商用硬件数据集之一 RoboSet;roboturk(2018)则是这条线的史前史——iPhone ARKit + WebRTC 让众包工人远程遥操 Sawyer,22 小时采 2218 条成功演示。

表 5 · 真机遥操作数据集对比

数据集年份本体轨迹数时长/规模任务/技能场景关键特色
roboturk2018Sawyer(仿真)2218 成功137.5 小时iPhone 众包遥操先驱
robonet20197 平台~162K~1500 万帧4 机构首个跨本体正迁移研究
bridge-data-original2021WidowX2507,20071 任务10$2900 低成本、联合训练 2×
bridgedata-v22023WidowX25060,09613 技能24跨机构零样本、技能多样性消融
rh20t20237 配置110K+配对人类视频147 任务/42 技能力矩+触觉+音频、接触丰富
open-x-embodiment2023221M+60 数据集聚合527 技能/160266 任务~300统一 RLDS、RT-X 正迁移
droid2024Franka×1876K350 小时86 任务564统一硬件、3 大洲 52 楼、场景多样
robomind20244 本体107K305.5 小时479 任务/38 技能失败+帧级标注、数字孪生
ario-all-robots-in-one2024多本体~3M episode258 系列321K 任务数据标准、五模态
agibot-world-colosseo2025人形 G1×100+1,003,6722976 小时217 任务/87 技能106人工在环质检、GO-1/ViLLA

B.2 遥操作硬件——降成本、加沉浸、扩自由度

数据集背后是采集硬件。这条线的目标是让”每小时能采多少高质量演示”越来越高,三个演进方向:降成本加沉浸感/精度从单臂扩到双臂/全身/灵巧手

低成本 leader-follower 路线aloha-act(Stanford 2023)用两对现成 Trossen 臂(小臂 leader、大臂 follower)+ 3D 打印件搭出 <$2 万的双臂遥操平台,配 80M 参数的 **ACT(Action Chunking with Transformers)**策略——“预测下 k 步动作块” + CVAE 建模演示多模态,每任务 50 条演示就做到 80-90%。ACT 的动作分块后来成了 π0/OpenVLA 一代 VLA 的标配。gello(Berkeley 2023)更极致——3D 打印一个按 DH 参数缩放的”迷你复刻臂”当 leader(廉价舵机做编码器),单套 <$300,用户直接掰关节即可,用户研究成功率 0.92(vs 3D 鼠标 0.63、VR 手柄 0.72)。

沉浸式视觉路线anyteleop(NVIDIA/UCSD 2023)做纯摄像头、机器人无关的通用视觉遥操,一套系统支持任意臂-手组合;open-television(UCSD/MIT 2024)给机器人头装可主动转动的立体相机、把双目视频流回 VR 头显,操作者”魂穿”进机器人、全链路 60Hz、跨美国东西海岸 3000 英里遥操;bunny-visionpro(2024)用 Apple Vision Pro 做双臂灵巧手遥操 + ERM 触觉反馈,全跑在单颗消费级 CPU。

移动/全身路线mobile-aloha(Stanford 2024)把 ALOHA 装到可背驱移动底盘,$3.2 万、全身 16-DoF 同时遥操,配 50/50 co-training(825 条静态 ALOHA 演示)把复杂长程任务训到 >80%(co-train +34%);humanplus(Stanford 2024)走”从人学”——40 小时 AMASS 数据在仿真 RL 训全身低层策略,真机后操作者用单台 RGB 相机实时估计全身姿态”影随”操控 33-DoF 人形;twist2(Stanford/Amazon 2025)用消费级 PICO 4 Ultra + $250 自研 2-DoF 颈部模块做免动捕全身遥操(PICO 设置 ~1 分钟);ace-f-foldable-teleop(UCSD 2025)做可折叠跨本体系统,不加任何力传感器——纯靠”目标位姿-实际位姿”偏差推算虚拟力渲染回 leader,让操作者”摸到”接触力。

表 6 · 遥操作硬件对比

系统年份成本/设备采集模态自由度/本体关键创新
roboturk2018iPhone(ARKit)WebRTC 视频流单臂 Sawyer众包遥操、与 VR 无显著差异
aloha-act2023<$2 万,Trossen×2RGB双臂leader-follower、ACT 动作分块
gello2023<$300,3D 打印RGB单/双臂(UR5/xArm/Franka)运动学缩放复刻臂、掰关节即用
anyteleop2023纯摄像头视觉任意臂-手组合机器人无关、多操作者协作
open-television2024VR 头显主动立体视觉双臂灵巧手/人形60Hz、3000 英里远程、主动视觉
bunny-visionpro2024Apple Vision Pro手/腕位姿 + ERM 触觉双臂灵巧手单 CPU、loop joint 实时求解
mobile-aloha2024$3.2 万RGB全身 16-DoF 移动双臂移动底盘、50/50 co-train +34%
humanplus2024单 RGB 相机全身姿态影随33-DoF 人形AMASS 训低层、单相机 shadowing
twist22025PICO 4 Ultra + $250 颈VR + 脚踝追踪全身人形 G1免动捕、第一人称视觉
ace-f-foldable-teleop2025可折叠 leaderIMU+手套跨本体无力传感器的虚拟力反馈

B.3 免机器人采集——UMI 家族的”不用机器人采机器人数据”

遥操作再便宜,也要机器人在场、要人训练。UMI 家族把这个约束彻底去掉:用手持采集器直接把野外人手演示变成可训练的机器人动作,采集速度和场景多样性因此解锁。

universal-manipulation-interface(Stanford/Columbia/TRI 2024,RSS 最佳系统论文入围)是这条线的原型——一把 780g、3D 打印、只装一台 GoPro 的手持平行夹爪(鱼眼 + 侧镜 + IMU-视觉 SLAM + 连续夹爪追踪),策略侧用推理期延迟匹配 + 相对轨迹动作表示 + Diffusion Policy,一份手持数据零样本部署到 UR5/Franka/ARX 三种本体,野外数据训出的策略对新环境/物体有 ~70% 零样本泛化。衍生工作沿三个方向扩展:umi-on-legs(2024)把桌面策略”装”到四足狗上——高层扩散策略只在任务坐标系里预测末端轨迹、底层纯仿真 RL 训的全身控制器跟踪,两者只靠”末端轨迹”握手;dexumi(Columbia/Stanford 2025,CoRL best paper finalist)从平行夹爪扩到多指灵巧手——给人手戴逐款优化的外骨骼读关节角、复刻同款触觉,再用”分割-修复-重渲染”把画面里人手换成机器人手像素;mv-umi(NYU 2025)加一路第三人称俯视相机 + SAM-2 分割补上手腕相机看不到的场景语境(大场景任务 +47%);vitamin-visuo-tactile-interface(清华/Berkeley 2025)把 UMI 升级为视觉-触觉双模态(Fin Ray 软夹爪内嵌摄像头),配”用触觉预测未来画面”的对比预训练做接触密集任务。

相邻的 dexcap(Stanford 2024)不是手持而是背包式 mocap(3.96 磅:EMF 手套测指关节 + SLAM 相机测手腕 6-DoF + 胸前 RGB-D LiDAR 测场景),配 DexIL(指尖 IK 重定向 + 点云 Diffusion Policy),让人不穿戴机器人、不遥操作就在野外直接采灵巧操作数据。

表 7 · 免机器人 / 手持采集对比

系统年份采集器形态传感本体扩展关键机制
universal-manipulation-interface2024780g 手持平行夹爪GoPro + IMU-SLAMUR5/Franka/ARX延迟匹配 + 相对轨迹 + Diffusion Policy
umi-on-legs2024UMI + 四足相机四足移动操作任务坐标系末端轨迹握手 + 仿真 RL WBC
dexumi2025灵巧手外骨骼编码器 + 触觉阵列多指灵巧手视频 inpainting 换手像素
mv-umi2025UMI + 俯视相机手腕 + 第三人称平行/三爪SAM-2 分割补场景语境 +47%
vitamin-visuo-tactile-interface2025Fin Ray 视触觉夹爪内嵌摄像头触觉软体夹爪触觉预测未来帧对比预训练
dexcap20243.96 磅背包 mocapEMF 手套 + SLAM + RGB-D LiDAR双臂 LEAP 灵巧手DexIL:指尖 IK + 点云 Diffusion Policy

B.4 人类第一视角视频——最”被动可扩展”的数据源

人类每天都在做操作,只要戴个相机就能被动采集——这是理论上最可扩展的数据源,代价是没有动作标签、有 embodiment gap。这条线分三层:底层视频语料、把人类动作转成机器人动作、以及把视频炼成视觉表征。

基础语料ego4d(Meta + 13 大学 2021)产出 3,670 小时 / 931 佩戴者 / 74 城市 / 9 国家第一人称视频 + 五大 benchmark,是把”人类第一视角”做成研究基础设施的奠基之作;ego-exo4d(Meta + Aria + 15 大学 2023)加上第一+第三人称同步(740 名专家、5,035 takes / 1,286.3 小时、Aria 眼镜 + 4-5 台 GoPro),配首创的”专家点评”标注;egodex(Apple 2025)用 Apple Vision Pro 采当时最大人类灵巧操作数据集——829 小时 / 194 任务 / 338K 演示 / 90M 帧,配采集时同步产生的 3D 双手骨骼(每手 25 关节),主张”第一视角视频 + 配对 3D 手姿”这条被动可扩展的第三条路。

人类动作 → 机器人动作egomimic(Georgia Tech 2025,ICRA)用 Aria 眼镜采人类视频 + 3D 手轨迹,把它当作与遥操作数据平等的训练源(硬件对齐 + 跨域对齐 + ACT 共享编码器),“多 1 小时人类数据比多 1 小时机器人数据更值钱”;humanoid-policy-human-policy-ph2d(UCSD/CMU 2025)建 302 万人类帧 + 66.8 万 H1 机器人帧的配对数据集 PH²D,用可微运动学重定向把人和人形统一到 54 维手腕-指尖空间联合训练 HAT;in-n-on-human0(UCSD 2025)把人类数据分”野生 in-the-wild”(1000+ 小时预训练)和”任务对齐 on-task”(20+ 小时后训练),训出的 flow matching 策略 Human0 涌现零样本语言跟随。此外 track2act(CMU/UW/Meta,ECCV 2024)用 ~40 万段网络视频训点跟踪扩散模型、把预测的 2D 点轨迹解算成 3D 刚体变换得开环动作,再用 ~400 条本体专属数据训小残差策略修正,实现零样本操作。

视频 → 视觉表征(冻结编码器喂给策略)r3m(Stanford/Meta 2022)在 Ego4D 3500+ 小时上用时间对比 + 视频语言对齐训冻结 ResNet,真机 20 条演示达 56%(vs CLIP 24%);mvp-masked-visual-pretraining(Berkeley 2022)用 MAE 在 450 万图上训 307M 编码器,981 次真机试验证明”模型与数据必须同步放大”;vc-1-cortexbench(Meta 2023)建 CortexBench(17 任务 7 基准)系统评测,发现无一”通吃”,遂用 MAE 在 4000+ 小时 / 562 万帧上训 VC-1(ViT-L 307M,冻结特征均值 68.7,超 MVP/R3M/CLIP),耗逾 1 万 GPU-小时。

表 8 · 人类视频数据源与表征对比

工作年份类型规模(一手数字)用途
ego4d2021语料3670 小时 / 931 人 / 9 国五大 benchmark、human-video 预训练主力源
ego-exo4d2023语料5035 takes / 1286 小时 / 740 专家ego-exo 同步、专家点评标注
egodex2025语料 + 3D 手姿829 小时 / 338K 演示 / 90M 帧被动可扩展、配对手部骨骼
egomimic2025人→机器人Aria 眼镜采集人类数据与机器人数据平等训练(+34-228%)
humanoid-policy-human-policy-ph2d2025人→机器人302 万人类帧 + 66.8 万 H1 帧54 维统一空间、HAT 联合训练
in-n-on-human02025人→机器人1000+ 小时野生 + 20+ 小时任务野生预训练 + 任务后训练、Human0
track2act2024视频→动作~40 万网络视频点跟踪 → 3D 变换 → 零样本操作
r3m2022视频→表征Ego4D 3500+ 小时冻结 ResNet,20 演示 56%
mvp-masked-visual-pretraining2022视频→表征450 万图 / 307M 参数MAE 预训练、981 真机试验
vc-1-cortexbench2023视频→表征4000+ 小时 / 562 万帧CortexBench、VC-1 68.7、1 万+ GPU-h

Part C · 两条引擎的交汇

仿真和真实数据不是二选一。整个领域最有价值的结论恰恰出在两者的接口上。

co-training 是把两条数据流缝起来的默认配方。DROID 的核心实验是简单 50/50 混合(一半 in-domain 演示 + 一半完整 DROID),比只用 in-domain 或用 OXE 混合平均高约 20%;Mobile ALOHA 把新移动数据和 825 条静态 ALOHA 演示各按 50% 概率混采,平均 +34%;AgiBot World 用 RDT 做探针证明在 AgiBot 上预训练比在 OXE 上预训练 in-distribution +0.30。方法学上,OXE 揭示了一个反直觉的事实:不需要任何弥合 embodiment gap 的专门机制,直接把异构数据池化共训就有正迁移——前提是模型容量足够大。

“多样性 > 数量”是这条线最重要的经验律data-scaling-laws-imitation(清华 2024,ICLR Oral)用 UMI 采 4 万+ 演示、跑 1.5 万+ 真机 rollout,发现泛化能力与物体数、环境数、环境-物体对数呈幂律(r=-0.98),而与每个环境/物体采多少条演示几乎无关,给出可照抄的配方——“在 32 个环境各放 1 个不同物体、每个采 50 条演示”就能对完全没见过的环境/物体零样本 ~90%。BridgeData V2 的技能多样性消融(3 技能 vs 13 技能、固定数据量、0.30→0.65)与 AgiBot World 的数据 scaling(9.2k→1M 轨迹幂律 r=0.97)都指向同一结论。

sim-to-real 的可信度正在从”定性演示”走向”定量相关”。早期 sim2real 靠 domain-randomization 的暴力随机化;如今领域普遍用仿真评测与真机 rollout 的相关系数衡量仿真价值:maniskill3 的 SIMPLER real2sim 相关系数 0.9284、MMRV 0.0147;genie-sim R²=0.924;Genesis World 1.0(genesis-physics-engine 商业重写版)Pearson 0.8996。而 mujoco-playground(MJX + Madrona,RSS 2025 最佳 demo)把这条线推到”完全开源栈也能真机零样本”——不到 8 周把状态与视觉策略部署到 6 个真实平台(Go1 平地 <5 min 训练、Franka 视觉 pick-cube 真机 12/12),且视觉 RL 借 Madrona 批渲染直接从像素端到端训练、不需要 teacher-student 蒸馏

real-to-sim 让真实世界反哺仿真。数字孪生(RoboMIND 的 Isaac Sim 孪生、ManiSkill3 的 SIMPLER 移植、Genesis 的 NuRec、Isaac Sim 的 3DGUT 神经重建)把真实场景重建进仿真做快速可复现评测——SIMPLER 数字孪生能 60×–100× 真实世界速度、bit-exact 可复现地评测 Octo,把”数万 episode 一整轮评测从真机 200+ 小时压到仿真 <0.5 小时”。


共通设计模式

横看这 74 个工作,几条设计模式反复出现:

  1. 消除跨设备/跨介质的搬运延迟。仿真侧是”物理与训练同芯片”(Isaac Gym 的 direct-GPU API、Brax/MJX 的全程 JIT、Madrona 的零拷贝张量导出);数据侧是”手持采集器直接产机器人动作”(UMI 免去遥操作与真机在场)——本质都是把中间的转换/搬运环节压掉。

  2. 统一抽象层收编碎片化后端。物理引擎用统一数据结构支持可插拔求解器(Newton 的 Model/State/Control + 8 求解器、Brax v2 四管线、MJX-JAX/Warp 双后端);benchmark 用 simulator-agnostic 配置收编多个仿真器(RoboVerse 的 MetaSim 统一 7 个);数据用统一格式收编异构来源(OXE 的 RLDS、ARIO 的数据标准、LeRobot)。

  3. 粗对齐而非精对齐。OXE 只把动作粗对齐成 7 维末端向量、坐标系不跨数据集对齐(同一向量在不同机器人上诱发不同运动),却仍产生正迁移;DROID 用统一硬件回避对齐问题。经验是:规模和多样性带来的收益,大于精确对齐的收益

  4. 少量真数据 + 自动倍增。MimicGen(10→1000)、DexMimicGen(60→21K)、ManiSkill3(~10 遥操 → RFCL/RLPD → 海量 rollout)、DreamGen(单环境 → 22 动词)都是”少量高质量种子 + 引擎倍增”,把人力从”采集每条轨迹”挪到”采集种子 + 设计倍增机制”。

  5. 可微是一条始终在场但从未免费的支线。DiffTaichi/Warp/Brax/Genesis 都押注可微仿真(解析策略梯度、系统辨识),但可微性与接触精度/吞吐反复冲突——MJX-Warp、Newton 的主后端都为性能放弃了自动微分。可微仿真至今是”有潜力但难驯服”的方向。

  6. 人工在环质检成为一等目标。规模到百万级后,数据质量比数量更关键——AgiBot World 的”采一批→训→评→回改协议”闭环证明 528 条人工核验数据 > 482 条未核验数据(+0.18),把质检从事后清洗提升为采集回路的组成部分。


走向何方

  • 仿真引擎在收口与融合。Newton 把 NVIDIA / DeepMind / Disney 的 GPU 物理阵营收进 Linux Foundation 中立治理,MJX 吸收了 Brax 的物理管线,Isaac Sim 5.0 开源、Isaac Lab 预告接入 Newton——分裂多年的”每家一套 GPU 物理”正在归并到少数几个可互操作的底座上,OpenUSD 成为共享资产层的事实标准。

  • 数据从”堆规模”转向”堆质量与多样性 + 合成倍增”。真机数据集已到百万级(AgiBot World),但 scaling law 反复证明多样性 > 数量;未来增量更可能来自**免机器人采集(UMI 家族)+ 人类视频(被动可扩展)+ 生成式倍增(DreamGen/世界模型)**这三条”边际成本更低”的路,而非继续堆遥操作工时。

  • sim 与 real 的边界在模糊。co-training 成默认、real2sim 数字孪生做评测、生成式世界模型(Cosmos/WAN → DreamGen)直接”造”训练视频——“仿真数据”与”真实数据”正在合成一条连续谱,评价标准从”像不像真”转向”仿真评测与真机 rollout 的相关系数”。

  • 未解的硬骨头:高精度接触密集装配(ManiSkill2 的 3mm/0.5mm 插孔任务 RL/IL 成功率仍接近 0)、可微仿真的驯服、对全新未见本体的泛化(OXE 明言未研究)、以及”何时会/不会发生正向迁移”的理论判据(至今仍是经验观察)——这些是下一代仿真与数据基础设施要啃的。

一句话收束:具身智能没有可以爬的互联网,于是它自己造了两台引擎——一台把 GPU 算力炼成数据,一台把真实世界和人炼成数据。过去五年这两台引擎各自完成了”加速器原生”与”跨机构规模化”的革命,而下一个五年的主战场,是它们在 co-training、sim-to-real、生成式倍增上的合流