具身智能数据:从「没有互联网规模机器人数据」到把数据造出来
具身智能与 LLM/VLM 最根本的差别在数据这一维:语言/图文有互联网现成语料,而机器人动作数据必须一条一条采。generalist-robot-internet-video-survey 把这个鸿沟量化得很直白——已知最大的互联网视频集 InternVid 有 76 万小时 / 2.3 亿片段,已知最大的开源机器人数据集 Open X-Embodiment 折算约 5,556 小时,两者相差两个数量级以上;skild-brain 的博客更极端地论证「真正的 scale 需要万亿级样本——即便集合全地球人口去采,也要数年才能凑够 1000 亿条轨迹」。
因此整个领域的数据史,就是一部**「如何把数据便宜地造出来」的策略演化史**,每种策略在保真度 ↔ 规模 ↔ 成本三角里占不同的点:
- 真机遥操作——最保真、动作标签天然精确,但最贵(单实验室 → 机队 → 跨机构聚合);
- 跨具身聚合与配比——把已有数据集拼起来复用,核心问题从「采数据」变成「怎么混」;
- 低成本采集器 / 手持夹爪——绕开机器人本体,把采集成本压一个数量级;
- 人类第一人称视频——被动可扩展、语义丰富,但缺动作标签、有具身鸿沟;
- 仿真 + 自动扩增——GPU 上无限生成、自带像素级真值,但有 sim-to-real gap;
- 无动作标签数据的动作化——用 latent action / 世界模型把海量视频「翻译」成可训练信号。
英伟达 groot-n1 的「数据金字塔」把后几层整合成一个统一图景:塔底是海量人类视频(base)、塔中是仿真与神经生成视频(middle)、塔尖是稀少而昂贵的真机遥操作(peak)——vla-embodied-manipulation-survey、dreamgen-groot-dreams、galaxea-g0-5 等后续工作都沿用这一框架。
一、真机遥操作:从单实验室到平台级机队
早期:单实验室数据集(千—十万条量级)
第一代数据集回答的问题是「多任务 + 多域能不能兼得」。robonet 走的是自监督随机动作路线(162k 轨迹 / 1500 万帧 / 7 平台,但动作是随机推抓、非语义任务);bridge-data-original 第一次把「多任务 + 多域」凑齐(71 任务 / 10 环境 / WidowX250s + Oculus Quest 2,整套 <$3,600);rt-1 把规模拉到 13 万条、744 任务、13 台机器人采 17 个月,成为后来无数 VLA 的预训练底座(Fractal 数据)。bc-z 引入 HG-DAgger 共享自主(专家打底 + 人类实时纠错迭代 16 轮),rh20t 则把力/力矩 + 指尖触觉这类接触模态首次做进大规模数据集(7 种机器人配置、每技能约 750 次演示、40TB)。
| 数据集 | 轨迹/演示 | 任务·技能 | 本体·采集 | 采集组织 | 特点 |
|---|---|---|---|---|---|
| robonet | ~162k / 1500 万帧 | 随机动作 | 7 平台 / 4 机构 | 自监督无人值守 | 无语言、纯随机探索、36GB |
| bridge-data-original | 7,200 | 71 任务 | WidowX250s + Quest2 | UC Berkeley + UPenn | 首个「多任务×多域」;<$3,600 |
| bridgedata-v2 | 60,096(50,365 人类 + 9,731 脚本) | 13 技能 / 24 环境 / 100+ 物体 | WidowX250(~$4,000) | 事后众包语言标注 | 84% 人类 / 16% 脚本;CC BY 4.0 |
| rt-1 | ~130k | 744 任务 / 12 类技能 | 13 台 EDR / 17 月 | 2×VR 手柄遥操 | Move-Near 337 条最多;已开源 |
| bc-z | 25,877(11,108 专家 + 14,769 纠偏)+ 18,726 人类视频 | 100 任务 | 12 臂 / 7 人 / 5 月 | HG-DAgger 迭代 16 轮 | 共享自主 + SQL 数据质检 |
| roboagent-mt-act | 98,050(RoboSet 全集) | 48 任务 / 12 技能 / 11 场景 | 4 场地 / 2 月 | 遥操 + 启发式 + 语义增强 | 每帧 SAM inpaint 自动增强 |
| rh20t | 110k+ 机器人 + 110k+ 人类视频 / 5000 万帧 | 147 任务 / 42 技能 | 7 种机械臂×夹爪×力传感器 | 数十志愿者、每技能重复 10 次 | 力/力矩 + Cfg7 指尖触觉;40TB |
平台级:百万条量级与「数据工厂」
2023–2025 数据集进入百万条 / 数千小时级,且采集从「拼实验室」变成「建工厂 + 标准化流水线」。droid 强调多样性五轴(564 场景 / 1417 视角 / 52 栋楼 / 13 机构,GPT-4V 自动分类场景),agibot-world-colosseo 直接建 4000㎡ 工厂 1:1 复刻家居/零售/工业/餐厅/办公五大域(100 万条 / 2976.4 小时),robomind 首创帧级细粒度语言标注 + 5k 条失败轨迹(附失败原因,类比 RLHF),galaxea-g0 坚持单一本体全量采集以保证感知-动作-语言对齐。这些数据集的共同套路是人在环质检闭环——采一批 → 训策略 → 部署评估 → 据表现回改采集协议(agibot-world-colosseo 由此发现并剔除「过多 idle 帧」,还提出对抗式采集 ADC)。
| 数据集 | 轨迹 | 时长 | 任务·技能·场景 | 本体 | 采集方式 |
|---|---|---|---|---|---|
| open-x-embodiment | 1M+(聚合 60 数据集) | — | 527 技能 / 160,266 任务 | 22 本体 / 34 实验室 | 聚合各源遥操标签,只统一格式 |
| droid | 76k(+16k 失败不计入) | 350h | 86 任务 / 564 场景 / 1417 视角 | 18 机器人(Franka)/ 13 机构 | 每场景随机抽任务 GUI;GPT-4V 场景分类 |
| agibot-world-colosseo | 1,003,672(Beta) | 2976.4h | 217 任务 / 87 技能 / 106 场景 / 3000+ 物体 | 单本体 / 4000㎡ 工厂 | 人工遥操 + 三阶段流水线;1% 失败恢复 |
| robomind | 107k(+5k 失败) | 305.5h | 479 任务 / 38 技能 / 96 物体类 | 4 本体(Franka/Tien Kung/AgileX/UR5e) | 10k 条帧级语言标注;8 条质检准则 |
| galaxea-g0 | 100k | 500h+ | 150 任务 / 58 技能 / 1600+ 物体 | 单本体 R1 Lite | 结构化 schema 语言标注;2.87TB |
| ario-all-robots-in-one | 3,033,188 episode | — | 321,064 任务 / 258 series | 聚合 + 自采 + 仿真三路 | 统一时间戳数据标准;含 sim+real |
| pi0 自采 | 903M timesteps | ~10,000h | 68 任务 | 7 种机器人构型 | 106M 单臂 + 797M 双臂;n^0.43 加权 |
| bytedance-gr-3 自采 | — | 拾放 69h + 清桌 101h + 挂衣 116h | 101 物体 | 双臂 | 采集调度器最大化多样性 |
一个反复出现的口径不一致教训:几乎每个大数据集的论文正文、项目页、HF release 三处数字都对不上(droid 76k vs 后续补标、robomind 论文 107k vs HF 107,877 / 12.3TB、agibot-world-colosseo 1,003,672 vs 1,001,552、roboagent-mt-act 98,050 vs 项目页 28,500)——本库一律以论文 Table 固定数字为准并显式并陈差异。
二、跨具身聚合与数据配比:从「采数据」到「怎么混」
open-x-embodiment(RT-X)是分水岭:它把 60 个现成数据集统一成标准格式,证明跨 22 本体的多样数据能带来正迁移(RT-1-X / RT-2-X)。从此下游 VLA 的核心工程问题不再是「采多少」,而是「混合权重怎么配」——因为各数据集规模差几个数量级,直接按条数采样会被 Kuka、Fractal 这类巨无霸主导。
主流做法有三种加权:octo 的启发式(下调低多样性、上调高多样性数据集,被 openvla 直接沿用);rdt-1b / hpt-heterogeneous-pretrained-transformers 的 √N 加权(抑制大数据集过采样、保证小数据集被充分采样);pi0 的 n^0.43 加权(下压被过度代表的组合如 laundry folding)。下表对齐同一批 OXE 子数据集在不同 VLA 里的采样占比,能看出各家取舍:
| 数据源 | openvla | cogact | spatialvla | univla | uniact | villa-x |
|---|---|---|---|---|---|---|
| Bridge | 13.3% | 15.3% | 15.34% | 6.8% | 13.3% | 5.47% |
| Fractal(RT-1) | 12.7% | 27.1% | 14.71% | 13.9% | 12.7% | 9.70%(RT-1) |
| Kuka | 12.7% | 14.7% | 7.06% | 6.3% | 12.7% | 1.97% |
| BC-Z | 7.5% | 8.6% | 8.64% | 8.8% | 7.5% | 3.47% |
| Language Table | 4.4% | — | 5.06% | 5.2% | 4.4% | 0.11% |
| droid | 10%(后期移除) | 排除 | 11.66% | — | 10.0% | 3.46% |
| RH20T | — | — | 5.67% | — | — | 5.56% |
| agibot-world-colosseo Beta | — | — | — | — | — | 20.0% |
| ego4d(人类视频) | — | — | — | 3.0% | — | 21.46% |
几个一手结论从表里跳出来:
- DROID 是个反复被「请出去」的数据集。openvla、spatialvla 都以 10%/保守权重并入 DROID,却发现其动作 token 准确率训练全程偏低,于是在训练最后 1/3 阶段把 DROID 移除并把权重重分配;cogact 干脆从一开始就排除 DROID 和 Language Table(分布差异过大)。
- 数据清洗能决定成败。openvla 发现原始 BridgeData V2 每条 demo 首帧记录了全零(no-op)动作,不过滤会让 VLA 频繁预测全零、评测时「冻住」——过滤首帧 transition 是它大幅超 RT-2-X 的关键。
- 异构 vs 对齐是路线之争。uniact 刻意保留动作异构性(EEF 位置/速度/关节位置混用),与 Octo/OpenVLA 需要「手工清洗成同一动作空间」形成对比;hpt-heterogeneous-pretrained-transformers 同样刻意最小化处理,只做归一化。
- 人类视频入混合成为新趋势。villa-x(Ego4D 21.46% + 9 个人类视频源合计 3.6M 片段)、univla(Ego4D 3.0% + GNM 导航数据)把人类视频当作 mixture 的一等成员,而非单独预训练阶段。
RT-2 系工作则把配比问题上升到 co-fine-tuning:rt-2 让机器人数据占训练混合的 50%(PaLI-X)/66%(PaLM-E),与 WebLI 图文数据同源训练;foundation-models-in-robotics 综述把这条「同一模型既是 VLM 又是策略」的思路列为破解数据稀缺的核心路径。autort 则以 50-50 比例把自采 77k 数据与 RT-1 预训练数据混合 co-fine-tune。
三、遥操作硬件谱系:把单位时间产出拉起来
真机数据贵在采集吞吐。ALOHA 一脉(aloha-act 双臂 leader-follower,$18–20k)把成本从 DexPilot(~$100k/单臂手)、Shadow 系统(≥$400k)压下来;mobile-aloha 加移动底盘做全身移动操作;gello 用低成本关节复制主臂做通用遥操接口。VR/视觉遥操路线有 anyteleop(视觉手部重定向)、open-television(VR 沉浸式主动视觉)、bunny-visionpro(Apple Vision Pro 双手灵巧)、humanplus(RGB 相机实时人体+手部姿态影随)。人形全身遥操则有 twist2、wholebodyvla、wildlma-loco-manipulation-in-the-wild、clone-teleoperation、open-television。
这条线最有价值的一手数据是采集吞吐对比——它直接决定「同样预算能采多少」:
| 对比 | 高吞吐方式 | 低吞吐方式 | 倍差 | 来源 |
|---|---|---|---|---|
| 人类视频 vs 机器人遥操 | 人类 23 演示/min(Object-in-Bowl) | 机器人 2 演示/min | ~12× | egomimic |
| VR 人类 vs 遥操机器人 | 450 条/h | 250 条/h | 1.8× | bytedance-gr-3 |
| 仿真自动生成 vs 真机遥操 | 20 条 / 0.5h(plug insertion) | 2753 条 / 27h / 36 天 | ~时间成本悬殊 | demostart |
| 全身遥操 vs 解耦遥操 | whole-body 学习控制器 | base 与 arm 分开操作 | 采集成本 −26.9% | wildlma-loco-manipulation-in-the-wild |
| 隐动作预训练降遥操需求 | 人类视频 >50% 预训练 + 25 条微调 | <25% 预训练 + 200 条微调 | ~8× 数据压缩 | wholebodyvla |
四、手持采集器与 in-the-wild:UMI 谱系与数据缩放律
universal-manipulation-interface(UMI)是「绕开机器人本体采数据」的代表:一个手持夹爪 + GoPro,靠 SLAM + 基准标记从录像反解 6-DoF 末端轨迹当动作标签,无需机器人在场即可 in-the-wild 采集(野外杯子任务:3 名演示者、12 人·小时、跨 30 个真实地点、1400 条)。这一范式衍生出触觉版 vitamin-visuo-tactile-interface(视触觉手持,SLAM 成功率约 80%)、音频版 maniwav(保留摇晃声)、灵巧手版 dexumi(外骨骼)、多视角版 mv-umi,并被 ario-all-robots-in-one 整体收编(ManiWAV 是其唯一含声音模态的来源)。
UMI 谱系最重要的一手贡献是 data-scaling-laws-imitation(具身模仿学习的数据缩放律)——用 UMI 采 4 万+ 条演示、跑 1.5 万+ 次真机 rollout,得出对整个领域采集策略有指导意义的结论:
- 多样性 >> 数量。固定环境/物体数时加演示数很快饱和,加环境/物体多样性持续涨分。
- 每环境放几个物体? 环境数 ≥16 后,多物体 vs 单物体差异可忽略 → 推荐每个环境只放 1 个独有物体、尽量多铺环境。
- 每对采多少演示? 按推荐设定,8/16/32 个环境-物体对分别在 400/800/1600 条饱和 → 推荐每个环境-物体对采 50 条。
这组「多样性优先、50 条/对」的经验,与 aloha-unleashed 的数据量消融(ShirtMessy 这类「凌乱初始化」任务对数据量远比 ShirtEasy 敏感,且过滤掉冗长含失误演示有帮助、但过度过滤会丢失有价值的重试演示)、droid 的场景多样性分析一起,构成了当前采集实践的量化底座。
五、人类第一人称视频:被动可扩展的塔底
人类视频是数据金字塔的塔底——语义最丰富、采集最被动可扩展,但缺动作标签、有第一/第三视角与具身鸿沟。这条线从视觉表征预训练(r3m 用 Ego4D、mvp-masked-visual-pretraining 用 450 万张 Ego 图、vc-1-cortexbench 用 562 万帧 Ego4D+MNI 混合集)起步,逐步演进到直接把人手轨迹当动作监督。
| 数据集 | 规模 | 采集设备 | 标注 | 用途 |
|---|---|---|---|---|
| ego4d | 3,670h / 931 人 / 74 城 / 9 国 | 头戴相机 | 3.85M 叙述句 / >250k 工时 | 视频预训练底座(GR-1/R3M/MVP/VC-1) |
| ego-exo4d | 1,286.3h ego+exo / 740 人 / 123 场地 | 多视角 + Aria | 117,812 条专家点评 / 14M 帧姿态 | 技能理解、姿态估计 |
| egodex | 829h / 338k 演示 / 194 任务 / 90M 帧 | Apple Vision Pro | 25 关节/手 SE(3) + GPT-4 语言 | 灵巧操作行为学习;2.0TB |
| humanoid-policy-human-policy-ph2d | ~3.02M 帧 / 26,824 演示 | AVP / Quest3+ZED(<$700) | 语言指令 | 人-人形共训(PH²D) |
| in-n-on-human0 | 1,000h+ 野生 + 20h+ 任务对齐(PHSD) | AVP + Aria | — | EgoDex + ActionNet + PH2D 聚合 |
把「无动作人类视频」变成「可训练机器人数据」有两条主线:
(a) 显式重定向 / 手部轨迹当动作。egomimic 用 Aria 眼镜 MPS 输出 3D 手部位姿当动作,并把人类数据在时间上「放慢 4 倍」对齐机器人节奏;humanplus 用 WHAM+HaMeR 实时估计人体+手部姿态影随。这条线的关键实证是人类:机器人采样比——in-n-on-human0 发现后训练时把人类数据采样比调到约 70% 最能保留语义(与另一工作 8:2 的发现一致),bytedance-gr-3 用人类轨迹时把腕部相机填空白、只用手部轨迹监督。
(b) co-training 混合。gr-1(Ego4D 3 秒短片 80 万段 / 800 万帧预训练)、bytedance-gr-2(3800 万条文本-视频 / 500 亿 token)把人类视频当视频生成预训练语料;groot-n1 把 Ego4D 2144.7h + HoloAssist + Ego-Exo4D 等合计 2517 小时人类视频放进金字塔 base 层。
六、仿真与自动扩增:GPU 上的数据工厂
仿真的卖点是无限生成 + 自带像素级真值(分割/深度/6D 位姿)+ 可加速时间流速,代价是 sim-to-real gap(尤其可变形物/液体/接触物理)。这条线分几支:
程序化场景生成:procthor 程序化生成 1 万套房屋,behavior-1k 从 2000 个 WikiHow 活动众包出 1000 个日常活动 + 9,318 物体模型,robocasa 用生成式 AI 造资产(1,592 个 Luma.ai 物体 + MidJourney 纹理)。
从少量人类示范自动扩增是当前主力。mimicgen 从 <200 条人类示范生成 50k+ 条(靠物体位姿变换 + 成功率过滤 DGR),dexmimicgen 扩到双臂灵巧(60 源 → 21k),robotwin-2 每个 task-embodiment 组合给 100 clean + 400 域随机化轨迹(合计 100k+)。数据生成率(DGR)跨任务差异极大是这条线的普遍痛点(mimicgen Kitchen D0 100% vs Gear Assembly D1 仅 8.2%)。
仿真作为数据引擎/平台:maniskill/maniskill2/maniskill3(分而治之,per-object SAC 生成 3.6 万/4M+ 演示帧)、genie-sim(10,000h+ / 200 任务)、roboverse(聚合 15 个 benchmark → 510.5k 轨迹 / 276 任务 / 5.5k 资产)、genmanip(GPT-4 合成 ToSG 任务)。
| 系统 | 演示/场景规模 | 生成方式 | 保真手段 |
|---|---|---|---|
| procthor | 10,000 训练房屋 + 1,633 交互实例 | 程序化生成 + SAG 共现组 | Bernoulli(0.8) 材质随机化 |
| robocasa | 1,250 人类 + 72k/28k MimicGen = 100k+ | GPT-4 任务 + MimicGen 扩增 | Luma.ai/MidJourney 生成资产 |
| mimicgen | <200 源 → 50k+ / 18 任务 | 物体位姿变换 + 成功过滤 | robosuite + Factory(毫米级) |
| dexmimicgen | 60 源 → 21k / 9 任务 / 3 本体 | 对象中心分段-变换-重组 | RoboSuite/MuJoCo |
| robotwin-2 | 100k+(100 clean + 400 DR/组合) | 数字孪生 + 五轴域随机化 | 12k 材质库 + 桌高/位姿扰动 |
| genie-sim | 10,000h+ / 200 任务 / 5,140 资产 | AgiBot G1/G2 平台生成 | LLM+ADER 自动评测 |
| roboverse | 510.5k 轨迹 / 276 任务 / 5.5k 资产 | 15 benchmark 迁移 + RL rollout | Isaac Sim 域随机化 |
| groot-n1 sim | 780k 轨迹 ≈ 6,500h(11h 生成) | RoboCasa + DexMimicGen | 54 组合 × 10k 条 |
locomotion/RL 的「数据」= 仿真采样分布 + 域随机化范围。这一支没有离线数据集,规模由「并行环境数 × 步数」决定(learning-to-walk-in-minutes-massively-parallel-rl 4096 环境 / 1500 更新、rma-rapid-motor-adaptation Phase1 12 亿步、deep-whole-body-control-loco-manipulation 5000 环境 / 20 亿样本、walk-these-ways 2.58B timesteps)。数据配方的核心是域随机化 + 命令采样范围(摩擦、负载、电机强度、推力、延迟),domain-randomization 是这套方法的源头(几十万张低保真渲染图、零真实图像)。
七、人形运动数据:MoCap retarget 与 sim-to-data 清洗
人形全身控制自成一条数据脉络:人体动捕(AMASS 为主)→ retarget 到机器人 → sim-to-data 可行性过滤。h2o-human2humanoid 定义了这套「sim-to-data」清洗——先用特权运动模仿器去跟踪全部重定向序列,它跟不上的即判为机器人不可行并剔除(AMASS 13k → 10k retarget → 8.5k 可行)。这个过滤思路被 phc-perpetual-humanoid-control、hover、unitracker、gmt、asap、clone-teleoperation 广泛沿用。
| 工作 | 源库 | retarget 后规模 | 过滤/亮点 |
|---|---|---|---|
| phc-perpetual-humanoid-control | AMASS | 11,313 训练 + 140 测试 | 启发式剔除人-物交互 |
| h2o-human2humanoid | AMASS 40h / 13k clips | 10k → 8.5k(sim-to-data) | β′ 体型拟合 + 特权模仿器过滤 |
| humanplus | AMASS 40h | 11,000+ 序列 | SMPL-X 22 身体 + 30 手部关节 |
| twist | AMASS + OMOMO | 15k+(42h)+ 150 自采在线重定向 | 小撮在线重定向数据桥接分布差 |
| gmt | AMASS + LAFAN1 | 8,925 clip / 33.12h | 规则过滤 + 50 亿步策略完成度过滤 |
| unitracker | AMASS | 8,179(PHC 精筛) | 未过滤 vs 过滤定性对比证质量重要 |
| sonic | in-house 700h / 100M+ 帧 / 170 人 | + Bones-SEED 14.2 万条 / 288h 开源 | 身高 145–199cm;held-out AMASS 评测 |
| omniretarget | OMOMO + LAFAN1 + in-house | >8–9h(发布 4.0h) | 交互保留 + 运动学增广(79.1% vs 82.2%) |
一个反复被验证的一手结论:clone-teleoperation 用精心设计的 345 个运动片段,反而胜过 OmniH2O 的 8k+ 未针对性设计数据(「小而精 > 大而杂」),h2o-human2humanoid 的数据规模消融(0.1%/1%/10%/100% → 52%/58.8%/61.3%/72.5%)则表明强域随机化下即使 0.1% 数据也能到 52%。
八、无动作数据的动作化:latent action 与世界模型
金字塔塔底(人类视频)与塔中(神经生成视频)都没有动作标签,把它们「动作化」是 2024–2025 的关键突破。主线是 latent action:lapa-latent-action-pretraining 用 VQ-VAE 从相邻帧对学离散潜动作,univla 在 OXE+GNM+Ego4D 混合上只用帧序列 + 文本训隐动作模型(预训练完全不用真实动作标签),villa-x、moto、wholebodyvla 沿此路线。groot-n1 更把 latent action 与 IDM 伪动作并用——真机数据用「真实动作 + latent」双目标,神经轨迹用「latent + IDM」。
神经生成视频是塔中的新增层:groot-n1 用 LoRA 微调 WAN2.1-I2V 把 88 小时真机遥操「~10× 扩增到 827 小时」counterfactual 轨迹(23.8M 帧 @8fps),dreamgen-groot-dreams 提供跨真机/仿真/人类视频的 LAPA 训练混合,onex-neo-redwood 用世界模型(1XWM)验证「自主 rollout 里的失败样本对世界模型对齐最关键」。groot-n1 的四层金字塔全量统计是这条路线最完整的一手账本:真机 262.3M 帧 / 3288.8h、人类视频 181.3M 帧 / 2517h、仿真 125.5M 帧 / 1742.6h、神经视频 23.8M 帧 / 827.3h。
九、导航数据:网络视频与跨本体
导航自成数据谱系,核心是跨本体 + 网络视频。gnm-general-navigation-model/vint-foundation-model-visual-navigation 把 8–11 个已有数据集聚合(约 60–80 小时 / 6–8 种机器人本体、速度 0.2–10 m/s),nomad-goal-masked-diffusion-navigation 用 GNM + SACSoN 合计 100h+,动作标签全靠里程计自监督(图像目标从同轨迹未来帧采样,ViNG 式负样本挖掘)。更激进的是直接吃网络视频:citywalker-embodied-urban-navigation 用 2000 小时 YouTube 步行/驾驶视频 + DPVO 视觉里程计伪标签(250h 混合数据即接近 1000h 纯步行效果),lelan-language-conditioned-navigation-in-the-wild 用 130h+ 第一人称视频 + 「开源 VLM 出描述 + 廉价 LLM 出提示」的自动标注管线。仿真导航则有 uni-navid-video-vla-navigation(5.9M 样本 / 861 合成场景,其中 ObjectNav 必须用 rollout 而非最短路径,否则 SR 从成功骤降到 30.1%)、trackvla-embodied-visual-tracking(Habitat 3.0 自建 EVT-Bench,跟踪:识别 1:1 混合)。
空白与趋势
贯穿全局的张力是塔尖真机数据的稀缺——即便 agibot-world-colosseo 百万条、open-x-embodiment 聚合百万条,也比互联网视频小两个数量级(generalist-robot-internet-video-survey)。可观察到的趋势与空白:
- 从「采」到「造」的重心迁移。数据缩放律(data-scaling-laws-imitation「多样性 >> 数量」)与吞吐对比(人类视频比遥操快 6–12×、隐动作预训练压缩下游遥操需求 ~8×)正把资源从「堆真机遥操」推向「便宜采集器 + 人类视频 + 仿真扩增」;latent action / IDM 让无动作视频首次成为一等训练信号。
- 配比与清洗是隐性护城河。DROID 被反复「请出去」、Bridge no-op 首帧过滤决定成败——说明混合权重与数据清洗对最终性能的影响不亚于数据量本身,但目前多靠启发式(√N / n^0.43 / 逐数据集实测调权),缺乏原则性理论。
- 失败数据被重新发现价值。robomind(5k 失败附原因)、agibot-world-colosseo(1% 失败恢复)、q-transformer(保留 18.5 万失败 episode)、onex-neo-redwood(自主 rollout 失败样本对世界模型最关键)都表明「只留成功」是在丢信息。
- 口径混乱是治理债。几乎每个大数据集论文/项目页/HF 三处数字对不上(droid/robomind/agibot-world-colosseo/roboagent-mt-act/gnm-general-navigation-model),持续更新的数据托管进一步放大歧义——可复现性依赖显式版本快照。
- 触觉/力/音频仍是长尾。rh20t(指尖触觉)、maniwav(音频)、vitamin-visuo-tactile-interface(视触觉)、bunny-visionpro(FSR 触觉)尚属零星,大规模数据集仍以 RGB(-D) + 本体感受为主;接触密集与可变形/液体操作的数据保真度是公认短板(foundation-models-in-robotics、embodied-intelligence-simulators-world-models-survey)。
- 人形与灵巧手数据稀薄。ario-all-robots-in-one 明确指出「人形机器人数据量很小」,人形运动数据仍高度依赖 AMASS retarget + sim-to-data 过滤这一条窄路;灵巧手操作数据(dexmimicgen、dexcap、dexumi)规模远小于平行夹爪。