具身智能数据:从「没有互联网规模机器人数据」到把数据造出来

具身智能与 LLM/VLM 最根本的差别在数据这一维:语言/图文有互联网现成语料,而机器人动作数据必须一条一条采generalist-robot-internet-video-survey 把这个鸿沟量化得很直白——已知最大的互联网视频集 InternVid 有 76 万小时 / 2.3 亿片段,已知最大的开源机器人数据集 Open X-Embodiment 折算约 5,556 小时,两者相差两个数量级以上skild-brain 的博客更极端地论证「真正的 scale 需要万亿级样本——即便集合全地球人口去采,也要数年才能凑够 1000 亿条轨迹」。

因此整个领域的数据史,就是一部**「如何把数据便宜地造出来」的策略演化史**,每种策略在保真度 ↔ 规模 ↔ 成本三角里占不同的点:

  1. 真机遥操作——最保真、动作标签天然精确,但最贵(单实验室 → 机队 → 跨机构聚合);
  2. 跨具身聚合与配比——把已有数据集拼起来复用,核心问题从「采数据」变成「怎么混」;
  3. 低成本采集器 / 手持夹爪——绕开机器人本体,把采集成本压一个数量级;
  4. 人类第一人称视频——被动可扩展、语义丰富,但缺动作标签、有具身鸿沟;
  5. 仿真 + 自动扩增——GPU 上无限生成、自带像素级真值,但有 sim-to-real gap;
  6. 无动作标签数据的动作化——用 latent action / 世界模型把海量视频「翻译」成可训练信号。

英伟达 groot-n1 的「数据金字塔」把后几层整合成一个统一图景:塔底是海量人类视频(base)、塔中是仿真与神经生成视频(middle)、塔尖是稀少而昂贵的真机遥操作(peak)——vla-embodied-manipulation-surveydreamgen-groot-dreamsgalaxea-g0-5 等后续工作都沿用这一框架。


一、真机遥操作:从单实验室到平台级机队

早期:单实验室数据集(千—十万条量级)

第一代数据集回答的问题是「多任务 + 多域能不能兼得」。robonet 走的是自监督随机动作路线(162k 轨迹 / 1500 万帧 / 7 平台,但动作是随机推抓、非语义任务);bridge-data-original 第一次把「多任务 + 多域」凑齐(71 任务 / 10 环境 / WidowX250s + Oculus Quest 2,整套 <$3,600);rt-1 把规模拉到 13 万条、744 任务、13 台机器人采 17 个月,成为后来无数 VLA 的预训练底座(Fractal 数据)。bc-z 引入 HG-DAgger 共享自主(专家打底 + 人类实时纠错迭代 16 轮),rh20t 则把力/力矩 + 指尖触觉这类接触模态首次做进大规模数据集(7 种机器人配置、每技能约 750 次演示、40TB)。

数据集轨迹/演示任务·技能本体·采集采集组织特点
robonet~162k / 1500 万帧随机动作7 平台 / 4 机构自监督无人值守无语言、纯随机探索、36GB
bridge-data-original7,20071 任务WidowX250s + Quest2UC Berkeley + UPenn首个「多任务×多域」;<$3,600
bridgedata-v260,096(50,365 人类 + 9,731 脚本)13 技能 / 24 环境 / 100+ 物体WidowX250(~$4,000)事后众包语言标注84% 人类 / 16% 脚本;CC BY 4.0
rt-1~130k744 任务 / 12 类技能13 台 EDR / 17 月2×VR 手柄遥操Move-Near 337 条最多;已开源
bc-z25,877(11,108 专家 + 14,769 纠偏)+ 18,726 人类视频100 任务12 臂 / 7 人 / 5 月HG-DAgger 迭代 16 轮共享自主 + SQL 数据质检
roboagent-mt-act98,050(RoboSet 全集)48 任务 / 12 技能 / 11 场景4 场地 / 2 月遥操 + 启发式 + 语义增强每帧 SAM inpaint 自动增强
rh20t110k+ 机器人 + 110k+ 人类视频 / 5000 万帧147 任务 / 42 技能7 种机械臂×夹爪×力传感器数十志愿者、每技能重复 10 次力/力矩 + Cfg7 指尖触觉;40TB

平台级:百万条量级与「数据工厂」

2023–2025 数据集进入百万条 / 数千小时级,且采集从「拼实验室」变成「建工厂 + 标准化流水线」。droid 强调多样性五轴(564 场景 / 1417 视角 / 52 栋楼 / 13 机构,GPT-4V 自动分类场景),agibot-world-colosseo 直接建 4000㎡ 工厂 1:1 复刻家居/零售/工业/餐厅/办公五大域(100 万条 / 2976.4 小时),robomind 首创帧级细粒度语言标注 + 5k 条失败轨迹(附失败原因,类比 RLHF),galaxea-g0 坚持单一本体全量采集以保证感知-动作-语言对齐。这些数据集的共同套路是人在环质检闭环——采一批 → 训策略 → 部署评估 → 据表现回改采集协议(agibot-world-colosseo 由此发现并剔除「过多 idle 帧」,还提出对抗式采集 ADC)。

数据集轨迹时长任务·技能·场景本体采集方式
open-x-embodiment1M+(聚合 60 数据集)527 技能 / 160,266 任务22 本体 / 34 实验室聚合各源遥操标签,只统一格式
droid76k(+16k 失败不计入)350h86 任务 / 564 场景 / 1417 视角18 机器人(Franka)/ 13 机构每场景随机抽任务 GUI;GPT-4V 场景分类
agibot-world-colosseo1,003,672(Beta)2976.4h217 任务 / 87 技能 / 106 场景 / 3000+ 物体单本体 / 4000㎡ 工厂人工遥操 + 三阶段流水线;1% 失败恢复
robomind107k(+5k 失败)305.5h479 任务 / 38 技能 / 96 物体类4 本体(Franka/Tien Kung/AgileX/UR5e)10k 条帧级语言标注;8 条质检准则
galaxea-g0100k500h+150 任务 / 58 技能 / 1600+ 物体单本体 R1 Lite结构化 schema 语言标注;2.87TB
ario-all-robots-in-one3,033,188 episode321,064 任务 / 258 series聚合 + 自采 + 仿真三路统一时间戳数据标准;含 sim+real
pi0 自采903M timesteps~10,000h68 任务7 种机器人构型106M 单臂 + 797M 双臂;n^0.43 加权
bytedance-gr-3 自采拾放 69h + 清桌 101h + 挂衣 116h101 物体双臂采集调度器最大化多样性

一个反复出现的口径不一致教训:几乎每个大数据集的论文正文、项目页、HF release 三处数字都对不上(droid 76k vs 后续补标、robomind 论文 107k vs HF 107,877 / 12.3TB、agibot-world-colosseo 1,003,672 vs 1,001,552、roboagent-mt-act 98,050 vs 项目页 28,500)——本库一律以论文 Table 固定数字为准并显式并陈差异。


二、跨具身聚合与数据配比:从「采数据」到「怎么混」

open-x-embodiment(RT-X)是分水岭:它把 60 个现成数据集统一成标准格式,证明跨 22 本体的多样数据能带来正迁移(RT-1-X / RT-2-X)。从此下游 VLA 的核心工程问题不再是「采多少」,而是「混合权重怎么配」——因为各数据集规模差几个数量级,直接按条数采样会被 Kuka、Fractal 这类巨无霸主导。

主流做法有三种加权:octo启发式(下调低多样性、上调高多样性数据集,被 openvla 直接沿用);rdt-1b / hpt-heterogeneous-pretrained-transformers√N 加权(抑制大数据集过采样、保证小数据集被充分采样);pi0n^0.43 加权(下压被过度代表的组合如 laundry folding)。下表对齐同一批 OXE 子数据集在不同 VLA 里的采样占比,能看出各家取舍:

数据源openvlacogactspatialvlaunivlauniactvilla-x
Bridge13.3%15.3%15.34%6.8%13.3%5.47%
Fractal(RT-1)12.7%27.1%14.71%13.9%12.7%9.70%(RT-1)
Kuka12.7%14.7%7.06%6.3%12.7%1.97%
BC-Z7.5%8.6%8.64%8.8%7.5%3.47%
Language Table4.4%5.06%5.2%4.4%0.11%
droid10%(后期移除)排除11.66%10.0%3.46%
RH20T5.67%5.56%
agibot-world-colosseo Beta20.0%
ego4d(人类视频)3.0%21.46%

几个一手结论从表里跳出来:

  • DROID 是个反复被「请出去」的数据集openvlaspatialvla 都以 10%/保守权重并入 DROID,却发现其动作 token 准确率训练全程偏低,于是在训练最后 1/3 阶段把 DROID 移除并把权重重分配;cogact 干脆从一开始就排除 DROID 和 Language Table(分布差异过大)。
  • 数据清洗能决定成败openvla 发现原始 BridgeData V2 每条 demo 首帧记录了全零(no-op)动作,不过滤会让 VLA 频繁预测全零、评测时「冻住」——过滤首帧 transition 是它大幅超 RT-2-X 的关键。
  • 异构 vs 对齐是路线之争uniact 刻意保留动作异构性(EEF 位置/速度/关节位置混用),与 Octo/OpenVLA 需要「手工清洗成同一动作空间」形成对比;hpt-heterogeneous-pretrained-transformers 同样刻意最小化处理,只做归一化。
  • 人类视频入混合成为新趋势villa-x(Ego4D 21.46% + 9 个人类视频源合计 3.6M 片段)、univla(Ego4D 3.0% + GNM 导航数据)把人类视频当作 mixture 的一等成员,而非单独预训练阶段。

RT-2 系工作则把配比问题上升到 co-fine-tuningrt-2 让机器人数据占训练混合的 50%(PaLI-X)/66%(PaLM-E),与 WebLI 图文数据同源训练;foundation-models-in-robotics 综述把这条「同一模型既是 VLM 又是策略」的思路列为破解数据稀缺的核心路径。autort 则以 50-50 比例把自采 77k 数据与 RT-1 预训练数据混合 co-fine-tune。


三、遥操作硬件谱系:把单位时间产出拉起来

真机数据贵在采集吞吐。ALOHA 一脉(aloha-act 双臂 leader-follower,$18–20k)把成本从 DexPilot(~$100k/单臂手)、Shadow 系统(≥$400k)压下来;mobile-aloha 加移动底盘做全身移动操作;gello 用低成本关节复制主臂做通用遥操接口。VR/视觉遥操路线有 anyteleop(视觉手部重定向)、open-television(VR 沉浸式主动视觉)、bunny-visionpro(Apple Vision Pro 双手灵巧)、humanplus(RGB 相机实时人体+手部姿态影随)。人形全身遥操则有 twist2wholebodyvlawildlma-loco-manipulation-in-the-wildclone-teleoperationopen-television

这条线最有价值的一手数据是采集吞吐对比——它直接决定「同样预算能采多少」:

对比高吞吐方式低吞吐方式倍差来源
人类视频 vs 机器人遥操人类 23 演示/min(Object-in-Bowl)机器人 2 演示/min~12×egomimic
VR 人类 vs 遥操机器人450 条/h250 条/h1.8×bytedance-gr-3
仿真自动生成 vs 真机遥操20 条 / 0.5h(plug insertion)2753 条 / 27h / 36 天~时间成本悬殊demostart
全身遥操 vs 解耦遥操whole-body 学习控制器base 与 arm 分开操作采集成本 −26.9%wildlma-loco-manipulation-in-the-wild
隐动作预训练降遥操需求人类视频 >50% 预训练 + 25 条微调<25% 预训练 + 200 条微调~8× 数据压缩wholebodyvla

四、手持采集器与 in-the-wild:UMI 谱系与数据缩放律

universal-manipulation-interface(UMI)是「绕开机器人本体采数据」的代表:一个手持夹爪 + GoPro,靠 SLAM + 基准标记从录像反解 6-DoF 末端轨迹当动作标签,无需机器人在场即可 in-the-wild 采集(野外杯子任务:3 名演示者、12 人·小时、跨 30 个真实地点、1400 条)。这一范式衍生出触觉版 vitamin-visuo-tactile-interface(视触觉手持,SLAM 成功率约 80%)、音频版 maniwav(保留摇晃声)、灵巧手版 dexumi(外骨骼)、多视角版 mv-umi,并被 ario-all-robots-in-one 整体收编(ManiWAV 是其唯一含声音模态的来源)。

UMI 谱系最重要的一手贡献是 data-scaling-laws-imitation具身模仿学习的数据缩放律)——用 UMI 采 4 万+ 条演示、跑 1.5 万+ 次真机 rollout,得出对整个领域采集策略有指导意义的结论:

  • 多样性 >> 数量。固定环境/物体数时加演示数很快饱和,加环境/物体多样性持续涨分。
  • 每环境放几个物体? 环境数 ≥16 后,多物体 vs 单物体差异可忽略 → 推荐每个环境只放 1 个独有物体、尽量多铺环境
  • 每对采多少演示? 按推荐设定,8/16/32 个环境-物体对分别在 400/800/1600 条饱和 → 推荐每个环境-物体对采 50 条

这组「多样性优先、50 条/对」的经验,与 aloha-unleashed 的数据量消融(ShirtMessy 这类「凌乱初始化」任务对数据量远比 ShirtEasy 敏感,且过滤掉冗长含失误演示有帮助、但过度过滤会丢失有价值的重试演示)、droid 的场景多样性分析一起,构成了当前采集实践的量化底座。


五、人类第一人称视频:被动可扩展的塔底

人类视频是数据金字塔的塔底——语义最丰富、采集最被动可扩展,但缺动作标签、有第一/第三视角与具身鸿沟。这条线从视觉表征预训练(r3m 用 Ego4D、mvp-masked-visual-pretraining 用 450 万张 Ego 图、vc-1-cortexbench 用 562 万帧 Ego4D+MNI 混合集)起步,逐步演进到直接把人手轨迹当动作监督。

数据集规模采集设备标注用途
ego4d3,670h / 931 人 / 74 城 / 9 国头戴相机3.85M 叙述句 / >250k 工时视频预训练底座(GR-1/R3M/MVP/VC-1)
ego-exo4d1,286.3h ego+exo / 740 人 / 123 场地多视角 + Aria117,812 条专家点评 / 14M 帧姿态技能理解、姿态估计
egodex829h / 338k 演示 / 194 任务 / 90M 帧Apple Vision Pro25 关节/手 SE(3) + GPT-4 语言灵巧操作行为学习;2.0TB
humanoid-policy-human-policy-ph2d~3.02M 帧 / 26,824 演示AVP / Quest3+ZED(<$700)语言指令人-人形共训(PH²D)
in-n-on-human01,000h+ 野生 + 20h+ 任务对齐(PHSD)AVP + AriaEgoDex + ActionNet + PH2D 聚合

把「无动作人类视频」变成「可训练机器人数据」有两条主线:

(a) 显式重定向 / 手部轨迹当动作egomimic 用 Aria 眼镜 MPS 输出 3D 手部位姿当动作,并把人类数据在时间上「放慢 4 倍」对齐机器人节奏;humanplus 用 WHAM+HaMeR 实时估计人体+手部姿态影随。这条线的关键实证是人类:机器人采样比——in-n-on-human0 发现后训练时把人类数据采样比调到约 70% 最能保留语义(与另一工作 8:2 的发现一致),bytedance-gr-3 用人类轨迹时把腕部相机填空白、只用手部轨迹监督。

(b) co-training 混合gr-1(Ego4D 3 秒短片 80 万段 / 800 万帧预训练)、bytedance-gr-2(3800 万条文本-视频 / 500 亿 token)把人类视频当视频生成预训练语料;groot-n1 把 Ego4D 2144.7h + HoloAssist + Ego-Exo4D 等合计 2517 小时人类视频放进金字塔 base 层。


六、仿真与自动扩增:GPU 上的数据工厂

仿真的卖点是无限生成 + 自带像素级真值(分割/深度/6D 位姿)+ 可加速时间流速,代价是 sim-to-real gap(尤其可变形物/液体/接触物理)。这条线分几支:

程序化场景生成procthor 程序化生成 1 万套房屋,behavior-1k 从 2000 个 WikiHow 活动众包出 1000 个日常活动 + 9,318 物体模型,robocasa 用生成式 AI 造资产(1,592 个 Luma.ai 物体 + MidJourney 纹理)。

从少量人类示范自动扩增是当前主力。mimicgen 从 <200 条人类示范生成 50k+ 条(靠物体位姿变换 + 成功率过滤 DGR),dexmimicgen 扩到双臂灵巧(60 源 → 21k),robotwin-2 每个 task-embodiment 组合给 100 clean + 400 域随机化轨迹(合计 100k+)。数据生成率(DGR)跨任务差异极大是这条线的普遍痛点(mimicgen Kitchen D0 100% vs Gear Assembly D1 仅 8.2%)。

仿真作为数据引擎/平台maniskill/maniskill2/maniskill3(分而治之,per-object SAC 生成 3.6 万/4M+ 演示帧)、genie-sim(10,000h+ / 200 任务)、roboverse(聚合 15 个 benchmark → 510.5k 轨迹 / 276 任务 / 5.5k 资产)、genmanip(GPT-4 合成 ToSG 任务)。

系统演示/场景规模生成方式保真手段
procthor10,000 训练房屋 + 1,633 交互实例程序化生成 + SAG 共现组Bernoulli(0.8) 材质随机化
robocasa1,250 人类 + 72k/28k MimicGen = 100k+GPT-4 任务 + MimicGen 扩增Luma.ai/MidJourney 生成资产
mimicgen<200 源 → 50k+ / 18 任务物体位姿变换 + 成功过滤robosuite + Factory(毫米级)
dexmimicgen60 源 → 21k / 9 任务 / 3 本体对象中心分段-变换-重组RoboSuite/MuJoCo
robotwin-2100k+(100 clean + 400 DR/组合)数字孪生 + 五轴域随机化12k 材质库 + 桌高/位姿扰动
genie-sim10,000h+ / 200 任务 / 5,140 资产AgiBot G1/G2 平台生成LLM+ADER 自动评测
roboverse510.5k 轨迹 / 276 任务 / 5.5k 资产15 benchmark 迁移 + RL rolloutIsaac Sim 域随机化
groot-n1 sim780k 轨迹 ≈ 6,500h(11h 生成)RoboCasa + DexMimicGen54 组合 × 10k 条

locomotion/RL 的「数据」= 仿真采样分布 + 域随机化范围。这一支没有离线数据集,规模由「并行环境数 × 步数」决定(learning-to-walk-in-minutes-massively-parallel-rl 4096 环境 / 1500 更新、rma-rapid-motor-adaptation Phase1 12 亿步、deep-whole-body-control-loco-manipulation 5000 环境 / 20 亿样本、walk-these-ways 2.58B timesteps)。数据配方的核心是域随机化 + 命令采样范围(摩擦、负载、电机强度、推力、延迟),domain-randomization 是这套方法的源头(几十万张低保真渲染图、零真实图像)。


七、人形运动数据:MoCap retarget 与 sim-to-data 清洗

人形全身控制自成一条数据脉络:人体动捕(AMASS 为主)→ retarget 到机器人 → sim-to-data 可行性过滤h2o-human2humanoid 定义了这套「sim-to-data」清洗——先用特权运动模仿器去跟踪全部重定向序列,它跟不上的即判为机器人不可行并剔除(AMASS 13k → 10k retarget → 8.5k 可行)。这个过滤思路被 phc-perpetual-humanoid-controlhoverunitrackergmtasapclone-teleoperation 广泛沿用。

工作源库retarget 后规模过滤/亮点
phc-perpetual-humanoid-controlAMASS11,313 训练 + 140 测试启发式剔除人-物交互
h2o-human2humanoidAMASS 40h / 13k clips10k → 8.5k(sim-to-data)β′ 体型拟合 + 特权模仿器过滤
humanplusAMASS 40h11,000+ 序列SMPL-X 22 身体 + 30 手部关节
twistAMASS + OMOMO15k+(42h)+ 150 自采在线重定向小撮在线重定向数据桥接分布差
gmtAMASS + LAFAN18,925 clip / 33.12h规则过滤 + 50 亿步策略完成度过滤
unitrackerAMASS8,179(PHC 精筛)未过滤 vs 过滤定性对比证质量重要
sonicin-house 700h / 100M+ 帧 / 170 人+ Bones-SEED 14.2 万条 / 288h 开源身高 145–199cm;held-out AMASS 评测
omniretargetOMOMO + LAFAN1 + in-house>8–9h(发布 4.0h)交互保留 + 运动学增广(79.1% vs 82.2%)

一个反复被验证的一手结论:clone-teleoperation 用精心设计的 345 个运动片段,反而胜过 OmniH2O 的 8k+ 未针对性设计数据(「小而精 > 大而杂」),h2o-human2humanoid 的数据规模消融(0.1%/1%/10%/100% → 52%/58.8%/61.3%/72.5%)则表明强域随机化下即使 0.1% 数据也能到 52%。


八、无动作数据的动作化:latent action 与世界模型

金字塔塔底(人类视频)与塔中(神经生成视频)都没有动作标签,把它们「动作化」是 2024–2025 的关键突破。主线是 latent actionlapa-latent-action-pretraining 用 VQ-VAE 从相邻帧对学离散潜动作,univla 在 OXE+GNM+Ego4D 混合上只用帧序列 + 文本训隐动作模型(预训练完全不用真实动作标签),villa-xmotowholebodyvla 沿此路线。groot-n1 更把 latent action 与 IDM 伪动作并用——真机数据用「真实动作 + latent」双目标,神经轨迹用「latent + IDM」。

神经生成视频是塔中的新增层:groot-n1 用 LoRA 微调 WAN2.1-I2V 把 88 小时真机遥操「~10× 扩增到 827 小时」counterfactual 轨迹(23.8M 帧 @8fps),dreamgen-groot-dreams 提供跨真机/仿真/人类视频的 LAPA 训练混合,onex-neo-redwood 用世界模型(1XWM)验证「自主 rollout 里的失败样本对世界模型对齐最关键」。groot-n1 的四层金字塔全量统计是这条路线最完整的一手账本:真机 262.3M 帧 / 3288.8h、人类视频 181.3M 帧 / 2517h、仿真 125.5M 帧 / 1742.6h、神经视频 23.8M 帧 / 827.3h。


九、导航数据:网络视频与跨本体

导航自成数据谱系,核心是跨本体 + 网络视频gnm-general-navigation-model/vint-foundation-model-visual-navigation 把 8–11 个已有数据集聚合(约 60–80 小时 / 6–8 种机器人本体、速度 0.2–10 m/s),nomad-goal-masked-diffusion-navigation 用 GNM + SACSoN 合计 100h+,动作标签全靠里程计自监督(图像目标从同轨迹未来帧采样,ViNG 式负样本挖掘)。更激进的是直接吃网络视频:citywalker-embodied-urban-navigation 用 2000 小时 YouTube 步行/驾驶视频 + DPVO 视觉里程计伪标签(250h 混合数据即接近 1000h 纯步行效果),lelan-language-conditioned-navigation-in-the-wild 用 130h+ 第一人称视频 + 「开源 VLM 出描述 + 廉价 LLM 出提示」的自动标注管线。仿真导航则有 uni-navid-video-vla-navigation(5.9M 样本 / 861 合成场景,其中 ObjectNav 必须用 rollout 而非最短路径,否则 SR 从成功骤降到 30.1%)、trackvla-embodied-visual-tracking(Habitat 3.0 自建 EVT-Bench,跟踪:识别 1:1 混合)。


空白与趋势

贯穿全局的张力是塔尖真机数据的稀缺——即便 agibot-world-colosseo 百万条、open-x-embodiment 聚合百万条,也比互联网视频小两个数量级(generalist-robot-internet-video-survey)。可观察到的趋势与空白:

  • 从「采」到「造」的重心迁移。数据缩放律(data-scaling-laws-imitation「多样性 >> 数量」)与吞吐对比(人类视频比遥操快 6–12×、隐动作预训练压缩下游遥操需求 ~8×)正把资源从「堆真机遥操」推向「便宜采集器 + 人类视频 + 仿真扩增」;latent action / IDM 让无动作视频首次成为一等训练信号。
  • 配比与清洗是隐性护城河。DROID 被反复「请出去」、Bridge no-op 首帧过滤决定成败——说明混合权重与数据清洗对最终性能的影响不亚于数据量本身,但目前多靠启发式(√N / n^0.43 / 逐数据集实测调权),缺乏原则性理论。
  • 失败数据被重新发现价值robomind(5k 失败附原因)、agibot-world-colosseo(1% 失败恢复)、q-transformer(保留 18.5 万失败 episode)、onex-neo-redwood(自主 rollout 失败样本对世界模型最关键)都表明「只留成功」是在丢信息。
  • 口径混乱是治理债。几乎每个大数据集论文/项目页/HF 三处数字对不上(droid/robomind/agibot-world-colosseo/roboagent-mt-act/gnm-general-navigation-model),持续更新的数据托管进一步放大歧义——可复现性依赖显式版本快照。
  • 触觉/力/音频仍是长尾rh20t(指尖触觉)、maniwav(音频)、vitamin-visuo-tactile-interface(视触觉)、bunny-visionpro(FSR 触觉)尚属零星,大规模数据集仍以 RGB(-D) + 本体感受为主;接触密集与可变形/液体操作的数据保真度是公认短板(foundation-models-in-roboticsembodied-intelligence-simulators-world-models-survey)。
  • 人形与灵巧手数据稀薄ario-all-robots-in-one 明确指出「人形机器人数据量很小」,人形运动数据仍高度依赖 AMASS retarget + sim-to-data 过滤这一条窄路;灵巧手操作数据(dexmimicgendexcapdexumi)规模远小于平行夹爪。