一句话定位

浙江大学团队的机器人灵巧操作综述:把机器人操作的演进归纳为机械编程、闭环控制、具身智能三个历史阶段,聚焦当前”具身灵巧操作阶段”,沿数据采集范式(仿真生成 / 人类示范 / 遥操作示范)与技能学习框架(模仿学习 / 强化学习)两条主线系统盘点现状,最终总结出数据不足、静态学习框架鲁棒性弱、端到端框架泛化性不足三大待解挑战。

背景与定位

作者:Gaofeng Li(通讯作者)、Ruize Wang、Peisen Xu、Qi Ye、Jiming Chen,均来自浙江大学控制科学与工程学院,依托浙江省协同感知与自主无人系统重点实验室,受国家自然科学基金(62203426、2088101)资助。2025 年 7 月 16 日提交 arXiv v1。

论文在引言中明确定位于六篇既有综述的空白之间:Liu et al. 只总结 DRL 算法在操作控制中的应用;Mohammed et al. 把杂乱环境下的 DRL 操作任务分三类review;Fang et al. 从示范、表征、学习算法三方面review模仿学习;Yu et al. 系统review了多指手从模型式方法到 RL 的方法演进;Han et al. 总结了基于学习的操作方法,但过于聚焦算法本身而忽略了训练所需的数据采集这一基石;Liu et al. 按数据集来源把方法分三类review,但同样没有涉及数据采集方法本身;Newbury et al. 系统review了深度学习在物体抓取中的应用(方法/数据集/基准),但主要针对二指或三指抓手,很少考虑拟人多指手,且聚焦数据集设计而非采集方法。本文的三点自陈贡献:(1) 按时间顺序把机器人操作发展分为机械编程、闭环控制、具身智能操作三个阶段,逐一给出各阶段特征与挑战;(2) 聚焦当前具身灵巧操作阶段,从数据采集方法与操作技能学习框架两方面系统列举近期进展;(3) 基于上述分析总结三项制约灵巧操作发展的关键挑战。

与本库其他工作的关联:文中把 NVIDIA groot-n1(GR00T N1)作为遥操作数据采集系统的代表引用(借助 Apple Vision Pro 采集多指手遥操作示范);在展望长时程组合技能学习时,把 Figure AI 的 figure-helix(Helix:System 1 快速反应控制 + System 2 慢速审慎推理)作为尚未充分展开的未来框架提及,但正文未给出正式引用编号。

模型架构

本文是纯综述,不提出新模型,其”架构性”贡献是一套分类学:

机器人操作的三阶段历史框架(§II):

  1. 机械编程阶段——以 Unimate、PUMA560 配平行抓手为代表,依预编程控制器完成产线拾放,无外部感知能力,无法适应工件位置/形状变化。
  2. 闭环控制阶段——基于视觉伺服,通过 Eye-in-Hand 或 Eye-to-Hand 相机把视觉反馈引入控制回路做基于特征跟踪的闭环控制,代表系统 ABB YuMi 双臂协作机器人可在半结构化环境完成部件装配;局限是仍依赖对外部环境/工件的精确建模,非结构化场景中的建模误差会显著降低操作性能。
  3. 具身智能操作阶段——强调端到端”感知-决策-执行”闭环,基于视觉、力、触觉等多模态信息增强对环境的理解,是当前赋予机器人拟人灵巧操作能力最有希望的技术路线。

末端执行器的硬件演进(Fig.1):平行抓手 → 多指抓手 → 软体欠驱动手 → 刚性灵巧手 → 高度拟人的全驱动手;同时软体抓手/软体手也逐渐成熟。

§III 从抓手到多指手的挑战:机器人所操作的对象从传统刚性工件变为难以感知/建模的复杂对象——线状物(如线缆)、透明物(如玻璃)、软体物(如布料)、可形变物(如医疗手术中的人体组织);操作类型也从基础拾放扩展到依赖单点接触实现复杂物体移动的”点触滑动”操作、推拉操作(如拨算盘、开关阀门)、仅靠单手完成物体旋转的手内操作,以及阀门开合/工具使用等场景化灵巧操作。文中指出当前研究主要仍集中在二指抓手上——如 Google 的机器人大语言模型 RT-X 系列与结合 LLM+VLM 的 VoxPoser——二指抓手的两大缺陷是接触点少、抓取不够稳定可靠,以及自由度少、无法完成手内旋转/工具使用等复杂操作。相比二指抓手,多指灵巧手的技能学习尤其困难:更高自由度和更多变的交互空间显著增加了 RL 等算法在高维空间中搜索的难度;操作过程中与物体存在多接触点,力学特性更复杂多样。

人-机形态差距(Fig.4,§IV-B):Allegro Hand 只有四指且每根手指远大于人类手指;Shadow Hand 手指纤细接近人手,但背后有一个巨大的驱动箱,严重限制了手的可达空间——这是人类示范数据难以直接迁移到机器人(Human-to-Robot gap)的具体形态学根源。

数据

综述汇总了三类灵巧操作数据采集范式(Table I),逐一列出代表工作与具体规模数字:

(1) 基于仿真平台生成——优势是规避真实世界重复试验的高成本与危险性、可高效低成本重复生成大量同源可比数据、可通过改变仿真时间流速加速数据采集;局限是摩擦力/空气阻力等建模误差带来 Sim2Real gap,且对可形变/柔性物体的物理引擎仿真效果仍不理想、计算资源消耗大。代表工作:

  • GraspM³(Li et al., ICRA 2024,论文标题《TPGP: Temporal-parametric optimization with deep grasp prior for dexterous motion planning》)——为 Shadow Hand 提供覆盖 8,152 个物体百万级抓取轨迹。
  • RoboGen(Wang et al., ICML 2024)——生成式机器人智能体,自动生成任务、场景与训练监督信号,理论上可无限生成数据;末端执行器为普通抓手。
  • DexGraspNet(Wang et al., ICRA 2023)——面向 Shadow Hand 的大规模仿真抓取数据集,含 133 个类别、5,355 个物体132 万条抓取数据。
  • GRUtopia(综述表中写作 “GRPtopia”,Wang et al., arXiv:2407.10943,上海人工智能实验室)——城市级具身智能仿真平台,提供 89 个功能场景10 万条高质量交互数据。
  • 综述另列举 Genesis、Isaac Sim、PyBullet、MuJoCo 作为常用物理引擎基础设施。

(2) 基于人类示范采集——优势是规模上不及仿真数据,但显著降低了真机反复试错的难度、无需机器人硬件即可扩大采集范围,且是真实物理环境中产生的真实交互数据,能显著缩小 Sim2Real gap;局限是人-机形态差异导致人类示范数据难以直接复现到机器人上(Human-to-Robot gap,见上文 Allegro/Shadow Hand 对比)。代表工作:

  • VideoDex(Bahl et al., CoRL 2023 + CVPR 2023)——从互联网上已有的数十亿量级视频中提取人类动作与关键交互要素,指导多指手行为。
  • VTDexManip(Liu et al., ICLR 2025 + ICRA 2024)——视触觉融合的人体动作捕捉系统,采集10 项日常任务、182 个物体的视触觉数据集,面向多指手。

(3) 基于遥操作示范采集——通过人机共享控制把人类智能融入机器人操作,同时严格遵守机器人自身运动学/动力学约束,可同时缓解 Sim2Real gap 与 Human-to-Robot gap。代表工作:

  • Open-TeleVision(Cheng et al., CoRL 2025,综述称由 MIT 与 UCSD 共同开发)——通过 VR 设备把操作者的手臂/手部动作镜像到机器人,无力反馈,面向多指手。
  • NVIDIA GR00T(即 groot-n1,arXiv:2503.14734)——利用 Apple Vision Pro 等多种设备捕捉人手动作用于遥操作示范数据采集,无力反馈,面向多指手。
  • DexCap(Wang et al., arXiv:2403.07788)——通过动捕手套+多相机捕捉人手腕 6 自由度姿态与手指动作,无力反馈,面向多指手。
  • Mobile ALOHA(Fu et al., arXiv:2401.02117)——通过全身遥操作系统采集双臂移动操作数据,末端执行器为抓手。
  • π0(Black et al., arXiv:2410.24164)——在单臂与双臂机器人上采集由复杂行为组成的 68 个任务数据,控制频率较低,末端执行器为抓手。

综述指出现有遥操作系统的共性问题:多数系统仅靠视觉反馈构成”弱耦合”,缺乏对人类的力/触觉反馈,导致接触密集型任务中人类的力觉/触觉经验难以有效融入采集数据;多数系统基于二指抓手,缺乏高自由度多指灵巧手数据集;此外现有系统时延偏高——§IV-C 原文表述为”exhibit latencies exceeding tens of milliseconds”(超过数十毫秒),而 §VI 总结挑战时的表述是”current latencies for existing systems is generally at several milliseconds”(通常为几毫秒级)——原文两处对时延量级的措辞并不一致,但结论一致:现有遥操作系统的敏捷性都不足以支撑精细操作。

训练方法

综述把技能学习框架归纳为模仿学习(IL)与强化学习(RL)两大类(Table II)。

IL 的两条支线

  1. 概率建模类(GMM/GMR 为主)——用高斯混合模型对人类示范数据做概率建模,复现时对轨迹参数化并优化以匹配学到的概率模型;相比深度学习/RL 所需训练数据更少、无需先验知识、不依赖大型神经网络、数学可解释性更好。代表方法:DMP(编码示范轨迹为稳定可复现的吸引子动力学)、SEDS(把运动建模为非线性自治动力系统)、ProMP(用概率模型建模运动的变异性)、TPGMM(自动适应机器人遇到的新情况)、KMP(基于核方法的轨迹学习+多坐标系表示,适应未见障碍物与高维输入)。局限:主要适合简单轨迹复现,难以处理涉及复杂视触觉信息的交互任务,应用大多局限于机械臂+二指抓手的单任务学习,很少拓展到多指灵巧手。
  2. 深度学习策略网络类——不依赖环境交互或奖励,直接从预采集数据集学习模仿人类专家决策。代表方法:行为克隆 BC(Arunachalam et al. ICRA 2023,仅用单个 RGB 相机采集遥操作人类示范;Ye et al. RA-L 2023,用隐函数从人类示范生成多指手连续抓取动作;Wang et al. RA-L 2024,结合行为分类与几何增强,从混合质量示范数据集中做有效 BC;DIH-Tele,融合触觉信息做多指手 IL)、逆强化学习 IRL(Das et al. CoRL 2020,用预训练视觉动力学模型学习 cost function 再做视觉 MPC 复现;Orbik et al. ICDL 2021,结合随机采样生成与奖励归一化克服演示依赖型奖励偏差)、生成对抗模仿学习 GAIL(Ho & Ermon, NeurIPS 2016,先用 IRL 恢复专家 cost function 再用 RL 从中提取策略)。局限:只能学习静态行为,无法像 RL 那样超越人类表现;遇到训练分布外状态时性能显著下降,鲁棒性不足。

RL:已成为灵巧操作技能学习的主导范式。专用仿真环境如 Bi-DexHands(Chen et al., TPAMI 2024,双手灵巧手仿真器,含 20 个双手操作任务数千个目标物体)支撑了大量方法研究。纯粹依赖”智能体-环境”交互的 RL 常受稀疏奖励与低样本效率困扰,通常需要百万级迭代才能学到有用行为,探索过程也可能产生不连贯或不安全的动作。为提升效率,近期工作利用预训练模型提取的特征引导下游任务(借鉴 GPT 式预训练思路、移动机器人导航中的预训练 masked image model)。触觉信息被反复证明有效:Su et al.(ICRA 2024)仅用本体感知+触觉信息训练机器人把物体转到目标朝向;TactileAIRL(Liu et al., IROS 2024)把基于模型的技术与内在好奇心引入 RL 过程,利用视觉触觉特征提取有意义的接触信息;T-TD3(Zhou et al., TASE 2025)利用触觉先验实现可形变物体的稳定抓取;DartBot(Aslam et al., TASE 2025)结合触觉探索与 RL 实现非刚性小物体的鲁棒投掷技能。融入人类先验以提升 RL 效率的方向:DAPG(Rajeswaran et al., RSS 2018)是首个引入预训练模型思路的工作;DexH2R(Zhao et al., 2024)结合人手动作重定向与任务导向的残差动作策略;UC Berkeley 的人机交互系统(Luo, Xu, Wu, Levine,2025)在学习过程中持续检测人类操作者的纠正信号并离线更新策略——综述指出这类方法目前仍是弱耦合、离散式的人类监督,而非连续紧密耦合的引导。长时程组合技能方向:LEGION(Meng et al., Nature Machine Intelligence 2025)利用贝叶斯非参数模型与语言嵌入方法实现终身强化学习,支持语言引导的技能组合,但仍局限于简单抓手,多指手的技能组合性研究基本空白;面向多指手,Figure AI 提出的 Helix 框架设想结合 System 1(快速反应控制)与 System 2(慢速审慎推理)模拟人类认知系统,但综述指出该概念如何落地仍不明确。

Infra(训练 / 推理工程)

综述本身不训练模型,未披露任何自有 GPU 数量、GPU-hours、并行策略或训练精度数字。全文唯一涉及”运行性能”的量化描述是遥操作系统时延,但原文本身在两处给出的量级并不一致——§IV-C 称”超过数十毫秒”,§VI 称”通常为几毫秒级”——均未给出具体机型/测量方法,无法进一步核实统一数值,此处如实并列两处原文表述而不做调和。除此之外未见任何推理 FPS/控制频率/边缘硬件的具体数字。

评测 benchmark

综述不构建统一新基准,也未提供跨方法的成功率/精度对比表。文中出现的量化数字均为对既有数据集/仿真器”规模”的转述(详见”数据”一节:GraspM³ 百万级轨迹覆盖 8,152 物体、DexGraspNet 132 万条数据覆盖 5,355 物体 133 类、GRUtopia 89 场景 10 万条交互数据、VTDexManip 10 项任务 182 物体、Bi-DexHands 20 个双手任务数千物体、π0 数据集 68 个任务),而非方法间的评测结果对比。因此本篇不提供可摘录的 benchmark 成绩表。

创新点与影响

贡献

  1. 首次按时间顺序把机器人操作的发展系统划分为机械编程、闭环控制、具身智能操作三个阶段,逐阶段给出特征与瓶颈。
  2. 聚焦当前具身灵巧操作阶段,沿数据采集(仿真生成/人类示范/遥操作示范)与技能学习框架(IL/RL)两条主线做系统性梳理,覆盖数十项具体工作与数据集规模数字。
  3. 基于上述梳理总结三项制约灵巧操作发展的关键挑战,并给出对应的未来趋势判断。

它改变了什么:把此前分散在”纯 DRL 算法review”(Liu et al.)、“杂乱环境 DRL 分类review”(Mohammed et al.)、“纯 IL review”(Fang et al.)、“多指手模型式方法到 RL 演进”(Yu et al.)、“学习方法review但忽略数据采集”(Han et al.)、“按数据集分类但不谈采集方法”(Liu et al.)、“二三指抓手抓取深度学习review”(Newbury et al.)等六篇既有综述,统一到”数据采集范式 × 技能学习框架”这一两轴框架下,并首次把 Sim2Real gap、Human-to-Robot gap、遥操作弱耦合/高时延这三大瓶颈系统性地关联到多指灵巧手这一具体场景。

作者自陈局限 / 三大挑战(§VI,即本文对当前领域整体的诊断):

  1. 多指灵巧手高质量数据集不足:仿真数据信息熵低且存在 Sim2Real gap;人类示范数据存在 Human-to-Robot gap(Allegro/Shadow Hand 与人手的形态差异);现有操作技能数据集绝大多数基于二指抓手采集,高自由度多指手数据集稀缺;现有遥操作系统虽能同时缓解上述两个 gap,但普遍仅靠视觉反馈(弱”人-机”耦合,缺乏力/触觉反馈)且时延偏高,敏捷性不足以支撑精细操作。促进方向:构建具备高自由度力-触觉反馈的敏捷遥操作机器人系统,实现紧密的”人-机-环境”耦合;在视觉模态之外融入力、触觉等其他模态传感以丰富接触信息。
  2. 静态学习框架的鲁棒性弱:当前基于 RL/IL 的技能学习框架只能从既有数据集中静态提取操作技能,无法动态调整;人类监督/引导与学习过程弱耦合,无法及时反映人类对技能学习效果的满意度;一旦环境或任务超出数据集覆盖范围,性能会显著下降。促进方向:把人类实时纳入学习闭环,通过身体刚度、眼动追踪等生理信号量化人类意图——其中身体刚度因采集便捷、能丰富反映人类肌肉活动而尤其适合作为实时反馈信号,帮助机器人更及时地学习并完成从人到机器人的技能迁移。
  3. 端到端学习框架的泛化能力不足:当前操作技能学习普遍采用端到端框架,存在任务高耦合、缺乏可解释性等问题,难以适应长时程组合任务场景;近期虽有工作探索长时程任务的技能组合,但仍局限于简单机械臂+二指抓手配置,面向多指灵巧手的组合技能研究仍处于早期阶段。综述援引认知科学结论:人类完成长时程任务并非遵循端到端框架,而是先做任务分解,再自动无意识地执行各原子技能;受此启发提出的 Helix 框架尝试结合 System 1(快速反应控制)与 System 2(慢速审慎推理),但该框架的实现机制仍不明确。促进方向:构建整合上层决策模块与多模态感知的混合智能系统,模拟人类认知系统的组合机制,作为长时程组合任务场景下灵巧操作学习的可行路径。

原始链接

一手源存档(sources/)

  • 本篇为纯 arXiv 综述预印本,未见配套官方博客、GitHub 仓库、HF/ModelScope 模型卡或独立项目页可供归档;一手原文(arXiv HTML/PDF)不入 git,见上方”原始链接”。