一句话定位
2023 年 11 月挂出的早期综述,由同济大学「自主智能无人系统全国重点实验室」团队(Xuan Xiao、Jiahang Liu、Zhipeng Wang、Yanmin Zhou、Qian Cheng、Bin He、Shuo Jiang,通讯作者 Shuo Jiang)联合陕西科技大学(Yong Qi)完成:把 ChatGPT 之后涌入机器人学习的基础模型工作,按**操作(manipulation)/ 导航(navigation)/ 任务规划(planning)/ 推理(reasoning)**四条下游任务线拉网式梳理,前置一节汇总模拟器、数据集、基础模型三张清单表,末尾单列一节 discussion 给出六个未来方向。全文只有 arXiv v1,未见期刊或会议发表信息,也未附带配套代码仓库。
背景与定位
写作时间点正卡在 rt-2(2023-07,VLA 概念提出)与 open-x-embodiment(2023-10,跨本体数据集)刚发布之后,与 Firoozi 等人的 foundation-models-in-robotics(2023-12,Stanford/Princeton/NVIDIA/DeepMind)几乎同期,是这一波”基础模型进机器人”综述潮的最早一批之一。
与同期综述的定位差异:
- foundation-models-in-robotics 按「即插即用通用基础模型 vs. 从零造机器人专用基础模型」两分类组织,专辟一节讲安全与不确定性量化(conformal prediction);
- 本文按四类下游任务(操作/导航/规划/推理)组织,每类任务下再细分方法子类(如操作分”技能原语学习/复杂操作任务学习/多模态融合操作”),并在每类任务末尾单独列出 Datasets and Metrics 小节,附录再给出可复用的资源对照表(模拟器、通用数据集、各任务专用数据集)——更像一本”任务导向的资源手册”而非”技术路线地图”。
- 与稍晚的 vla-survey-embodied-ai(2024-05,聚焦 VLA 架构分类学)相比,本文更早、覆盖面更泛(不局限于 VLA,也纳入导航/推理等非 VLA 路线),但技术分类粒度更粗,多为”逐篇罗列 + 一句话摘要”而非提炼架构分类树。
技术演进脉络(Fig.2):教学编程 TP(运动学示教 kinesthetic teaching + 遥操作 teleoperation)→ 交互式强化学习 → 具身模仿学习 → 基于 AIGC 生成式模型的学习,本文的定位就是刻画最后一个阶段。
模型架构
本文不提出模型,“架构”贡献是任务导向的方法分类学,按四条下游任务线组织代表性工作(而非统一的 backbone/action-head 分类):
操作(Manipulation)——三个子类:
- 技能原语学习:LLM 引导动作原语学习(Huang et al. 用 saycan 同源思路做知识库任务采样:ActivityPrograms 292 个高层任务,88 个留出任务评测/204 个作演示集);rt-1(Brohan et al.,13 台机器人 17 个月采集 13 万条演示);RFUniverse(87 种原子操作、8 类物体基元的物理仿真环境);ManiSkill2(20 个操作任务 benchmark)。
- 复杂操作任务学习:RoboGen(仿真无限数据自动生成)、Eureka(LLM 设计奖励函数,首次让仿真灵巧手完成转笔)、CLIPort(CLIP 语义 + Transporter 空间精度)、EmbCLIP(无任务专属架构的简单基线)、Huang et al. 用 LLM 推断 affordance/约束再驱动 VLM 生成 3D value map 做零样本闭环操作、GNFactor(多任务视觉行为克隆)。
- 多模态融合操作:MOMA-Force(视觉+力感知模仿学习)、VIMA(多模态 prompt,transformer 自回归输出动作)、AudioPaLM(文本+语音)、rt-2(VLM 联合微调机器人轨迹数据 + 互联网视觉语言任务)、RPT(感知运动 token 序列上的 Transformer,预测缺失 token 学物理世界模型)、Sound-Action-Vision 数据集(Tilt-Bot 平台,60 个物体上 1.5 万次交互)。
导航(Navigation)——四个子类:环境感知(Lynch et al. 真实环境自然语言交互框架;IMU 与视觉 embedding 对齐扩展 VLM 模态)、地图构建(VLMaps 融合预训练视觉语言特征与 3D 重建;BEVbert 多模态地图预训练;HOZ 分层物体-区域地图)、自主定位(CLIP on Wheels 零样本开放词表导航;通用 VPR 方案)、运动规划(NavGPT——LLM 零样本序贯动作预测;March-In-Chat——房间/物体感知场景感知器 + LLM 实时通信,在 REVERIE benchmark 上超越此前模型;LACO——仅用单视角图像+语言线索+机器人构型学碰撞函数)。
任务规划(Task Planning)——单机器人任务分解(LLM+P——首个把经典规划器能力接入 LLM 的框架;Text2Motion——技能库 Q 函数编码可行性启发式;EmbodiedGPT——从 LLM 生成的规划查询中抽取任务相关特征形成闭环)、多机器人协作(RoCo——统一多机器人协作框架+RoCoBench;ChatDev 式的设计-编码-测试-记录四阶段多智能体流水线)、自我纠错与自我改进(REFLECT——LLM 解释机器人失败、在 RoBoFail 数据集上评测;Reflexion——动态记忆+自我反思;DoReMi——即时检测规划-执行不一致并恢复;RoboCat——视觉目标条件决策 transformer,能用自身产出数据做迭代自我提升)。
推理(Reasoning)——逻辑推理(palm-e——562B 多模态模型,把连续传感器模态接入 LLM;CoT/ToT 提示)、常识推理(LLM+知识图谱互补,如 KG-GPT、AutoKG、KGLLM)、affordance 推理(saycan——预训练技能价值函数把 LLM 抽象长程指令落到真实世界可行动作;Statler——世界状态读写双 LLM 实例维护跨时间记忆;CoTDet——affordance 知识提示驱动任务导向目标检测)、个性化推理(TidyBot——学习个人偏好整理房间;AffectGPT——首个情感计算多模态 LLM)。
数据
综述本身不训练模型,“数据”贡献是三张附录资源对照表(Table 1-3)+ 各任务专属数据集表(Table 4-7),给出的具体规模数字(均为综述汇总的第三方数据,非自采):
Table 1 模拟器(部分场景/物体规模,“未披露”处原文即空):Habitat 2.0 105 场景/92 物体;Habitat 3.0 211 场景/18k 物体;BEHAVIOR-100 15 场景/391 物体(含质量/质心/摩擦力等动力学交互标注);BEHAVIOR-1K 50 场景/5000+ 物体;iGibson 2.0 15 场景/570 物体;AI2-THOR 2.0 120 场景/84 物体;BabyAI 19 场景(2D gridworld);PyBullet 9 场景。计算资源栏披露 MineDojo 用 8×V100 GPU,RFUniverse 需 20-50GPU,UniSim 需高端桌面 GPU。
Table 2 通用机器人数据集:Open X-Embodiment 4435.41GB、527 项技能;HoloAssist 166 小时 RGB+深度+头部姿态+3D 手部姿态+眼动+音频+IMU+文本、20 项协同操作技能;rt-1 130K 条指令-图像 token 化演示、744 项技能;RoboTurk 137 小时演示(block lifting/bin picking/nut-and-peg assembly);RoboNet 1500 万视频帧;Bridge Data 7200 条厨房任务演示、71 项技能;RH20T 约 11 万条(RGB+深度+双目 IR+关节角/力矩+夹爪 6-DoF+指尖触觉)、147 项技能;ARMBench 19 万物体、23.5 万条数据;GSO 1030 个 3D 物体模型、数据量 13G;Google Brain Robot Data 约 80 万次抓取尝试;Dex-Net 2.0 670 万点云、1500 物体;Daily Manipulation 3354 次尝试、33 项技能;ImageNet 140 万+图像;HANDAL 210 物体、30.6 万图像帧;ScanScribe(3D-VisTA 配套数据集)56.1k 物体/1185 场景、2995 张 RGB-D 扫描。
Table 4 操作/抓取数据集:YCB Benchmark 77 物体、4.62 万 RGB-D 图像;Cornell Grasping 240 物体、885 张图/720 抓取;GraspNet-1Billion 88 物体/190+ 场景、9.73 万 RGB-D 图像、超 10 亿标注抓取;DexGraspNet 5355 物体、132 万抓取;Grasping-anything 约 300 万物体、约 6 亿采样;JACQUARD 1.1 万物体、5.45 万 RGB-D/10.9 万深度图、110 万标注。
Table 5 视觉语言导航数据集:R2R 7189 条轨迹、90 个场景、2.2 万条指令;REVERIE 10318 张全景图、132 个场景、4140 物体、21702 条指令、86 座建筑;BnB 140 万图像、14 万座建筑、70 万条指令;VXN(图像+文本+音频)960 万条 episode、58 个场景、21 个类别。
Table 6 长程任务规划数据集:CALVIN 34 项语言条件连续控制任务、1.3GB;RLBench 100 个操作任务;Epic-Kitchens 700 项第一人称厨房日常活动任务、1.1TB;Coin-Dataset 476 小时视频、12 个领域;Youcook2 2000 个烹饪任务、35.1GB;IKEA assembly dataset 406GB(3 路 RGB + 1 路深度 + 人体姿态/物体分割/跟踪+相机标定)。
Table 7 推理数据集:InfLevel 8 万条视频(物理常识理解);PhysObjects 3.96 万条众包标注 + 41.7 万条标注(物体物理属性);CLEVR 10 万图像/10 万问题(视觉推理);SWAG 11.3 万样本(常识推理);Socratis 18378 条标注(图文情绪推理)。
训练方法
综述本身不训练模型,归纳的是各下游任务的方法论范式与评测口径:
- 操作:技能原语分解 + LLM 引导组合 → 复杂任务自主学习(RL 奖励设计 Eureka、仿真数据自动生成 RoboGen)→ 多模态融合(视觉+力/触觉/声音);评测用 (1) 计划成功率(选择的技能是否匹配指令,不论是否执行成功)(2) 执行成功率。
- 导航:环境感知(多模态对齐进 VLM)→ 地图构建(度量地图/语义地图/拓扑符号)→ 自主定位(开放词表零样本)→ 运动规划(LLM 零样本序贯动作预测、跨模态匹配 + 自监督模仿);评测用 Success/Oracle Success Rate、Navigation Error(m)、SPL、CLS、nDTW、SDTW。
- 任务规划:单机器人长程任务分解(结合经典规划器/技能库可行性启发式)→ 多机器人任务分解-分配-调度→自我纠错与自我改进(利用 LLM 生成失败解释驱动重规划,或动态记忆+自我反思);评测用 Task Success Rate、Task Durations、Task Diversity、Task Difficulty、Task Dependencies。
- 推理:逻辑推理(Chain-of-Thought / Tree-of-Thought)→ 常识推理(LLM + 知识图谱互补,缓解 LLM 黑盒事实性不足)→ affordance 推理(预训练技能价值函数、世界状态读写记忆)→ 个性化推理(人格/共情建模);评测用 Accuracy、F1、Exact Match、Top-k Accuracy、MRR、BLEU。
Table 3 额外汇总了跨域基础模型的训练配方作为背景参照(非本综述贡献):ChatGLM 6B-130B、1.2T 英文+1.25T 中文 token、96×DGX-A100(8×40G)、60 天;LLaMA 7B-65B、4.7T 数据/1.4T token、2048×A100、21 天;LaMDA 2B-137B、1.56T 词、1024×TPU-v3、57.7 天;PANGU-Σ 1.085T 参数、2158GB 数据/329B token、512×Ascend 910 NPU、100 天;BLOOM 176B、341B token、48 节点×8×A100(80GB)、3.5 个月;SAM 11M 图像/1.1B mask、256 GPU、68 小时;DINOv2 1.2B 图像、8×V100(32GB)、2 天;palm-e 12B/84B/562B 三档;rt-2 图文对训练数据 10B 规模、参数 5B 与 55B 两档;Gato 63M episodes、1.2B 参数、1.5T token;VIMA 65 万条轨迹、2M-200M 参数、8×V100、1 天。
Infra(训练 / 推理工程)
本综述自身未训练模型,无自有 GPU/GPU-hours/并行策略/精度披露(未披露)。它在附录 Table 1、Table 3 里汇总了被综述工作的算力披露作为背景参照(详见”数据”节末尾),是全文唯一出现具体 GPU 数字的地方;正文四个下游任务章节未给出任何推理延迟/控制频率/边缘硬件数字。
评测 benchmark
综述不做自有实验,只按任务汇总评测指标口径(详见”训练方法”节)与配套数据集/benchmark(附录 Table 4-7,详见”数据”节)。正文各方法段落引用的是原论文自报的效果描述(如 March-In-Chat “在 REVERIE benchmark 上超越此前模型”、RT-2/EmbodiedGPT 的定性能力描述),没有综述自己产出的跨方法定量对比表或排行榜——这是与部分同期综述(如 vla-survey-embodied-ai 的 Table I-VII 结构化对照)相比较弱的一点。
创新点与影响
贡献:
- 较早一批系统梳理”基础模型 × 机器人学习”的综述之一(2023-11),按操作/导航/规划/推理四条下游任务组织,并前置模拟器/数据集/基础模型三张资源清单。
- 每类任务末尾单列 Datasets and Metrics 小节,把方法论与评测口径明确分开。
- discussion 部分提出六个未来方向:机器人软硬件解耦、面向环境交互的动态数据、机器人泛化能力(含人类在场场景的对齐与仿生学习)、多模态交互(视觉/语言之外纳入触觉/嗅觉/听觉)、机器人专属基础模型(灾难性遗忘、幻觉、低层控制基础模型缺失、大小模型结合)、计算效率(存算一体架构、知识蒸馏/剪枝/量化)、机器人安全与伦理(物理安全、数据隐私、模型投毒/窃取/提示注入)。
作者自陈的局限/待解问题(散见各任务 Problems 小节与第 4 节 discussion,未设独立 Limitations 节):现有技能动作库存在长尾分布问题、对可形变/透明/铰接物体的操作仍薄弱;导航在部分可观测场景、未知环境泛化、传感器噪声(深度缺失/RGB 模糊/分割误差)上仍有明显短板;任务规划的自我改进策略、规划时效、生成计划的可执行性都有待提升;推理能力(因果推理、时空推理、物理约束理解)整体偏弱,模型多为从左到右推理、缺乏反向推理,且当前多模态仅覆盖文本-视觉-语音,未直接建模触觉等模态。
它改变了什么:作为该主题最早的综述之一,为后续更细分的综述(如聚焦 VLA 架构的 vla-survey-embodied-ai、聚焦具身智能对齐的 aligning-cyber-physical-embodied-ai-survey)提供了一份可参照的”任务导向索引”雏形,但本身分类粒度较粗、缺乏统一的架构分类树与定量横向对比,之后未见期刊/会议发表记录,也没有配套代码仓库或持续维护的资源列表(这点与 foundation-models-in-robotics、vla-survey-embodied-ai 均带 Awesome 仓库形成对比)。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2311.14379
- arXiv PDF(v1,唯一版本):https://arxiv.org/pdf/2311.14379
一手源存档(sources/)
- 无配套官方博客 / GitHub / HuggingFace 模型卡 / 项目主页——arXiv 是唯一一手来源,仅 v1、cs.RO 分类,未见期刊/会议发表信息。
- arXiv 全文 PDF(2311.14379v1)为 arXiv 原文 PDF,不入 git,见上方 PDF 链接。