一句话定位
Firoozi、Tucker、Tian、Majumdar、Schwager 等 15 位来自 Stanford / Princeton / UT Austin / NVIDIA / Google DeepMind 的作者,在 2023 年 12 月挂出的一篇奠基性综述:系统梳理”预训练基础模型(LLM / VLM / ViT / 视觉生成模型)如何进入机器人自主性栈(感知—决策—控制)“,把工作分成”把通用基础模型即插即用/微调进机器人”和”为机器人从零造新基础模型”两大类,配一张按任务组织的分类树(Fig. 1)和两张硬指标表(Table I 通用基础模型规格、Table II 机器人专用基础模型的参数量/推理频率/硬件),并用整整一节把机器人落地的五大拦路虎——数据稀缺、高变异性、不确定性量化、安全评测、实时性——讲透,尤其是别的综述几乎不碰的安全与不确定性量化(conformal prediction / KnowNo 案例)。后被 IJRR 收录,配套仓库 Awesome-Robotics-Foundation-Models 成为该领域高频引用的资源索引。
背景与定位
这是 VLA(vision-language-action)时代早期的一篇”地图型”综述。它出现的时间点很关键:rt-2(RT-2,VLA 概念的提出)刚在 2023 年中问世、open-x-embodiment(RT-X,跨本体大数据集)2023 年 10 月放出、palm-e(562B 具身多模态语言模型)2023 年 3 月发布——机器人社区刚开始意识到”internet-scale 预训练 + 机器人”这条路,但方法散落在感知、规划、控制各条线里没人串起来。这篇综述的定位就是串线 + 指方向。
作者把综述范围限定为三类论文:(1) 背景论文——不直接谈机器人但理解基础模型必需的(放在第 II 节,如 BERT/GPT-3/CLIP/DALL-E/扩散模型);(2) 机器人论文——把基础模型即插即用、或微调、或从零造机器人专用基础模型的;(3) 机器人相邻论文——计算机视觉/具身 AI 里有清晰机器人落地路径的方法。
论文明确点出同期 arXiv 上另有一篇机器人基础模型综述(引用 [20],即 “Robot Learning in the Era of Foundation Models” 一脉,对应本库 embodied-benchmark-survey 类工作),并划清差异:本文更强调未来挑战与机会,尤其是安全与风险,且在”应用、算法、架构”层面对现有工作做更强的横向对比;相比另一些只聚焦单一切面(prompt 工程、vision transformer、决策)的窄综述,本文提供跨线索的更宽视角;相比 Bommasani 等把基础模型铺到所有学科的超宽综述,本文只钉在机器人。范式命名上,它把”基础模型作为即插即用模块(plug-and-play)“与”为机器人从零构建基础模型(build from scratch)“作为组织全篇的一对核心对立。
模型架构
作为综述,它不提出新模型,而是给出两张规格表 + 一棵分类树,把散落的模型按能力和骨干归位。核心结构信息如下。
分类树(Fig. 1) 把”应用基础模型的机器人工作”分为两支:
- Robotics(直接用于机器人):机器人策略学习(语言条件模仿学习:CLIPort / Play-LMP / PerAct / MCIL / CACTI / Voltron;语言辅助 RL:AdA / Palo et al.)、语言-图像目标条件价值学习(R3M / SayCan / Inner Monologue / VoxPoser / VIP / LIV / LOREL)、高层任务规划(NL2TL)、LLM 代码生成(ProgPrompt / Code-as-Policies / ChatGPT-for-Robotics)、机器人 Transformer(rt-1 / RT-2 / RT-X / PACT / LATTE)。
- Relevant to Robotics(相邻):感知(开放词表检测 OWL-ViT / GLIP / Grounding DINO;分割 SAM / FastSAM / MobileSAM;3D 场景表示 CLIP-NeRF / LERF / DFF;affordance)与具身 AI(EmbodiedGPT / MineDojo / VPT / Voyager / ELLM)。
Table I — 通用大预训练模型(作为即插即用零件),逐行给出架构/参数量/训练数据/预训练目标/训练方法/硬件:
| 模型 | 架构 | 参数量 | 训练数据 | 预训练方式 | 硬件 |
|---|---|---|---|---|---|
| CLIP | ViT-L/14@336px + 文本编码器 | 0.307B | 400M 图文对 | 对比学习 | 256×V100 训 12 天 |
| GPT-3 | transformer(GPT-2 微调) | 175B | Common Crawl(约 1 万亿词) | 自回归 | 未披露(NPA) |
| GPT-4 | 未披露 | 未披露 | 未披露 | 文本输出 | 未披露 |
| PaLI-X | encoder-decoder | 55B | 10B 图文对(WebLI)+ 辅助任务 | 自回归 | 多 TPU 云 |
| DALL-E | decoder-only transformer | 12B | 250M 图文对 | 自回归 | 未披露 |
| DALL-E2 | CLIP prior + decoder | 3.5B | CLIP + DALL-E | 扩散 | 未披露 |
| DINOv2 | ViT-g/14 | 1.1B | LVD-142M | 判别式自监督 | 20 节点 × 8×V100-32GB |
| SAM | MAE-ViT + CLIP 文本编码器 | 632M(ViT-H) + 63M(文本) | SA-1B:11M 图 / 1.1B 掩码 | 监督学习 | 256×A100 跑 68 小时 |
Table II — 机器人专用基础模型,给骨干/参数量/预训练任务/推理频率/硬件(这是本综述最”硬”的一张表,直接反映”能不能实时上机器人”):
| 模型 | 骨干 | 参数量 | 任务 | 推理频率 | 硬件 |
|---|---|---|---|---|---|
| RoboCat | decoder-only transformer | 1.18B | 操作 | 10–20 Hz | — |
| Gato | decoder-only transformer | 1.2B | 通才 agent | 20 Hz | 16×16 TPU v3 slice 训 4 天 |
| PaLM-E-562B | decoder-only transformer | 562B | 语言子目标 1 Hz + 低层控制 5 Hz | 5–6 Hz | 多 TPU 云 |
| ViNT | EfficientNet + decoder transformer | 31M | 视觉导航 | 4 Hz | 2×4090 / 8×A100 等多种 |
| VPT | 时序卷积 + ResNet + 残差注意力 | 0.5B | Minecraft 具身 agent | 20 Hz | 720×V100 训 9 天 |
| RT-1 | Conditioned EfficientNet + TokenLearner + decoder-only transformer | 35M | 真机任务 | 3 Hz | — |
| RT-2 | PaLI-X | 55B | 真机任务 | 1–3 Hz | 多 TPU 云 |
| RT-2-X | ViT + UL2 语言模型 | 55B | 真机任务 | 1–3 Hz | 多 TPU 云 |
| LIV | CLIP | — | 奖励学习 | 15 Hz | 8×V100 |
| SMART | decoder-only transformer | 11M | 双向动力学预测 + masked hindsight control | 1 Hz | 8×V100 |
| COMPASS | 3D-ResNet 编码器 | 20M | 对比损失 | 30 Hz | 8×V100 |
| PACT | decoder-only transformer | 12M | 前向动力学 + 下一动作预测 | 10 Hz(边缘) / 50 Hz | Nvidia Xavier NX(边缘) / 8×V100 |
动作表示(action-conditioning)的两条路线,综述反复对比:
- 离散动作 token:RT-1 输出离散化的底盘 + 机械臂动作;RT-2 把动作写成文本字符串、再用 LLM tokenizer 切成文本 token,从而让 VLM 直接吐低层闭环控制(VLA 范式);PerAct 用 3D voxel 表示观测与动作空间,输出”下一最优 voxel 动作”,动作含 6-DoF 位姿 + 夹爪开合 + 避碰。
- 连续/扩散/生成动作:StructDiffusion 用多模态 transformer + 扩散迭代细化,输出 6-DoF 目标位姿;ViNT 用 EfficientNet 编码视觉观测与目标图、预测时间距离与归一化动作,并可叠加扩散式子目标图像做探索。
- 跨本体(cross-embodiment):Gato 用同一套权重同一网络跨 Atari / 对话 / 图像描述 / 真机堆积木 / 3D 导航等 604 个任务;RT-X / ViNT 把”embodiment-agnostic”作为设计目标。
数据
综述把”数据稀缺”列为机器人基础模型的头号障碍,并给出多组具体数据集规模与缓解手段:
- RT-1 数据集:13 台机器人机队、17 个月、13 万+ 条真机轨迹(“over 130k”)、700+ 任务。
- RT-X / open-x-embodiment:21 家机构合作、22 种不同机器人、527 项技能、160266 个任务,统一为标准数据格式;证明多本体多样数据能带来跨机器人正迁移。
- Gato:604 个不同任务,混合多模态观测与动作,语言作为跨本体的公共 grounding。
- SA-1B(SAM):1100 万张图 + 11 亿个分割掩码,配数据引擎滚雪球式扩标注。
- DINOv2:LVD-142M(1.42 亿张精选图);判别式自监督。
- CLIP:4 亿图文对;PaLI-X:100 亿图文对(WebLI);DALL-E:2.5 亿图文对。
数据配比 / 协同训练(co-training):RT-2 的关键做法是把 VLM 直接在机器人轨迹上co-fine-tune,让同一模型同时是语言模型 + VLM + 机器人策略;动作被写成文本串后与网络图文数据同源训练。
缓解数据稀缺的六条路径(第 VI-A 节):(1) 用非结构化 play data 与无标注人类视频(Play-LMP / MimicPlay,后者从人手交互视频训目标条件轨迹生成)扩规模,已有工作显示只需低至 1% 的语言标注数据即可训练视觉-语言 affordance 模型;(2) 用图像 inpainting 做数据增强(ROSIE 对未见物体/背景/干扰物做语义引导 inpaint);(3) 破解 3D 数据稀缺(3D 点云与文本不对齐,先转成图像再转文本做二级对齐);(4) 高保真仿真合成数据;(5) 用 VLM 做数据增强/弱标注(DIAL 三步:小数据对比微调 CLIP → 用微调后 VLM 给大数据打相关性分 → 行为克隆训语言条件策略);(6) 承认”机器人物理技能受限于数据中技能分布”这一根本约束。
sim vs real:综述指出多数具身 AI 仿真器(Gibson / Habitat / RoboTHOR / VirtualHome)为高层任务与视觉保真牺牲了低层接触物理,带来大 sim-to-real gap;真机数据虽真但难复现。
训练方法
综述第 II 节系统讲了基础模型的训练范式(这是它作为”背景教科书”价值的一环):
- 自回归语言建模:GPT 家族去掉 encoder 只留 decoder,最小化上下文窗内下一 token 的负对数似然(式 2);GPT-3 词表 50257、embedding 维 12288、上下文窗 2048 token、每层 96 头 / 每头 128 维 / 96 层堆叠。
- 掩码自编码(MAE / MLM):BERT 加双向编码器 + 掩码语言建模,学词的上下文而非仅下一词。
- 对比学习:CLIP 类 VLM 用对称交叉熵对比损失(式 3–5,λ=0.5 等权),把图文编码器拉到联合嵌入空间、最大化真配对的互信息;源流上归到 ConVIRT。
- 扩散模型:前向 Markov 链加高斯噪声、反向学去噪,用简化的 ELBO 训练(式 6–8);DALL-E2 为代表。
- RLHF:GPT-3/GPT-4 用人类反馈强化学习对齐。
- 知识蒸馏 / 自监督 ViT:DINO 是无标签知识蒸馏(student 模仿 teacher),DINOv2 判别式自监督。
- In-context learning(ICL)与 Chain-of-Thought:无需改参数、只靠 prompt 内示例;被大量机器人工作用来把 LLM 套进具体域(Mirchandani 的”LLM 作通用模式识别器”、Chain-of-Thought Predictive Control)。
- 机器人侧的训练目标:语言条件模仿学习用最大似然目标条件模仿损失(式 9,GCIL);AdA 用基于模型的 RL + Transformer-XL 长记忆 + 蒸馏扩到 500M+ 参数、在 XLand(10^40 种可能任务)自动课程里训练;VPT 用行为克隆 + 逆动力学模型给海量无标注视频打动作标签。
Infra(训练 / 推理工程)
综述本身不训模型,但汇总了它评述工作的工程数字(散见 Table I/II 与正文):
- 训练算力样本:CLIP 256×V100 训 12 天;SAM 256×A100 跑 68 小时;DINOv2 20 节点 × 8×V100-32GB;VPT 720×V100 训 9 天;Gato 16×16 TPU v3 slice 训 4 天;PaLM-E / RT-2 / PaLI-X 均”跑在多 TPU 云服务”。
- 推理频率 / 实时性(Table II,第 VI-B 节专门讨论):机器人专用模型推理频率从 PACT 的 50 Hz(边缘 Xavier NX 上 10 Hz)、COMPASS 30 Hz、Gato/VPT 20 Hz,一路降到 RT-1 的 3 Hz、RT-2/RT-2-X 仅 1–3 Hz、PaLM-E-562B 5–6 Hz(语言子目标 1 Hz + 低层控制 5 Hz)。综述明确指出部分大模型的推理时间仍不足以可靠实时上机器人,需要专门研究提升计算效率。
- 云依赖与网络可靠性:GPT/DALL-E 等只能走 API,SAM/LLaMA/DINOv2 可本地下载运行;对自动驾驶、无人机、搜救、国防等时敏场景,不能依赖网络连通,需要”经典自主工具的本地安全兜底模式”或把大模型蒸馏成可上板小模型(以牺牲部分能力/上下文换体积与速度)作为长期方向。
评测 benchmark
作为综述,它不给出统一的横向定量榜单——而且专门用一节(VI-H)论证这正是该领域的痛点:机器人工作要么依赖真机硬件实验(难复现,需要同款设备),要么用非物理仿真器(忽略接触物理),加上缺乏标准化仿真设置与持续存在的 sim-to-real gap,导致跨研究难以基准化对比。它给的是仿真器 / benchmark 目录:
- 具身 AI 仿真器:Gibson / iGibson / BEHAVIOR-1K(家居任务、高保真)、Habitat(Habitat-Sim 单线程可达数千 fps)/ Habitat-Lab / Habitat 3.0、RoboTHOR(75 个仿真训练+验证场景,test-dev/test-standard 各 14 个含真机对应)、VirtualHome。
- 机器人学习 benchmark:VIMA-BENCH(多模态机器人学习)、HomeRobot(开放词表移动操作 OVMM,含仿真+真机)、导航常用 Matterport3D / Gibson / Habitat。
- 定性结论:综述反复强调通用化、零样本、多模态、可扩展是基础模型给机器人带来的潜在变革,但把”是否真能可靠迁移到真机”留作开放问题,并主张用”开放硬件 + 物理仿真基准 + 实验/仿真设置透明化”来改善可复现性。
创新点与影响
贡献:(1) 给出该领域早期最完整的一张任务导向分类图,把感知/决策/控制三条线下的基础模型工作系统归位;(2) 用 Table I/II 把通用与机器人专用基础模型的架构、参数量、数据规模、推理频率、硬件放在一起可比,尤其”推理频率对实时性”的现实约束一目了然;(3) 把”即插即用 vs 从零造机器人基础模型”确立为组织性对立;(4) 相较同期综述,独家把不确定性量化与安全评测讲成一等公民——区分 instance-level / distribution-level UQ、强调 Frequentist vs Bayesian 校准之别、以 KnowNo(用 conformal prediction 让语言指令机器人”知道自己不知道”并按统计保证求助) 为案例,并提出预部署红队测试、运行时监控与 OOD 检测等方向。
它改变了什么:这篇(连同同期几篇)把散乱的”LLM/VLM + 机器人”实践定型为一个有共同词汇(plug-and-play、cross-embodiment、VLA、data scarcity、sim-to-real)的子领域,配套 Awesome-Robotics-Foundation-Models 仓库成为入门索引;其对”实时性/推理频率""安全与 UQ""基准缺失”三大痛点的点名,基本预言了此后两年 VLA(推理加速、动作分块、蒸馏上板)与机器人安全评测的研究议程。
作者自陈的局限:(1) 决策/控制一节的工作大多依赖定制硬件或非物理仿真,横向对比困难、可迁移性差;(2) 机器人物理技能受限于训练数据中的技能分布,模型无法凭空生成新动作;(3) 多模态表示假设”每种模态都可 token 化并压进简单嵌入”,对 3D 点云等数据稀缺、与文本不对齐的模态并不成立;(4) UQ 仅在 LLM(KnowNo)上有校准案例,VLM/VNM/VLA 的可靠性保证仍是空白。
原始链接
- arXiv 摘要:https://arxiv.org/abs/2312.07843
- arXiv PDF:https://arxiv.org/pdf/2312.07843
- arXiv HTML 全文:https://arxiv.org/html/2312.07843v1
- 配套仓库 Awesome-Robotics-Foundation-Models:https://github.com/robotics-survey/Awesome-Robotics-Foundation-Models
- 期刊版:后收录于 International Journal of Robotics Research (IJRR), 2024(
@article{firoozi2024foundation})
一手源存档(sources/)
- foundation-models-in-robotics—github-readme — 配套仓库 README 快照(sources/embodied/2023/)
- arXiv 全文 PDF/HTML 未入 git,见上方 arXiv 链接(arXiv 原文,不入 git)