一句话定位

Firoozi、Tucker、Tian、Majumdar、Schwager 等 15 位来自 Stanford / Princeton / UT Austin / NVIDIA / Google DeepMind 的作者,在 2023 年 12 月挂出的一篇奠基性综述:系统梳理”预训练基础模型(LLM / VLM / ViT / 视觉生成模型)如何进入机器人自主性栈(感知—决策—控制)“,把工作分成”把通用基础模型即插即用/微调进机器人”和”为机器人从零造新基础模型”两大类,配一张按任务组织的分类树(Fig. 1)和两张硬指标表(Table I 通用基础模型规格、Table II 机器人专用基础模型的参数量/推理频率/硬件),并用整整一节把机器人落地的五大拦路虎——数据稀缺、高变异性、不确定性量化、安全评测、实时性——讲透,尤其是别的综述几乎不碰的安全与不确定性量化(conformal prediction / KnowNo 案例)。后被 IJRR 收录,配套仓库 Awesome-Robotics-Foundation-Models 成为该领域高频引用的资源索引。

背景与定位

这是 VLA(vision-language-action)时代早期的一篇”地图型”综述。它出现的时间点很关键:rt-2(RT-2,VLA 概念的提出)刚在 2023 年中问世、open-x-embodiment(RT-X,跨本体大数据集)2023 年 10 月放出、palm-e(562B 具身多模态语言模型)2023 年 3 月发布——机器人社区刚开始意识到”internet-scale 预训练 + 机器人”这条路,但方法散落在感知、规划、控制各条线里没人串起来。这篇综述的定位就是串线 + 指方向

作者把综述范围限定为三类论文:(1) 背景论文——不直接谈机器人但理解基础模型必需的(放在第 II 节,如 BERT/GPT-3/CLIP/DALL-E/扩散模型);(2) 机器人论文——把基础模型即插即用、或微调、或从零造机器人专用基础模型的;(3) 机器人相邻论文——计算机视觉/具身 AI 里有清晰机器人落地路径的方法。

论文明确点出同期 arXiv 上另有一篇机器人基础模型综述(引用 [20],即 “Robot Learning in the Era of Foundation Models” 一脉,对应本库 embodied-benchmark-survey 类工作),并划清差异:本文更强调未来挑战与机会,尤其是安全与风险,且在”应用、算法、架构”层面对现有工作做更强的横向对比;相比另一些只聚焦单一切面(prompt 工程、vision transformer、决策)的窄综述,本文提供跨线索的更宽视角;相比 Bommasani 等把基础模型铺到所有学科的超宽综述,本文只钉在机器人。范式命名上,它把”基础模型作为即插即用模块(plug-and-play)“与”为机器人从零构建基础模型(build from scratch)“作为组织全篇的一对核心对立。

模型架构

作为综述,它不提出新模型,而是给出两张规格表 + 一棵分类树,把散落的模型按能力和骨干归位。核心结构信息如下。

分类树(Fig. 1) 把”应用基础模型的机器人工作”分为两支:

  • Robotics(直接用于机器人):机器人策略学习(语言条件模仿学习:CLIPort / Play-LMP / PerAct / MCIL / CACTI / Voltron;语言辅助 RL:AdA / Palo et al.)、语言-图像目标条件价值学习(R3M / SayCan / Inner Monologue / VoxPoser / VIP / LIV / LOREL)、高层任务规划(NL2TL)、LLM 代码生成(ProgPrompt / Code-as-Policies / ChatGPT-for-Robotics)、机器人 Transformer(rt-1 / RT-2 / RT-X / PACT / LATTE)。
  • Relevant to Robotics(相邻):感知(开放词表检测 OWL-ViT / GLIP / Grounding DINO;分割 SAM / FastSAM / MobileSAM;3D 场景表示 CLIP-NeRF / LERF / DFF;affordance)与具身 AI(EmbodiedGPT / MineDojo / VPT / Voyager / ELLM)。

Table I — 通用大预训练模型(作为即插即用零件),逐行给出架构/参数量/训练数据/预训练目标/训练方法/硬件:

模型架构参数量训练数据预训练方式硬件
CLIPViT-L/14@336px + 文本编码器0.307B400M 图文对对比学习256×V100 训 12 天
GPT-3transformer(GPT-2 微调)175BCommon Crawl(约 1 万亿词)自回归未披露(NPA)
GPT-4未披露未披露未披露文本输出未披露
PaLI-Xencoder-decoder55B10B 图文对(WebLI)+ 辅助任务自回归多 TPU 云
DALL-Edecoder-only transformer12B250M 图文对自回归未披露
DALL-E2CLIP prior + decoder3.5BCLIP + DALL-E扩散未披露
DINOv2ViT-g/141.1BLVD-142M判别式自监督20 节点 × 8×V100-32GB
SAMMAE-ViT + CLIP 文本编码器632M(ViT-H) + 63M(文本)SA-1B:11M 图 / 1.1B 掩码监督学习256×A100 跑 68 小时

Table II — 机器人专用基础模型,给骨干/参数量/预训练任务/推理频率/硬件(这是本综述最”硬”的一张表,直接反映”能不能实时上机器人”):

模型骨干参数量任务推理频率硬件
RoboCatdecoder-only transformer1.18B操作10–20 Hz
Gatodecoder-only transformer1.2B通才 agent20 Hz16×16 TPU v3 slice 训 4 天
PaLM-E-562Bdecoder-only transformer562B语言子目标 1 Hz + 低层控制 5 Hz5–6 Hz多 TPU 云
ViNTEfficientNet + decoder transformer31M视觉导航4 Hz2×4090 / 8×A100 等多种
VPT时序卷积 + ResNet + 残差注意力0.5BMinecraft 具身 agent20 Hz720×V100 训 9 天
RT-1Conditioned EfficientNet + TokenLearner + decoder-only transformer35M真机任务3 Hz
RT-2PaLI-X55B真机任务1–3 Hz多 TPU 云
RT-2-XViT + UL2 语言模型55B真机任务1–3 Hz多 TPU 云
LIVCLIP奖励学习15 Hz8×V100
SMARTdecoder-only transformer11M双向动力学预测 + masked hindsight control1 Hz8×V100
COMPASS3D-ResNet 编码器20M对比损失30 Hz8×V100
PACTdecoder-only transformer12M前向动力学 + 下一动作预测10 Hz(边缘) / 50 HzNvidia Xavier NX(边缘) / 8×V100

动作表示(action-conditioning)的两条路线,综述反复对比:

  • 离散动作 token:RT-1 输出离散化的底盘 + 机械臂动作;RT-2 把动作写成文本字符串、再用 LLM tokenizer 切成文本 token,从而让 VLM 直接吐低层闭环控制(VLA 范式);PerAct 用 3D voxel 表示观测与动作空间,输出”下一最优 voxel 动作”,动作含 6-DoF 位姿 + 夹爪开合 + 避碰。
  • 连续/扩散/生成动作:StructDiffusion 用多模态 transformer + 扩散迭代细化,输出 6-DoF 目标位姿;ViNT 用 EfficientNet 编码视觉观测与目标图、预测时间距离与归一化动作,并可叠加扩散式子目标图像做探索。
  • 跨本体(cross-embodiment):Gato 用同一套权重同一网络跨 Atari / 对话 / 图像描述 / 真机堆积木 / 3D 导航等 604 个任务;RT-X / ViNT 把”embodiment-agnostic”作为设计目标。

数据

综述把”数据稀缺”列为机器人基础模型的头号障碍,并给出多组具体数据集规模与缓解手段:

  • RT-1 数据集:13 台机器人机队、17 个月、13 万+ 条真机轨迹(“over 130k”)、700+ 任务。
  • RT-X / open-x-embodiment:21 家机构合作、22 种不同机器人527 项技能160266 个任务,统一为标准数据格式;证明多本体多样数据能带来跨机器人正迁移。
  • Gato:604 个不同任务,混合多模态观测与动作,语言作为跨本体的公共 grounding。
  • SA-1B(SAM):1100 万张图 + 11 亿个分割掩码,配数据引擎滚雪球式扩标注。
  • DINOv2:LVD-142M(1.42 亿张精选图);判别式自监督。
  • CLIP:4 亿图文对;PaLI-X:100 亿图文对(WebLI);DALL-E:2.5 亿图文对。

数据配比 / 协同训练(co-training):RT-2 的关键做法是把 VLM 直接在机器人轨迹上co-fine-tune,让同一模型同时是语言模型 + VLM + 机器人策略;动作被写成文本串后与网络图文数据同源训练。

缓解数据稀缺的六条路径(第 VI-A 节):(1) 用非结构化 play data 与无标注人类视频(Play-LMP / MimicPlay,后者从人手交互视频训目标条件轨迹生成)扩规模,已有工作显示只需低至 1% 的语言标注数据即可训练视觉-语言 affordance 模型;(2) 用图像 inpainting 做数据增强(ROSIE 对未见物体/背景/干扰物做语义引导 inpaint);(3) 破解 3D 数据稀缺(3D 点云与文本不对齐,先转成图像再转文本做二级对齐);(4) 高保真仿真合成数据;(5) 用 VLM 做数据增强/弱标注(DIAL 三步:小数据对比微调 CLIP → 用微调后 VLM 给大数据打相关性分 → 行为克隆训语言条件策略);(6) 承认”机器人物理技能受限于数据中技能分布”这一根本约束。

sim vs real:综述指出多数具身 AI 仿真器(Gibson / Habitat / RoboTHOR / VirtualHome)为高层任务与视觉保真牺牲了低层接触物理,带来大 sim-to-real gap;真机数据虽真但难复现。

训练方法

综述第 II 节系统讲了基础模型的训练范式(这是它作为”背景教科书”价值的一环):

  • 自回归语言建模:GPT 家族去掉 encoder 只留 decoder,最小化上下文窗内下一 token 的负对数似然(式 2);GPT-3 词表 50257、embedding 维 12288、上下文窗 2048 token、每层 96 头 / 每头 128 维 / 96 层堆叠。
  • 掩码自编码(MAE / MLM):BERT 加双向编码器 + 掩码语言建模,学词的上下文而非仅下一词。
  • 对比学习:CLIP 类 VLM 用对称交叉熵对比损失(式 3–5,λ=0.5 等权),把图文编码器拉到联合嵌入空间、最大化真配对的互信息;源流上归到 ConVIRT。
  • 扩散模型:前向 Markov 链加高斯噪声、反向学去噪,用简化的 ELBO 训练(式 6–8);DALL-E2 为代表。
  • RLHF:GPT-3/GPT-4 用人类反馈强化学习对齐。
  • 知识蒸馏 / 自监督 ViT:DINO 是无标签知识蒸馏(student 模仿 teacher),DINOv2 判别式自监督。
  • In-context learning(ICL)与 Chain-of-Thought:无需改参数、只靠 prompt 内示例;被大量机器人工作用来把 LLM 套进具体域(Mirchandani 的”LLM 作通用模式识别器”、Chain-of-Thought Predictive Control)。
  • 机器人侧的训练目标:语言条件模仿学习用最大似然目标条件模仿损失(式 9,GCIL);AdA 用基于模型的 RL + Transformer-XL 长记忆 + 蒸馏扩到 500M+ 参数、在 XLand(10^40 种可能任务)自动课程里训练;VPT 用行为克隆 + 逆动力学模型给海量无标注视频打动作标签。

Infra(训练 / 推理工程)

综述本身不训模型,但汇总了它评述工作的工程数字(散见 Table I/II 与正文):

  • 训练算力样本:CLIP 256×V100 训 12 天;SAM 256×A100 跑 68 小时;DINOv2 20 节点 × 8×V100-32GB;VPT 720×V100 训 9 天;Gato 16×16 TPU v3 slice 训 4 天;PaLM-E / RT-2 / PaLI-X 均”跑在多 TPU 云服务”。
  • 推理频率 / 实时性(Table II,第 VI-B 节专门讨论):机器人专用模型推理频率从 PACT 的 50 Hz(边缘 Xavier NX 上 10 Hz)、COMPASS 30 Hz、Gato/VPT 20 Hz,一路降到 RT-1 的 3 Hz、RT-2/RT-2-X 仅 1–3 Hz、PaLM-E-562B 5–6 Hz(语言子目标 1 Hz + 低层控制 5 Hz)。综述明确指出部分大模型的推理时间仍不足以可靠实时上机器人,需要专门研究提升计算效率。
  • 云依赖与网络可靠性:GPT/DALL-E 等只能走 API,SAM/LLaMA/DINOv2 可本地下载运行;对自动驾驶、无人机、搜救、国防等时敏场景,不能依赖网络连通,需要”经典自主工具的本地安全兜底模式”或把大模型蒸馏成可上板小模型(以牺牲部分能力/上下文换体积与速度)作为长期方向。

评测 benchmark

作为综述,它不给出统一的横向定量榜单——而且专门用一节(VI-H)论证这正是该领域的痛点:机器人工作要么依赖真机硬件实验(难复现,需要同款设备),要么用非物理仿真器(忽略接触物理),加上缺乏标准化仿真设置与持续存在的 sim-to-real gap,导致跨研究难以基准化对比。它给的是仿真器 / benchmark 目录

  • 具身 AI 仿真器:Gibson / iGibson / BEHAVIOR-1K(家居任务、高保真)、Habitat(Habitat-Sim 单线程可达数千 fps)/ Habitat-Lab / Habitat 3.0、RoboTHOR(75 个仿真训练+验证场景,test-dev/test-standard 各 14 个含真机对应)、VirtualHome。
  • 机器人学习 benchmark:VIMA-BENCH(多模态机器人学习)、HomeRobot(开放词表移动操作 OVMM,含仿真+真机)、导航常用 Matterport3D / Gibson / Habitat。
  • 定性结论:综述反复强调通用化、零样本、多模态、可扩展是基础模型给机器人带来的潜在变革,但把”是否真能可靠迁移到真机”留作开放问题,并主张用”开放硬件 + 物理仿真基准 + 实验/仿真设置透明化”来改善可复现性。

创新点与影响

贡献:(1) 给出该领域早期最完整的一张任务导向分类图,把感知/决策/控制三条线下的基础模型工作系统归位;(2) 用 Table I/II 把通用与机器人专用基础模型的架构、参数量、数据规模、推理频率、硬件放在一起可比,尤其”推理频率对实时性”的现实约束一目了然;(3) 把”即插即用 vs 从零造机器人基础模型”确立为组织性对立;(4) 相较同期综述,独家把不确定性量化与安全评测讲成一等公民——区分 instance-level / distribution-level UQ、强调 Frequentist vs Bayesian 校准之别、以 KnowNo(用 conformal prediction 让语言指令机器人”知道自己不知道”并按统计保证求助) 为案例,并提出预部署红队测试、运行时监控与 OOD 检测等方向。

它改变了什么:这篇(连同同期几篇)把散乱的”LLM/VLM + 机器人”实践定型为一个有共同词汇(plug-and-play、cross-embodiment、VLA、data scarcity、sim-to-real)的子领域,配套 Awesome-Robotics-Foundation-Models 仓库成为入门索引;其对”实时性/推理频率""安全与 UQ""基准缺失”三大痛点的点名,基本预言了此后两年 VLA(推理加速、动作分块、蒸馏上板)与机器人安全评测的研究议程。

作者自陈的局限:(1) 决策/控制一节的工作大多依赖定制硬件或非物理仿真,横向对比困难、可迁移性差;(2) 机器人物理技能受限于训练数据中的技能分布,模型无法凭空生成新动作;(3) 多模态表示假设”每种模态都可 token 化并压进简单嵌入”,对 3D 点云等数据稀缺、与文本不对齐的模态并不成立;(4) UQ 仅在 LLM(KnowNo)上有校准案例,VLM/VNM/VLA 的可靠性保证仍是空白。

原始链接

一手源存档(sources/)