一句话定位

把机器人的图像、状态估计、3D 神经场景表示等连续传感器信号,用编码器直接投影进预训练大语言模型(PaLM)的词嵌入空间,与文本 token 交错成”多模态句子”端到端联合训练,得到一个最大 562B 参数(PaLM-540B + ViT-22B)的具身多模态模型;它以自回归文本输出高层规划子目标(再交给低层策略执行),核心发现是正向迁移——把互联网规模的视觉-语言数据和多机器人数据混在一起训,机器人任务性能不降反升、且数据效率极高。这是”LLM 直接吃原始传感器流做具身推理”这一 VLA 范式的奠基作之一。

背景与定位

PaLM-E 出自 Robotics at Google、Google Research(Brain) 与 TU Berlin(一作 Danny Driess,通讯含 Pete Florence、Sergey Levine、Karol Hausman、Igor Mordatch 等),2023-03-06 首发 arXiv,配 2023-03-10 的 Google Research 博客与 palm-e.github.io 项目页,后中 ICML 2023。

它要破的核心矛盾是 grounding(落地):LLM 有海量世界知识与推理力,但只吃文本、看不见物理世界的几何构型;论文实验还证明当时 SOTA 的通用视觉-语言模型(flamingo、PaLI)out-of-the-box 也解不了机器人推理任务。相对同门前作:

  • saycan(2022)把 LLM 的输出接到”学好的机器人策略 + affordance 价值函数”上做决策,但LLM 本身只拿到文本输入,对”桌上哪个方块在哪”这类几何信息无感。PaLM-E 直接把图像/状态喂进 LLM,消解了这个瓶颈。
  • rt-1 是被 PaLM-E 调用的低层语言-动作策略(PaLM-E 出高层步骤,RT-1 出末端控制指令)。
  • vima-bench(VIMA)同样用多模态 prompt,但那里语言更像”任务规格”;PaLM-E 生成的是文本形式的高层指令,能条件在自己的预测上并直接调用参数里的世界知识。
  • gato-a-generalist-agent(Gato)同为多具身通用体,但 PaLM-E 强调跨任务/跨域的正向迁移,而非单纯多任务拼装。
  • 架构灵感来自 Frozen(Tsimpoukelli 2021,把视觉 encoder 通过冻结 LLM 反传训练)——PaLM-E 把它拓宽到更多输入模态(含神经场景表示),并在 VQAv2 上超过 Frozen 45%+。

范式命名:embodied language model / 把连续观测注入语言嵌入空间;关键机制词是 positive transfer(正向迁移)。它是后续 RT-2 及整条 VLA 线(foundation-models-in-robotics 综述归为此脉)的直接前身。

模型架构

总体思路:decoder-only LLM,自回归生成文本补全。给定前缀(prompt),把连续观测 O 通过编码器 φ: O → X^q 映射为与语言 token embedding 同维(k 维)的 q 个向量序列,再与文本 token embedding γ(w) 交错拼进前缀。前缀里每个向量 x_i 要么来自词嵌入器 γ,要么来自某个编码器 φ_j(公式 3)。一个观测通常被 token 化成多个 embedding 向量;不同编码器可插在前缀不同位置组合多模态。注入复用了 LLM 已有的位置编码,且观测 embedding 不固定位置、动态嵌在文本中间(区别于 PaLI 等固定位置插图)。词表 |W| = 256,000(沿用 PaLM)。

LLM backbone(PaLM):基于预训练的 8B / 62B / 540B 三档 PaLM。组合命名:

  • PaLM-E-12B = 8B PaLM + 4B ViT
  • PaLM-E-84B = 62B PaLM + 22B ViT
  • PaLM-E-562B = 540B PaLM + 22B ViT(论文自称当时已报道的最大视觉-语言模型

视觉/观测编码器 φ(论文对每种模态给不同结构)

  • 状态估计向量 φ_state:一个 MLP,把描述物体位姿/尺寸/颜色的状态向量 s∈R^S 映到语言嵌入空间(最简单的一种)。
  • Vision Transformer(ViT):候选含 ViT-4B(取自 PaLI,Chen 2022)、ViT-22B(Dehghani 2023,均在图像分类上预训练),以及从零训的 ViT + TokenLearner(ViT+TL)(Ryoo 2021)。ViT 输出维度 k̃ 未必等于 LLM 维度 k,故每个 embedding 再过一个可学习仿射变换 ψ 投影:x_i = ψ(φ̃_ViT(I)_i)。
  • 物体中心表示(object-centric):视觉不像语言那样天然结构化成”实体”,ViT 表示更像静态网格而非物体集合。给定真值实例掩码 M_j,可把 ViT 表示按物体分解:x^j = φ_ViT(M_j ∘ I)。
  • OSRT(Object Scene Representation Transformer,Sajjadi 2022a)无需真值分割的 3D 中心神经场景表示,通过新视角合成任务在域内数据上无监督地把场景发现成 object slots o_j;每个 slot 再经 MLp ψ 投成 m 个 embedding。论文发现 OSRT 这种几何/物体中心表示数据效率最高、planning 最强。
  • Entity referrals(实体指代 token):当物体难用少量自然语言唯一指称时(如同色多方块),在 prompt 里标注 Object 1 is <obj_1>. … Object j is <obj_j>.,使 PaLM-E 能在生成的计划里用 <obj_j> 特殊 token 引用物体,低层策略也在这些 token 上操作。这是论文的一个新架构点。

输出→具身:若任务只需文本(具身问答/场景描述),输出即答案;若是规划/控制,则输出一串低层技能词表里的技能序列,PaLM-E 自行根据训练数据与 prompt 判断有哪些技能可用(无额外约束/过滤),嵌进控制闭环——执行后产生新观测供 PaLM-E 重新规划。可理解为序列化控制低层策略的高层策略

数据

训练数据形态:每条样本 = u_i 个连续观测 + 文本 w_{1:L} + 前缀终点索引 n_i;损失是只对非前缀文本 token(预测目标)求平均的交叉熵。文本里的特殊 token 在模型内被编码器的 embedding 向量替换。

“full mixture”(App. A / Table 6,采样频率与占比)——绝大多数是互联网规模视觉-语言数据,具身机器人数据仅占 8.9%

数据集采样频率占比 %
WebLI (Chen 2022)10052.4
VQ²A (Changpinyo 2022)2513.1
CC3M (Sharma 2018)2513.1
VQG (Changpinyo 2022)105.2
Object Aware (Piergiovanni 2022)105.2
OKVQA10.5
VQAv210.5
COCO10.5
Wikipedia text10.5
(robot) Mobile Manipulator, real63.1
(robot) Language-Table (sim + real)84.2
(robot) TAMP, sim31.6

三个机器人环境的数据来源与规模

  • TAMP(Task and Motion Planning,仿真):3–5 个不同尺寸/颜色/初始位姿的立方体;数据由 Driess 2020 的规划器与低层策略生成,共 96,000 个训练场景;实验里 TAMP 只占总训练量的 1%(即 p1、p2 各 320 条样本)。OOD 测试用 6、8 个物体。
  • Language-Table(真机 + 仿真,取自 Interactive Language,Lynch 2022):多物体桌面推动;数据采集时对每条长程指令,让标注者每 4 秒输入一条短程指令,交给 Interactive Language 策略执行 40 步(10Hz × 4s),直到标注者判定完成。few-shot 实验每任务仅 10 条演示;one-shot 实验用 100 个长程任务、每个仅 1 条训练样本
  • Mobile Manipulation(厨房,setup 仿 SayCan,Ahn 2022):导航+操作序列;低层策略来自 rt-1。长程规划训练用 SayCan 的 runs 共 2912 条序列。三个用例:affordance 预测、failure 检测、long-horizon 规划。

动作标注/技能均来自各自的低层策略;sim 与 real 都覆盖(Language-Table、Mobile Manip 都在真机闭环执行)。

训练方法

目标:标准自回归交叉熵,只在非前缀(文本目标)token 上求平均。

从预训练组件初始化:LLM 用预训练 PaLM,视觉用预训练 ViT;编码器 φ 则或预训练、或从零训。

两个关键的训练配方维度(论文核心消融变量)

  1. 冻结 vs 微调 LLM
    • 冻结 LLM,只训输入编码器——等价于一种输入条件的 soft-prompting(编码器要产出让冻结 LLM 落地到观测、并告知具身能力的 embedding)。可行、且能完全保住语言能力,但机器人任务偶尔吃力(Table 2)。OSRT 实验里连 slot 表示也冻结,只更新小投影器 ψ。
    • 端到端全量微调(含 LLM)——机器人任务更强,但会有灾难性遗忘;论文发现模型越大遗忘越少(见评测)。
  2. co-training(跨任务混训)预训练(ViT/PaLM):把机器人数据混进多模态大模型训练,是产生正向迁移的关键;full mixture 里具身数据只占 8.9%。

Language-Table 微调细节:为支持数据复杂度扫描而不必从零重训多个模型,对预训练好的 PaLM-E 再训 9,000 步

不改低层策略:论文直接复用已有的低层语言-条件策略(Lynch & Sermanet 2020、RT-1 等),不做修改;PaLM-E 只负责高层。

关键超参(GPU/TPU、学习率、batch 等训练配置)论文正文未披露

Infra(训练 / 推理工程)

  • 训练硬件 / GPU-TPU 数量 / 训练时长 / 并行策略 / 精度:论文正文与博客均未披露(PaLM-E 建立在 PaLM 的 Pathways/TPU 训练体系之上,但本文未给具体机器数与卡时)。
  • 推理 / 控制频率
    • Language-Table 闭环里 PaLM-E 以 1 Hz 下发语言子目标给低层策略,低层策略以 5 Hz 输出机器人动作(Interactive Language 策略)。
    • Mobile Manipulation 长程规划为自回归逐步生成,直到 PaLM-E 输出 terminate;执行中遇到外部扰动/低层策略失败可重规划
    • 具体单步推理延迟、562B 的部署 FPS/时延未披露

评测 benchmark

通用视觉-语言(Table 5,generalist 单一 checkpoint 跨评测)

  • OK-VQA(val):PaLM-E-562B = 66.1,创当时 SOTA,超过专门在 OK-VQA 上微调的模型(PaLI 64.5、Flamingo 32-shot 57.8);PaLM-E-12B = 55.5。
  • VQAv2(test-dev):PaLM-E-562B = 80.0,PaLM-E-12B = 76.2;冻结 LLM 的 PaLM-E-12B = 70.3,比 Frozen(Tsimpoukelli 2021)的 48.4 高(正文称在 VQAv2 上超 Frozen 45%+)。
  • COCO caption(Karpathy test,CIDEr):PaLM-E-562B = 138.7,PaLM-E-12B = 135.0。

灾难性遗忘 / 语言能力保持(21 个 NLU/NLG 基准,Table 8 / Fig 6,相对原 PaLM 的相对掉点)

  • PaLM-E-12B:NLG -87.3%、NLU -15.0%(小模型全量微调几乎丢光生成能力);
  • PaLM-E-84B:NLG -61.6%、NLU -4.3%;
  • PaLM-E-562B:NLG 仅 -3.9%、NLU +0.4%——规模越大,多模态微调后语言退化越小。(冻结 LLM 的 PaLM-E 与底座 PaLM 语言性能完全一致。)

机器人:TAMP(Table 1,1% 数据 = 320 样本,LLM 冻结)

  • 正向迁移证据:ViT-4B 单机器人 planning p1/p2 = 30.6 / 32.9 → 混训 full mixture = 74.1 / 74.6(性能翻倍多)
  • OSRT 最强:q1 99.7、q3 100.0、p1 82.5、p2 76.2(几何/物体中心表示即使无大规模数据也最有效、最省数据)。
  • 基线 SayCan(带 oracle affordance)planning p1/p2 = 38.7 / 33.3(即便用了 oracle affordance,仍远低于 PaLM-E 混训的 74.1/74.6);PaLI zero-shot 在 embodied VQA q1/q2 = 0.0 / 0.0,解不了机器人任务。
  • Fig 4(PaLM-E-12B,1% 数据):LLM 微调+full mixture 94.9% ≫ 冻结+full mixture 74.3% > 微调+单机器人 48.6% > 无预训练 42.9% > 冻结+单机器人 31.8%。
  • OOD(6/8 物体):预训练 62B LLM 比 8B 泛化更好;无预训练 LLM 基本无 OOD 泛化。

机器人:Mobile Manipulation(Table 4 / 9 / 10,F1)

  • Failure detection:PaLM-E-12B(预训练)F1 = 0.91,胜 CLIP-FT-hindsight 0.89(后者信息更多且专为此任务设计)、PaLI zero-shot 0.73。
  • Affordance prediction:PaLM-E-12B(full mixture,端到端微调 LLM)F1 = 0.91(同配置冻结 LLM 为 0.87),胜 QT-OPT 价值函数阈值 0.63、PaLI zero-shot 0.62。
  • 真机长程规划:定性验证在真实厨房能完成长程移动操作,且对对抗扰动鲁棒

机器人:Language-Table(Table 2,仿真规划,80 rollouts/任务):混训互联网视觉-语言数据在少样本(每任务 10 demos)下让机器人规划更强;12B→84B 在 3 个任务中的 2 个上提升;SayCan 与 zero-shot PaLI 在最简单的 Task 1 上均为 0.0。真机上展示 one-shot/zero-shot 泛化到新物体对与未见物体(如玩具乌龟)。

涌现能力(Fig 2,562B,仅在单图上训练):zero-shot 多模态思维链、few-shot prompting、OCR-free 数学推理、多图关系推理(尽管只训过单图)、视觉条件笑话、带时间戳第一人称视觉问答——端到端单模型实现(此前 Socratic Models 需 task-specific 程序拼装)。

创新点与影响

贡献(论文自述 5 点)

  1. 证明把具身数据混进多模态大模型训练,可训出一个通用、迁移学习的、多具身决策智能体;
  2. 现成 SOTA 通用 VLM zero-shot 解不好具身推理,但可以训出一个既是能干的 VLM、又是高效具身推理器的通用模型;
  3. 提出神经场景表示(OSRT)注入与**实体标注多模态 token(entity referral)**两个新架构点;
  4. PaLM-E 同时是定量有竞争力的视觉-语言 + 语言通才
  5. 证明扩大 LLM 规模能让多模态微调的灾难性遗忘显著减少

改变了什么:确立了”LLM 直接摄入原始连续传感器流做具身推理”的路线,并用大量实验坐实正向迁移(视觉-语言数据反向提升机器人任务、带来极高数据效率)。它把 saycan 的”LLM 出计划 + 外部 affordance 落地”升级为”观测直接进 LLM、计划自带落地”,是 RT-2 与整条 VLA 研究线的直接思想源头。

论文自陈的局限

  • 冻结 LLM 虽能完全保住语言能力,但机器人任务偶尔吃力(Table 2);端到端微调虽强却要靠”把模型做大”来缓解语言退化——两条路都有取舍。
  • 机器人数据相对语言/视觉数据仍极度稀缺,模型靠迁移才能从极少样本(Language-Table 10–80、TAMP 320)学会;把 OSRT 的几何表示与大规模视觉数据结合是留给未来的方向。
  • PaLM-E 只出高层文本决策,仍依赖外部低层策略执行;其技能词表与可行性靠训练数据与 prompt 隐式界定,无显式约束/过滤机制。

原始链接

一手源存档(sources/)

  • palm-e—blog — Google Research 博客快照(sources/embodied/2023/palm-e—blog.md)
  • palm-e—project-page — palm-e.github.io 项目页快照(sources/embodied/2023/palm-e—project-page.md)
  • arXiv 2303.03378 全文 PDF 为一手原文(不入 git),引用见上方 arXiv 链接。