一句话定位

3D-VLA 把 3D-based LLM(3d-llm 路线)改造成一个生成式世界模型:给模型加一套 <scene>/<obj>/<loc>/<action> 交互 token 做 3D 感知与动作接口,再外挂预训练好的 RGB-D 扩散模型 + Point-E 点云扩散模型、用 transformer projector 对齐进 LLM 词嵌入空间,让模型先”想象”目标状态的图像/深度/点云,再据此做具身问答、定位与机械臂动作规划——三件事(3D 推理、多模态目标生成、动作规划)共享同一个骨干。

背景与定位

2023-2024 年之交的具身基础模型两条主线都有明显缺口:一是 rt-2palm-e 这类 2D VLA,只学”感知→动作”的直接映射,不建模世界动态,也不理解 3D 空间关系(比如”把最远的杯子放进中间的抽屉”);二是同期的 3D 基础模型(3D-LLM 等)虽然引入了点云/3D 特征,但止步于对当前场景的理解与问答,不能预测未来、不能生成动作。3D-VLA 的定位是把这两条线缝合:在 3D-LLM 骨干上叠加生成式世界模型能力——先想象目标的多模态(图像/深度/点云)状态,再据此规划动作,呼应人类”预视化目标再决策”的认知过程。

数据侧的核心创新是把 rt-1rlbenchcalvin 等已有的 12 个机器人数据集 + 2 个人-物交互数据集,用深度估计、光流、Grounded-SAM 等现成工具重新加工出统一的 3D-language-action 三元组标注(3D bbox、深度/点云、7 自由度动作),而不是依赖任何新采的真机数据。目标生成侧则不直接复用互联网视频扩散模型(作者实测 Runway 生成会把整个场景改得面目全非)或冻结 Stable Diffusion(方法参照 next-gpt 会导致输出坍塌),而是专门在机器人数据上从头预训练一套具身扩散解码器(参照 instructpix2pix 的图像编辑范式、point-e 的点云扩散范式),再对齐进 LLM。

模型架构

骨干:不从 3D-LLM 的预训练权重初始化(其训练集是室内场景/物体,和具身机器人场景不匹配),而是以 BLIP2-FlanT5XL 为起点,沿用 3D-LLM 的做法——用多视角 2D 特征构建 3D 场景特征、无需改动底层 VLM 架构即可接入 3D 输入。训练阶段解冻 token 的输入/输出 embedding 以及 Q-Former 权重。

交互 token(3D-VLA 对 3D-LLM 的关键扩展):

  • <obj></obj> 包裹解析出的物体名词(如 <obj> a chocolate bar </obj>),标记被操作/被指代的对象;
  • <loc0-255> 共 6 个位置 token,以 AABB(轴对齐包围盒)形式表示 3D bounding box,做空间定位;
  • <scene></scene> 包裹一个静态场景的 embedding,支持交错的 3D-文本输入,以及跨帧组合来表达动态场景;
  • 动作侧新增 <aloc0-255>(绝对位置)、<arot0-255>(旋转)、<gripper0/1>(夹爪开合)离散 token 表示机械臂 7 自由度动作,<ACT_SEP> 分隔连续动作步。

目标生成(注入到 LLM 里的扩散解码器):

  • RGB-D → RGB-D:以 Stable Diffusion v1.4 为预训练底座,把 RGB 隐变量与 depth 隐变量拼接作为图像条件,在预训练 VAE 的隐空间做 latent diffusion。
  • 点云 → 点云:以 Point-E 为预训练底座,新增点云条件输入通道(修改输入/输出层通道数)。
  • 桥接:引入 <image></image><pcd></pcd> 特殊 token 告知解码器要生成的模态类型,LLM 在这两个 token 之间生成”给机器人执行的指令”(可含 obj/loc token);再用一个 transformer-based projector 把 LLM 输出特征映射进各扩散解码器的条件空间,联合最小化 LLM 损失与扩散模型的去噪损失。为控制训练成本、避免灾难性遗忘,用 LoRA 微调扩散模型,主干扩散权重和 LLM 主体都不动,只训练新增 token embedding、对应输出线性层与 projector。

数据

自建的 3D 具身指令微调数据集,共 2M 条 3D-language-action 数据对,来自 316k 个 episode(机器人数据集 305k + 人-物交互 HOI 数据集 11k),覆盖 Verification / Task Caption / Localization / Dense Caption / 目标图像&点云生成 / Action Prediction 等多种任务类型:

数据集Episode 数
Fractal(RT-1)70k
RoboVQA61k
RLBench50k
BC-Z40k
Bridge25k
Dobb-E20k
Lang Table13k
CALVIN10k
Epic Kitchen(HOI)6k
HOI4D(HOI)5k
Playing Food4.2k
Taco Play3.2k
RH20T / Roboturk各 2.0k
Mutex1.5k
Pick&Place1.3k
Jaco Play0.9k
Play Fusion0.5k

标注管线(超 95% 的具身视频数据集本身不带深度信息):用 ZoeDepth 逐帧估计深度、RAFT 估计光流;对相机不动的片段,用光流找出静止背景,跨帧对齐深度图(乘系数校准一致性),再用相机内外参把 RGB-D 提升为 3D 点云。物体级标注上,先用 spaCy 从指令文本解析名词短语,再用 Grounded-SAM 得到 2D mask、投影为 3D 后取得物体的 3D bounding box(在光流显著区域内取置信度最高的 mask 作为被操作物体)。目标图像/深度/点云直接取自未来帧的真值。语言标注参照 3D-LLM 的做法,先用模板生成初版 prompt/answer,再用 GPT-3.5-turbo-0125(2-3 个人工示例做引导)改写为更自然多样的表述,七类任务(含无固定模板的任务)均由 ChatGPT 参与生成。

数据全部来自已有数据集的重新加工(Open-X Embodiment 中选取的 12 个数据集 + Dobb-E + RH20T + RLBench + CALVIN 共同构成机器人数据,外加 Epic-Kitchens、HOI4D 两个 HOI 数据集),没有采集新的真机轨迹;机器人数据集因场景复杂度被过滤以保证 Grounded-SAM 定位准确,但同数据集内背景高度同质,故目标生成任务额外引入 HOI 数据集来增加场景与交互多样性。

训练方法

三阶段流水线:

  1. 扩散模型预训练(独立训练,不涉及 LLM):按模态分别在机器人数据上从头/微调预训练 RGB-D 扩散模型与点云扩散模型(见下方 Infra 的具体步数/周期)。
  2. 3D-VLA 骨干预训练:在 BLIP2-FlanT5XL 上加入交互 token,用 3D 具身指令数据集训练具身 QA、任务描述、定位、假设性问答(what-if QA,基于动作 token 预测”如果执行某动作会怎样”)等任务,30 epoch。
  3. 对齐阶段(Bridging LLM and Goal Generation):引入 <image>/<pcd> token 与 transformer projector,联合优化 LLM 生成损失与扩散模型去噪损失,LoRA 微调扩散解码器,最多 20 epoch。

优化器为 AdamW(β₁=0.9, β₂=0.999, weight decay=0.05),学习率在预训练/对齐两阶段均先做 1K 步线性 warmup(1e-8 → 1e-5),再余弦衰减到最小值 1e-6;用 Distributed Data Parallel 训练。动作预测部分为开环(open-loop)控制——不像部分基线那样依赖历史观测/物体状态反馈。

Infra(训练 / 推理工程)

3D-VLA 骨干(论文正文,附录 A):

  • 预训练阶段:6×32 = 192 张 V100,batch size 4/节点,30 epoch,每 epoch 验证一次。
  • 对齐阶段:6×64 = 384 张 V100,batch size 2/节点,最多 20 epoch。

扩散解码器(GitHub Model Card,独立训练):

  • Goal Image LDM(RGB→RGB):192 张 V100,训练 360,000 步,耗时约 3 周
  • Goal RGB-D LDM(RGB-D→RGB-D):96 张 V100,训练 100,000 步,耗时约 2 周(作者观察到比纯 RGB 版本收敛更快)。
  • Goal Point Cloud DM(基于 Point-E 微调):32 张 V100,训练 200 epoch,训练时用 2048 点,推理时可生成远超训练点数、最高 8192 点的点云。

推理 FPS / 控制频率 / 端到端时延:论文与代码库均未披露

评测 benchmark

3D 推理与定位(表 1,与 3D-LLM、BLIP2、OpenFlamingo、LLaVA 对比,含 zero-shot 与 held-in 两种基线设置):以 Embodied QA 为例(BLEU-1/2/3/4, METEOR, ROUGE-L, EM@1),3D-VLA 达 48.34 / 38.55 / 31.72 / 26.80 / 23.72 / 49.33 / 24.53,显著超过 held-in 训练的 BLIP2-FlanT5XL 基线(37.31/…/15.35)以及 3D-LLM zero-shot(1.05/…/0.00,证明未针对机器人场景训练的 3D-LLM 在该任务上几乎失效)。Task Caption 与 What-if QA 任务上同样大幅领先(Task Caption EM@1 3D-VLA 29.34 vs BLIP2-FlanT5XL 7.75)。

定位(表 2,对比 2D grounding MLLM 通过深度投影转 3D bbox):IoU / Acc@25 / Acc@50 上,3D-VLA 29.33 / 42.26 / 27.09,显著超过 Kosmos-2(w/ GT depth,10.92/12.73/3.85)与 CoVLM(w/ GT depth,19.81/25.39/16.61)。

目标图像生成(表 3,PSNR / CLIP Sim / SSIM / FID,4000 个 Open-X 未见 episode):3D-VLA 在 PSNR(17.21)、SSIM(0.636)上最优;同用机器人数据训练的 Instruct-P2P*(16.67 PSNR)也被超过,证明引入 LLM 理解指令带来额外增益;消融”去掉预测 bbox 输入”(3D-VLA w/o Pred BBox)PSNR 降至 17.02,验证中间预测 bbox 的作用。

目标点云生成(表 4,P-FID↓ / Chamfer-L1↓):3D-VLA 4.796 / 0.139 为最优,消融”去掉预测 bbox”(3D-VLA w/o Pred BBox)为 4.914 / 0.143,纯 Point-E* 基线为 5.241 / 0.159——两项消融均验证了 LLM 集成与预测 bbox 的增益。

动作规划 — RLBench(表 5,成功率%,4 个任务含 1 个未见变体):3D-VLA 在 Put Knife(68)、Take Umbrella(52)上领先 LanCon-Learn(w/ History,32.2/50.8),Pick up Cup 上 3D-VLA(40)略低于 LanCon-Learn w/ His.(44.2,后者利用历史观测/物体状态,3D-VLA 仅开环);未见变体 Pick up Cup(unseen)3D-VLA 达 24,验证泛化能力。

动作规划 — CALVIN(表 6,长程 5 任务连续完成率%):3D-VLA 在完成 1/2/3/4 个任务的比例上均超过 MCIL(44.7/16.3/8.1/1.6 vs MCIL 的 28.2/2.5/0.3/0),完成全部 5 个任务两者都为 0。

创新点与影响

  • 首次把生成式世界模型(而非直接感知→动作映射)引入 3D-based VLA,让模型先”想象”目标状态(图像/深度/点云)再规划动作,并证明这一想象能力能反哺推理与规划精度。
  • 提出一套交互 token(scene/obj/loc/action)把 3D 场景、物体指代、空间定位、机械臂动作统一编码进 LLM 词表,使单一模型能处理定位、目标生成、动作规划等异构任务。
  • 已有 2D 具身数据集重新加工出 3D 标注(深度估计+光流对齐+Grounded-SAM 分割)这一低成本管线,绕开了”3D 机器人数据稀缺”的瓶颈,产出 2M 条 3D-language-action 数据对。
  • 提出预训练具身扩散模型 + transformer projector 对齐的方案,解决了”通用视频/图像扩散模型不适配具身场景”(Runway 生成场景畸变、冻结 SD 输出坍塌)的问题。
  • 作者自陈局限(Impact Statement):当前验证限于模拟环境与 held-in 数据集,实机部署需要先在模拟器充分训练、并在真实世界部署时保持人工监督,以降低机器人与物体/人碰撞的风险。

原始链接

一手源存档(sources/)

  • 3d-vla—github-readme — GitHub README 快照(sources/world-model/2024/3d-vla—github-readme.md)
  • 3d-vla—model-card — GitHub docs/model_card.md 快照,含三个扩散模型的 GPU 数/步数/训练时长(sources/world-model/2024/3d-vla—model-card.md)
  • arXiv 全文(HTML v1)已通读,含附录 A 训练超参与附录 B 数据集明细表;未入 git(arXiv 原文 PDF,不入 git)