一句话定位

TinyVLA 用一个 70M–1.4B 参数的小型多模态模型(Llava-Pythia)替代 OpenVLA/RT-2 那类 7B+ 自回归 VLA 骨干,再挂一个扩散策略(Diffusion Policy)头直接回归连续动作而非离散动作 token,从而做到不需要 OpenX 规模的机器人预训练数据、推理延迟比 OpenVLA 低约 20 倍,同时在真实机器人任务上平均成功率反超 OpenVLA 25.7 个百分点。

背景与定位

范式:小型 VLM 骨干 + 扩散策略头,是对 rt-2/openvla 这条”大 VLM + 自回归离散动作 token”路线的正面挑战。论文指出这条路线的两个代价:(1) 骨干普遍超过 7B 参数,推理慢;(2) 逐自由度自回归采样离散动作 token,训练难、需要海量数据、且容易收敛到单一众数状态。TinyVLA 反其道而行之——先训一个 <1B 参数的多模态模型(基于 Pythia 语言模型 + LLaVA 训练流程得到 Llava-Pythia 系列),再在机器人数据微调阶段换掉”预测动作 token”这一步,改用 diffusion-policy 的 DDPM 头直接输出连续动作,并且完全跳过 OpenVLA 依赖的 970K 条 open-x-embodiment 预训练数据。

关联工作:视觉-语言骨干沿用 LLaVA 的训练流程与数据,语言模型换成更小的 Pythia 系列;动作头直接复用 diffusion-policy 的 DDPM 建模;主要对比对象是 openvla(7.2B,OpenX 预训练)、Diffusion Policy(无语言条件)、以及加了 FiLM 语言条件的 Multimodal Diffusion 变体(仿照 RT-1 与 YAY 的做法)。该工作发表于 IEEE Robotics and Automation Letters (RA-L) 2025。

模型架构

Policy backbone = Llava-Pythia(自建的小型 VLM 家族,遵循 LLaVA 训练流程与视觉-语言数据训练得到):

  • 语言模型底座:Pythia,论文训练了 70M–1.4B 参数区间的一族 VLM;开源的三个 checkpoint 分别为 ~400M / ~700M / ~1.3B(HF: lesjie/Llava-Pythia-400M / -700M / -1.3B),对应 TinyVLA-S / TinyVLA-B / TinyVLA-H 三个规格。
  • 机器人数据微调阶段保留 VLM 的全部模块(视觉骨干 + 视觉-语言对齐模块),不重新训练。

ACTION 头 = Diffusion Policy(连续动作,非离散 token):

  • 用 DDPM(Denoising Diffusion Probabilistic Models)建模动作分布:训练时对动作加噪(随机步数 K∈[0,N]),模型学习预测噪声;推理时从纯高斯噪声出发迭代去噪 {aⁿ, aⁿ⁻¹, …, a¹} → a⁰ 得到最终动作。
  • 扩散头与 VLM 骨干的连接极简:两个 Linear 投影 + 一个 LayerNorm,VLM 联合编码当前观测与语言指令得到的多模态 embedding 作为条件,控制扩散头的去噪过程。
  • 论文明确放弃了 RT-2 式的离散动作 token 化,理由是连续/高维数据离散化训练难、需要巨量数据、且容易塌缩到单一众数状态。
  • 输出动作表示:6D 位姿——位置 (x, y, z) + 旋转 (roll, pitch, yaw)。

LoRA 微调机器人数据:冻结 VLM 大部分权重,仅对 Transformer 注意力的 Q、K、V 权重矩阵插入 LoRA 低秩适配(W₀+ΔW=W₀+BA),可训练参数仅占整个 Transformer 参数的 5.0%;训练完成后将 LoRA 重参数化合并回主干,不引入额外推理开销。论文在附录(该版本 arXiv HTML 未渲染出附录正文)称消融显示”全量微调”或”完全冻结 Transformer 层”都会掉点,支持 5% LoRA 的折中选择。

三档模型规模(Table II 实测参数量):

规格VLM 总参数微调可训练参数(LoRA+扩散头)
TinyVLA-S422M101M
TinyVLA-B740M138M
TinyVLA-H1.3B143M

对照基线 openvla:总参数 7.2B(970K OpenX 预训练),微调可训练参数 195M。

数据

  • 不使用任何机器人预训练数据——这是与 OpenVLA(970K 条 open-x-embodiment 轨迹预训练)最核心的区别;TinyVLA 的 VLM 部分只在 LLaVA 的视觉-语言数据上预训练,机器人数据只用于任务微调阶段。
  • 单臂 Franka Panda 7DoF:5 个任务(CloseDrawer / StackCubes / OpenBox / PlaceTennis / FlipMug),每个任务通过遥操作(teleoperation)采集 100 条轨迹,共 500 条,用于平衡 5 个任务间的数据分布。采集时记录两个外置 ZED 2 双目相机的 RGB 流与机器人关节位置等状态。个别任务(如 OpenBox)刻意不加干扰物,专门留给后续泛化测试评估鲁棒性。StackCubes 等任务轨迹长度跨度大(约 100–300 步),增加了多任务学习难度。
  • 双臂 UR5:3 个协作任务(TransferBread / PlaceTennisBag / StackCubes),场景由两个手腕 Realsense D435i 相机 + 一个顶部相机采集;论文正文未披露双臂设置具体采集的轨迹条数。
  • 仿真基准 MetaWorld:50 个任务,按难度分层(Easy 28 / Medium 11 / Hard 6 / Very Hard 5),每任务 50 条示范,多任务联合训练。
  • 无 sim-to-real 或额外协同训练数据;真实机器人数据全部来自自采遥操作演示,不做数据增强(论文特别强调其视觉/外观/光照泛化能力”在不依赖数据增强”的情况下取得)。

训练方法

  1. VLM 预训练:用 Pythia 作为语言模型底座,按 LLaVA 的训练流程与视觉-语言数据训练出 70M–1.4B 参数区间的小型 VLM 家族(Llava-Pythia)。
  2. 机器人数据微调:冻结 VLM 绝大部分权重,仅对注意力 Q/K/V 矩阵做 LoRA(可训练参数占比 5.0%),同时训练新增的扩散策略头(通过 2 层 Linear + LayerNorm 接到 VLM 输出的多模态 embedding 上)。
  3. 动作生成目标:标准 DDPM 去噪目标(预测所加噪声),而非自回归 next-token 预测。
  4. 推理后处理:LoRA 权重重参数化合并进标准 Transformer 权重,消除推理时的适配器开销,是”20 倍推理延迟优势”的来源之一(另一来源是骨干本身远小于 7B+ VLM,且动作头一次前向输出整段动作而非逐自由度自回归)。
  5. 所有多任务实验(单臂 5 任务、双臂 3 任务、MetaWorld 50 任务)均为联合多任务训练,单一策略网络覆盖全部任务,而非逐任务单独训练。

Infra(训练 / 推理工程)

  • 训练 GPU 数量、GPU-hours、并行策略、精度:未披露
  • 推理侧:论文仅给出相对指标——在同一块 NVIDIA A6000 GPU 上对比,TinyVLA-H 相比 OpenVLA 实现约 20 倍更低的推理延迟(单臂 Franka 真实机器人实验,5 个任务的平均成功率 vs. 延迟散点图,Figure 1);具体的绝对延迟(ms)、控制频率(Hz)、边缘设备部署数据均未披露

评测 benchmark

MetaWorld 仿真(Table I,50 任务,50 条示范/任务,3 个随机种子 × 5 次迭代取均值):

方法Easy(28)Medium(11)Hard(6)Very Hard(5)Avg
diffusion-policy23.110.71.96.110.5
TinyVLA-H77.621.511.415.831.6

TinyVLA-H 平均成功率超 Diffusion Policy 21.5 个百分点,在 Hard 档差距达到约 6 倍。

真实机器人单臂(Table II,5 任务,每任务 20 次试验,3 个 checkpoint 均值±标准差):

方法总参数可训练参数PlaceTennisFlipMugStackCubesCloseDrawerOpenBoxAvg
diffusion-policy111M111M16.7±0.630±0.23.3±0.173.3±0.153.3±0.135.3
Multimodal Diffusion(FiLM 语言条件)230M230M23.3±0.313.3±1.36.7±0.336.7±0.310.0±018.0
openvla(970K OpenX 预训练)7.2B195M83.3±1.151.7±3.140.0±0.185.0±181.7±0.668.3
TinyVLA-S422M101M8.3±0.16.7±0.16.7±0.160.0±0.235.0±0.323.3
TinyVLA-B740M138M76.7±0.676.7±0.171.7±0.181.7±0.180.0±0.277.4
TinyVLA-H1.3B143M90.0±0.298.3±0.198.3±0.196.7±0.386.7±0.194.0

TinyVLA-H 以 5.5 倍更少的总参数(1.3B vs. 7.2B)平均成功率反超 OpenVLA 25.7 个百分点。

双臂 UR5(Table III,3 任务,10 次试验均值):

方法可训练参数PlaceBreadStackCubesPlaceTennisBag
diffusion-policy111M0±00±00±0
openvla195M0±00±00±0
TinyVLA-H143M76.7±2.336.7±2.330±1

OpenVLA 与 Diffusion Policy 在双臂场景全部任务成功率为 0——论文推测是因为 OpenVLA 预训练用的 OpenX 数据全部是单臂机器人数据,无法迁移到双臂设置。正文写”TinyVLA-H 平均成功率达到 65%“,但按 Table III 三个任务数值直接算术平均为 (76.7+36.7+30)/3≈47.8%,与正文所述 65% 不一致——这是源文本自身的差异,未能进一步核实,如实标注。

定性泛化实验(均为无数值成功率的案例展示,非严格量化对比):指令泛化(未见颜色/未见物体/新技能组合三档难度)、视角泛化(左右视角偏移最高容忍约 ±30°,优于 Diffusion Policy 对视角剧烈敏感)、背景泛化(6 种桌布/桌垫材质)、光照泛化(顶灯关闭/全暗两档,OpenVLA 在暗光下任务失败而 TinyVLA 不受影响)、干扰物泛化(两档难度,Diffusion Policy 与 OpenVLA 均表现不佳)、外观泛化(改变物体颜色,无数据增强下仍成功)、空间泛化(位置偏移到训练分布之外,论文承认”OpenVLA 略优于 TinyVLA”,推测因 OpenVLA 在大规模机器人数据预训练中见过更多样的机器人动作)。

创新点与影响

  • 证明小型 VLM(<1B)+ 扩散策略头可以替代 7B+ VLM + 自回归离散动作 token,在不做机器人预训练的情况下,数据效率与推理速度双双碾压 OpenVLA,同时真实机器人任务成功率更高。
  • LoRA(5% 可训练参数)+ 推理时权重重参数化,是”小模型高精度、低延迟”组合拳的关键工程细节,论文附录消融显示全量微调或完全冻结都不如这一折中方案(具体消融数值本 arXiv HTML 版本未渲染出附录正文,未能核实)。
  • 揭示了 OpenVLA 式”海量单臂机器人数据预训练”策略的一个脆弱点:在双臂等预训练数据分布外的机器人形态上完全失效(0% 成功率),而 TinyVLA 由于不依赖机器人预训练数据、只靠视觉-语言预训练的世界知识做泛化,在双臂场景反而更稳健。
  • 作者自陈的局限:论文本身未讨论明确的局限章节(Conclusion 仅一段总结性陈述),推理延迟只给出相对倍数(20×)而非绝对数值;空间泛化任务上承认弱于 OpenVLA;双臂实验的正文表述数字与表格数值存在未解释的不一致。

原始链接

一手源存档(sources/)