一句话定位
TinyVLA 用一个 70M–1.4B 参数的小型多模态模型(Llava-Pythia)替代 OpenVLA/RT-2 那类 7B+ 自回归 VLA 骨干,再挂一个扩散策略(Diffusion Policy)头直接回归连续动作而非离散动作 token,从而做到不需要 OpenX 规模的机器人预训练数据、推理延迟比 OpenVLA 低约 20 倍,同时在真实机器人任务上平均成功率反超 OpenVLA 25.7 个百分点。
背景与定位
范式:小型 VLM 骨干 + 扩散策略头,是对 rt-2/openvla 这条”大 VLM + 自回归离散动作 token”路线的正面挑战。论文指出这条路线的两个代价:(1) 骨干普遍超过 7B 参数,推理慢;(2) 逐自由度自回归采样离散动作 token,训练难、需要海量数据、且容易收敛到单一众数状态。TinyVLA 反其道而行之——先训一个 <1B 参数的多模态模型(基于 Pythia 语言模型 + LLaVA 训练流程得到 Llava-Pythia 系列),再在机器人数据微调阶段换掉”预测动作 token”这一步,改用 diffusion-policy 的 DDPM 头直接输出连续动作,并且完全跳过 OpenVLA 依赖的 970K 条 open-x-embodiment 预训练数据。
关联工作:视觉-语言骨干沿用 LLaVA 的训练流程与数据,语言模型换成更小的 Pythia 系列;动作头直接复用 diffusion-policy 的 DDPM 建模;主要对比对象是 openvla(7.2B,OpenX 预训练)、Diffusion Policy(无语言条件)、以及加了 FiLM 语言条件的 Multimodal Diffusion 变体(仿照 RT-1 与 YAY 的做法)。该工作发表于 IEEE Robotics and Automation Letters (RA-L) 2025。
模型架构
Policy backbone = Llava-Pythia(自建的小型 VLM 家族,遵循 LLaVA 训练流程与视觉-语言数据训练得到):
- 语言模型底座:Pythia,论文训练了 70M–1.4B 参数区间的一族 VLM;开源的三个 checkpoint 分别为 ~400M / ~700M / ~1.3B(HF:
lesjie/Llava-Pythia-400M/-700M/-1.3B),对应 TinyVLA-S / TinyVLA-B / TinyVLA-H 三个规格。 - 机器人数据微调阶段保留 VLM 的全部模块(视觉骨干 + 视觉-语言对齐模块),不重新训练。
ACTION 头 = Diffusion Policy(连续动作,非离散 token):
- 用 DDPM(Denoising Diffusion Probabilistic Models)建模动作分布:训练时对动作加噪(随机步数 K∈[0,N]),模型学习预测噪声;推理时从纯高斯噪声出发迭代去噪 {aⁿ, aⁿ⁻¹, …, a¹} → a⁰ 得到最终动作。
- 扩散头与 VLM 骨干的连接极简:两个 Linear 投影 + 一个 LayerNorm,VLM 联合编码当前观测与语言指令得到的多模态 embedding 作为条件,控制扩散头的去噪过程。
- 论文明确放弃了 RT-2 式的离散动作 token 化,理由是连续/高维数据离散化训练难、需要巨量数据、且容易塌缩到单一众数状态。
- 输出动作表示:6D 位姿——位置 (x, y, z) + 旋转 (roll, pitch, yaw)。
LoRA 微调机器人数据:冻结 VLM 大部分权重,仅对 Transformer 注意力的 Q、K、V 权重矩阵插入 LoRA 低秩适配(W₀+ΔW=W₀+BA),可训练参数仅占整个 Transformer 参数的 5.0%;训练完成后将 LoRA 重参数化合并回主干,不引入额外推理开销。论文在附录(该版本 arXiv HTML 未渲染出附录正文)称消融显示”全量微调”或”完全冻结 Transformer 层”都会掉点,支持 5% LoRA 的折中选择。
三档模型规模(Table II 实测参数量):
| 规格 | VLM 总参数 | 微调可训练参数(LoRA+扩散头) |
|---|---|---|
| TinyVLA-S | 422M | 101M |
| TinyVLA-B | 740M | 138M |
| TinyVLA-H | 1.3B | 143M |
对照基线 openvla:总参数 7.2B(970K OpenX 预训练),微调可训练参数 195M。
数据
- 不使用任何机器人预训练数据——这是与 OpenVLA(970K 条 open-x-embodiment 轨迹预训练)最核心的区别;TinyVLA 的 VLM 部分只在 LLaVA 的视觉-语言数据上预训练,机器人数据只用于任务微调阶段。
- 单臂 Franka Panda 7DoF:5 个任务(CloseDrawer / StackCubes / OpenBox / PlaceTennis / FlipMug),每个任务通过遥操作(teleoperation)采集 100 条轨迹,共 500 条,用于平衡 5 个任务间的数据分布。采集时记录两个外置 ZED 2 双目相机的 RGB 流与机器人关节位置等状态。个别任务(如 OpenBox)刻意不加干扰物,专门留给后续泛化测试评估鲁棒性。StackCubes 等任务轨迹长度跨度大(约 100–300 步),增加了多任务学习难度。
- 双臂 UR5:3 个协作任务(TransferBread / PlaceTennisBag / StackCubes),场景由两个手腕 Realsense D435i 相机 + 一个顶部相机采集;论文正文未披露双臂设置具体采集的轨迹条数。
- 仿真基准 MetaWorld:50 个任务,按难度分层(Easy 28 / Medium 11 / Hard 6 / Very Hard 5),每任务 50 条示范,多任务联合训练。
- 无 sim-to-real 或额外协同训练数据;真实机器人数据全部来自自采遥操作演示,不做数据增强(论文特别强调其视觉/外观/光照泛化能力”在不依赖数据增强”的情况下取得)。
训练方法
- VLM 预训练:用 Pythia 作为语言模型底座,按 LLaVA 的训练流程与视觉-语言数据训练出 70M–1.4B 参数区间的小型 VLM 家族(Llava-Pythia)。
- 机器人数据微调:冻结 VLM 绝大部分权重,仅对注意力 Q/K/V 矩阵做 LoRA(可训练参数占比 5.0%),同时训练新增的扩散策略头(通过 2 层 Linear + LayerNorm 接到 VLM 输出的多模态 embedding 上)。
- 动作生成目标:标准 DDPM 去噪目标(预测所加噪声),而非自回归 next-token 预测。
- 推理后处理:LoRA 权重重参数化合并进标准 Transformer 权重,消除推理时的适配器开销,是”20 倍推理延迟优势”的来源之一(另一来源是骨干本身远小于 7B+ VLM,且动作头一次前向输出整段动作而非逐自由度自回归)。
- 所有多任务实验(单臂 5 任务、双臂 3 任务、MetaWorld 50 任务)均为联合多任务训练,单一策略网络覆盖全部任务,而非逐任务单独训练。
Infra(训练 / 推理工程)
- 训练 GPU 数量、GPU-hours、并行策略、精度:未披露。
- 推理侧:论文仅给出相对指标——在同一块 NVIDIA A6000 GPU 上对比,TinyVLA-H 相比 OpenVLA 实现约 20 倍更低的推理延迟(单臂 Franka 真实机器人实验,5 个任务的平均成功率 vs. 延迟散点图,Figure 1);具体的绝对延迟(ms)、控制频率(Hz)、边缘设备部署数据均未披露。
评测 benchmark
MetaWorld 仿真(Table I,50 任务,50 条示范/任务,3 个随机种子 × 5 次迭代取均值):
| 方法 | Easy(28) | Medium(11) | Hard(6) | Very Hard(5) | Avg |
|---|---|---|---|---|---|
| diffusion-policy | 23.1 | 10.7 | 1.9 | 6.1 | 10.5 |
| TinyVLA-H | 77.6 | 21.5 | 11.4 | 15.8 | 31.6 |
TinyVLA-H 平均成功率超 Diffusion Policy 21.5 个百分点,在 Hard 档差距达到约 6 倍。
真实机器人单臂(Table II,5 任务,每任务 20 次试验,3 个 checkpoint 均值±标准差):
| 方法 | 总参数 | 可训练参数 | PlaceTennis | FlipMug | StackCubes | CloseDrawer | OpenBox | Avg |
|---|---|---|---|---|---|---|---|---|
| diffusion-policy | 111M | 111M | 16.7±0.6 | 30±0.2 | 3.3±0.1 | 73.3±0.1 | 53.3±0.1 | 35.3 |
| Multimodal Diffusion(FiLM 语言条件) | 230M | 230M | 23.3±0.3 | 13.3±1.3 | 6.7±0.3 | 36.7±0.3 | 10.0±0 | 18.0 |
| openvla(970K OpenX 预训练) | 7.2B | 195M | 83.3±1.1 | 51.7±3.1 | 40.0±0.1 | 85.0±1 | 81.7±0.6 | 68.3 |
| TinyVLA-S | 422M | 101M | 8.3±0.1 | 6.7±0.1 | 6.7±0.1 | 60.0±0.2 | 35.0±0.3 | 23.3 |
| TinyVLA-B | 740M | 138M | 76.7±0.6 | 76.7±0.1 | 71.7±0.1 | 81.7±0.1 | 80.0±0.2 | 77.4 |
| TinyVLA-H | 1.3B | 143M | 90.0±0.2 | 98.3±0.1 | 98.3±0.1 | 96.7±0.3 | 86.7±0.1 | 94.0 |
TinyVLA-H 以 5.5 倍更少的总参数(1.3B vs. 7.2B)平均成功率反超 OpenVLA 25.7 个百分点。
双臂 UR5(Table III,3 任务,10 次试验均值):
| 方法 | 可训练参数 | PlaceBread | StackCubes | PlaceTennisBag |
|---|---|---|---|---|
| diffusion-policy | 111M | 0±0 | 0±0 | 0±0 |
| openvla | 195M | 0±0 | 0±0 | 0±0 |
| TinyVLA-H | 143M | 76.7±2.3 | 36.7±2.3 | 30±1 |
OpenVLA 与 Diffusion Policy 在双臂场景全部任务成功率为 0——论文推测是因为 OpenVLA 预训练用的 OpenX 数据全部是单臂机器人数据,无法迁移到双臂设置。正文写”TinyVLA-H 平均成功率达到 65%“,但按 Table III 三个任务数值直接算术平均为 (76.7+36.7+30)/3≈47.8%,与正文所述 65% 不一致——这是源文本自身的差异,未能进一步核实,如实标注。
定性泛化实验(均为无数值成功率的案例展示,非严格量化对比):指令泛化(未见颜色/未见物体/新技能组合三档难度)、视角泛化(左右视角偏移最高容忍约 ±30°,优于 Diffusion Policy 对视角剧烈敏感)、背景泛化(6 种桌布/桌垫材质)、光照泛化(顶灯关闭/全暗两档,OpenVLA 在暗光下任务失败而 TinyVLA 不受影响)、干扰物泛化(两档难度,Diffusion Policy 与 OpenVLA 均表现不佳)、外观泛化(改变物体颜色,无数据增强下仍成功)、空间泛化(位置偏移到训练分布之外,论文承认”OpenVLA 略优于 TinyVLA”,推测因 OpenVLA 在大规模机器人数据预训练中见过更多样的机器人动作)。
创新点与影响
- 证明小型 VLM(<1B)+ 扩散策略头可以替代 7B+ VLM + 自回归离散动作 token,在不做机器人预训练的情况下,数据效率与推理速度双双碾压 OpenVLA,同时真实机器人任务成功率更高。
- LoRA(5% 可训练参数)+ 推理时权重重参数化,是”小模型高精度、低延迟”组合拳的关键工程细节,论文附录消融显示全量微调或完全冻结都不如这一折中方案(具体消融数值本 arXiv HTML 版本未渲染出附录正文,未能核实)。
- 揭示了 OpenVLA 式”海量单臂机器人数据预训练”策略的一个脆弱点:在双臂等预训练数据分布外的机器人形态上完全失效(0% 成功率),而 TinyVLA 由于不依赖机器人预训练数据、只靠视觉-语言预训练的世界知识做泛化,在双臂场景反而更稳健。
- 作者自陈的局限:论文本身未讨论明确的局限章节(Conclusion 仅一段总结性陈述),推理延迟只给出相对倍数(20×)而非绝对数值;空间泛化任务上承认弱于 OpenVLA;双臂实验的正文表述数字与表格数值存在未解释的不一致。
原始链接
- arXiv: https://arxiv.org/abs/2409.12514
- PDF: https://arxiv.org/pdf/2409.12514
- 项目主页: https://tiny-vla.github.io/
- GitHub: https://github.com/liyaxuanliyaxuan/TinyVLA
- HF 模型(Llava-Pythia 骨干,400M/700M/1.3B 三档): https://huggingface.co/lesjie/Llava-Pythia-1.3B
一手源存档(sources/)
- tinyvla—project-page — 项目主页文本快照(任务设置 + 5 类泛化实验说明),https://tiny-vla.github.io/
- tinyvla—github-readme — GitHub README(VLM 骨干下载表、训练/评测脚本说明),https://github.com/liyaxuanliyaxuan/TinyVLA
- tinyvla—hf-card — HuggingFace 模型卡(
Llava-Pythia-1.3B,TinyVLA-H 骨干),https://huggingface.co/lesjie/Llava-Pythia-1.3B - arXiv 全文 PDF(2409.12514,arXiv 原文 PDF,不入 git):https://arxiv.org/pdf/2409.12514