一句话定位

VLA(vision-language-action)这一族回答的是同一个问题:怎样把互联网规模学到的语义先验,接进一个能在真机上闭环跑的动作策略里。整族的历史可以压成两条正交主轴来读——(A) web 知识从哪来(直接拿预训练 VLM 当底座 / 用视频生成预训练 / 用无标签视频学潜动作),(B) 动作怎么产出(自回归离散 token → 压缩离散 token → 扩散动作头 → flow-matching 动作专家 → 并行解码 + 连续回归 → 双系统 → 回归纯自回归统一)。从 2022 年 RT-1 的机器人专用 Transformer,到 2023 年 RT-2 把「动作当文本 token、与网页数据 co-fine-tune」立成范式并命名 VLA,再到 2024 年开源三件套(OctoOpenVLARDT-1B)、π0 用 flow-matching action expert 突破高频灵巧控制,2025 年 GR00T/Gemini Robotics 把双系统与前沿 VLM 推上人形与跨本体,直到 2026 年 π0.7 展示接近 LLM 的组合式泛化、Galaxea G0.5 又把整族拉回纯自回归——每一步都是在这两根主轴上做替换。

本页按「奠基与命名 → 开源基线 → flow-matching 动作专家(π 系)→ 双系统与人形 → 视频生成/潜动作支线 → 中国开源与商业本体 → 规划-执行分层与具身大脑」七条支线梳理谱系,给出演化时间线、两张 head-to-head 对比表、一条贯穿全族的动作头设计演进主线,以及共享设计模式与走向判断。


为什么它们是一个”族”:共同的三个矛盾

几乎所有 VLA 的立意都能追溯到三个结构性矛盾,区别只在攻击哪一个、用什么武器:

  • 语义 vs. grounded 动作:最强的 VLM 在网页上吃了数十亿 token,却只会推理标签/文本,不会输出机器人要的低层笛卡尔/关节指令;而机器人数据近期不可能堆到 web 那个量级。RT-2 的破题——动作即语言 token,与网页数据同池 co-fine-tune——是整族的第一块基石,让 web 语义(关系、多语言、符号、affordance)迁移进闭环控制,unseen 泛化从 RT-1 的 32% 跳到 62%。
  • 离散化 vs. 高频灵巧:把动作逐维逐时间步分箱(256-bin)后,相邻时间步 token 高度相关,自回归目标的边际信息量趋近于零,模型退化为「复制上一动作」——这正是 OpenVLA 能跑低频 Bridge、却在 50Hz 双臂折衣上几乎 0 分的原因。答案是两条:要么换更懂压缩的分词器(FAST 的 DCT+BPE、G0.5 的学习式 RVQ),要么彻底改用扩散/流匹配生成连续动作块(OctoRDT-1Bπ0)。
  • 数据稀缺 vs. 泛化:机器人数据没有「互联网规模」。全族用四类办法补:跨本体统一动作空间共训(OXE)、无动作视频做潜动作/伪动作预训练(LAPAUniVLAGR-2)、仿真 + 神经生成视频造数据(GR00T 数据金字塔)、以及把 VLM 的网页知识当先验直接继承。

两块基石——动作分块(action chunk,源自 ACTVLM 底座初始化——此后成了几乎每个成员的标配。理解了这三个矛盾与两块基石,后面所有分化都是在其上做正交替换。


谱系与演化时间线

时间工作一句话贡献范式坐标(web 知识源 / 动作头)
2022-04~09SayCan·Inner Monologue·Code-as-Policies冻结 LLM 当高层规划器(Say×Can 打分 / 反馈闭环 / 写 Python 策略),低层控制器另训LLM 规划 / 无动作头(编排原语)
2022-12RT-135M 机器人专用 Transformer,动作离散成 token,多任务模仿的强基线无 web / 离散 token
2023-03PaLM-E把连续传感器投影进 PaLM 词空间做具身多模态推理(最大 562B),奠基「LLM 吃原始传感流」前沿 LLM / 输出高层子目标文本
2023-07RT-2命名并奠基 VLA:PaLI-X 55B / PaLM-E 12B 动作当 token 与网页数据 co-fine-tune,涌现推理VLM-as-VLA / 离散 token
2023-12SARA-RT·RT-HRT-2 的线性注意力提速 up-training / 插入「语言运动」动作层级、可语言纠错VLM-as-VLA / 离散 token
2024-02~05PIVOT·Octo·OpenVLA迭代视觉提示零训练 / 首个全开源 GRP(扩散头)/ 首个全开源 7B VLA(离散 token)VLM / 扩散头·离散 token
2024-09~10TinyVLA·LAPA·RDT-1B·GR-2小 VLM+扩散头 / 无标签视频学潜动作 / 1.2B 扩散双臂基座 / 视频生成预训练 VLA多源 / 扩散·潜动作·视频生成
2024-10~12π0·CogACT·DiVLA·RoboVLMsflow-matching action expert 确立 / 认知-动作解耦 DiT / FiLM 注入扩散头 / VLA 建造实证VLM / flow-matching·扩散头
2025-01~02FAST·SpatialVLA·Gemini Robotics·Helix·DexVLA·ChatVLA·MagmaDCT+BPE 动作分词让 AR 上高频 / 3D 对齐 / 前沿 VLM 底座 + 云端-机载双系统 / 人形 200Hz 双系统VLM·视频伪动作 / 多样
2025-03~06GR00T N1·Dita·π0.5·KI·UniVLA·SmolVLA·GR00T N1.5·WorldVLA人形数据金字塔双系统 / in-context 扩散 / 开放世界泛化 / 知识隔离 / 任务中心潜动作 / 450M 社区数据 / 冻结语言塔+FLARE / 自回归动作-世界模型统一多源 / flow-matching·扩散·潜动作·AR
2025-07~09GR-3·villa-X·WALL-OSS·Galaxea G0·Gemini Robotics 1.5·InternVLA-M1VR 人类轨迹 co-train / 潜动作+本体对齐 / 紧耦合 MoE+Uni-CoT / 单本体 vs 跨本体对照 / Thinking VLA + Motion Transfer / 空间引导双系统VLM / flow-matching·扩散·双系统
2025-11π*0.6·RynnVLA-002RECAP 真实世界 RL(advantage conditioning)从经验自我提升 / VLA-世界模型同权重统一VLM / flow-matching·AR
2026-01~06InternVLA-A1·π0.7·WALL-OSS-0.5·InternVLA-A1.5·Galaxea G0.5理解-生成-动作三专家 MoT / 多样上下文条件 + 世界模型子目标 → 组合泛化 / 预训即可零样本部署 / 冻结视频模型查潜前瞻 / 回归纯自回归统一VLM+世界模型 / flow-matching·AR

一句话读这张表:2023-07 的 RT-2 是命名与奠基点2024-05~10 是开源基线爆发期(Octo/OpenVLA/RDT 把可复现基线钉死);2024-10 的 π0 把动作头从「离散/扩散」推进到「flow-matching action expert」,成为此后主流模板;2025 年在此模板上密集迭代双系统、人形、跨本体、知识保护;2026 年出现两股反向力量——一边是 π0.7 把「多样数据 + 世界模型」推向组合式泛化,另一边是 Galaxea G0.5 用学习式动作分词把整族拉回纯自回归,论证 VLM-as-Encoder 未必是终局。


支线一:奠基与命名(Google/DeepMind RT → Gemini Robotics)

这条线的技术信条是**「让预训练 VLM 直接当策略」**,一路从 5B 级专用 VLM 走到把整个前沿 Gemini 当底座。

  • RT-2(2023-07) 是整族的原点。做法极简:把 6-DoF 动作均匀离散成 256 bin、拼成 8 个整数当文本 token,与 WebLI(约 10 亿图文样本)co-fine-tune(机器人数据占 50%/66%)。不加任何动作专用层、语言与动作权重完全共享。结果 unseen 泛化 62%(RT-1 32%)、涌现能力平均 60(RT-1 17),但 55B 模型只能 1–3 Hz、需部署在云端 TPU。它同时给出两条日后被反复验证的结论:co-fine-tuning > 纯微调 > from-scratch,且模型越大泛化越好
  • RT-H(2024-03) 在「任务→动作」中间插一层从本体感受自动抠出的语言运动(“move arm forward”),让语义迥异的任务在动作层共享结构(+15% vs RT-2),还能用语言直接纠错(40%→63%)。SARA-RT 则把 RT-2 的二次注意力换成线性注意力 up-training,5B 上提速 14% 且精度不降。
  • Gemini Robotics(2025-03) 把底座换成前沿 Gemini 2.0,拆成两个模型:Gemini Robotics-ER(具身推理 VLM,统一指点/3D 检测/抓取/轨迹)与端到端 VLA。工程上首创云端蒸馏 backbone(<160ms)+ 机载 action decoder(≈250ms 端到端)→ 50Hz 的低延迟架构,泛化基准平均是同期 SOTA VLA 的 2 倍以上,并开源 ERQA(400 题具身推理基准)。
  • Gemini Robotics 1.5(2025-09) 升级到 Gemini 2.5,给出三大范式:Thinking VLA(多层级内心独白「先想后动」)、Motion Transfer(单 checkpoint 控 ALOHA/Bi-Franka/Apollo 三本体并零样本迁移技能)、agentic 双模型(GR-ER 1.5 编排器把长程失败率从 44.5% 砍到 22%)。>90% 开发期评测在 MuJoCo 完成,印证「提升执行 ≠ 解长程,关键在高层具身推理」。

支线二:开源基线(Octo / OpenVLA 及其提速改造)

2024 年这条线把「可复现、可微调、消费级 GPU 可及」变成硬指标,此后几乎所有 VLA 论文都拿它们当对照。

  • Octo(2024-05):首个完全开源的通用机器人策略(27M/93M)。transformer-first 骨干 + 扩散动作头(3 层 MLP,DDPM cosine 20 步,chunk=4),block-wise masked attention + readout token 让微调时能增删观测/动作 head 而不动预训练骨干。80 万条 OXE 轨迹(25 子集/1.2TB)预训练,TPU v4-128 上 8–14h,4090 上 13–17 it/s,单张 A5000 5h 可微调迁移到新传感器/新本体。零样本 WidowX 0.50 追平 55B 的 RT-2-X。走的是「小策略 + 连续扩散动作」路线。
  • OpenVLA(2024-06):首个全开源 7B VLA,走「端到端微调现成 VLM + 离散 token」的 RT-2 路线。底座 Prismatic(DINOv2+SigLIP 融合视觉 + Llama-2-7B),970k OXE 轨迹,分位数 256-bin(改进 RT-2 的 min-max)、过滤 no-op、训 27 epoch。64×A100 训 14 天(21,500 A100-h)。跨 29 任务绝对成功率超闭源 55B RT-2-X 16.5% 且少 7× 参数。第一个证明 LoRA(1.4% 参数)+ int4 量化(7GB,4090 上 6Hz) 能把 VLA 拉进消费级硬件。
  • OpenVLA-OFT(2025-02):不是新模型,而是一套微调配方——并行解码 + 动作分块 + 连续动作 + L1 回归。一次前向吐整段 chunk,把 LIBERO 四套件从 76.5% 拉到 97.1%、吞吐提 26×(8 步)到 43×(ALOHA 25 步),在真实双臂上以 25Hz 超过在双臂数据上预训练过的 π0RDT-1B。核心洞见:L1 回归 ≈ 扩散(95.3 vs 95.4)但更快,且微调配方可能比预训练数据覆盖更决定下游表现
  • SmolVLA(2025-06):HF/LeRobot 的 450M 小模型(动作专家 100M),只用 481 个社区众包数据集(22.9k episodes/10.6M frames,比同类少一个数量级)。靠「层跳过 N=L/2 + 视觉 token 压到 64/帧 + 交替 CA/SA 动作专家」换效率,LIBERO 87.3 追平 3.3B 的 π0(86.0),并给出模型无关的异步推理栈
  • 同期开源变体:SpatialVLA 给输入输出各加 3D 对齐(Ego3D 位置编码 + 自适应动作网格,单步只需 3 token);Dita 把去噪动作 token 直接塞进因果 Transformer 做 in-context 条件化;CogACT 用「认知 token → DiT 动作模块」解耦;TinyVLA/DiVLA 走小 VLM + 扩散头、不依赖 OXE 规模预训练;RoboVLMs 则用 600+ 组对照实验给出 VLA 建造配方(连续动作 + policy head 融合历史 + 充分预训练的 backbone)。

支线三:flow-matching 动作专家(Physical Intelligence π 系)

这是 2024 年末以来的主流模板:在预训练 VLM 上外挂一套独立权重的 action expert,用 flow matching 生成连续动作块,二者仅在注意力层交互(类 MoE 按 token 路由)。π 系一步步把这套配方推到极致。

  • π0(2024-10):PaliGemma 3B + 300M action expert(flow matching,H=50,10 步 Euler 积分)= 3.3B。约 1 万小时真机(903M timesteps,含 106M 单臂 + 797M 双臂)+ 9.1% 开源数据,跨 7 种构型统一到 18 维动作空间。50Hz 灵巧控制,4090 上板载 73ms。out-of-box 上 OpenVLA 几乎全 0(自回归不支持动作块),π0 全面领先;VLM 预训练带来 >2× 提升。以 openpi 开源,成为社区 base checkpoint。
  • π0-FAST(2025-01):另一条腿——保留纯自回归 next-token 训练,只换分词器。DCT → 量化 → BPE,把动作块压成稠密 token(压缩 1.75×@5Hz 到 13.2×@50Hz 双臂),让 AR VLA 第一次在高频灵巧任务上训成,训练比扩散 π0 省约 5× GPU-hours。代价是推理慢(750ms/块 vs 扩散 100ms)。首个在 DROID 上训出零样本语言泛化的策略。
  • π0.5(2025-04)异构数据 co-training + 分层。预训练样本里仅 2.4% 是本体移动操作、97.6% 来自其它机器人/网页,却能开箱进全新家庭做 10–15 分钟整屋清洁。配方:离散 FAST 预训练(280k 步)→ 加 action expert 的 flow-matching 后训练(80k 步);高层子任务 + 低层动作由同一模型输出。消融显示网页数据(WD)对 OOD 新物体最关键(去掉后 OOD 成功率 94%→74%)。
  • Knowledge Insulation(2025-05):把 π0.5 两阶段配方形式化并单阶段化。发现随机初始化的 action expert 梯度会污染 VLM 知识,解法是在注意力层对 action-expert→backbone 方向做 stop-gradient,同时用离散 FAST token 给 backbone 补一条独立学习信号。结果「训得快(比 π0 少 7.5× 步数)+ 跑得快(同 π0 的 10Hz)+ 泛化好」三者兼得,单步成本仅 +20%。已并入 openpi 的 π0.5 checkpoint。
  • π*0.6(2025-11):把 VLA 从模仿推进到真实世界 RL。底座 π0.6(Gemma3 4B + 860M expert = 5B),RECAP 配方 = 离线 RL 预训练 + 演示 SFT + 专家纠错 + 自主实践,核心是 advantage conditioning(给动作前插 Advantage: positive/negative token)绕开对 flow-matching 难施加的 policy gradient,配一个 670M 分布式价值函数(201 bins)。最难任务吞吐翻倍、失败率约减半,咖啡任务连续跑 13 小时。
  • π0.7(2026-04):5B(Gemma3 4B + 860M expert + MEM 视频编码器)。不提新架构,提多样上下文条件——把 prompt 从一句指令扩展为「子任务 + 情节元数据(速度/质量/是否出错)+ 控制模态 + 世界模型(BAGEL 14B)生成的子目标图像」,让失败/次优/自主/非机器人数据都能安全利用。首次在机器人上给出接近 LLM 的组合式泛化:折衬衫从静态双臂零样本迁到 UR5e 双臂 85.6% 进度/80% 成功率,追平 10 位顶级遥操作者(90.9%/80.6%);单一模型经「蒸馏 π*0.6 的 RL 经验」追平多个 RL 专家。

支线四:双系统与人形(NVIDIA GR00T / 创业实验室)

这条线借 Kahneman《快与慢》的 System 1/System 2 比喻,把「慢思考的 VLM」和「快反应的动作策略」拆成两条不同频率运行、端到端联训的通路,尤其瞄准高维人形控制。

  • GR00T N1(2025-03):首个开源人形基础模型(2.2B,VLM 1.34B)。System 2 = Eagle-2 VLM(SmolLM2-1.7B + SigLIP2)@10Hz,取第 12 层表征;System 1 = DiT flow-matching @120Hz(K=4 去噪,H=16),用简单 cross-attention 桥接(相对 π0 的 MoE 更解耦)。核心是数据金字塔:真机 262M 帧 + 人类视频 181M 帧 + 仿真 125M 帧 + 神经生成视频(WAN2.1 造 827h counterfactual 轨迹),无动作数据用 latent action/IDM 打伪标签。50k H100 GPU-hours,batch 16384/200k 步。真机 GR-1 全量 76.8%。
  • GR00T N1.5(2025-06):三处关键改动——冻结 VLM 语言塔(防微调冲掉语言能力)、FLARE 世界建模目标(对齐未来 latent,能从无动作人类视频学)、DreamGen 神经轨迹并入预训练。真机语言跟随率 46.6%→93.3%,从人类视频零样本学新物体 0%→15%(后训练到 55%),新动词泛化 13.1%→38.3%。1000 H100 训 250k 步。
  • Helix(2025-02,Figure)7B 开源 VLM System 2 @7-9Hz + 80M System 1 @200Hz,直接回归连续动作(不做动作 token 化)控制人形上半身 35-DoF。仅约 500 小时数据(<5% 以往 VLA),首个完全跑在机载低功耗 GPU 上、双机同权重零样本协作。纯博客、无量化 benchmark。
  • OpenHelix(2025-05) 是对 Helix 的开源复现尝试,系统消融「MLLM 怎么训 / 投影层怎么连 / 异步频率」;Hume(2025-05) 给 System 2 加 value-query 头做 Best-of-N「深思」并支持失败后自我纠错。这些与 Gemini Robotics 的云端-机载拆分、Galaxea G0 的 VLM 规划器构成 2025 年「双系统」的密集探索。

支线五:视频生成 / 潜动作 / 世界模型支线

这条线的信条是**「web 知识不必来自图文 VLM,可以来自视频」**——用视频生成或无标签视频学动力学/潜动作先验。

  • GR-2(2024-10,ByteDance):先在 **3800 万条视频片段(约 500 亿 token)**上做自回归视频生成预训练,再微调「同时预测未来视频 + 动作轨迹」(VQGAN 图像 token + cVAE 动作头,230M/95M 可训练)。视频预测充当动作规划器,改进视频生成即可迭代改进动作。105 任务 97.7%,CALVIN 平均长度 4.64,bin-picking 33.3→79.0。上承 GR-1,其后 GR-3 转向「Qwen2.5-VL + flow-matching DiT(MoT,4B)+ VR 人类轨迹 co-train」,table bussing 指令跟随 53.8%→97.5% 超 π0。
  • LAPA(2024-10):用 VQ-VAE 从无动作视频学离散「潜动作」码本,先训 VLM 预测潜动作、再少量真机映射到真实动作——第一个不需动作标签的 VLA 预训练,实机反超用 97 万条带标签轨迹训的 OpenVLA,算力省 30–40×。UniVLA(AgiBot/港大) 用两阶段 VQ-VAE 解耦「任务相关」潜动作,接 Prismatic-7B,不到 OpenVLA 1/20 算力(960 vs 21,500 A100-h) 全面反超;villa-X(MSR) 给潜动作加本体感受分支并用联合流匹配串起潜动作专家与动作专家。
  • 世界模型内化为辅助目标WorldVLARynnVLA-002(阿里达摩院)把动作模型与世界模型塞进同一自回归权重互相监督;InternVLA-A1(2026-01,上海AI Lab) 用 Mixture-of-Transformers 把「理解 + 生成(Cosmos VAE 预测 16-token 未来帧)+ 动作(flow matching)」绑进一套 masked attention,让动作能「参考」对未来的想象,传送带分拣等高动态场景比 π0/GR00T-N1.5 高 40–73 个百分点;InternVLA-A1.5 进一步改用向冻结的 WAN2.2-5B 视频模型查潜前瞻。
  • 动作推理MolmoAct(Ai2) 提出「动作推理模型」——动作 token 前先自回归吐深度 token 和视觉推理轨迹,仅约 26.3M 样本(比 π0 的 9.03 亿小一个数量级)超 GR00T N1/π0-FAST,且全开源。

支线六:中国开源与商业本体(RDT / Galaxea / WALL / AgiBot / 上海AI Lab)

  • RDT-1B(2024-10,清华 TSAIL):把扩散策略推到基座规模——1.2B 的 Diffusion Transformer(cross-attention),SigLIP+T5-XXL 冻结编码,三处机器人化改造(QKNorm+RMSNorm 稳训练、MLP decoder、交替注入图文的 ACI),128 维物理可解释统一动作空间 + 0/1 mask 让几乎所有带夹爪机器人异构共训。46 数据集/100 万+ 轨迹/21TB 预训练 + 6K 双臂微调,48×H100 训一个月。4090 上 6Hz 动作块 / 381Hz 动作,广谱任务成功率 +56%。
  • Galaxea G0(2025-09,星海图):双系统(PaliGemma flow-matching System 1 + Qwen2.5-VL 的 G0-VLM System 2),三阶段课程(跨本体预训练 → 单本体预训练 → 任务后训练)。用 500+ 小时单一本体开放世界数据集做了一个干净的对照实验,得出反直觉结论:当本体形态差距大时,跨本体预训练对底盘/躯干等本体特有动作的迁移可能不增反降,单本体高质量数据更关键。G0-VLM 规划器(微调过的 Qwen2.5-VL)四项任务全面超 Gemini-2.5-pro(最大差 >50pt)。
  • Galaxea G0.5(2026-06):把整族拉回纯自回归——单一 Qwen3.5-2B 解码器在同一 token 流、同一交叉熵目标下同时吐推理 token 和动作 token,靠可学习的跨本体 ActionCodec(RVQ + 结构化分组 + 时序对比) 压掉离散化的效率代价(27 维统一动作,14 本体)。原生 CoT(子任务/bbox/2D 轨迹/动作提示可推理期任意开关)。七个独立评测全面追平或超过 π0.5/GR00T-N1.7:LIBERO 98.9、RoboTwin 2.0 93.3、DROID 零样本 82.5、BEHAVIOR-1K 上单 checkpoint 训 1 epoch 即超 π0.5 训 4 epoch。三组证据(零样本语言遵循已超后训练 π0.5、算力对齐真机微调击败 π0.5/GR00T)共同论证「自回归路线的优势是结构性的」。
  • WALL-OSS(2025-09,自变量机器人):Qwen2.5-VL-3B + 紧耦合 MoE + 静态路由(按 token 类型路由到 Action FFN / VL FFN),两阶段(FAST 离散动作先验 Inspiration → flow-matching 精控 Integration)+ Unified Cross-Level CoT(指令→推理→子任务→动作统一进单一可微框架)。>10k 小时数据,embodied VQA 从基座 46% 提到 91.6%。后续 WALL-OSS-0.5 用「梯度桥接协同训练」(离散 token + 多模态 + 连续 flow 三目标)做成预训即可零样本部署的 4B 策略。
  • 上海AI Lab / AgiBot 线InternVLA-M1 用 230 万条空间定位数据做「空间引导」双系统;AgiBot World 提供百万级真机数据被 GR00T/InternVLA 等广泛混训;WholeBodyVLA(智元/港大) 用两个 VQ-VAE 潜动作模型(操作 + 行走)给 Prismatic-7B 做统一监督 + RL 下肢控制器,首次在 AgiBot X2 上单一端到端策略连续完成「走位—蹲下—抓取—转身—放置—推车」整机 loco-manipulation。
  • 美的/华东师大线TinyVLADiVLADexVLAChatVLAChatVLA-2)则专攻「小 VLM + 可插拔扩散专家」与「训练机器人后不失语」的知识保护问题。

支线七:规划-执行分层与具身大脑

早于「端到端 VLA」的一支,至今仍作为高层编排层与 VLA 互补:

  • SayCan(2022-04) 用 LLM 列候选技能、用 RL 价值函数(affordance)打「当前场景能不能做成」的分,两者相乘选下一步——Say×Can 范式的开山之作。Inner Monologue 给冻结 LLM 规划器接环境反馈闭环;Code-as-Policies 直接让 Codex 把指令写成 Python 策略代码;PIVOT 把 VLM 控制重写成「看图选号」的迭代视觉提示。这些是「LLM 规划 + 独立低层控制器」的松耦合路线,被后来的端到端 VLA(RT-2 起)与单模型分层(π0.5、Gemini 1.5 的 orchestrator)逐步收编。
  • 具身大脑 / 规划 VLMRoboBrainRoboBrain 2.0RoboBrain 2.5(BAAI) 走「统一具身 VLM」路线,专注规划、affordance、轨迹预测、3D 度量空间推理与时序价值估计,作为下游 RL 的奖励信号与高层大脑,而非直接输出连续动作。RoboBrain 2.5 还首次在千卡级国产加速器上完成端到端训练。

Head-to-head 对比表(一):主力成员架构与数字

(横向可滚动。参数量、频率、数据均取各页一手数字;”—” 为原文未披露。)

模型年份/机构VLM 主干动作头动作块/频率预训练数据关键 benchmark 数字
RT-22023 · Google DMPaLI-X 55B / PaLM-E 12B离散 256-bin token(AR)无 chunk / 1–3 HzWebLI ~1B + RT-1 机器人(50/66%)unseen 泛化 62%;涌现 60(RT-1 17)
Octo2024 · Berkeley 等无(浅 conv + t5-base 冻结)扩散 MLP 头(DDPM 20 步)chunk 4 / 5–15 HzOXE 800k 轨迹 / 1.2TB零样本 WidowX 0.50=RT-2-X;微调均 0.72
OpenVLA2024 · Stanford 等Prismatic 7B(DINOv2+SigLIP+Llama2)离散分位 256-bin(AR)无 chunk / 6 Hz(int4)OXE 970k 轨迹超 RT-2-X 16.5% abs(少 7× 参数)
RDT-1B2024 · 清华SigLIP+T5-XXL 冻结DiT 扩散 1.2B(x0-pred)chunk 64 / 6Hz块·381Hz46 集/1M+ 轨迹/21TB + 6K 双臂广谱 +56% vs 基线;ManiSkill 53.6%
GR-22024 · ByteDanceVQGAN+CLIP 文本cVAE 动作头(+视频预测)/ 200Hz WBC38M 视频/50B token + 机器人105 任务 97.7%;CALVIN 4.64
π02024 · Physical Intel.PaliGemma 3Bflow-matching expert 300Mchunk 50 / 50 Hz~1 万小时(903M ts)+9.1% 开源out-of-box 全面领先(OpenVLA≈0)
GR00T N12025 · NVIDIAEagle-2(SmolLM2-1.7B+SigLIP2)1.34BDiT flow-matching(K=4)chunk 16 / S1 120Hz·S2 10Hz数据金字塔(真机+视频+仿真+神经)真机 GR-1 全量 76.8%;50k H100-h
Gemini Robotics2025 · Google DMGemini 2.0连续(云端 backbone+机载 decoder)chunk / 50 Hz(≈250ms)数千小时 ALOHA 2 + 网页 co-train泛化 2×+ SOTA VLA;ERQA 400 题
OpenVLA-OFT2025 · StanfordOpenVLA 7B并行解码 + 连续 + L1 头chunk 8/25 / 25 Hz微调法(LIBERO/ALOHA/Bridge)LIBERO 97.1;吞吐 26–43×;超 π0
π0.52025 · Physical Intel.PaliGemma ~2BFAST 预训练 + flow expert 300Mchunk 50 / 50 Hz异构(本体移动操作仅 2.4%)新家整屋清洁;OOD 成功 94%
GR-32025 · ByteDanceQwen2.5-VL-3B(MoT)flow-matching DiT(5 步)chunk / —机器人 + 网页 VL + VR 人类轨迹table bussing IF 53.8→97.5 vs π0
SmolVLA2025 · HFSmolVLM2(0.45B 总)flow-matching expert 100M(CA/SA)chunk 50 / 30 FPS481 社区集/22.9k ep/10.6M frameLIBERO 87.3 追平 π0(86.0)
Galaxea G02025 · 星海图PaliGemma + Qwen2.5-VL(双系统)flow-matching expert(FAST 预训练)chunk / —500h 单本体 + 1000h OXE单本体 > 跨本体(形态差距大时)
WALL-OSS2025 · 自变量Qwen2.5-VL-3B(紧耦合 MoE)FAST 离散 → flow-matchingchunk / —>10k 小时 + VQAembodied VQA 46→91.6;长程超 π0
InternVLA-A12026 · 上海AI LabInternVL3/Qwen3-VL(MoT 三专家)flow-matching + 未来帧生成chunk / ~13 Hz533M 帧(InternData-A1+AgiBot)通用 75.1 vs π0 60.6;高动态 +70pt
π0.72026 · Physical Intel.Gemma3 4B + MEMflow-matching expert 860M(+世界模型)chunk 50 / 20–50 Hz多样(示范+自主+人类视频+web)零样本跨本体折衣 85.6%≈人类遥操作
Galaxea G0.52026 · 星海图Qwen3.5-2B(纯自回归统一)AR 离散(学习式 RVQ ActionCodec)chunk 16 / —14 本体 + 100M VQA(1:4)LIBERO 98.9;BEHAVIOR-1K 超 π0.5

Head-to-head 对比表(二):动作头设计演进(贯穿全族的主线)

动作头是整族最能看出「代际」的维度。可以整理成一条清晰的演进链:

动作表示代表工作优点致命短板 → 触发下一代
1自回归离散 token(均匀/分位 256-bin)RT-1·RT-2·OpenVLA·SpatialVLA复用 VLM 权重、极简、语言动作同池慢(1–6Hz)、不支持高频 chunk,OpenVLA 在灵巧任务≈0
2压缩离散 token(DCT+BPE / 学习式 RVQ)FAST·G0.5 ActionCodec·WALL-OSS Inspiration让 AR 上高频(压缩 1.75–13×)、保留纯 next-token 训练自回归解码仍慢(FAST 750ms/块)
3扩散动作头(readout 上小 MLP/DiT)Octo·RDT-1B·CogACT·Dita·DiVLA连续、多模态、精细;一次前向内多步去噪训练慢、推理多步去噪;与 VLM 耦合方式不一
4flow-matching 动作专家(独立权重,MoE 式交互)π0·π0.5·GR00T·GR-3·SmolVLA·G0高频(50Hz)、少步积分(4–10 步)、快推理随机初始化专家的梯度污染 VLM 知识、收敛慢
5并行解码 + 连续 + L1OpenVLA-OFT一次前向出整段 chunk,L1≈扩散但更快(26–43×)L1 趋向 median mode,真多模态分布可能吃亏
6知识隔离(离散+连续双通道 + stop-gradient)KI训快 + 跑快 + 泛化好三者兼得,保护语言跟随单步 +20% 成本;仍不完美
7双系统(S2 VLM latent → S1 快策略)Helix·GR00T·Gemini Robotics·Hume慢语义 + 快控制解耦、可独立迭代、机载可跑latent 瓶颈、两系统对齐/延迟工程复杂
8潜动作监督(无标签视频学码本,再解码真实动作)LAPA·UniVLA·villa-X·WholeBodyVLA摆脱动作标签依赖、跨本体/跨形态迁移潜动作到真实动作的映射需少量真机校准
9回归纯自回归统一(动作与推理同 token 流同目标)G0.5·WorldVLA·RynnVLA-002prompt 可直接驱动物理执行、CoT 与动作同流 attend需学习式分词压效率代价;长程记忆仍开放
+世界模型/未来帧条件(作为语义搬运工或辅助目标)GR-2·InternVLA-A1·π0.7 子目标·GR00T N1.5 FLARE注入动力学先验、打破数据偏置、复杂指称生成质量/推理成本瓶颈(14B 世界模型 1.25s/图)

读这张表的一句话:「离散→压缩离散→扩散→flow-matching 专家」是 2023–2025 的主干,而 2025–2026 出现两条分岔——一边 OFT/KI 在 flow-matching 专家路线上补速度与知识保护,另一边 G0.5 直接论证「学习式动作分词 + 纯自回归」可以既快又强,动摇「VLM 只能当 Encoder」的默认假设。


贯穿全族的共享设计模式

无论走哪条动作头路线,成熟 VLA 几乎都会命中以下模式:

  1. 动作分块(action chunking)几乎无一例外:源自 ACT,一次预测未来 H 步(H=8–64),把有效时域缩短、抑制复合误差。OFT 甚至证明 chunk 本身就涨 +14% 成功率。
  2. 跨本体统一动作空间 + padding + maskπ0 取最大 18 维、RDT 用 128 维物理可解释空间、G0.5 27 维、GR00T pad 到 32——不同形态机器人共享同一输出头,缺失维度填 noop/掩码。
  3. LLM 式 pre-training / post-training 两段式:大而杂的预训练给「通用性 + 纠错」,小而精的后训练给「流畅高质执行」。π0GR00TG0 都显式对齐这套。
  4. 数据金字塔 / 多源 co-training:真机遥操作 + 无动作人类视频 + 仿真 + 神经生成视频(GR00T);机器人轨迹 + 网页 VQA + VR 人类轨迹(GR-3);社区众包(SmolVLA)。网页/VQA co-training 被反复证明是防遗忘、保语言跟随、涨 OOD 泛化的关键。
  5. VLM 底座来自开源模型:PaliGemma(π 系/G0)、Qwen2.5-VL(GR-3/WALL-OSS/G0-VLM)、Prismatic(OpenVLA/UniVLA/WholeBodyVLA)、SmolVLM2(SmolVLA)、Eagle(GR00T)、Gemma3(π0.6/0.7)、Gemini(Gemini Robotics)。
  6. 消费级/机载 GPU 部署是硬指标:4090 上 6Hz(OpenVLA int4)、73ms(π0 板载)、~13Hz(InternVLA-A1);Helix/GR00T 直接上机载嵌入式 GPU(Jetson/A6000)。
  7. 「冻结 vs 微调」的反复权衡OpenVLA 发现微调视觉编码器至关重要(80% vs 46.7%);GR00T N1.5 反过来冻结语言塔保护语言能力(46.6→93.3);KI 用 stop-gradient 做「部分冻结」。
  8. 语言跟随(language following)是一等公民也是老大难GR-3 的 task-status 辅助监督、OFT 的 FiLM、π0.5 的离散 token 训练、G0.5 的 AR 同流——都是为了让模型真正「看指令」而非利用多视角虚假相关性。

走向何方

  • 从模仿走向从经验学习(RL)π*0.6 的 RECAP 首次系统证明 VLA 能从真实部署经验持续变强(吞吐翻倍、失败率减半);GR-3、RoboBrain 均把 RL/RLVR 列为下一步。自主经验正被视为「最终可能最大的数据源」。
  • Thinking / CoT VLA 成为共识Gemini 1.5 的多层级内心独白、MolmoAct 的显式推理轨迹、G0.5 的原生 CoT、WALL-OSS 的 Uni-CoT——「先想后动」带来可解释性、隐式子任务感知与自纠错。
  • 世界模型作为「语义搬运工」π0.7 用 BAGEL 生成子目标图像、InternVLA-A1/A1.5 预测未来潜变量、GR00T N1.5 的 FLARE——把 web 级图像/视频生成知识经「想象未来」注入策略。
  • 组合式泛化与跨本体零样本迁移π0.7 给出接近 LLM 的组合泛化证据(零样本跨本体折衣追平人类遥操作者);Motion Transfer、潜动作路线都在攻「只在 A 机器人见过的技能在 B 上零样本可用」。
  • 整机 loco-manipulation:从桌面操作扩到「走位—操作」交织的长程整机任务(π0.5 移动清洁、GR-3 移动本体、WholeBodyVLA 人形)。
  • 自回归的回归G0.5 用学习式动作分词论证纯自回归可以既快又强,为「VLM-as-Encoder + 独立动作专家」是否是终局打了一个问号——这可能是下一轮架构辩论的焦点。
  • 数据来源多元化:社区众包(SmolVLA)、VR 人类轨迹(GR-3,450 条/小时 vs 遥操作 250)、第一人称视频、神经生成视频——都在绕开「真机遥操作太贵」这道墙。

一句话收束整族:VLA 的历史,是动作表示不断向「更快、更连续、更能被 web 知识驱动」演进,同时**知识来源不断从「图文 VLM」扩展到「视频、潜动作、世界模型、自主经验」**的历史;RT-2 立的「动作即语言」之问,到 G0.5/π0.7 仍在被重新回答。


关联页面