一句话定位

Hume 是一个双系统 VLA:System 2(π0 式 flow-matching VLA 骨干)先”不完全去噪”地采样 N=5 个带不同噪声水平的候选动作块,再用一个训练自离线 RL(Cal-QL)的 value-query 头做 Best-of-N 打分选出最优候选,交给 System 1(DINOv2-small + 轻量 Transformer)接力去噪成最终动作,以此把”深思”(System 2, 4Hz)和”快反应”(System 1, 6Hz→控制频率 90Hz)解耦异步运行,在 LIBERO/SimplerEnv 与 21 项真实机器人任务上取得当时 SOTA,并展示了失败后靠 value 重新选样”自我纠错”的能力。

背景与定位

范式:这是把 LLM 领域”System-2 慢思考”(Chain-of-Thought、Best-of-N、树搜索)引入 VLA 的一次具体尝试,但论文明确指出机器人动作缺乏 LLM 文本那样清晰一致的语义,难以直接套用语言式 CoT(dexvla 用的”子步骤语言推理”是另一条路),因此 Hume 选择不生成语言推理,而是让模型对”多个尚未完全去噪的候选动作”做价值打分再择优,把”思考”转化成动作空间里的 Best-of-N 采样。

对比脉络:单系统 VLA 一脉是 rt-2(PaLI-X + 离散动作 token)、openvla(Prismatic VLM + OXE)、π0(PaliGemma + flow matching 连续动作)、robovlmcogactocto 等;双系统一脉包括 HiRT(低频 VLM + 高频视觉控制)、dexvla(扩散动作专家 + 具身课程学习)、[groot-n1|GR00T N1]、Figure 的 Helix(VLM System2 + 小网络 System1,但 System2 不做有效”思考”)。论文认为已有双系统工作的 System2 只是”降频跑一遍 VLM”,并未真正执行有意义的推理去指导 System1,Hume 的差异化贡献就是把 System2 变成”会打分择优”的 value-guided thinking。

Hume 的 System2 权重直接从 π0 导出(GitHub 明确标注”pretrained weights exported from pi0”),即架构上是 PaliGemma 骨干 + flow-matching 动作头,Hume 在此基础上外挂 value-query 头,并另建一个独立的 System1 网络做级联去噪。

模型架构

System 2(慢思考,4Hz):基于预训练 VLM(权重导出自 π0,即 PaliGemma 骨干)+ 两个额外头:

  • 动作去噪头(ACTION 头 = flow matching,连续动作):Transformer,建模 p(A_t|o_t),用前向欧拉法从随机噪声 A_t⁰~N(0,I) 迭代去噪,训练时 10 步去噪(δ=0.1)。推理时,通过对同一路观测积分 ODE 到不同终点 τ=1-(n-1)ξ(ξ 控制候选间噪声间隔),一次生成 N=5 个”不完全去噪”的候选动作块——大多数候选并未积分到 τ=1,这一”故意留噪声”的设计是级联去噪的前提。
  • value-query 头:在 VLM 输入序列末尾追加一个可学习的 query token q_t(与语言 token 同维度),该 token 通过注意力聚合 RGB 观测 i_t、语言指令 ℓ_t、机器人状态 s_t 与候选动作块 A_t 的信息,输出状态-动作价值 Q_θ(q_t, A_t)。头内部由两个 critic 网络 + 一个辅助训练的 actor 网络组成(Cal-QL 惯用的 actor-critic 结构)。

Best-of-N 价值引导思考:N 个候选各自过 value-query 头打分,选 arg max Q 的候选 A_t^{τ*} 传给 System1。

System 1(快反应,6Hz):DINOv2-small 视觉编码器 + 轻量 Transformer,不是从头去噪,而是把 System2 传来的、尚未完全去噪的候选 A_t^{τ*} 沿同一条 flow-matching ODE 继续积分到 τ=1(级联去噪,Cascaded Denoising,概念借自图像超分的 cascaded diffusion),同样 10 步(δ=0.1)、同一 flow matching 损失函数,但输入换成 System1 自己更高频的最新观测 õ,从而让最终动作对新观测保持响应性。

异步部署机制(以论文 Sec 3.3 描述的实例,horizon 配置与 AgiBot G-1 训练配置一致):System2 以 4Hz 生成 N=5 个 horizon H=30 的候选,选中的 A_t^{τ*} 存入共享队列;System1 以 6Hz 从队列取出前 h=15 步的子块 õ_t^{τ*},继续去噪并立刻在真实机器人上执行全部 h=15 步动作,K=H/h=2 个子块执行完后 System1 再取新一轮候选——由于 System2 更慢,能在 System1 消耗完当前候选前就绪下一个,故整体控制频率达到 6Hz×15=90Hz。不同任务/平台的 chunk 尺寸配置见下方”训练方法”表,H=30/h=15 只是 Sec 3.3 举例用的其中一组配置(与 AgiBot G-1 训练超参一致)。

参数规模(来自 HF Model Zoo 页面,而非论文正文):System2-only 预训练权重(Hume-vla/Hume-System2)标注为 3B;含 System2+value-query头+System1 的完整任务检查点(如 Hume-vla/Libero-Object-1)标注为 4B——即 value-query 头 + System1(DINOv2-small + 轻量 Transformer)合计约 1B 参数,论文正文未单独给出这一拆分数字。

输入观测:LIBERO/Franka 用第三人称相机+腕部相机+机器人状态;SimplerEnv/WidowX 只用第三人称相机+状态;AgiBot G-1 用头部相机+双臂腕部相机+状态。GitHub README 推理示例中图像张量形状为 (B,224,224,3),即 224×224(此为代码示例分辨率,论文正文未专门写训练分辨率数字)。

数据

Hume 本身不发布新的大规模预训练数据集,而是复用标准基准数据 + 自采真实机器人示教:

  • 仿真/基准训练数据(通过 lerobot 格式,来自 IPEC-COMMUNITY 的 OXE 转换版):LIBERO-Spatial/Object/Goal/Long(即 LIBERO-10,共 4 个子集,libero_*_no_noops_lerobot)、Bridge(bridge_orig_lerobot,对应 WidowX)、Fractal(fractal20220817_data_lerobot,对应 Google Robot/SimplerEnv)。
  • 真实机器人示教(自采,遥操作):
    • WidowX 250s:6 类任务(put eggplant in basket、put carrot on plate、close microwave、lift red pepper、put green cup on pink cloth、put purple cup on white plate),具体演示条数论文未披露。
    • Franka-Emika-Panda:5 类任务,部分给出演示条数——Kitchen Banana(香蕉入篮)50 条、Kitchen Pot(碗放置)100 条、Tea(推茶壶把手)50 条、Three Cube(三色方块分拣)每色 50 条共 150 条;Plush Toy(毛绒玩具识别摆放)条数未披露。
    • AgiBot G-1(人形双臂):4 类长时程任务(Restock 补货、Pour Water 倒水、Fold Shorts 叠短裤、Pass the Water 递水瓶),演示条数未披露。
  • 总计覆盖 3 个仿真环境 + 3 个真实机器人平台,15 个机器人学习场景、21 项真实世界操作任务
  • value-query 头训练数据:由预训练用的示教数据重新打奖励标签构成离线数据集 𝒟={(q_t, A_t, r, q_t’)},奖励函数沿用 Kumar 等”Pre-training for robots”(PTR)的稀疏奖励设计——每条 episode 最后 3 个 transition 记 +1,其余记 0。未使用数据增强,未提及 sim-to-real 迁移或额外仿真数据生成。

训练方法

两阶段训练:

  1. Stage 1:仅训练 VLM 骨干 + System2 动作去噪头,用 flow matching 损失(公式同标准 flow-matching VLA),确保 System2 能给出可靠动作。
  2. Stage 2:冻结 Stage 1 训练好的 VLM 骨干与 System2 动作去噪头;从零训练 System1 + value-query 头。System1 用与 System2 相同形式的 flow matching 损失(但基于 System2 传来的、未完全去噪的候选继续积分)。value-query 头用离线 RL 训练,目标是最小化 Bellman 误差 + 校准保守正则项(Cal-QL,Nakamoto et al. 2023),正则项 ℛ(θ) 通过对分布外动作的 Q 值做惩罚、并用训练集内动作的 Q 值做补偿来防止价值高估。

关键超参(Sec 8.2,按平台):

平台输入System2 chunkSystem1 chunkGPU 数batch size
LIBERO三人称+腕部相机+状态168816
SimplerEnv-Bridge(WidowX 仿真)三人称相机+状态84832
SimplerEnv-Google Robot三人称相机+状态42832
Franka(真实)三人称相机+状态168432
WidowX 250s(真实)三人称相机+状态84832
AgiBot G-1(真实)头部+双腕相机+状态301588

未披露:优化器、学习率、总训练步数/epoch 数、GPU 具体型号(H100/A100 等未提及)、总 GPU-hours。

Infra(训练 / 推理工程)

  • 训练:按平台用 48 张 GPU(具体型号未披露),batch size 832(见上表)。总 GPU-hours 未披露。
  • 推理(部署时的异步双系统频率):System2 值引导思考频率 4Hz(每次生成 N=5 个候选并打分选优);System1 去噪+执行频率 6Hz,每次执行 h 步动作(h 因平台而异,如 AgiBot G-1 的 h=15),整体机器人动作控制频率可达 90Hz(以 h=15 的配置计算,6Hz×15)。端到端延迟(ms)、显存占用、量化/压缩细节均未披露。
  • 硬件平台:WidowX 250s、Franka-Emika-Panda、AgiBot G-1(人形双臂)三种真实机器人,具体机载算力/边缘设备型号未披露。

评测 benchmark

论文摘要/引言给出的三项 headline 汇总声明(原文原句):相对 π0,在 LIBERO 基准上成功率 +4.4%,在 SimplerEnv(“Simpler benchmark”)上 +25.9%,在真实世界部署上 +12.9%(此为论文对多任务/多平台结果的整体汇总表述,与下方分基准/分平台明细表格对应但不逐一相等,因不同小节的平均口径不同)。

LIBERO(Table 1,4 个子集,10 次试验均值,原文表格数字):

模型SpatialObjectGoalLongAverage
Diffusion Policy78.5%87.5%73.5%64.8%76.1%
OpenVLA-OFT97.6%98.4%97.9%94.5%97.1%
π096.8%98.8%95.8%85.2%94.2%
π0-FAST96.4%96.8%88.6%60.2%85.5%
GR00T N194.4%97.6%93.0%90.6%93.9%
Hume98.6%99.8%99.4%96.7%98.6%

Hume 在 LIBERO-Long(长时程)上比 π0 高 +11.5%、比 GR00T 高 +6.1%;全部四个子集排名第一。

SimplerEnv-WidowX(4 项任务,Grasp/Success 两列,原文表格数字):Hume 整体平均 72.6%,对比 π0 40.1%(Hume 高 +32.5%,与表格数字一致)、OpenVLA 7.8%(Hume 高 +64.8%,与表格数字一致)、π0-FAST 48.3%、SpatialVLA 42.7%(均为原文表格中的行)。正文另称”+39.6% over GR00T”,但 GR00T 并未出现在 WidowX 结果表格中(该表格只列 RT-1-X/Octo/OpenVLA/RoboVLM/SpatialVLA/π0/π0-FAST/Hume),故 GR00T 在 WidowX 上的具体数值未披露,此处如实标注文字声明与表格覆盖范围的不一致。

SimplerEnv-Google Robot(Table 2,原文表格数字):

模型Visual Matching 均值Variant Aggregation 均值
SpatialVLA73.8%70.7%
π058.8%54.8%
π0-FAST61.9%59.0%
Hume78.7%74.1%

正文另给出 Google Robot 任务的 VM/VA 综合均值:Hume 76.4%,比 π0(综合均值 56.8%)高 +19.6%(76.4% = (78.7%+74.1%)/2,56.8% = (58.8%+54.8%)/2,与表格数字一致)。

真实世界评测:

  • WidowX 250s(7 项任务,含未见环境/光照/物体变体):Hume 平均成功率 91%,比 π0 高 +12%,比 OpenVLA 高 +33%
  • Franka(5 项任务,含长时程/形变物体/工具使用):Hume 平均 87%,比 π0 高 +14.75%,比 OpenVLA 高 +37.25%
  • AgiBot G-1(人形,长时程双臂任务):Fold Shorts(叠短裤)Hume 88%(+15% over π0);Pour Water(倒水)Hume 82%(+20% over π0,+60% over GR00T)。

消融(Table 3,#1 完整 Hume 为基准,给出 LIBERO/SimplerEnv-WidowX/SimplerEnv-Google 三处均值):

变体LIBERO 均值WidowX 均值Google VM/VA 均值
[1] 完整 Hume98.6%72.6%78.7% / 74.1%
[2] 去掉级联去噪(w/o Cascaded Denoising)95.9%68.7%76.1% / 71.6%
[3] 去掉重复采样(w/o Repeat Sampling,只生成 1 个候选)93.8%65.6%73.0% / 68.7%
[4] 去掉 System1(直接用 System2 最高价值候选)89.8%61.6%70.2% / 65.5%
[5] 去掉 value-query 头(随机选 1 个候选)84.9%56.3%67.5% / 60.5%

原文给出的跨环境平均降幅:去掉级联去噪 → SimplerEnv variant aggregation 均降 -3.2%、LIBERO -2.7%、真实世界 -19%;去掉重复采样 → SimplerEnv -6.2%、LIBERO -4.8%、真实世界 -37%;去掉 System1 → SimplerEnv -9.8%、LIBERO -8.8%、真实世界 -63%;去掉 value-query 头 → SimplerEnv -14.95%、LIBERO -13.7%、真实世界 -78%(降幅最陡,证明 value-guided thinking 是复杂真实任务成败的关键)。

失败恢复能力(定性,Fig. 12 + 项目主页视频):当 π0、GR00T 陷入错误状态(如抓取位置偏差)后往往无法恢复,因为错误状态观测未出现在训练数据中;Hume 由于 System2 会重复采样”未完全去噪”的候选动作(其中包含能从错误状态恢复的轨迹),再由 value-query 头选出正确候选引导恢复,从而能在多次尝试后完成任务。

创新点与影响

  • 把”思考”重新定义为动作空间里的 Best-of-N 价值择优,绕开了机器人动作缺乏清晰语言语义、难以套用 LLM 式 CoT 的问题;value-query 头训练用离线 RL(Cal-QL)而非模仿学习,让 System2 的”择优”标准直接来自任务奖励而非仅仅拟合专家动作分布。
  • 级联去噪(Cascaded Denoising)首次被用于耦合双系统 VLA 的慢/快回路:让”故意未去噪完的候选”成为连接 System2(择优)与 System1(精修)的桥梁,而不是像此前双系统工作那样用隐向量或语言指令做桥接。
  • 异步频率解耦:System2 4Hz 深思 + System1 6Hz(执行动作块后等效 90Hz)快反应,在 LIBERO/SimplerEnv/21 项真实任务上全面超过 π0、GR00T N1、OpenVLA-OFT 等同期基线,尤其在长时程与失败恢复场景优势最大。
  • 作者自陈局限(Conclusion 节):(1)value-guided thinking 效果受限于采样候选的质量,如何让采样过程本身产生更多高价值候选仍待研究;(2)估计出的状态-动作价值与语义没有很好对齐,价值学习本身仍有改进空间;(3)Hume 当前的 System-2 思考范式仍相对朴素(仅 Best-of-N),未来可探索树搜索、自我纠错、强化学习等更复杂的范式。

原始链接

一手源存档(sources/)