一句话定位

Figure AI 2025-02 博客发布的通用人形 VLA:用「System 1 / System 2」双系统解耦——一个 7B 开源 VLM 以 7-9 Hz 慢速做场景/语言理解,一个 80M 视觉运动 transformer 以 200 Hz 快速做连续控制——首次让单套权重直接输出整个人形上半身(腕、躯干、头、手指共 35-DoF)的高频连续控制、双机零样本协作、并完全跑在机器人板载低功耗 GPU 上。

背景与定位

Helix 属于 Vision-Language-Action(VLA) 范式,但针对的痛点与此前主流 VLA 不同。上一代 VLA 有两条技术路线:一条是把动作离散化成 token、直接由 VLM 自回归吐出(rt-2openvla),另一条是 VLM/大模型条件下的连续动作策略(octopi0rdt-1b)。前者在低维动作空间(如二值化平行夹爪)上验证过,但博客明确指出「离散动作 token 化在高维人形控制上遇到扩展瓶颈」;后者速度/泛化难以兼得。

Helix 把这一矛盾归结为「VLM 通用但慢、视觉运动策略快但不通用」,并借用认知科学的 System 1 / System 2 双过程比喻(此前 palm-e 等把 VLM 直接当规划器,Helix 则显式把「慢思考的 VLM」和「快反应的策略」拆成两条以不同频率运行、端到端联训的通路)。定位上它瞄准「家庭」这一极端非结构化场景:博客用一张 scaling 曲线论证——传统启发式靠 PhD 手写脚本、传统模仿学习靠采集数据量堆技能,而 Helix 让「新技能可以在推理时用自然语言即时指定」,从而改变机器人技能获取的 scaling 轨迹。

注意:这是一篇纯博客披露,没有配套 arXiv 论文、没有开源代码/权重,多数结论以定性演示(视频)而非量化 benchmark 表格给出。

模型架构

双系统总体(EMB:policy backbone + VLM)

  • System 2(S2,慢系统 / 语义规划):板载、互联网预训练的 VLM,运行在 7-9 Hz。骨干是一个 7B 参数的开源、开放权重 VLM(博客未点名具体型号)。输入是单目机器人图像 + 机器人状态(状态由腕位姿 + 手指位置构成),投影进视觉-语言嵌入空间,再叠加自然语言指令;S2 把所有与任务相关的语义信息蒸馏进一个连续 latent 向量,交给 S1 做条件。
  • System 1(S1,快系统 / 视觉运动控制)80M 参数cross-attention encoder-decoder transformer,运行在 200 Hz。视觉侧用一个全卷积、多尺度视觉骨干,该骨干完全在仿真中预训练后初始化。S1 与 S2 吃相同的图像和状态输入,但以更高频率处理以实现更强闭环反应。S2 传来的 latent 向量被投影进 S1 的 token 空间,并沿序列维与 S1 视觉特征拼接,作为任务条件。

动作头 / ACTION-conditioning:Helix 不做动作 token 化,S1 直接回归连续控制量——涵盖期望腕位姿、手指屈曲与外展(flexion / abduction)控制、躯干与头部朝向目标。动作空间额外附加一个合成的「任务完成百分比」维度,让模型能自预测终止条件,便于把多个学到的行为串接成长程任务。

关键配置数字:S2 = 7B / 7-9 Hz;S1 = 80M / 200 Hz;动作空间 = 35-DoF @ 200 Hz(全上半身:腕、手指、躯干、头);单目相机;单套权重覆盖全部行为,无按任务微调、无分任务动作头。

数据

  • 规模:约 500 小时遥操作数据,总量。博客强调这只是「此前 VLA 数据集规模的 <5%」,且量级更接近现代单任务模仿学习数据集,而非大规模多任务 VLA 数据集。
  • 来源 / 构成:多机器人、多操作员采集的多样化遥操作行为(human teleoperation),全部真机(无 sim-to-real 动作数据;仿真只用于 S1 视觉骨干的预训练)。
  • 动作标注 / 语言配对:用一个自动标注 VLM 生成事后指令(hindsight instructions)——把机器人板载相机的分段视频片段喂给 VLM,提示词是「What instruction would you have given the robot to get the action seen in this video?」,据此反推出该片段对应的自然语言指令,形成「语言 - 动作」训练对。
  • 数据卫生:训练中处理过的所有物品都被排除在评测之外,以防污染(training/eval object 不重叠)。
  • 未披露:帧数 / episode 数 / 具体任务配比 / 机器人型号数量等更细的数据切分。

训练方法

  • 目标完全端到端,从原始像素 + 文本指令映射到连续动作,用标准回归损失(regression loss)监督(纯模仿学习,博客未提 RL)。
  • 单阶段、单套权重没有分任务适配、没有独立动作头、没有多阶段/多具身分开采集的流程;保持单一训练阶段、单一权重。
  • S2↔S1 联合优化:梯度从 S1 反传到 S2,经由条件化 S1 行为的那个 latent 通信向量,实现两部分的联合优化(S2 并非冻结)。
  • 训练-部署对齐(关键工程):训练时在 S1 与 S2 的输入之间人为加入一个时间偏移(temporal offset),该偏移被标定为等于部署时 S1、S2 推理延迟之间的实际差距——从而让训练如实反映实时控制约束,最小化 train-inference 分布差。
  • 未披露:优化器 / 学习率 / 训练步数 / batch size / 训练所用 GPU 与时长等超参。

Infra(训练 / 推理工程)

训练:博客未披露训练用 GPU 数量、GPU-hours、并行策略、精度等——未披露

推理 / 部署(披露较细)

  • 硬件:每台 Figure 机器人配两块低功耗嵌入式 GPU(dual low-power-consumption embedded GPUs);具体型号 未披露。Helix 是首个完全跑在板载嵌入式低功耗 GPU 上的 VLA,博客称其「immediately ready for commercial deployment」。
  • 模型并行 / 流水线:推理管线按 S2(高层 latent 规划)/ S1(低层控制)拆到各自专用 GPU
  • 异步流式推理:S2 作为异步后台进程,消费最新观测(板载相机 + 机器人状态)与自然语言指令,持续更新一个共享内存的 latent 向量(编码高层行为意图);S1 作为独立实时进程维持关键的 200 Hz 控制回路,每步取最新观测 + 最近一次 S2 latent。两者速度差天然让 S1 对观测有更高时间分辨率,形成更紧的反应式反馈回路。
  • 这套异步 + 时间偏移的部署方式刻意镜像训练时引入的 temporal offset,缩小训练/部署分布 gap,使 Helix 能跑到「与最快单任务模仿学习策略同速」。
  • 控制频率:S2 = 7-9 Hz;S1 / 全身控制 = 200 Hz

评测 benchmark

博客以定性演示为主,没有给出量化 benchmark 表格 / 数值成功率 / 命名基线对比。披露的结果性主张:

  • 全上半身控制:35-DoF @ 200 Hz 协调手指、末端轨迹、头部注视与躯干姿态;头/躯干运动会同时改变可达范围与视野(历史上易致不稳定),Helix 声称首次在如此高维动作空间上做到实时协调且仍能跨任务/物体泛化。
  • 零样本双机协作:两台 Figure 机器人用同一套 Helix 权重、无机器人专属训练、无显式角色分配,仅靠自然语言提示完成协作式收纳杂货(handover + 放入抽屉),且处理的是训练中从未见过的新物品。博客称这是首个用 VLA 实现的多机器人柔性长程协作演示。
  • 「Pick up anything」涌现能力:对「Pick up the [X]」指令,系统化测试中成功抓取数千件杂乱场景中的新物品(玻璃器皿、玩具、工具、衣物等),无需先验演示或定制编程;并能把抽象概念落到动作(如「Pick up the desert item」→ 识别玩具仙人掌、选最近的手、执行抓取)。

未披露:任何数值成功率、与 pi0 / openvla / rt-2 等的可比量化对照、评测集规模的精确数字(仅「thousands of novel items」)。

创新点与影响

贡献

  1. 首个直接从自然语言控制整个人形上半身的 VLA(35-DoF,含腕/躯干/头/手指),并以 200 Hz 高频连续输出。
  2. System 1 / System 2 解耦架构:慢 VLM(7-9 Hz 语义)+ 快视觉运动策略(200 Hz 控制),端到端联训、经单个 latent 向量通信,兼顾 VLM 的泛化与实时策略的速度;separation of concerns 让两系统可独立迭代。
  3. 抛弃动作 token 化、直接回归连续高维动作,规避了离散化方案在高维人形控制上的扩展瓶颈。
  4. 数据高效:仅约 500 小时(<5% of 以往 VLA 数据集)就实现强物体泛化,量级接近单任务模仿学习。
  5. 首个完全板载嵌入式低功耗 GPU 运行的 VLA,加上双机同权重协作,指向商用可部署性。

改变了什么:把「VLM 的常识/语义即时迁移为机器人动作」这件事在人形全上半身尺度上跑通,并给出「用语言即时指定新技能」的 scaling 叙事,成为 2025 年创业实验室 embodied VLA(对比学术界 pi0openvla)的代表性系统之一。

博客自陈的局限 / 展望:这只是「早期结果」,「只触及可能性的皮毛」;作者明确表示期待把 Helix scale 1,000x 及以上。博客未提供失败案例分析、量化误差、安全边界或长期可靠性数据;无论文、无代码、无权重、无量化评测,复现与外部验证受限。

原始链接

一手源存档(sources/)

  • figure-helix—blog — 官方博客全文快照(sources/embodied/2025/figure-helix—blog.md)