一句话定位
Physical Intelligence 提出的动作分词器 FAST:把动作块先做离散余弦变换(DCT)压缩到频域,再用字节对编码(BPE)打包成稠密 token,使自回归 VLA 第一次能在高频灵巧任务上训练成功;配合 pi0 主干得到 π0-FAST,性能追平扩散式 π0,训练最多快 5 倍。
背景与定位
自回归 VLA(RT-2、openvla 一脉)把连续动作离散化后当文本 token 做 next-token 预测,最常见做法是逐维、逐时间步的均匀分箱(bin,通常 N=256)。论文指出这套方案在高频(如 50Hz 双臂折衣)数据上会彻底失效:分箱后相邻时间步的 token 高度相关,自回归目标的边际信息量趋近于零,模型退化为直接复制上一个动作——这正是 OpenVLA 在低频 BridgeV2/RT-1 上可行、却拟合不了高频 DROID 数据集的原因。作者先用一个合成插值任务(三次样条拟合)复现了这一现象:采样频率越高,朴素分箱训练出的模型预测误差越大,直至完全退化;而基于 DCT 的分词在所有采样率下都保持稳定低误差。
这与扩散/流匹配式 VLA(如 pi0 本身的 flow-matching 头)形成对照:扩散路线绕开了离散化问题但训练慢、需要额外的 action-expert 网络;FAST 的思路是保留纯自回归 next-token-prediction 训练范式(不改模型结构、可套用任何预训练自回归 transformer),只是换一种更懂”压缩”的分词方式,参考语言模型的 BPE 和 JPEG/MP3 的频域压缩传统。
模型架构
FAST 本身不是一个神经网络策略,而是一个确定性、可逆的分词算法(仅一个可学习组件——BPE 词表),接在任意自回归 VLA 骨干之前:
分词流程(算法细节):
- 量化归一化:对每个动作维度,用训练集中该维度值的 1st/99th 分位数把值域映射到 [-1, 1](分位数而非 min-max,以抗异常动作)。
- DCT 变换:对归一化后的动作序列,逐维单独做离散余弦变换,把时域信号转成频域系数矩阵。
- 量化:对 DCT 系数做
round(γ · C)的缩放取整(γ 为超参,单一数据集分词器默认 γ=10),得到稀疏系数矩阵(多数项为零)。 - 展平:将 |动作维度| × H 的稀疏矩阵按列优先(低频分量在前、跨维度交织)展平成一维整数序列——作者验证列优先(先预测刻画整体形状的低频分量)比行优先(先出完一个维度的全部频率分量)训练出的策略 rollout 更稳定。
- BPE 压缩:对展平序列训练字节对编码,把大量重复的零值和常见系数组合合并成稠密 token,默认词表大小 1024。
FAST 的唯一两个超参(DCT 量化尺度、BPE 词表大小)在作者报告中都不敏感,全部单数据集实验共用同一组取值。
FAST+(通用分词器): 在约 100 万条跨本体真机 1 秒动作块上训练的黑盒 BPE 词表,可直接 AutoProcessor.from_pretrained("physical-intelligence/fast") 调用,3 行代码完成 tokenize/decode,也提供 .fit() 接口在新数据集上现训(通常几分钟)。
接入 VLA 骨干时的 action 头: 论文在两个预训练自回归 VLA 骨干上验证 FAST 与骨干无关——
- π0-FAST:以 pi0 的 PaliGemma-3B 骨干为基础,但去掉扩散 π0 用于动作解码的 300M 参数 action-expert,直接复用 PaliGemma 内部完整的 2B 参数语言模型做自回归动作 token 解码;把最不常用的 VLM 词表位置覆写为 FAST 的动作 token,与 RT-2/OpenVLA 一致的做法。
- OpenVLA + FAST(消融):骨干换成 Prismatic-7B(OpenVLA 原骨干),同样只替换分词器。
策略输入: 2–3 张 224×224 图像(一路第三人称 + 每机械臂一路手腕相机),经骨干自带的预训练视觉编码器分别编码后拼接;自然语言指令与本体感知状态(proprioceptive state)都作为字符串走 VLM 自身的文本分词器——本体状态额外做 256-bin 的分箱预处理(因为它是策略输入而非需要精细还原的输出)。
数据
- FAST+ 通用分词器训练集:约 100 万条 1 秒动作块,覆盖单臂/双臂/移动机器人,关节空间(joint)、末端执行器世界系(EE world frame)、末端执行器相机系(EE camera frame)三种动作空间参数化,动作统一 pad 到 32 维。数据混合以 π0 pi0 训练集为主体,附录给出完整 30 行配比表,主要平台与权重(节选):ARX 双臂关节 7.2%、UR5 单臂关节 10.3%、Franka FR3 单臂关节 3.7%、ALOHA 双臂关节 5.0%、DROID 单臂关节(15Hz)11.2%、Bridge V2 单臂 EE(5Hz)5.0%、Open X-Embodiment 混合动作空间 3.8%,其余为 AgileX/Fibocom/Mobile Trossen/Trossen Biarm/ARX slate mobile 等平台的 joint/EE/CamFrame 三种变体(各 0.9%–5.2% 不等)。Open X-Embodiment、DROID、Bridge V2 保留原始形式未做额外变换。
- 单数据集分词器/策略训练集(Table I,均取 1 秒动作块):BridgeV2(7 维,5Hz)、DROID(7 维,15Hz)、Table Bussing(7 维,20Hz)、T-Shirt Folding(14 维即双臂各 7 维,50Hz)。
- DROID 策略训练:只用标记为 “success” 的 75k episodes(21M 步),过滤全零动作的静止时间步(遥操作者重置 VR 手柄时产生),其余不做额外清洗;训练 3 个 epoch(240k 迭代 @ batch size 256)。
- 通用 π0-FAST 生成式策略训练集:沿用 π0(Black et al. 2024)的跨本体混合,含 PI 自有机器人数据 903M 时间步,另有约 9.1% 的训练混合来自开源数据集 Bridge V2、DROID、OXE——论文称之为”迄今最大的灵巧机器人操作数据集”。
- FAST+ 泛化性测试集(Table III,均为分词器训练时未见过的数据集,共 13 个,跨单臂/灵巧手/人形/导航形态):SOAR(WidowX EE)、DROID-Eval EE/Joint(Franka)、SERL(Franka EE)、π Table Bussing(UR5 joint)、NYU DexHand/Berkeley DexHand/Berkeley DexArm(ALLEGRO 灵巧手)、HATO(UR5+Psyonic 灵巧手)、UMI/UMI on Legs(EE)、HumanPlus(Unitree H1 joint)、UCSD TeleVision(Unitree H1+ 颈部)、Waymo(自动驾驶 2D delta)。
训练方法
- 目标函数:标准 next-token 交叉熵,把动作 token 当文本 token 训练,不改预训练骨干结构,权重不冻结、全量微调。
- 优化器:AdamW(β1=0.9,β2=0.95,无 weight decay),学习率 1k 步线性 warmup 后恒定 5e-5,梯度裁剪到 1,权重 EMA(衰减 0.999)。
- 推理解码:默认贪心自回归解码;双臂任务(T-shirt folding、toaster、laundry folding)用温度 β=0.7 采样——因为部分训练数据里机器人在 episode 开头有一段静止不动的动作块,贪心解码容易卡在起始姿态出不来。
- DROID 具体动作空间:关节速度 + 末端夹爪绝对位置,15 步动作块,推理时按 8 或 15 步开环执行;不使用相机标定信息(因此新视角零样本可用)。
- 对照的其它分词方案:①朴素分箱(RT-2/RT-2-X/OpenVLA 一脉,逐时间步 256-bin);②FSQ(Finite Scalar Quantization,VQ-VAE 的简化替代,作为”学习式压缩”消融——需要额外训练一个量化网络,而 FAST 全程无需训练神经网络)。
Infra(训练 / 推理工程)
- DROID 单任务训练:240k 迭代、batch size 256、3 个 epoch,在 8×H100 上约 4 天(3B 参数量级的 VLA)。
- 通用 π0-FAST 生成式策略训练:相比同数据混合上的扩散 π0,收敛所需 GPU-hours 减少约 5 倍;在 Table Bussing 单任务上,达到同等表现所需训练步数减少约 3 倍。
- 推理延迟(NVIDIA 4090 GPU,单次 1 秒动作块):扩散 π0 约 100ms(10 步扩散 + 300M 参数 action-expert);π0-FAST 约 750ms(需自回归解码 30–60 个动作 token,且用完整 2B 参数语言模型主干而非小 action-expert)——论文明确把推理速度列为当前自回归 VLA 的短板,静态操作任务上可接受但拖慢了评测效率。
- 训练框架/并行度、精度(bf16/fp32 等)、具体训练卡型号(H100/A100/TPU)之外的细节论文正文未披露;开源仓库
openpi的自述文件给出的是复现所需的最低显存(推理 >8GB、LoRA 微调 >22.5GB、全量微调 >70GB),不代表本文原始训练配置。
评测 benchmark
论文的量化结果以柱状图 + 95% 置信区间形式呈现(Figure 6/9/11/15),正文未给出可直接摘录的数值表,以下为正文明确陈述的定性/半定量结论,并列出 Table I 的分词压缩率(可精确摘录):
分词压缩率(Table I,1 秒动作块,朴素分箱 vs. FAST,相近重建精度下):
| 数据集 | 动作维度 | 控制频率 | 朴素分箱 token 数 | FAST token 数 | 压缩比 |
|---|---|---|---|---|---|
| BridgeV2 | 7 | 5 Hz | 35 | 20 | 1.75× |
| DROID | 7 | 15 Hz | 105 | 29 | 3.6× |
| Table Bussing | 7 | 20 Hz | 140 | 28 | 5.0× |
| T-Shirt Folding | 14(双臂) | 50 Hz | 700 | 53 | 13.2× |
FAST 在各频率下都稳定收敛到约每臂 30 个 token/块(双臂约 60),说明它逼近的是动作信号本身的复杂度而非采样频率。
策略训练效果(定性,Figure 6/9):
- 朴素分箱在高频任务(Table Bussing 20Hz、T-Shirt Folding 50Hz)上完全学不出有效策略;FAST 与 FSQ(学习式压缩基线)都能训出有效策略,FAST 总体不弱于甚至优于 FSQ,在灵巧高频任务上优势更明显。
- FAST+ 通用分词器在所有测试任务上都逼近针对该数据集专门训练的 FAST 分词器,可作为强默认选择。
- 在小数据集(Libero、T-Shirt Folding,<50 小时数据)上,π0-FAST 与扩散 π0 表现相当;在大数据集(Table Bussing)上 π0-FAST 收敛快约 3 倍;在 DROID 上,π0-FAST 比扩散 π0 更好地遵循语言指令(扩散 π0 常常忽略指令)。
- OpenVLA 消融:把 OpenVLA 原生分箱换成 FAST+ 后,在高频 T-shirt folding 数据上训练效果显著提升,证明 FAST 与骨干无关。
- BPE 步骤消融:去掉 BPE(只保留 DCT + 量化)仍优于朴素分箱,但明显弱于完整 FAST——原因是大量重复的零 token 稀释了学习信号,还拖慢自回归推理(需要逐 token 解码数百个大多是零的 token)。
DROID 零样本泛化评测:设计 16 类任务、共 44 次试验的评测集(见文中 Table II,如”把勺子放进沥水架""擦桌子""关抽屉”等,按任务进度打分,如”抓对物体得 1 分、放对位置再得 1 分”),在完全未参与训练/co-training 的新场景(新桌面、新背景、新物体、新视角、新桌高)零样本测试。作者同时把同一 checkpoint 送到 UC Berkeley、Stanford、University of Washington 三所高校做定性测试(未报告成功率数字,仅提供成功/失败视频)。论文强调这是 DROID 数据集(含原始 DROID 论文与 OpenVLA)第一次被用于训练出可零样本语言泛化的策略——此前的工作都只做协同训练或微调评测。
计算匹配对照:附录 Figure 15 给出与扩散 π0 训练计算量对齐(compute-matched)后的对比,结论不变——π0-FAST 因收敛更快而全面优于计算匹配的扩散 π0。
创新点与影响
- 首次让自回归 VLA 训成高频灵巧任务:此前 RT-2/OpenVLA 式的逐时间步分箱在 20Hz+、双臂等高频数据上完全失效,FAST 是第一个让纯 next-token-prediction 训练路线在这些任务上奏效的方案,且不需要修改预训练 transformer 结构。
- 首个 DROID 零样本泛化生成式策略:此前所有基于 DROID 的工作(含原始 DROID 论文、OpenVLA)都止步于协同训练/微调评测,FAST 使得仅靠自然语言 prompt 就能在全新场景零样本执行成为可能。
- 训练效率:π0-FAST 与扩散 π0 性能相当,但 GPU-hours 减少约 5 倍,对”动辄数千 GPU-hours”的 VLA 训练而言是量级级别的成本下降。
- 通用即插即用分词器 FAST+:开源为 HuggingFace
AutoProcessor,3 行代码 tokenize/encode,对未见过的机器人形态(灵巧手、人形、移动平台、自动驾驶)压缩率同样有效,后续被openpi仓库用于发布 π0-FAST-base、π0-FAST-DROID 等 checkpoint。 - 论文自陈局限:①推理速度是主要短板——自回归解码(750ms/块)远慢于扩散解码(100ms/块),原因是需要 30–60 步自回归解码且复用完整 2B 语言模型而非小 action-expert,论文明确把加速自回归 VLA 推理(投机解码、量化、定制 kernel 等 LLM 界常用技术)留给未来工作;②FAST+ 在灵巧手/人形/移动机器人上只验证了离线压缩率,尚未做真实策略训练/部署评测;③自回归 vs. 扩散两条 VLA 路线孰优孰劣尚无定论,论文只是提供了训练速度/语言遵循能力上的初步权衡证据。
原始链接
- arXiv: https://arxiv.org/abs/2501.09747
- PDF: https://arxiv.org/pdf/2501.09747
- 官方博客/项目页: https://www.physicalintelligence.company/research/fast
- HuggingFace(FAST+ 分词器): https://huggingface.co/physical-intelligence/fast
- GitHub(openpi,含 π0-FAST 实现与 checkpoint): https://github.com/Physical-Intelligence/openpi
一手源存档(sources/)
- pi0-fast—blog — 官方博客快照:
sources/embodied/2025/pi0-fast--blog.md - pi0-fast—hf-card — HuggingFace 模型卡快照:
sources/embodied/2025/pi0-fast--hf-card.md - pi0-fast—github-readme — openpi GitHub README 快照:
sources/embodied/2025/pi0-fast--github-readme.md - arXiv 2501.09747 全文 PDF(arXiv 原文 PDF,不入 git): https://arxiv.org/pdf/2501.09747