一句话定位

用无监督强化学习(Forward-Backward 表征 + FB-CPR)在仿真里预训练出一个把动作、目标位姿、奖励函数统一嵌入同一个潜空间 Z 的策略,训练全程不依赖任何任务特定 reward,部署到真实 Unitree G1 上后可以零样本被”提示”去做动作追踪、位姿到达、奖励优化,还能在潜空间里做少样本采样优化适应新任务——是第一个把这套 unsupervised-RL/FB 范式跑通到真实人形机器人上的模型。

背景与定位

人形全身控制(whole-body control)近两年的主流范式是”仿真训练 + sim-to-real 迁移”,具体做法几乎都收敛到两阶段 teacher-student:先用 on-policy RL(多为 PPO)训一个(或多个)动作追踪 teacher 策略,再蒸馏成一个可部署的多任务 student——gmt(Motion MoE + Adaptive Sampling 课程)、asap(追踪策略 + 残差 delta-action 模型)、beyondmimic(扩散模型蒸馏)、twist、HugWBC(hugwbc)等都在这条线上。作者指出这条范式的三个结构性限制:任务特定(策略绑定在具体动作/任务上)、不可自适应(训完就定型,难以微调或组合新任务)、缺统一可解释接口(人没法用简单的 goal/reward 直接指挥策略组合技能)。

BFM-Zero 换了一条路:不走 teacher-student 蒸馏,而是直接用离策略(off-policy)无监督 RL 学一个 Behavioral Foundation Model(BFM)。方法论上继承 Forward-Backward(FB)零样本 RL 框架(Touati21,successor-feature 一族)与 FB-CPR(Tirinzoni 等 2025,此前只在仿真虚拟角色上验证过,未曾用于真实机器人)——FB-CPR 在纯 FB 目标之上加了一个基于动捕数据的判别器正则,把无监督学出的行为拉回人类风格。BFM-Zero 是把这套框架第一次搬到真实人形机器人上做验证的工作,同时补上了三个此前未被检验过的工程环节:非对称history-based训练、domain randomization、辅助安全奖励,用来填平仿真-真机的 gap。

模型架构

问题形式化:POMDP (S, O, A, P, γ)。真机是 29 自由度(DoF)Unitree G1,动作 a∈A⊂R²⁹ 为各 DoF 的 PD 目标位置。特权状态 s∈R⁴⁶³(根高度、body pose/rotation、线速度/角速度等全状态)。可观测状态 o_t∈R⁶⁴ = {关节位置偏差 q_t−q̄, 关节速度 q̇_t, 根角速度/4, 根投影重力},其中 q_t,q̇_t∈R²⁹。历史观测 o_{t,H}={o_{t-H},a_{t-H},…,o_t}∈R^(93·H+64),H=4。

三件套(unsupervised RL / successor-feature 范式):

  • 潜任务特征 φ: S→R^d(d=256);
  • 潜条件策略 π_z: S→A;
  • 潜条件 successor feature F_z,满足 F_z ≃ E[Σ_t γ^t φ(s_t) | π_z]。

FB 表征核心恒等式:长期转移概率分解 M^π_z(ds′|s,a) ≈ F(s,a,z)^T B(s′) ρ(ds′),其中 F: S×A×R^d→R^d 是前向映射,B: S→R^d 是后向映射;φ(s):=(E[B(s)B(s)^T])^{-1}B(s)。每个 z 定义一族线性奖励 r_z(s)=φ(s)^T z,对应策略 π_z 优化 E[Σ_t γ^t φ(s_t)^T z]=F(s,a,z)^T z(即 z 的 Q 函数)。

FB-CPR 正则:额外引入潜条件判别器 D,用动捕数据集 M 中的轨迹做 GAN 式约束(式见训练方法),把无监督探索出的行为拉向人类风格;同时 FB-CPR 是全在线、离策略训练,不需要覆盖度完备的离线数据集(相较原始离线 FB 算法)。

四个关键工程设计(用于弥合 sim-to-real gap,此前 unsupervised RL 未在真机验证过):

  • A) 非对称训练:actor 只吃 history-based 可观测量 o_{t,H},critic(F、Q_D、Q_R)额外吃特权信息 (o_{t,H}, s_t);用 history 缩小本体 actor 与特权 critic 间的信息差,提升 domain-randomization 下的适应性。
  • B) 大规模并行环境:借鉴 FastTD3(Seo2025)的大 batch 离策略 RL 配方,上千并行环境 + 大 replay buffer + 高 update-to-data (UTD) 比。
  • C) Domain Randomization:随机化 link mass、摩擦系数、关节零位偏移、torso 质心偏移,加扰动与传感器噪声。
  • D) 奖励正则化:加入 N_aux 个安全/物理可行性惩罚项(关节限位、动作变化率、自接触、脚部朝向、踝关节 roll、脚部打滑)。

零样本推理公式(无需重训/微调):

  • 奖励优化:给定任意 r(s),z_r = E_{s′~ρ}[B(s′)r(s′)],采样估计 z_r=(1/N)Σ_i r(s_i)B(s_i),s_i 从在线 replay buffer 子采样;
  • 位姿到达:z_g = B(s_g);
  • 动作追踪:给定序列 τ={s_1,…,s_n},滑窗生成策略序列 z_t=Σ_{t′=t}^{t+H} B(s_{t′}),H 为前瞻窗口(仿真中用完整序列长度,真机前瞻 H=3)。

少样本适应:在潜空间 Z 里做采样优化,目标 J(z)=Σ_t(r_task(s_t) − λ_R Σ_k r_k)。单帧位姿适应:以零样本潜 z_0=B(s_g,o_g) 为初值,跑 20 轮 CEM。轨迹级适应:warm-start 自追踪出的潜序列,用类 DIAL-MPC 的双循环退火调度对 z_{t:t+H-1} 做零阶采样轨迹优化(粒子数 N=2048,温度 λ₁=0.85、λ₂=0.9,迭代 M=6 轮)。

网络架构(真机测试所用配置):actor 与 critics(F, Q_D, Q_R)用带残差连接 + LayerNorm + Mish 激活的 Transformer-风格残差块(embedding 残差块 4 层 / 2048 维,主体残差块 6 层 / 2048 维);critics 用 2 网络 ensemble。判别器 D 与后向映射 B 用标准 MLP + ReLU(D:2 层前馈 / 1024 维;B:1 层前馈 / 256 维)。参数量:F 135.8M,Q_D/Q_R 各 134.8M,actor 31.9M,判别器 2.9M,B 0.2M,总计 440.5M(不含 target 网络)。潜维度 d=256。

数据

  • 动捕数据(判别器正则用):LAFAN1 数据集重定向到 Unitree G1,40 段数分钟长动作;训练时按 10 秒切块做更细粒度的优先级采样(基于 earth mover’s distance 的 exponential 优先级,p(m)∝2^(clip(EMD(m),[0.5,2])·4))。
  • 在线交互数据:全部来自仿真在线 rollout(IsaacLab,200 Hz 仿真 / 50 Hz 控制),episode 初始状态是”随机跌倒姿态”与”动捕数据中状态”的混合(fall-init 概率 0.3)。
  • 数据规模消融(附录 D.1):额外引入 AMASS 的 CMU 与 BMLHandball 子集,与 LAFAN1 按 {12.5%,25%,50%,75%,100%} 比例混合做数据/模型规模联合消融;发现仅用 LAFAN1 时 tracking 性能很快饱和(因为评测用的 AMASS 测试集虽已与训练集分离,但整体更接近 CMU/BMLHandball 分布而非 LAFAN1),reward inference 性能则依赖 LAFAN1 参与训练(仅用 AMASS 子集会下降)。
  • out-of-distribution 测试集:AMASS CMU 子集随机选取 175 条跟踪动作 + 全 AMASS 中手选 10 个位姿,用于验证泛化到训练分布之外的任务。
  • 跨机型验证:LAFAN1 用 LocoMujoco 重定向到 Booster T1(与 G1 完全相同超参数训练),验证框架对不同机器人本体的通用性(附录 D.2)。

训练方法

目标函数(FB + 判别器 + 辅助 critic 的联合 actor-critic):

  • FB 损失 L(F,B):标准 TD 形式,用 F̄、B̄ 停梯度目标网络;
  • 判别器损失 L(D) = −E_{τ~M}[log D(o,s,z)] − E_{(o,s,z)~D}[log(1−D(o,s,z))],其中 z=(1/l(τ))Σ B(o,s) 是轨迹 τ 的零样本模仿嵌入;
  • 辅助 critic Q_R 的 Bellman 残差损失,回归 N_aux 个惩罚奖励之和;
  • 风格 critic Q_D 用判别器导出的奖励 r_d(o,s,z)=D/(1−D) 训练;
  • actor 损失 L(π) = −E[F(o_{t,H},s_t,a_t,z)^T z + λ_D Q_D + λ_R Q_R](判别器正则系数 λ_D=0.05,奖励正则系数 λ_R=0.02)。

训练循环(Algorithm 1):每步在 N_env 个并行环境采样 → 存入在线 buffer D_online → 每个环境步做 N_ups 次梯度更新,每次更新从 D_online 采一个 batch 转移,从动捕集 M 采一批轨迹片段编码得到判别器目标 z_j(并做 √d 归一化:z_j ← √d·z_j/‖z_j‖₂),依次更新判别器、FB 表征、辅助 critic、风格 critic、actor,最后软更新 target 网络。orthonormality 损失系数为 100(约束 B 的正交性,FB 框架标准项)。

关键超参数:History H=4,Episode 长度 T=500,N_env=1024,batch N_batch=1024,UTD 比 N_ups=16,总梯度步 N_grad=3M(对应约 192M 环境步),buffer 缓冲天数 N_buffer=10(约 5M 条 transition),折扣因子 γ=0.98,seeding 步数 10·N_env,fall-init 概率 0.3,轨迹采样序列长度 8。学习率:F/actor/Q_D/Q_R 均 3e-4,B 与 D 均 1e-5。梯度惩罚系数 10。零样本奖励推理采样数 400,000。

Infra(训练 / 推理工程)

  • 仿真器:IsaacLab,仿真频率 200 Hz,控制频率 50 Hz;GPU 型号/数量、总训练 wall-clock 时间、算力总量未披露(论文只给出环境步数 ≈192M 与 UTD=16,未换算成 GPU-hours)。
  • 仿真到仿真(sim-to-sim)鲁棒性:MuJoCo 上重测,各项指标相对 IsaacLab 差异均 <7%。
  • 真机部署:Unitree G1;策略控制频率与仿真训练一致为 50 Hz(仿真物理步进 200 Hz,论文未单独重申真机侧控制频率,但同一策略直接零样本部署,控制频率应一致);真机前瞻窗口 H=3(vs 仿真中用完整序列长度);边缘算力硬件、端到端推理延迟/FPS未披露。
  • 跨机型部署:Booster T1(附录 D.2),同超参训练,展示自然行走与舞蹈动作泛化。
  • 少样本适应耗时:CEM 单帧位姿适应 20 轮迭代(论文项目页称”少于 2 分钟”完成仿真内适应);轨迹级 DIAL-MPC 式优化粒子数 N=2048、6 轮迭代。

评测 benchmark

仿真零样本验证(Fig. 3,指标:追踪/位姿到达用平均关节位置误差 E_mpjpe,越低越好;奖励用 500 步 episode 累积回报,越高越好):

模型测试环境测试数据Track↓Reward↑Pose↓
BFM-Zero-priv(特权版,无 DR)Isaac (无 DR)LAFAN11.0749299.31.0291
BFM-ZeroIsaac (DR)LAFAN11.1015221.91.1387
BFM-ZeroMujoco (DR)LAFAN11.0789207.31.1041
BFM-ZeroMujoco (DR)AMASS1.0342—1.4735
  • 域随机化(DR)代价:相对特权版 BFM-Zero-priv,追踪/奖励/位姿到达分别劣化 2.47%、25.86%、10.65%;奖励任务掉得最多,作者归因于奖励函数偏稀疏、且奖励推理过程对 domain-randomized 数据的小规模子采样更敏感。
  • Sim-to-sim(Isaac→MuJoCo):所有指标变化 <7%。
  • OOD 泛化:AMASS CMU 175 条动作 + 10 个手选位姿测试,追踪与位姿到达均能成功完成(LAFAN1 与 AMASS 数值因任务性质不同不可直接比较,但整体泛化良好)。

奖励任务集:6 大类共 24 个具体奖励函数——站立(不同骨盆高度)、移动(5 个代表性方向/速度组合 + 1 个低姿态前进)、旋转(顺/逆时针)、地面姿态(坐地 sitting、蹲 crouch-0.25)、举臂(低/中两档 z 高度、4 种组合)、复合技能(8 种组合),全部评测用 500 步累积回报。

真机定性验证(无量化跨基线数值,逐项定性描述):动作追踪覆盖舞蹈、格斗、运动风格走路,跌倒后能自然温和恢复继续追踪;位姿到达在不可行目标下仍收敛到自然近似姿态、且转换平滑无需显式插值;奖励优化在移动/举臂/骨盆高度三类任务上均”忠实执行”给定指令,且线性组合奖励可得到复合技能(如后退同时举臂);扰动测试(踢腿、推搡、拖拽倒地)均能自然恢复。

少样本适应量化结果:单腿站立负重适应——torso 增重 4kg 后,未适应的零样本策略在真机上 5 秒内失稳碰撞,CEM 适应后的策略维持单腿平衡 超过 15 秒;轨迹级适应——针对改变地面摩擦后的跳跃动作,用 dual-annealing 轨迹优化后追踪误差降低约 29.1%。

数据/模型规模消融(附录 D.1,Tab. 3,单 seed):残差网络 3/6/9-block × 1024/2048 维,以及 2/4 层 MLP × 1024/2048 维,参数量从 40.1M 到 679.9M 不等(论文主模型用 6-block/2048 维,440.5M 参数,标 ⋆)。整体趋势:增大模型容量提升追踪性能(LAFAN1 单独训练时提前饱和);残差架构优于同规模 MLP,且 MLP 放大后训练不稳定;奖励推理性能随模型增大有轻微提升趋势,但依赖 LAFAN1 参与训练混合比例。

创新点与影响

  • 贡献:首次证明离策略无监督 RL(FB 表征 + FB-CPR)可以训出能在真实人形机器人上工作的 Behavioral Foundation Model,不需要 teacher-student 两阶段蒸馏、不需要显式任务奖励做监督;补齐了此前只在仿真虚拟角色上验证过的 FB-CPR 框架在 sim-to-real 落地时缺失的三块拼图——非对称 history-based 训练、domain randomization、辅助安全奖励正则。潜空间 Z 被证明是平滑、按动作风格聚类的语义空间(t-SNE 可视化,Sect. 3.4),支持 SLERP 插值生成语义合理的中间技能,无需重训。
  • 改变了什么:相比 gmt/asap/beyondmimic 等两阶段蒸馏范式(先追踪 teacher 再蒸馏成 student,受限于动捕数据质量、任务绑定、训完难改),BFM-Zero 直接学一个可被”提示”(reward / goal / motion 三种输入形式统一走同一套 z 计算公式)的策略,且因为训练目标本身是无监督的(不依赖任何任务专属 reward),学到的技能库不受限于动捕数据里已标注的具体任务。
  • 作者自述局限(Discussion 部分原话整理):(1) 模型行为的范围与质量仍受限于训练用的动捕数据集,动捕规模/仿真数据规模/网络架构/模型性能之间尚缺乏系统的 scaling law;(2) 尽管 history-based actor/critic 与 domain randomization 缩小了 sim-to-real gap,作者认为要可靠表达更复杂的动作还需要更好的在线自适应算法;(3) 论文对少样本适应/微调只做了初步探索,更系统的快速适应机制理解仍待补充以扩展实际适用性。

原始链接

一手源存档(sources/)

  • bfm-zero—project-page — 项目页快照(sources/embodied/2025/bfm-zero—project-page.md)
  • bfm-zero—github-readme — GitHub README 快照(sources/embodied/2025/bfm-zero—github-readme.md)
  • bfm-zero—hf-card — HuggingFace checkpoint 仓库 README 快照(sources/embodied/2025/bfm-zero—hf-card.md)
  • arXiv 2511.04131 全文(arXiv 原文 PDF,不入 git;引用见上方链接)