一句话定位

首篇聚焦「行为基础模型(Behavior Foundation Model, BFM)」在人形机器人全身控制(WBC)中应用的系统综述:把预训练范式归纳为目标条件学习、内在奖励驱动学习、前向-后向(forward-backward, FB)表征学习三条路线,把适应策略归纳为微调与分层控制两类,并系统盘点应用前景、现存局限(Sim2Real gap、数据瓶颈、具身泛化)与未来机会(多模态、scaling law、post-training、评测机制)。已被 IEEE TPAMI 2025 接收,配套持续更新的论文列表仓库 awesome-bfm-papers

背景与定位

人形 WBC 的演进脉络(综述 §1 的三段式框架):

  1. 传统模型式控制器——centroidal MPC + 层级 QP 求解器(operational space control、hierarchical task control),代表系统 Atlas、HRP-2、DLR 力控机器人;局限是任务设计/增益调参劳动密集、高维 MPC 难实时、无法执行高动态技能、抗扰弱。
  2. 学习式/任务专用控制器——RL 路线(DeepMimic 结合动捕数据学物理仿真角色技能、AMP 引入对抗式动作先验、HoST 从零学人形站立)与 IL 路线(TRILL 用 VR 遥操作 + WBC 做双臂真机任务,达到 85% 成功率;上下半身解耦模仿);局限是 RL 样本效率低、对奖励设计敏感、Sim2Real gap,IL 数据采集贵、继承示范者偏差,两者都难泛化到新场景。
  3. 行为基础模型(BFM)——本文延续 Touati & Ollivier 首次提出的”BFM”术语(successor-measure 框架,支持从少量示范即时模仿多样行为),将其扩展定义为一类专门用于控制智能体行为的基础模型:区别于 GPT-4/CLIP/SAM 这类在静态数据上自监督预训练的通用基础模型,也区别于面向机械臂/轮式人形等相对稳定平台的 VLA 模型——BFM 直接控制人形的运动、操作与交互,面向的是形态更复杂的全身控制。

与本库其他人形全身控制工作对照:hugwbc(自监督命令空间跟踪,本综述归入目标条件学习一节讨论)、hover(oracle 蒸馏出的多模式统一策略,真实部署案例)、asap(残差动作学习缓解 Sim2Real,本综述在局限章节引用其局限性)、omnih2o(OmniH2O-6 遥操作多模态数据集,本综述引作数据瓶颈的例证)。同一批调研中还会覆盖 clone-teleoperation(CLONE,本综述在 Sim2Real 一节点名的真机 BFM-like 控制器)与 bfm-zero(BFM-Zero,本综述之后出现的更彻底的 BFM 实现)。

模型架构

综述本身不训练模型,其架构贡献是一套 BFM 预训练范式分类学(§3.1):

(1) 目标条件学习——追踪式学习:在每个时间步让策略跟踪参考动作的下一帧关节角/姿态。代表工作:足球动捕全身模仿 + NPMP 低层控制器再做钻式训练;ASE(对抗式技能嵌入,结合对抗式 IL 与无监督 RL 学一个可复用的隐空间运动先验,latent-conditioned 低层控制器);CALM(在 ASE 上加条件判别器实现细粒度隐变量控制);CASE(focal skill sampling + 骨架残余力提升敏捷性与多样性);HugWBC(不依赖预采集动捕数据,用速度/步态/姿态目标构成的通用命令空间做自监督命令跟踪);ModSkill(把全身动作解耦为部位专属技能,用技能模块化注意力层独立控制各身体部位)。进一步走向高层目标执行:MoConVQ(VQ-VAE 离散隐码统一运动控制,可接 LLM 做语言上下文提示);MaskedMimic(把物理角色控制建模为运动补全问题,两阶段训练:全约束跟踪控制器→部分约束 VAE 掩码目标蒸馏);InterMimic(两阶段教师-学生框架,把带噪声的人-物交互动捕蒸馏为鲁棒物理控制器);HOVER(从 oracle 蒸馏出单一统一策略,在移动/操作/导航间无缝切换,已见真实部署)。

(2) 内在奖励驱动学习——无外部任务奖励,靠自生成信号驱动探索。ICM(基于状态预测误差的好奇心奖励);DIAYN(隐变量互信息最大化学多样技能);RE3(状态访问频率驱动的覆盖率最大化);ODPP(用行列式点过程统一优化”轨迹内模式覆盖”与”轨迹间技能多样性”两个目标)。综述指出该路线的根本局限:需要巨量训练才能获得广泛行为覆盖,且持续产出不可靠的运动先验(如不安全/不实用的动作),对人形这类高复杂动力学系统尤其突出。

(3) 前向-后向(FB)表征学习——把策略学习与任务目标解耦的核心框架,是当前 BFM 最活跃的技术路线,推导如下:策略 π 的 successor measure 定义为 M^π(X|s,a) ≔ Σ_t γ^t Pr(s_{t+1}∈X|s,a,π),满足测度值 Bellman 方程;[87] 提出用前向嵌入 F(s,a) 与后向嵌入 B(s’) 的低秩近似 M^π(X|s,a) ≈ ∫_{s’∈X} F^π(s,a)^⊤B(s’)ρ(ds’),使动作值函数可写成 Q_r^π = F^π(s,a)^⊤z(z = E_{s~ρ}[B(s)r(s)]),从而学到 successor measure 后可对任意奖励 r 零样本推断值函数,无需额外训练。训练目标是最小化 TD 形式的 Bellman 残差损失 L_FB(式 9)与 actor 损失 L_actor(式 10)。零样本任务推断:给定奖励函数 r,取 z_r = (1/n)Σr(s_i)B(s_i);给定目标状态 s,直接取 z_s = B(s)。

该路线的关键节点:Touati & Ollivier 首次提出 “BFM” 一词的 FB-IL,支持行为克隆/特征匹配/目标归约等多种 IL 范式而无需为每个新任务单独跑 RL;FB-AWARE 引入自回归特征提升任务编码精度(标准 FB 用线性任务投影会模糊奖励、降低空间精度),并加入优势加权回归(AWR)解决离线复杂数据集学习问题,在 D4RL 等基准上匹配标准离线 RL agent 性能。最终落到 FB-CPR(即 Motivo,[41])——综述称其为”第一个真正意义上的人形 WBC BFM”:在 FB 表征基础上加判别器正则的条件策略正则化,损失 L_{FB-CPR} = −E[F(s,a,z)^⊤z] + αKL(p_π, p_ℰ),其中 KL 散度通过判别器 D 估计为 r_div ≈ log(D/(1−D)),再用另一个 critic 网络做 off-policy TD 估计。综述明确指出 FB-CPR 并非严格无监督方法,因为它借助无标签示范数据辅助运动先验学习。综述在讨论 scaling law 时提到 FB-CPR 从 25M 参数扩大到 288M 参数后,零样本运动跟踪与奖励优化性能均更稳健。

数据

综述汇总了当前 BFM 训练所依赖的动捕数据集规模(Table II,均为被引用的第三方数据集,非本综述自建):

数据集Clip 数时长(小时)年份
KIT-ML3,91111.22016
AMASS11,26540.02019
LAFAN774.62020
BABEL13,22043.52021
PoseScript2022
HumanML3D14,61628.62022
Motion-X81,084144.22023
Motion-X++120,462180.92025

综述明确指出这条数据线的规模远小于 LLM 或大视觉模型的训练数据(“数据瓶颈”是其列出的三大局限之一),且把动作 retarget 到具体机器人平台时,细微的形态差异会导致策略性能大幅下降。

多模态数据方面,综述以 OmniH2O 为例:通过遥操作采集头戴 RGBD 相机 + 全身本体感知 + 电机指令的配对数据,支持视觉自主与模仿学习,但其子集 OmniH2O-6 仅有 40 分钟,局限在实验室场景、缺乏多样接触动力学。综述断言:目前不存在任何跨多样环境、时间对齐的本体感知+视觉+接触动力学大规模数据集,这是亟需补齐的方向。

训练方法

综述归纳的两阶段范式(§3):预训练(建立可复用行为先验,即上文三条路线)→ 适应(微调 / 分层控制,§3.2)。

微调类适应

  • ReLA / LoLA(残差隐空间适应 / 前瞻隐空间适应,[42]):仅需极少量在线交互即可零样本适应新任务,任务性能提升最高 40%
  • Task Tokens([43]):用任务编码器为目标条件 BFM 生成任务专属 token,在长跳等任务上达到最高 99.75% 成功率。
  • Belief-FB([44]):用 transformer 编码器推断环境动力学,改善对未见动力学变化的适应,在动态变化场景下性能提升最高 2 倍

走向分层控制:UniHSI(语言指令→chain-of-contacts→基于 AMP 架构的统一控制器执行人-场景交互);TokenHSI(transformer 把本体感知与任务状态都 token 化,分离共享运动知识与任务专属参数,支持技能组合、物体/地形形状变化、长时程任务);CLoSD(文本驱动 RL 控制器,结合实时运动扩散规划器与物理仿真跟踪控制器的闭环反馈,处理目标到达、打击、人-物交互等任务);UniPhys(diffusion forcing 统一规划与控制,用文本/速度/目标引导处理预测误差,支持动态避障与长时程规划)。

Infra(训练 / 推理工程)

综述本身不训练模型,未披露自有 GPU/GPU-hours/并行策略/精度数字。其汇总的被引工作中,唯一具体的推理效率数字是 Motivo(FB-CPR):在运动跟踪任务的每 300 步 episode 上仅需 12 秒即可完成推理,计算效率优于 DIFFUSER 基线(综述原文表述为”surpassing DIFFUSER in computational efficiency”)。

Sim2Real 方面(§4.2.1),综述指出 ASAP 这类残差动作学习方法能缓解动力学失配,但残差只在单一预训练策略的轨迹上训练,泛化受限;当前 BFM 普遍”largely confined to simulation, with no documented large-scale real-world deployments”,仅 HugWBC、CLONE 等在真机上验证过,但技能范围较窄——综述认为这是行为先验丰富度与 Sim2Real 可行性之间尚未解决的张力。

评测 benchmark

综述不做统一新基准,而是逐一转述被引论文自报的实验数字(均非本综述自跑):

  • Motivo(FB-CPR):动作跟踪任务成功率 83%;奖励优化任务达到 top-line 性能的 61%;运动多样性得分 4.70 ± 0.66,优于 ASE 与 CALM。
  • ReLA / LoLA:任务性能提升最高 40%。
  • Task Tokens:长跳等任务成功率最高 99.75%。
  • Belief-FB:动态变化环境下性能提升最高 2 倍。
  • TRILL(IL 基线,非 BFM,作为学习式控制器演进脉络的对照案例):真实双臂任务成功率 85%。

综述明确指出行业空白(§5.1.6):不同于 LLM 已有 GPQA(知识)、MATH(数学)、MUSR(多步推理)等成熟基准,目前没有专门、综合的 BFM 评测机制。现有评估(如 Motivo 结合任务成功率与人类对运动自然度的定性打分)在评估技能组合能力、硬件专属约束、长期行为稳定性上仍有明显缺口;综述呼吁未来构建覆盖渐进式难度与跨域迁移测试的基准。

创新点与影响

贡献

  1. 首次系统综述”行为基础模型”在人形全身控制中的应用,建立预训练(目标条件 / 内在奖励 / 前向-后向)× 适应(微调 / 分层控制)两阶段分类学。
  2. 系统盘点 BFM 在通用加速器、虚拟角色与游戏、Industry 5.0、医疗与辅助机器人四大产业方向的应用前景。
  3. 明确三大现存局限——Sim2Real gap、数据瓶颈、具身泛化(当前 BFM 均针对固定人形本体训练,难以泛化到不同形态/执行器/传感器配置的新本体)。
  4. 给出六项未来机会(多模态 BFM、与 LLM 等高层 ML 系统集成、scaling law、post-training、多智能体系统、评测机制)与两类风险(伦理:训练数据的人口统计偏差与运动隐私泄露;安全:数据分布偏移下的鲁棒性、多模态间的跨模态一致性攻击面,举例引用 CLIP “苹果贴 iPod 标签被误分类”的跨模态混淆案例)。
  5. 配套持续更新的 awesome-bfm-papers 仓库,收录预训练/适应/数据集三张表。

它改变了什么:把此前分散在角色动画(DeepMimic/ASE 系)、无监督 RL(DIAYN/ICM 系)、successor representation 理论(Touati & Ollivier 系)等领域的工作,首次统一到”面向人形 WBC 的 BFM”这一术语与两阶段框架下,为后续更彻底的实现(如同一批调研中的 bfm-zero)提供了参照分类体系。已被 IEEE TPAMI 2025 接收。

作者自陈局限:现有 BFM 仍局限于仿真,没有大规模真实世界部署的文献记录;数据规模远小于 LLM/视觉基础模型,且 retarget 到具体机器人平台会因形态差异造成性能损失;当前 BFM 均针对固定具体人形本体训练,难以泛化到不同形态/执行器/传感器配置的新本体,奖励函数也难以跨本体迁移(如人形行走的奖励不适用于六足步态);安全机制、伦理治理框架(数据来源与实时行为规范性)均待建立。

原始链接

一手源存档(sources/)