一句话定位

FALCON 是一套双智能体(dual-agent)强化学习框架:把人形机器人全身控制拆成”下肢稳定运动”和”上肢末端执行器(EE)位置跟踪 + 隐式力补偿”两个独立策略,共享全身本体感知联合训练,并配一套考虑关节力矩上限的 3D 力课程,使机器人能在末端受到未知的大幅 3D 外力(0-100N,最高约体重 30%)时仍稳定完成搬运、拉车、开门等负重全身操作任务。CMU LeCAR Lab(+ Field AI、Nissan USA),L4DC 2026 Oral。

背景与定位

问题范式是人形负重全身操作(forceful loco-manipulation):不同于常见的轻量级全身控制或四足/轮式平台的力交互研究,本文关注人形机器人末端受到大幅未知 3D 外力(搬箱子、拉车、开门)时如何维持精确操作与稳定行走。论文把已有人形全身控制方法归成两类范式并各自指出短板:

  • Lower-RL-Upper-IK(如 Mobile-TeleVision/PMP、homie):下肢用 RL 训练运动,上肢靠逆运动学(IK)+ PD 跟踪目标姿态。问题是缺乏全身动力学建模,上肢力补偿滞后,全身协调性有限。
  • Monolithic-Whole-body-RL(如 exbody2、Cheng et al. Expressive-WBC 一类,归入 humanoid-wbc 谱系):单一策略直接学全部自由度。问题是探索效率低——一个策略要同时学”弱相关”的运动与操纵目标,容易过拟合、上下身行为互相压制。

已有的力自适应研究多集中在四足机器人(阻抗控制、MPC + 力规划),人形因动力学耦合更复杂、关节力矩上限更严格(尤其腕关节)而少有人做。FALCON 的定位是提出第三条路线:不共享单一策略、也不完全解耦训练,而是双智能体联合训练(各自独立 reward,但共享同一份全身本体感知与目标指令),在效率和协调性之间取得平衡;同时提出力矩可行性感知的 3D 力课程,解决”训练时怎么给多大外力才既有效又不违反关节力矩限制”的问题。代码库建立在 asap 和 HumanoidVerse 之上。

模型架构

双智能体分解:将全身自由度划分为下肢 n^l 与上肢 n^u 两组(n = n^l + n^u)。

  • 下肢运动智能体 π^l:(本体感知 s_t^p, 运动目标 G_t^l) → 下肢动作 a_t^l,独立 value function V^l。运动目标 G_t^l = [v_lin,ang, φ_stance, h_root, w_yaw](目标线/角速度、站立相位、目标躯干高度、腰部偏航角)。
  • 上肢操作智能体 π^u:(本体感知 s_t^p, 操作目标 G_t^u) → 上肢动作 a_t^u,独立 value function V^u。操作目标 G_t^u = [q_upper*] 为上肢目标关节角,训练时从 AMASS 数据集随机采样,部署时经 IK 计算。
  • 两个智能体观测同一份全身本体感知 s_t^p = [q_{t-4:t}, q̇_{t-4:t}, ω_root_{t-4:t}, g_{t-4:t}, a_{t-5:t-1}](5 帧关节角/角速度历史 + 根部角速度 + 重力投影 + 上一步动作),各自用 PPO 独立最大化折扣回报。合并动作 a_t=[a_t^l; a_t^u] 送入关节级 PD 控制器。
  • 训练采用非对称 actor-critic:critic 额外可见特权信息(根部线速度、真实 EE 力 F_t^ee),actor 部署时不需要这些信息(隐式力适应,无需显式力估计或力传感器)。
  • 验证平台:Unitree G1(29 自由度)Booster T1(29 自由度),两者共用同一套训练配方(仅少量任务相关超参调整),体现跨平台泛化。

数据

  • 无人工采集的示教数据——训练数据全部来自 IsaacGym 仿真自采(on-policy PPO rollout),上肢目标关节角序列从 AMASS 数据集随机采样作为操作目标。
  • 评测运动集:仿真侧对比在 252 条 ACCAD 动作目标上评测,三档外力(No-Force α_g=0、Middle-Force α_g=0.5、Large-Force α_g=1.0)。
  • 力课程数据生成(核心贡献之一,非传统”数据”而是”训练时程序化生成的力扰动”)
    • 每步先按当前上肢关节 Jacobian J_EE、关节力矩上限 τ^lim、重力补偿力矩 τ^g,解出每个笛卡尔轴的可行力区间 [f_min, f_max](Eq. 3-4,逐关节取最紧约束);
    • Dirichlet 分布采样 x/y/z 三轴力的相对比例 γ,在可行区间内均匀采样各轴力 F_i;
    • 用全局课程因子 α_g∈(0,1) 随训练渐进放大外力(Progressive Force Curriculum),行走时平面力被投影到与速度相反方向,并做低通滤波去抖动;
    • 施力点沿 EE 连杆(从腕部偏航关节到末端)随机化,模拟接触点变化带来的力臂/力矩映射差异。
  • 域随机化(附录 Table 6):摩擦系数 U(0.5,1.25)、连杆质量 ×U(0.9,1.2)、基座质量偏移 U(-1.0,3.0) kg、P/D 增益 ×U(0.9,1.1)、控制延迟 U(0,20) ms、每 5s 推机器人一次(v_xy=1 m/s)。
  • 真实世界力实测(用 Mxmoonfree Digital-500N 力计测得峰值,用于校准部署时的力量级):拉车峰值 107.9N、开门峰值 47.3N、原地抗力站姿 Unitree G1 峰值 57.4N、Booster T1 峰值 66.3N(T1 重心更低,抗纵向力更强)。
  • 全流程纯 sim-to-real 零样本迁移,未使用真实机器人数据做微调;自主抓取任务额外需要对托盘做 3D 扫描建模(供 FoundationPose 使用),不属于策略训练数据。

训练方法

  • 优化算法:PPO,双智能体各自独立更新参数 θ_l、θ_u,最大化各自折扣回报 max_θ E[Σγ^(t-1) r_t],无共享的联合损失项,只共享观测与环境。
  • 力矩可行性计算(Torque-Aware Force Computation):训练前先用 EE Jacobian 与力矩上限,逐笛卡尔轴求出施力可行区间(Eq. 3-4),保证课程后期力增大也不会让关节力矩超限。
  • 力课程饱和现象:训练中观察到力课程在 α_g≈0.6 附近饱和,因为力矩限制频繁触发,阻止课程进一步提升(Figure 3a 的实证发现)。
  • 消融验证的两条关键设计:①去掉力矩可行性感知的课程(用固定宽范围 X:[-100N,100N]、Y:[-100N,100N]、Z:[-100N,5N] 随机采样)会让策略在大力下过拟合运动目标、牺牲上肢精度;②力课程范围放宽(Table 2 的宽范围)对性能影响很小,说明力矩可行性感知比范围大小本身更重要。
  • 消融基线设计(用于对比 FALCON 的效果,均在同一目标空间与力课程下训练):Upper-PD-w/o-Force-Curr.、Upper-PD(+力课程)、Upper-PID(+积分项)、Upper-PD-ID(+学习式力估计器 + 准静态逆动力学力矩补偿,附录 A.3);Monolithic-WB-RL 的 w/o-Force-Curr. 与 with-Force-Curr. 两个变体。
  • 训练迭代规模(GitHub 训练脚本注明):G1 与 T1 均约 6k 迭代后即可部署;两个机型的训练配置(+exp=decoupled_locomotion_stand_height_waist_wbc_diff_force_ma_ppo_ma_env)几乎相同,仅调整少量任务超参(如 T1 的 feet_height_targetdesired_base_height=0.62、上下肢 action-rate 惩罚权重),体现”无需逐机型改 reward/课程”的跨平台可复用性。

Infra(训练 / 推理工程)

  • 仿真器:NVIDIA IsaacGym Preview 4,训练时 4096 个并行环境(GitHub 训练命令 num_envs=4096,G1 与 T1 一致)。
  • GPU 型号 / 训练时长 / 总算力:论文正文与附录未披露具体 GPU 型号、GPU 数量或训练总时长(仅知 ~6k 迭代收敛,走 wandb 记录)——未披露。
  • 推理/控制频率:论文未给出具体部署 Hz 数值——未披露(HOMIE 等同代码基座工作部署在 50 Hz,但本文未明确说明是否沿用)。
  • 真机硬件限制(附录 A.6,属于本文独有的工程发现):真实 G1 长时间高力矩输出会导致电机(尤其腕部)过热,限制单臂负重上限约 2kg(默认关节位置下);同一策略在 MuJoCo 仿真中(仅做力矩裁剪、未建模电机热特性)可在 -1 m/s 线速度指令下稳定搬运单臂 3kg 以上负载,说明仿真与真实执行器热耐受度存在明显 gap。对拉车等短时高力矩任务,因无需持续高输出,真机可正常完成。
  • 自主流水线感知栈FoundationPose(6-DoF 物体位姿估计,需先对目标物体做 3D 扫描 + 建 .obj/纹理模型)+ 动作捕捉(MoCap)系统做机器人/桌面全局定位 + IK 抓取规划,四态状态机(空手走、原地抬箱、负重走、原地放箱)。

评测 benchmark

IsaacGym 仿真评测(Table 1,Unitree G1,252 条 ACCAD 动作,三档外力 N/M/L-Force,指标为上肢关节跟踪误差 E_upper 与根速度跟踪误差 E_root,越低越好):

方法E_upper N-ForceM-ForceL-ForceE_root N-ForceM-ForceL-Force
Upper-PD-w/o-Force-Curr.0.460.941.440.380.661.14
Upper-PID-Force-Curr.0.240.310.600.320.350.46
Upper-PD-ID-Force-Curr.(力估计器+逆动力学)0.290.380.530.400.420.47
Monolithic-WB-RL-with-Force-Curr.0.430.500.730.280.320.44
FALCON-with-Force-Curr.0.210.240.370.270.300.45

大力档(L-Force)下 FALCON 上肢误差 0.37,优于 Upper-PID(0.60)与 Monolithic-WB-RL(0.73),根速度误差 0.45 保持稳定——对应摘要所称”2× 更精确的上肢跟踪”。

力矩可行性课程消融(Table 2):去掉力矩可行性感知后,L-Force 下上肢误差从 0.36 恶化到 0.61;力课程范围大小消融(Table 3):把力裁剪范围从窄(±50N)放宽到宽(±100N)几乎不影响性能(0.36 vs 0.37),说明力矩可行性感知比范围本身更关键。

探索效率对比(Figure 4,定性):FALCON 的动作噪声标准差比 Monolithic-WB-RL 衰减更快更平滑(探索收敛更快);Monolithic-WB-RL 因躯干/踝关节过度补偿出现明显姿态畸变(不自然弯腰、CoM 偏移)。

真实世界定量跟踪(Table 4,Unitree G1 双手各绑 1.2kg 负载,行走 0.5 m/s 直线):

方法E_upperE_root
Upper-PD-Force-Curr.1.810.40
Monolithic-WB-RL-Force-Curr.0.810.58
FALCON0.390.42

真实世界定性部署:Unitree G1 与 Booster T1 上无需改 reward/课程即可完成三类任务——搬运负载(0-20N 竖直力)、拉车(最高 100N 纵向力)、开门(最高 40N 三维力);另有自主全流程仓储 tote 物流任务演示(走-拾-走-放)。论文未报告成功率百分比等严格统计口径的真机指标,仅提供定性视频与力计实测峰值。

创新点与影响

  • 提出**双智能体(非完全解耦、非单体)**这一第三条人形全身操作范式:两个策略共享全身本体感知联合训练但各自独立优化目标,兼顾 Lower-RL-Upper-IK 的样本效率与 Monolithic-WB-RL 的协调表达力。
  • 力矩限制可行性感知的 3D 力课程是本文核心工程贡献:把”训练时该给多大外力”从随机猜测变成基于 Jacobian + 力矩上限的解析可行区间采样,显著提升大力工况下的上肢跟踪精度,且对课程范围大小不敏感(鲁棒)。
  • 证明同一套训练配方(reward/课程几乎不改)可跨 Unitree G1 与 Booster T1 两种不同形态/驱动的人形机器人复用,为后续人形负重全身操作研究提供了可复现的开源代码基座(建立在 ASAP + HumanoidVerse 之上,训练/sim2sim/sim2real 代码均已开源)。
  • 作者自陈局限(原文 Limitations):①仅处理施加在末端执行器上的力,未建模身体其它部位的接触力,不支持倚靠、支撑、协作搬抬等多接触交互场景;②力课程只考虑外力,忽略外力矩,因此在需要抵抗偏心加载的任务(如开阀门、拧工具)中可能表现不佳。附录另指出真机电机热限制(长时间高力矩腕部过热,限制单臂负重约 2kg)是仿真未建模、实际部署中观察到的额外差距。

原始链接

一手源存档(sources/)

  • falcon—github-readme — GitHub README 快照,含训练命令行超参、6k 迭代收敛说明(sources/embodied/2025/falcon—github-readme.md)
  • falcon—project-page — 项目页快照,含摘要、方法概述、L4DC 2026 Oral 与视频清单(sources/embodied/2025/falcon—project-page.md)
  • 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)