一句话定位
FALCON 是一套双智能体(dual-agent)强化学习框架:把人形机器人全身控制拆成”下肢稳定运动”和”上肢末端执行器(EE)位置跟踪 + 隐式力补偿”两个独立策略,共享全身本体感知联合训练,并配一套考虑关节力矩上限的 3D 力课程,使机器人能在末端受到未知的大幅 3D 外力(0-100N,最高约体重 30%)时仍稳定完成搬运、拉车、开门等负重全身操作任务。CMU LeCAR Lab(+ Field AI、Nissan USA),L4DC 2026 Oral。
背景与定位
问题范式是人形负重全身操作(forceful loco-manipulation):不同于常见的轻量级全身控制或四足/轮式平台的力交互研究,本文关注人形机器人末端受到大幅未知 3D 外力(搬箱子、拉车、开门)时如何维持精确操作与稳定行走。论文把已有人形全身控制方法归成两类范式并各自指出短板:
- Lower-RL-Upper-IK(如 Mobile-TeleVision/PMP、homie):下肢用 RL 训练运动,上肢靠逆运动学(IK)+ PD 跟踪目标姿态。问题是缺乏全身动力学建模,上肢力补偿滞后,全身协调性有限。
- Monolithic-Whole-body-RL(如 exbody2、Cheng et al. Expressive-WBC 一类,归入 humanoid-wbc 谱系):单一策略直接学全部自由度。问题是探索效率低——一个策略要同时学”弱相关”的运动与操纵目标,容易过拟合、上下身行为互相压制。
已有的力自适应研究多集中在四足机器人(阻抗控制、MPC + 力规划),人形因动力学耦合更复杂、关节力矩上限更严格(尤其腕关节)而少有人做。FALCON 的定位是提出第三条路线:不共享单一策略、也不完全解耦训练,而是双智能体联合训练(各自独立 reward,但共享同一份全身本体感知与目标指令),在效率和协调性之间取得平衡;同时提出力矩可行性感知的 3D 力课程,解决”训练时怎么给多大外力才既有效又不违反关节力矩限制”的问题。代码库建立在 asap 和 HumanoidVerse 之上。
模型架构
双智能体分解:将全身自由度划分为下肢 n^l 与上肢 n^u 两组(n = n^l + n^u)。
- 下肢运动智能体 π^l:
(本体感知 s_t^p, 运动目标 G_t^l) → 下肢动作 a_t^l,独立 value function V^l。运动目标G_t^l = [v_lin,ang, φ_stance, h_root, w_yaw](目标线/角速度、站立相位、目标躯干高度、腰部偏航角)。 - 上肢操作智能体 π^u:
(本体感知 s_t^p, 操作目标 G_t^u) → 上肢动作 a_t^u,独立 value function V^u。操作目标G_t^u = [q_upper*]为上肢目标关节角,训练时从 AMASS 数据集随机采样,部署时经 IK 计算。 - 两个智能体观测同一份全身本体感知
s_t^p = [q_{t-4:t}, q̇_{t-4:t}, ω_root_{t-4:t}, g_{t-4:t}, a_{t-5:t-1}](5 帧关节角/角速度历史 + 根部角速度 + 重力投影 + 上一步动作),各自用 PPO 独立最大化折扣回报。合并动作a_t=[a_t^l; a_t^u]送入关节级 PD 控制器。 - 训练采用非对称 actor-critic:critic 额外可见特权信息(根部线速度、真实 EE 力 F_t^ee),actor 部署时不需要这些信息(隐式力适应,无需显式力估计或力传感器)。
- 验证平台:Unitree G1(29 自由度) 与 Booster T1(29 自由度),两者共用同一套训练配方(仅少量任务相关超参调整),体现跨平台泛化。
数据
- 无人工采集的示教数据——训练数据全部来自 IsaacGym 仿真自采(on-policy PPO rollout),上肢目标关节角序列从 AMASS 数据集随机采样作为操作目标。
- 评测运动集:仿真侧对比在 252 条 ACCAD 动作目标上评测,三档外力(No-Force α_g=0、Middle-Force α_g=0.5、Large-Force α_g=1.0)。
- 力课程数据生成(核心贡献之一,非传统”数据”而是”训练时程序化生成的力扰动”):
- 每步先按当前上肢关节 Jacobian J_EE、关节力矩上限 τ^lim、重力补偿力矩 τ^g,解出每个笛卡尔轴的可行力区间 [f_min, f_max](Eq. 3-4,逐关节取最紧约束);
- 用 Dirichlet 分布采样 x/y/z 三轴力的相对比例 γ,在可行区间内均匀采样各轴力 F_i;
- 用全局课程因子 α_g∈(0,1) 随训练渐进放大外力(Progressive Force Curriculum),行走时平面力被投影到与速度相反方向,并做低通滤波去抖动;
- 施力点沿 EE 连杆(从腕部偏航关节到末端)随机化,模拟接触点变化带来的力臂/力矩映射差异。
- 域随机化(附录 Table 6):摩擦系数 U(0.5,1.25)、连杆质量 ×U(0.9,1.2)、基座质量偏移 U(-1.0,3.0) kg、P/D 增益 ×U(0.9,1.1)、控制延迟 U(0,20) ms、每 5s 推机器人一次(v_xy=1 m/s)。
- 真实世界力实测(用 Mxmoonfree Digital-500N 力计测得峰值,用于校准部署时的力量级):拉车峰值 107.9N、开门峰值 47.3N、原地抗力站姿 Unitree G1 峰值 57.4N、Booster T1 峰值 66.3N(T1 重心更低,抗纵向力更强)。
- 全流程纯 sim-to-real 零样本迁移,未使用真实机器人数据做微调;自主抓取任务额外需要对托盘做 3D 扫描建模(供 FoundationPose 使用),不属于策略训练数据。
训练方法
- 优化算法:PPO,双智能体各自独立更新参数 θ_l、θ_u,最大化各自折扣回报
max_θ E[Σγ^(t-1) r_t],无共享的联合损失项,只共享观测与环境。 - 力矩可行性计算(Torque-Aware Force Computation):训练前先用 EE Jacobian 与力矩上限,逐笛卡尔轴求出施力可行区间(Eq. 3-4),保证课程后期力增大也不会让关节力矩超限。
- 力课程饱和现象:训练中观察到力课程在 α_g≈0.6 附近饱和,因为力矩限制频繁触发,阻止课程进一步提升(Figure 3a 的实证发现)。
- 消融验证的两条关键设计:①去掉力矩可行性感知的课程(用固定宽范围 X:[-100N,100N]、Y:[-100N,100N]、Z:[-100N,5N] 随机采样)会让策略在大力下过拟合运动目标、牺牲上肢精度;②力课程范围放宽(Table 2 的宽范围)对性能影响很小,说明力矩可行性感知比范围大小本身更重要。
- 消融基线设计(用于对比 FALCON 的效果,均在同一目标空间与力课程下训练):Upper-PD-w/o-Force-Curr.、Upper-PD(+力课程)、Upper-PID(+积分项)、Upper-PD-ID(+学习式力估计器 + 准静态逆动力学力矩补偿,附录 A.3);Monolithic-WB-RL 的 w/o-Force-Curr. 与 with-Force-Curr. 两个变体。
- 训练迭代规模(GitHub 训练脚本注明):G1 与 T1 均约 6k 迭代后即可部署;两个机型的训练配置(
+exp=decoupled_locomotion_stand_height_waist_wbc_diff_force_ma_ppo_ma_env)几乎相同,仅调整少量任务超参(如 T1 的feet_height_target、desired_base_height=0.62、上下肢 action-rate 惩罚权重),体现”无需逐机型改 reward/课程”的跨平台可复用性。
Infra(训练 / 推理工程)
- 仿真器:NVIDIA IsaacGym Preview 4,训练时 4096 个并行环境(GitHub 训练命令
num_envs=4096,G1 与 T1 一致)。 - GPU 型号 / 训练时长 / 总算力:论文正文与附录未披露具体 GPU 型号、GPU 数量或训练总时长(仅知 ~6k 迭代收敛,走 wandb 记录)——未披露。
- 推理/控制频率:论文未给出具体部署 Hz 数值——未披露(HOMIE 等同代码基座工作部署在 50 Hz,但本文未明确说明是否沿用)。
- 真机硬件限制(附录 A.6,属于本文独有的工程发现):真实 G1 长时间高力矩输出会导致电机(尤其腕部)过热,限制单臂负重上限约 2kg(默认关节位置下);同一策略在 MuJoCo 仿真中(仅做力矩裁剪、未建模电机热特性)可在 -1 m/s 线速度指令下稳定搬运单臂 3kg 以上负载,说明仿真与真实执行器热耐受度存在明显 gap。对拉车等短时高力矩任务,因无需持续高输出,真机可正常完成。
- 自主流水线感知栈:FoundationPose(6-DoF 物体位姿估计,需先对目标物体做 3D 扫描 + 建 .obj/纹理模型)+ 动作捕捉(MoCap)系统做机器人/桌面全局定位 + IK 抓取规划,四态状态机(空手走、原地抬箱、负重走、原地放箱)。
评测 benchmark
IsaacGym 仿真评测(Table 1,Unitree G1,252 条 ACCAD 动作,三档外力 N/M/L-Force,指标为上肢关节跟踪误差 E_upper 与根速度跟踪误差 E_root,越低越好):
| 方法 | E_upper N-Force | M-Force | L-Force | E_root N-Force | M-Force | L-Force |
|---|---|---|---|---|---|---|
| Upper-PD-w/o-Force-Curr. | 0.46 | 0.94 | 1.44 | 0.38 | 0.66 | 1.14 |
| Upper-PID-Force-Curr. | 0.24 | 0.31 | 0.60 | 0.32 | 0.35 | 0.46 |
| Upper-PD-ID-Force-Curr.(力估计器+逆动力学) | 0.29 | 0.38 | 0.53 | 0.40 | 0.42 | 0.47 |
| Monolithic-WB-RL-with-Force-Curr. | 0.43 | 0.50 | 0.73 | 0.28 | 0.32 | 0.44 |
| FALCON-with-Force-Curr. | 0.21 | 0.24 | 0.37 | 0.27 | 0.30 | 0.45 |
大力档(L-Force)下 FALCON 上肢误差 0.37,优于 Upper-PID(0.60)与 Monolithic-WB-RL(0.73),根速度误差 0.45 保持稳定——对应摘要所称”2× 更精确的上肢跟踪”。
力矩可行性课程消融(Table 2):去掉力矩可行性感知后,L-Force 下上肢误差从 0.36 恶化到 0.61;力课程范围大小消融(Table 3):把力裁剪范围从窄(±50N)放宽到宽(±100N)几乎不影响性能(0.36 vs 0.37),说明力矩可行性感知比范围本身更关键。
探索效率对比(Figure 4,定性):FALCON 的动作噪声标准差比 Monolithic-WB-RL 衰减更快更平滑(探索收敛更快);Monolithic-WB-RL 因躯干/踝关节过度补偿出现明显姿态畸变(不自然弯腰、CoM 偏移)。
真实世界定量跟踪(Table 4,Unitree G1 双手各绑 1.2kg 负载,行走 0.5 m/s 直线):
| 方法 | E_upper | E_root |
|---|---|---|
| Upper-PD-Force-Curr. | 1.81 | 0.40 |
| Monolithic-WB-RL-Force-Curr. | 0.81 | 0.58 |
| FALCON | 0.39 | 0.42 |
真实世界定性部署:Unitree G1 与 Booster T1 上无需改 reward/课程即可完成三类任务——搬运负载(0-20N 竖直力)、拉车(最高 100N 纵向力)、开门(最高 40N 三维力);另有自主全流程仓储 tote 物流任务演示(走-拾-走-放)。论文未报告成功率百分比等严格统计口径的真机指标,仅提供定性视频与力计实测峰值。
创新点与影响
- 提出**双智能体(非完全解耦、非单体)**这一第三条人形全身操作范式:两个策略共享全身本体感知联合训练但各自独立优化目标,兼顾 Lower-RL-Upper-IK 的样本效率与 Monolithic-WB-RL 的协调表达力。
- 力矩限制可行性感知的 3D 力课程是本文核心工程贡献:把”训练时该给多大外力”从随机猜测变成基于 Jacobian + 力矩上限的解析可行区间采样,显著提升大力工况下的上肢跟踪精度,且对课程范围大小不敏感(鲁棒)。
- 证明同一套训练配方(reward/课程几乎不改)可跨 Unitree G1 与 Booster T1 两种不同形态/驱动的人形机器人复用,为后续人形负重全身操作研究提供了可复现的开源代码基座(建立在 ASAP + HumanoidVerse 之上,训练/sim2sim/sim2real 代码均已开源)。
- 作者自陈局限(原文 Limitations):①仅处理施加在末端执行器上的力,未建模身体其它部位的接触力,不支持倚靠、支撑、协作搬抬等多接触交互场景;②力课程只考虑外力,忽略外力矩,因此在需要抵抗偏心加载的任务(如开阀门、拧工具)中可能表现不佳。附录另指出真机电机热限制(长时间高力矩腕部过热,限制单臂负重约 2kg)是仿真未建模、实际部署中观察到的额外差距。
原始链接
- arXiv: https://arxiv.org/abs/2505.06776 (PDF: https://arxiv.org/pdf/2505.06776)
- 项目页(含 L4DC 2026 Oral 标注、全部演示视频、IEEE Spectrum 报道链接): https://lecar-lab.github.io/falcon-humanoid/
- GitHub(训练/sim2sim/sim2real 代码,基于 IsaacGym Preview4 + HumanoidVerse): https://github.com/LeCAR-Lab/FALCON
- 演示视频: https://www.youtube.com/watch?v=OfsvJ5-Fyzg
一手源存档(sources/)
- falcon—github-readme — GitHub README 快照,含训练命令行超参、6k 迭代收敛说明(sources/embodied/2025/falcon—github-readme.md)
- falcon—project-page — 项目页快照,含摘要、方法概述、L4DC 2026 Oral 与视频清单(sources/embodied/2025/falcon—project-page.md)
- 论文全文见上方 arXiv 链接(arXiv 原文 PDF,不入 git)