一句话定位

UC Berkeley(BAIR,Malik / Sreenath 组)把因果 Transformer 当作全尺寸人形机器人(Agility Digit)的运动控制器:以本体感受观测-动作历史为输入自回归预测下一动作,纯仿真里用大规模无模型 RL 训练、零样本迁移到真机,一周户外全天测试零跌倒——这是第一篇把 Transformer 序列建模 + in-context 适应用于真实全尺寸人形 locomotion 的奠基工作。

背景与定位

论文属于 sim-to-real + domain randomization 这一支腿式运动学习范式(Tobin 2017、Peng 2018)。此前腿足运动学习的主流是两条路线:一是记忆网络(LSTM,如 Cassie/Digit 双足工作 Siekmann-Hurst)直接吃历史;二是显式估计器从 TCN 特征回归环境属性(Lee 2020 四足越野、rma-rapid-motor-adaptation Kumar et al. RMA,同组 Malik)。本文的核心假设换了个角度:观测-动作历史本身隐式编码了”世界”的信息,一个足够强的 Transformer 可以在 context 窗口内自行做 in-context 适应,无需更新权重——类比 GPT-3(Brown et al.)的少样本 in-context learning,把”desired vs actual state 的历史”当作可推理的上下文。

定位上它区别于:经典/优化控制(Boston Dynamics Atlas 的后空翻、跳跃靠 model-based trajectory optimization,泛化难)、小型人形 RL(Rodriguez-Behnke DeepWalk)、以及 model-based + RL 混合的全尺寸人形控制。作者明确把 Transformer 的可扩展性(Kaplan scaling laws、可加多模态如 Flamingo)当作未来把人形控制”scale up”的理由。它是同组次年 humanoid-next-token-prediction(Humanoid Locomotion as Next Token Prediction, 2024) 的直接前身。硬件平台是 Agility Robotics 的 Digit 人形。

范式命名:causal-transformer sequence-modeling policy + massively-parallel sim RL + zero-shot sim-to-real(proprioceptive / blind)

模型架构

策略主干(EMB 视角):一个因果 Transformer,输入为长度 l 的观测-动作对历史轨迹 o_t, a_{t-1}, o_{t-1}, a_{t-2}, ..., o_{t-l+1}, a_{t-l},输出下一动作 a_t。每个”观测-动作对”编码为一个 token。

  • Token 化 / encoder:用 MLP 把每个观测-动作对嵌入到特征空间(输入投影 MLP 隐藏层 [512, 512]);加正弦位置编码表示 token 在序列中的时间位置。
  • Attention:多头自注意力,标准 softmax(QKᵀ/√d_k)V因果 mask只允许注意到前序 token(GPT 式),从而具备 in-context 能力。
  • Transformer 配置4 个 block,embedding 维度 192,注意力头 4 heads,MLP ratio 2.0
  • Action head:动作预测用 MLP,隐藏层 [256, 128]
  • 规模全模型 1.4M 参数context window = 16
  • Teacher(state policy):一个 MLP,隐藏层 [512, 512, 256, 128]

动作空间(action head 细节):连续控制。动作 = 16 个受驱关节的 PD 目标位置(setpoint) + 8 个受驱腿关节的预测 PD 增益4 个脚趾电机不由策略控制——设为默认位置、用固定 PD 增益(model-based 控制常用做法)。真机上策略以 50 Hz 输出、底层关节 PD 控制器 1 kHz。

机器人本体(Digit):Agility Robotics 通用人形,约 1.6 m 高、45 kg,浮动基座 30 自由度:每臂 4 个受驱关节、每腿 8 关节(其中 6 个受驱)。被动关节(shin、tarsus)通过板簧 + 四杆机构连接,toe 关节由 tarsus 处的连杆驱动——即闭链 + 欠驱动结构,是仿真的难点。

记忆/一致性:不用显式状态估计器,靠 Transformer 的 context(长度 16)做隐式记忆与 in-context 适应;策略是”盲”的(仅本体感受,无相机/外部感知)。

数据

本工作没有离线数据集——数据全部来自仿真中的 on-policy RL 采样

  • 规模:项目页披露”约一天内采集 order of 10 Billion(约 100 亿)样本”(IsaacGym 多 GPU、数千并行环境)。
  • 来源 / 混合:仿真环境为随机化 ensemble。地形类型混合:光滑平面、粗糙平面、光滑斜坡(训练斜坡最高 10% 坡度)。指令混合:前进、侧移、转向及其组合,固定间隔重采样(训练时每 10 秒采一次命令),小于阈值的命令截断为 0。
  • 动作标注 / curation:无需预计算轨迹或步态库(no gait library、no reference trajectory);reward 借鉴人类行走生物力学、含能量最小化项、trial-and-error 调出。
  • sim-vs-real:训练全在 IsaacGym;随后在 Agility 高保真仿真器里过滤不安全策略(该仿真器能精确建模闭链结构 + 传感器噪声,仅做筛选、不改网络参数);最后上真机。真机零样本,户外地形属性训练时未见过。
  • domain randomization:机器人动力学属性、控制参数、环境物理,以及给观测加噪声与延迟。作者强调”动力学 + 地形 + 延迟”随机化的组合是高质量 sim-to-real 的关键。

训练方法

两阶段 teacher-student pipeline(图 7A):

  1. Teacher state policy π_s(a_t|s_t):假设环境完全可观,用 MLP + RL 在状态空间训练。作者发现直接在观测空间做 RL 慢且样本效率低,故先训 state policy(快、省资源),并在此阶段调 reward(如 gait 参数)。

  2. Student observation policy π_o:把 teacher 蒸馏到观测策略,同时联合 RL。目标函数:

    L(π_o) = L_RL(π_o) + λ · D_KL(π_o ‖ π_s)

    其中 λ 是 state-policy 监督权重,沿训练过程退火到 0,通常在训练 horizon 中点归零——早期靠 teacher 引导、后期让 student 超越 teacher。整个过程 on-policy,不需要任何预计算轨迹或离线数据集

RL 算法PPO(Schulman 2017),actor-critic,actor 与 critic 不共享权重

动作 tokenization:观测-动作对 → MLP 嵌入 → token;连续动作头(非离散 token)。

仿真关键技巧——闭链建模:IsaacGym 无法有效建模 Digit 的 knee-shin-tarsus / tarsus-toe 闭链欠驱动。作者引入高刚度”虚拟弹簧”模型代表连杆,按弹簧偏离标称长度算出的力施加到刚体;再用交替仿真子步(alternating sub-step)方法快速把虚拟弹簧长度校正回标称值——这套近似让 sim-to-real 可行。

关键超参:context 16、PD setpoint + 预测 PD 增益动作、策略 50 Hz / PD 1 kHz、训练斜坡 ≤10%。

Infra(训练 / 推理工程)

  • 训练硬件4 张 A100 GPU,数千个随机化并行环境(IsaacGym GPU 仿真)。
  • 训练吞吐 / 时长:约一天采集 ~100 亿样本(项目页披露)。GPU-hours 未单独披露。
  • 并行 / 精度:massively parallel GPU 仿真 + 多 GPU 数据并行;精度未披露。
  • 推理 / 部署:真机上神经网络策略 50 Hz底层关节 PD 控制器 1 kHz;通过 Agility Robotics API 读取关节编码器与 IMU。边缘硬件具体型号未披露(运行在 Digit 板载计算上)。策略”盲”运行,无相机/外部感知,因此计算负载低。

评测 benchmark

全部结果来自论文一手实验(真机 + 仿真):

  • 户外部署:一周全天户外测试,走遍广场、人行道、跑道、草地等,未观察到一次跌倒,且无需安全吊架。
  • 实验室鲁棒性
    • 外力扰动:抛瑜伽球、木棍推、从背后拉——均能稳住。
    • 粗糙地形:命令 0.15 m/s,地面铺橡胶、布、电缆、气泡膜,全部通过;两段斜坡最高 8.7% 坡度(训练见过 ≤10%),更高速度(0.2 m/s)时更鲁棒。
    • 负载:5 组(空背包、满载背包、布手袋、满载垃圾袋、纸袋)全部完成路线;即使满载垃圾袋挂臂(策略依赖臂摆平衡)也能适应。
  • 对比 SOTA(Agility 官方控制器):在 Agility 高保真仿真器里,3 场景(斜坡、台阶、不稳定地面),成功=不跌倒穿越,报告 10 次运行的平均成功率 + 95% CI。斜坡上两者都好;台阶上本文明显胜出(官方控制器脚被卡后自动关机;真机复现一致,Movie 2);不稳定木板地面本文大幅领先(真机未测以免损坏硬件)。注意台阶未在训练中出现,恢复行为是 emergent。
  • 快速行走:命令 1 m/s,从静止 1 秒内达到并准确跟踪。
  • 涌现行为:contralateral 人类式臂摆(reward 未显式约束,含能量项,或暗示节能);随地形渐变的步态切换脚被卡后抬腿更高更快的恢复(台阶未训练过)。
  • 神经活动分析:把最后一层 192 维隐藏态用 PCA + t-SNE 投到 2D,按地形清晰聚类;部分神经元与步态/地形相关,foot-trapping 事件时激活有明显 spike。
  • 消融(图 8,控制变量、各自调超参):
    • (A) 架构:MLP / TCN / LSTM / Transformer 对比,Transformer 明显最优(3 场景 30 试的平均成功率 + 95% CI)。
    • (B) context 长度:更长 context 更好(1 m/s 走两段斜坡,20 试平均线速度 + 95% CI)。
    • (C) 训练目标:imitation + RL 联合 > 单用任一项

创新点与影响

贡献

  1. 首次证明因果 Transformer 序列策略可作真实全尺寸人形的 locomotion 控制器,纯仿真训练零样本上真机、稳定户外行走。
  2. in-context learning(GPT-3 式、不更新权重)引入腿式控制——用观测-动作历史做隐式在线适应,替代显式状态估计器(RMA/TCN)或 LSTM。
  3. 一套可复用的 teacher(state)-student(observation) + KL 退火 + PPO 联合目标 pipeline,配合 IsaacGym 闭链”虚拟弹簧”近似解决 Digit 欠驱动仿真。
  4. 系统展示涌现行为(臂摆、步态切换、脚卡恢复)并做神经活动可解释性分析。

改变了什么:为”把 locomotion 当序列建模 / 用 Transformer scale 人形控制”开了头,直接催生同组 2024 年 humanoid-next-token-prediction,并影响后续一批 Transformer/decision-transformer 式腿足与人形控制工作。

作者自述局限

  • 策略不完全对称(两侧电机轨迹不同,向左横移比向右好)。
  • 速度跟踪不完美。
  • 过强外部扰动(如很强的拉拽电缆)仍会让机器人跌倒。
  • IsaacGym 不支持精确欠驱动仿真,只能用近似,未来需改进仿真器。

原始链接

一手源存档(sources/)

  • real-world-humanoid-locomotion-rl—project-page — 项目页快照(sources/embodied/2023/real-world-humanoid-locomotion-rl—project-page.md,含 abstract、“~100 亿样本/天”披露、BibTeX)
  • arXiv 全文 PDF(2303.03381,arXiv 原文 PDF,不入 git),正文数字已抠入本页;引用见上方 arXiv 链接