一句话定位

把「物理仿真动作跟踪(motion tracking)」当成人形机器人控制的可扩展基础任务,沿数据(700 小时 / 100M+ 帧)、模型(1.2M→42M 参数)、算力(128 GPU)三个轴一次性放大,训出单一通用策略在 Unitree G1 上自然、鲁棒地做全身运动;再用一个统一 token 空间把机器人动作、人体动作、混合遥操作、视频/文本/音乐、乃至 VLA(groot-n1 N1.5)全接到同一个策略上——不需要为每个技能重新设计奖励,也不用蒸馏。

背景与定位

SONIC 属于「从人类动捕数据学人形全身控制」这条线(humanoid motion imitation / whole-body control),直接对标 gmt(GMT)、beyondmimic(BeyondMimic)、Any2Track 这批「统一策略跟踪多样动作」的工作,也承接 asap(ASAP,敏捷技能 sim-to-real)与 homie(HOMIE,外骨骼遥操作)的真机路线。

作者在引言里给出的核心论点是一个反差:GPT 家族在 2.5 万+ GPU、万亿 token 上训练,图像/视频生成模型也在数千 GPU、数十亿图像上放大,规模一直在解锁涌现能力、泛化与鲁棒性;但人形控制没享受到 scaling——SOTA 控制策略通常是几百万参数的三层 MLP、单 GPU 训几天、只做单一任务,甚至因为每个任务都要手工设计奖励项,训久了反而更差。

SONIC 的判断是:卡点在任务选择。定位(locomotion)这类任务需要为每个场景做奖励工程,「自然地往前走」对跳舞、从地上爬起来、遥操作几乎没有监督信号。解法是把 motion tracking 提为那个「可扩展基础任务」——它天然从动捕数据拿到逐帧稠密监督,不需要奖励工程,而 walking/running/dancing/sports/物体交互的动捕数据早已成规模存在。第二个卡点是如何支持多样的真实应用(遥操作、目标导向任务、导航、视觉-语言指令),SONIC 用一个通用 token 空间统一各种输入接口来解决。

范式命名:Supersizing motiOn tracking for Natural humanoId Control(SONIC)——把物理动作跟踪放大到前所未有的 1 亿帧 / 128 GPU,得到「universal tracker」,并把它当作全身控制的behavior foundation model(行为基础模型 / System 1 快反射控制器),上面再叠 VLA 的 System 2 慢推理。

模型架构

整套系统由三块组成:通用控制策略(universal control policy,即 tracker) + 生成式运动学规划器(kinematic planner,即 MotionBricks) + 多模态动作生成模型(GENMO / GEM)。核心创新在 tracker 的 encoder-decoder + 量化 token 设计。

通用控制策略(policy backbone)——一个 encoder-decoder 架构,把机器人动作、人体动作、混合动作三种异构指令编码进共享隐空间,量化成一个 universal token,再由公共解码器输出电机指令:

  • 三个专用编码器(都是 MLP,hidden [2048,1024,512,512]):
    • robot motion encoder E_r:编码机器人关节位置/速度,未来 F_r=10 帧、帧间隔 Δt_r=0.1s
    • human motion encoder E_h:编码 SMPL 3D 人体关节位置,未来 F_h=10 帧、帧间隔 Δt_h=0.02s
    • hybrid motion encoder E_m:编码当前帧稀疏上半身关键点(头+双手,用于实时上半身跟踪)+ 未来 F_m=10 帧下半身机器人动作。多帧输入带来预判(anticipatory)行为并提升鲁棒性。
  • 量化器:用 FSQ(Finite Scalar Quantization, Mentzer 2023)把隐表示量化成 universal token z——D_z 维、每维 L_z 个量化级。GitHub 模型卡披露实际 token 为 64 维
  • 两个解码器:robot control decoder D_c(MLP [2048,2048,1024,1024,512,512],输出对角高斯、动作维 = 29,对应 G1 的 29 个关节)把 token 变成电机指令;robot motion decoder D_r(MLP [2048,1024,512,512])重建机器人动作指令,作为辅助监督兼隐式 retargeting 模块(人→机器人)。Critic 也是 [2048,2048,1024,1024,512,512] 的 MLP。
  • 动作输出:策略输出目标关节角,由每个关节的 PD 控制器跟踪。状态 = 本体感知 s_p(关节位姿/速度、根角速度、重力向量、上一动作)+ 动作指令 s_g(robot/human/hybrid 三型),全部表达在机器人局部朝向坐标系以保证旋转不变。

这套设计的意义:同一个策略、同一套权重能接受来自不同 embodiment(人 vs 机器人)与不同接口(gamepad/VR/视频/文本/音乐/VLA)的指令,靠 token 对齐把它们映射到同一表示,天然支持 cross-embodiment 跟踪(把估计出的全身人体动作直接映射为控制信号,绕过显式 retargeting)。

生成式运动学规划器(MotionBricks)——大规模隐空间生成模型,和 tracker 用同一套动捕数据训练。把交互控制形式化为自回归 motion in-betweening:上下文关键帧是历史机器人状态,目标关键帧来自用户命令(速度/方向/风格)或技能特定目标(蹲/爬/拳击)。连续动作先编码为隐 token 序列(encoder 下采样率 4),backbone(Transformer 或 Conv1D)用 masked token prediction(MaskGIT 式,推理走 cosine schedule 迭代确定高置信 token)在两端关键帧约束下生成中间段。每个规划步生成 0.8s–2.4s 的动作段,时长由网络自动决定;根轨迹用临界阻尼弹簧模型平滑不合理命令(位置阻尼 5ln2、朝向 20ln2)。GitHub README(MotionBricks 子项目)称可达 15,000 FPS 的零样本动作合成(此数字出自 README,非项目页)。

多模态动作生成模型(GENMO / GEM)——把「从视频估计」当成受约束的生成:temporal transformer 做 motion token 到多模态条件 token 的 cross-attention 融合,一个扩散式动作先验从高斯噪声去噪到运动学合理轨迹;文本/音频/视频编码器各自成流,缺失区间用 mask token 原生处理。生成的人体动作被编码进同一 universal token 空间,单一 decoder 服务多种下游 embodiment。用滑窗+重叠+ inpainting 保证低延迟连续生成;模型转 TensorRT 加速。

数据

训练主语料(in-house,论文主实验用):

  • 700 小时人体动捕,共 1 亿+ 帧 @ 50Hz
  • 170 名受试者,男女均衡,身高 145–199 cm(均值 174.3、标准差 10.9,近正态);
  • 覆盖 locomotion、日常活动、手势、以及大量风格化格斗动作;单段时长 1–180 秒;数千种独特动作行为,多数动作由多名受试者多次采集,提供丰富的类内/类间变化;
  • 人体动作用 GMR(General Motion Retargeting, Araujo 2025)retarget 到 Unitree G1。

scaling 实验用的数据集分档: LaFAN(0.4M 帧)→ in-house 子集(7.4M 帧)→ 全量(100M 帧),用于测数据规模对跟踪误差的影响。

评测集(关键:完全 held-out): retargeted AMASS 的均匀随机子集,9 小时、1,602 条轨迹(与 TWIST 同源)。作者强调 SONIC 不在 AMASS 上训练,此评测集比多数先前工作大几个数量级、甚至与一些工作的训练集规模相当,以此凸显泛化。

开源复现数据(GitHub 披露,与主语料不同): Bones-SEED(huggingface.co/datasets/bones-studio/seed),14.2 万+ 条人体动作、约 288 小时、已 retarget 到 G1(含 MuJoCo 轨迹),是放出来给社区从零训练/微调 SONIC 的开放子集——注意它并非论文主实验那份 700 小时 in-house 语料。

VLA 数据: 用 VR 3-point 遥操作接口采集 300 条「移动抓取-放置」示范(走到桌上随机位置的苹果、右手抓取、放到随机位置的盘子里),作为下游 VLA 监督。

训练方法

目标函数(单阶段、无蒸馏): L = L_ppo + L_recon + L_token + L_cycle

  • L_ppo:标准 PPO(Schulman 2017),把跟踪问题当 MDP,最大化折扣累积回报;
  • L_recon:三种输入模态各自的机器人动作重建损失 ‖D_r(z_r)−g_r‖² + ‖D_r(z_h)−g_r‖² + ‖D_r(z_m)−g_r‖²——当输入是人体动作 g_h 时,encoder-decoder 就充当人→机器人的 retargeting 管线,此项即 retargeting loss,是 cross-embodiment 迁移的关键;
  • L_token = ‖z_r − z_h‖²:显式拉近机器人 token 与人体 token,强制跨 embodiment 表示对齐;
  • L_cycle = ‖E_r(D_r(z_h)) − z_r‖²:循环一致性,人→机器人→再编码回来要保住原 token。

奖励设计(Table 1,跟随 BeyondMimic): 跟踪项 R(根朝向 w=0.5、body link 相对位置 w=1.0、相对朝向 w=1.0、线速度 w=1.0、角速度 w=1.0,均为 exp(-‖·‖²/σ²) 形式,朝向用 6D 表示)+ 惩罚项 P(action rate −0.1、关节限位 −10.0、非期望接触 −0.1)。

自适应采样: bin-based adaptive motion sampling——把数据集按固定时长分 bin,按各 bin 失败率 f_i 采样,失败率上限 capped 到 β·f̄(β=200),最终概率 p_i = α·p̂_i + (1−α)/N(α=0.1)在「专攻难 bin」与「均匀覆盖」间平衡。初始帧在选中 bin 内均匀采样。

域随机化(Table 2): 静摩擦 U[0.3,1.6]、动摩擦 U[0.3,1.2]、恢复系数 U[0,0.5]、默认关节位 ±0.01、base COM 偏移,周期性对根线/角速度施加外推(模拟推搡,持续 1–3s),并对目标动作指令加 jitter 提升鲁棒。

关键超参(Table 4): 每 GPU 4096 并行环境、每环境 24 步、5 epoch、4 minibatch、γ=0.99、GAE λ=0.95、clip 0.2、entropy 系数 0.013、actor lr 2e-5、critic lr 1e-3、max grad norm 0.1、desired KL 0.01、自适应 lr [1e-5, 2e-4]。所有模型在 Isaac Lab 上训练,训到收敛(3–7 天)。

成功判据(scaling 实验): 跟踪中任意时刻机身高度偏离参考 >0.25m 或根朝向偏离 >1 rad 即判失败。

scaling 结论: 沿数据、模型、算力任一轴放大都稳定提升跟踪性能;其中扩大动作数据集收益最大,模型规模与算力次之。GPU 并行度很关键——8 GPU 的渐近性能明显差于 128 GPU(不是简单的「时间换卡」)。

Infra(训练 / 推理工程)

训练: 仿真平台 Isaac Lab(2.3.2);旗舰模型 128 GPU、训练 3 天。算力口径在原文里出现三处不一致,需明示:arXiv v1 摘要与贡献列表写「9k GPU hours」(≈ 128 GPU × 3 天 × 24h = 9,216,自洽),正文 §2.1 写「32,000 GPU hours(128 GPUs over 3 days)」,项目页摘要写「21k GPU hours」——本页以「128 GPU × 3 天 ≈ 9k GPU-hours(旗舰主训练)」为准,另两值并列记录。scaling 实验分别用 8 / 32 / 128 GPU。GPU 型号未披露。模型参数从 1.2M 扩到 42M

部署 / 推理(全部 onboard):

  • 运行在 Unitree G1 板载 Jetson Orin GPU,用 TensorRT + CUDA Graph 加速;
  • 策略前向 1–2 ms/次,运动生成前向 12 ms/次;规划器在普通笔记本上 <5 ms、Jetson Orin 上 12 ms
  • 多进程多频率解耦:策略环 50 Hz、低层 PD 指令流 500 Hz(经 Unitree low-level API,不阻塞策略环)、用户输入 100 Hz、运动学规划器 10 Hz;采用「latest-data-wins」快照约定抑制抖动;
  • 遥操作实测(右手腕,300 条轨迹,均在腰部坐标系):目标→实现的平均延迟 121.9 ms平均位置误差 6 cm(p95 13.3 cm),平均朝向误差 0.145 rad ≈ 8.32°(p95 0.267 rad ≈ 15.31°)。注意模型卡强调「lookahead(默认 ~200ms / 低延迟档 ~80ms)」只是参考前瞻窗,不等于端到端遥操作延迟。
  • 交互能力区间:导航速度 0–6.0 m/s、方向 0–360°;骨盆高度可平滑控制 0.3–0.8 m(蹲/跪);爬行全向 0–0.5 m/s;规划器重规划最快每 100 ms(或命令更新即刻触发)。

发布: 两个 G1 checkpoint(默认档 = 10 帧 @20ms ≈ 200ms 前瞻;低延迟档 = 4 帧 @20ms ≈ 80ms 前瞻),均为 64 维 universal token、50 Hz、支持 SMPL/G1/VR-3点输入;部署走 C++ + TensorRT,PyTorch checkpoint 供 Isaac Lab 评测与续训。代码 Apache-2.0,权重 NVIDIA Open Model License。

评测 benchmark

动作跟踪(仿真,held-out AMASS 9h / 1602 条): 指标为 Succ(跟踪成功率)、根相对 MPJPE(mm)、加速度误差 E_acc、速度误差 E_vel。与 SOTA tracker Any2Track、BeyondMimic(均在 LaFAN 上训)、gmt GMT(在 AMASS 上训) 对比,为公平统一在 MuJoCo 评测(放宽判据:仅当机身相对参考掉高 >0.25m 才算摔倒/失败)。结论:SONIC 在所有指标上(成功率与各项跟踪精度)显著优于全部 baseline——具体数值以 Fig. 2(d–g) 曲线呈现,正文未给数字表。同图的 scaling 曲线(Fig. 2 a–c)以 MPJPE 展示数据/模型/算力三轴单调提升。

真机跟踪: 部署到 50 条多样轨迹(舞蹈、跳跃、loco-manipulation),真机结果与仿真高度一致,零样本 100% 成功(无一失败)

VLA 驱动的移动双手操作(proof-of-concept): 用 300 条 VR 遥操作数据微调 groot-n1 GR00T N1.5,在「苹果→盘子」移动抓放任务上 20 次试验 95% 成功。VLA 输出遥操作格式指令(头+双腕位姿、腰高、导航命令),喂给运动学规划器+hybrid encoder,再由通用策略执行——验证 tracker 作为 System 1 快反射控制器可与 VLA 的 System 2 慢推理互补。作者明确说明此实验只为证明「VLA 规划器 ↔ 跟踪控制器」的兼容性,不主张广义泛化

创新点与影响

贡献:

  1. 提出 motion tracking 为人形控制的可扩展基础任务——首次在人形控制上展示与算力、数据多样性/规模一致对齐的 scaling trend,把训练放大到 ~9k GPU-hours、1 亿帧、42M 参数,得到覆盖多样人类行为的 universal tracker,并对未见动作零样本迁移。
  2. universal token 空间 + 单阶段(无蒸馏)跨 embodiment 训练——robot/human/hybrid 三编码器 → FSQ token → 单一策略,用 L_recon/L_token/L_cycle 把人体动作与机器人动作在隐空间对齐,天然做隐式 retargeting,一套接口同时支持 gamepad、VR 3-point、全身 VR、视频遥操作、文本/音乐控制、以及 VLA。
  3. **实时运动学规划器(MotionBricks)**把「意图」变成短时参考动作,实现无需重训的响应式导航、姿态模式(蹲/跪/爬)、风格调制;对接 VLA 基础模型给出完整「大规模跟踪 → 基础模型驱动人形」的闭环 pipeline。

改变了什么: 相对 Any2Track/BeyondMimic/GMT 三点——(1) scale:训练与未见评测集都大几个数量级;(2) versatility:机器人/人/混合指令共享隐空间,支持 cross-embodiment 与多样接口;(3) practicality:G1 上板载实时 sim-to-real,在统一评测协议下性能更强。把 motion tracking 从「窄域模仿」推向「全身控制的通用基础」。

作者自陈局限: 尚未正式处理长期部署下的安全性、柔顺性、能效,以及部署时的噪声输入;VLA 实验仅为兼容性验证、非广义泛化;未来工作包括在更多样数据上研究 scaling law、做 VLA 指令的全身 loco-manipulation、以及联合训练规划器/tokenizer/策略以缩小模态间隙。

原始链接

一手源存档(sources/)