一句话定位
一个分层的人形视觉 loco-manipulation 框架:任务无关的低层关键点跟踪器(从人类动捕数据 teacher-student 蒸馏而来)负责全身平衡与动作自然度,任务相关的高层策略只看自我中心深度视觉 + 本体感知就能生成关键点指令,两层都纯 sim 训练、零样本部署到真机 Unitree G1,做推箱子、抬箱子、踢箱子、盘球等全身物体交互。
背景与定位
人形 loco-manipulation 现有三条路子各有短板:纯 locomotion 方法(地形穿越)不管物体交互;依赖外部动捕做物体状态估计的方法(如 Hitter,arXiv:2508.21043)只能在实验室里用;纯视觉方法又分两派——模仿学习(如 amo、homie 一类遥操作数据)受限于示范数据稀缺,泛化差;视觉 sim-to-real RL 更鲁棒但目前只能做简单交互,如 VideoMimic(Allshire et al., arXiv:2505.03729)的坐下、爬楼梯。VisualMimic 想在”视觉 sim-to-real RL 做复杂物体交互”这条线上往前走一步。
范式与同期工作的关系:VisualMimic 的低层关键点跟踪器训练管线(teacher 拿未来 2 秒参考帧、特权本体感知;student 蒸馏成只用即时关键点指令)与 twist(同一批作者 Yanjie Ze / C. Karen Liu / Jiajun Wu)、gmt 高度同源——都是”teacher-student + 关键点/局部坐标接口”的人形全身控制配方;区别在于 TWIST 面向实时遥操作闭环,VisualMimic 面向”视觉驱动的自主任务策略”,在跟踪器之上再叠一层任务专属的高层视觉策略。论文 Table I 把自己和 TWIST、VideoMimic、Hitter、Lin et al. 的 Recipe(arXiv:2502.20396)、HEAD(Chen et al., CoRL 2025)做了对比,称自己是唯一同时具备”全身灵巧 + loco-manipulation + 视觉策略”三项的方法。动作重定向用 GMR(Ze et al. 开源工具,github.com/YanjieZe/GMR)把 AMASS 与 OMOMO 动捕数据集重定向到人形关节空间,这与 twist、gmt 的数据管线一致。
模型架构
整体分层:低层任务无关关键点跟踪器 π_tracker + 高层任务相关视觉关键点生成器 π_generator,均为纯仿真训练、零样本迁移到真机;分层设计让新任务只需重训高层。
低层:General Keypoint Tracker(两阶段 teacher-student)
- Teacher motion tracker π_tracker^tea:3 层 MLP,PPO 训练(Schulman et al. PPO + Rudin et al. IsaacGym 并行仿真配方)。输入未来 2 秒参考动作序列 + 特权本体感知(如脚底接触力),奖励 r_motion = r_track + r_penalty(跟随 TWIST 的奖励结构),在世界坐标系(非局部系)下跟踪机器人躯干位置和根速度。
- Student keypoint tracker π_tracker^stu:DAgger 蒸馏,同样是 3 层 MLP,只用本体感知 + 即时关键点指令 c_t^kp。关键点指令定义为 6 点接口:根位置误差 Δp_t = p_t^des − p_t^cur,加上头、双手、双脚共 5 个关键点相对根的误差 Δx_t^i(i=1..5),即 c_t^kp = [Δp_t, Δx_t^1, …, Δx_t^5](式 1–3)。消融显示把这个接口换成”3 关键点(仅上半身)“会在 Balance Ball 任务里完全学不会用脚(网站视频证实);换成 23-DoF 关节角接口(“DoF as Interface”)在 Push Box / Kick Box 上明显更差、Kick Ball 完全学不会(见评测)。
高层:Task-Specific Keypoint Generator(两阶段 teacher-student)
- Teacher state-based generator π_generator^tea:3 层 MLP + PPO,输入 = 任务物体状态(特权)+ 本体感知,任务奖励包括 Approach(单点/双点接触,双点用调和平均)、Forward(物体前向位移,tanh 饱和)、Force(施力是否达阈值 F_des)、Look-at-object(正对目标)、Drift(侧向偏移惩罚)等(式 4–9)。
- Student visuomotor generator π_generator^stu:DAgger 蒸馏,只用深度图像(CNN encoder)+ 本体感知(不用 RGB,因 RGB sim-to-real gap 大)。直接用视觉 RL 训练高层策略效率极低(物体状态部分可观 + IsaacGym 接入视觉后仿真显著变慢),故必须走 teacher-student 两段式。
训练稳定性的两个关键技巧(Human Motion Space, HMS):
- 低层 student 训练时对关键点指令注入乘性噪声 X_noised = X·λ_i,λ_i ~ U(0.5, 1.5)(即 ±50% 相对噪声),扩大低层能容忍的指令范围。
- 用低层策略输入归一化器的统计量估计 HMS 边界(每维建模为高斯 μ±1.64σ,覆盖约 90% 概率质量),对高层策略输出做动作裁剪(action clip),防止 RL 探索跑出可行人体动作空间。
真机部署工程:真机 Unitree G1 + 机载 RealSense D435i 深度相机;对真实深度图做空间+时间滤波;仿真中做重度随机遮挡来逼近真实深度噪声——20% 概率加固定左下角白色遮罩,另外各 10% 概率独立叠加最多 6 个矩形遮罩(黑/白/灰随机,灰度 0–1 均匀采样),每个遮罩最大 30×30 像素(相对 80×45 的深度帧,覆盖约 25% 画面);相机朝向额外做 ±5° 随机化(应对 G1 脖子非刚性固定导致的相机漂移)。安全部署上引入二值暂停/执行指令:0 时关闭任务奖励、开启”站立不动”奖励,1 时反过来,训练时以 50%/50% 概率采样两种状态,机器人总是从暂停态启动。
数据
- 动作重定向数据:AMASS(人体动捕)+ OMOMO(物体运动引导的人体动作合成数据集),通过 GMR 工具重定向到人形关节空间,供低层 teacher motion tracker 训练。规模(帧数/小时数)论文未披露具体数字。
- 仿真任务物体:Push Box(30″×40″×40″、4kg,摩擦系数随机 0.5–2.0);Kick Box / Lift Box / Large Kick 共用 15″×20″×20″、0.5kg 箱子;Reach Box 用 30″×40″×40″箱子;Kick Ball / Balance Ball 用足球;Push Cube 用 8″方块(桌面任务)。
- 真机物体:推箱任务用约 3.8kg、与机器人同高的大箱子;抬箱任务用 0.5kg 箱子,抬升到 1 米高度。
- 训练/评测环境并行数:状态输入策略 4096 个并行 rollout,视觉输入策略 512 个并行 rollout(均 3 个随机种子、每次 1 分钟 rollout)——论文未进一步披露仿真步数、总训练样本量等规模数字。
训练方法
- 优化器/算法:PPO(teacher 与 state-based generator)+ DAgger(两次蒸馏:teacher motion tracker → student keypoint tracker;state-based generator → visuomotor generator)。
- 低层训练顺序:先训 teacher motion tracker(特权未来帧+接触力),再蒸馏出只用即时关键点指令的 student keypoint tracker;消融显示跳过这一步、直接单阶段 RL 训关键点跟踪器会导致明显不自然的动作(Fig. 6 对比图)。
- 高层训练顺序:先训有物体特权状态的 teacher generator(PPO + 任务奖励),再蒸馏成只用深度图+本体感知的 student;直接视觉 RL(Visual RL 消融基线,同等训练步数)在 Kick Box、Kick Ball 上完全失败。
- 高层训练稳定性技巧:低层噪声注入(±50%)+ 高层动作裁剪(μ±1.64σ)——两者去掉任一个都会显著掉点或训练崩溃(见评测消融)。
- 关键超参数:低层教师 look-ahead 窗口 2 秒;HMS 裁剪覆盖约 90% 概率质量(1.64σ);相对噪声水平 50%;深度遮罩最大 30×30px / 80×45 帧(~25% 覆盖);相机朝向随机化 ±5°;暂停/执行二值指令 50/50 采样。
- 未披露:具体 PPO 超参(学习率、clip range、GAE λ、batch size 等)、总训练步数/wall-clock 时长、网络隐藏层宽度。
Infra(训练 / 推理工程)
- 仿真器:IsaacGym(论文明确点名,用于大规模并行 RL 训练;文中说明”把视觉接入 IsaacGym 会显著拖慢仿真”,这是选择 teacher-student 两段式而非直接视觉 RL 的直接原因之一)。
- GPU 型号、GPU 数量、训练 wall-clock 时间、总仿真步数:论文未披露。
- 真机硬件:Unitree G1 人形机器人 + 机载 Intel RealSense D435i 深度相机;跟踪器/生成器均为 3 层 MLP + (生成器侧)CNN 深度编码器,参数规模未披露。
- 控制频率 / 推理延迟 / 板载算力:论文未披露具体 Hz 或延迟数字(只说明用了空间+时间滤波处理真实深度噪声)。
评测 benchmark
(结果来自 Table II/III,均为 3 个随机种子上 1 分钟 rollout 的均值±标准差;state-based 4096 并行环境,vision-based 512 并行环境)
主表现(Table II,“stu w/ vision” = 最终可部署的视觉策略):
| 任务 | 指标 | teacher(特权状态) | stu w/ vision | stu w/o vision(blind) |
|---|---|---|---|---|
| Push Box | Distance/Forward/Drift [m] | 152±36 / 151±29 / 13±4 | 37±28 / 19±15 / 21±12 | 2±0 / 2±0 / 1±0 |
| Kick Box | Distance/Forward/Drift [m] | 78±3 / 78±3 / 0±0 | 55±5 / 30±3 / 33±3 | 0±0 / 0±0 / 0±0 |
| Lift Box | Height[m]/Fall Rate[%]/Alive[s] | 1±0 / 34±25 / 38±13 | 1±0 / 30±23 / 30±7 | 0±0 / 15±21 / 6±4 |
| Reach Box | Velocity[m/s]/Collision[%]/Alive[s] | 4±0 / 0±0 / 60±0 | 4±0 / 0±0 / 42±6 | 4±0 / 0±0 / 18±6 |
| Large Kick | Distance/Forward/Drift [m] | 8±1 / 7±1 / 2±0 | 6±0 / 6±0 / 2±0 | 4±0 / 4±0 / 1±0 |
| Kick Ball | Distance/Forward/Drift [m] | 189±3 / 189±3 / 4±1 | 135±6 / 121±8 / 47±12 | 1±0 / 1±0 / 0±0 |
| Balance Ball | Force[N]/Foot Fall[%]/Alive[s] | 21±2 / 0±0 / 34±8 | 24±1 / 0±0 / 45±7 | 6±0 / 0±0 / 5±1 |
| Push Cube(桌面) | Error[cm]/Finish[s]/Alive[s] | 9±3 / 4±1 / 58±1 | 21±2 / 20±8 / 57±0 | 57±22 / 43±8 / 51±10 |
论文用自然语言强调两个数字:视觉策略能推动一个 3.8 公斤、与机器人同高的箱子平均每分钟 37 米;能以经验球员的流畅度盘带足球,每分钟 135 米(其中 121 米为前向位移)。视觉版相对盲版(stu w/o vision)在几乎所有任务上都有数量级提升,证明自我中心视觉是完成这些任务的关键(Q4 结论)。
消融(Table III,仅 Push Box / Kick Box / Kick Ball 三个任务,state-based 与 vision-based 各一组):
- w/o noise(低层蒸馏不注入指令噪声):state-based Push Box 的 Distance 从 152±36 掉到 2±1(几乎学不会);vision-based 三任务 Distance 均下降(Push Box 37±28→2±1,Kick Box 55±5→25±7,Kick Ball 135±6→86±7)——注意此时 Drift 数字也一并降低(如 Kick Ball 47±12→30±8),但那是移动距离本身骤减的伴生效应,不代表方向控制变好。
- w/o clip(高层去掉动作裁剪):训练后期 return 崩溃(Fig. 9b),vision-based 三任务 Distance 全部接近 0(Push Box 10±18、Kick Box 6±7、Kick Ball 1±1)。
- DoF as Interface(低层接口换成 23-DoF 关节角而非关键点):state-based Kick Ball 完全学不会(Distance 0±0,对照 teacher 的 189±3),vision-based 三任务 Distance 全面跌至个位数。
- Local-Frame Tracker(低层跟踪器在局部坐标系而非世界坐标系下训练):vision-based 三任务 Distance 均显著低于 Ours(Push Box 37±28→14±11,Kick Box 55±5→27±15,Kick Ball 135±6→38±17);作者认为世界坐标系跟踪更利于减少漂移、利于高层训练(论文原文表述,未附逐项漂移率对比)。
- Visual RL(直接视觉 RL、不做 teacher-student,同等训练步数):Kick Box、Kick Ball 完全失败(0±0)。
- 无正式 baseline(对比 Hitter、VideoMimic 等外部系统的定量数字)——论文明确说这些方法要么不做视觉、要么不做全身/loco-manipulation,不具备可比的定量协议,Table I 只做定性能力对比(✓/✗)。
真机部署(定性):在 Unitree G1 上完成 Lift Box、Kick Ball、Kick Box、Push Box 四个任务的零样本迁移,并在室外多光照条件(早/中/晚/夜)与多场地(Hover Tower、工程楼、机器人中心、纪念教堂)下验证策略的鲁棒性;网站视频也展示了失败/恢复案例(如抬箱子失败后重新尝试、脚与龙门架碰撞)。
创新点与影响
- 提出”关键点指令”作为低层-高层接口的紧凑表征(根+头+双手+双脚共 6 点),既比 23-DoF 关节角接口更容易训练稳定的高层策略,又比纯上半身/3 点接口更能诱导全身参与(脚部接触在 Balance Ball 等任务里是必需的)。
- 两次 teacher-student 蒸馏(低层动作跟踪 + 高层任务策略)把”学人类动作先验”和”学任务目标”解耦,使高层只需设计极简的任务奖励(Approach/Forward/Force/Look/Drift 五类)就能获得类人的全身交互策略,无需人-物体配对示范数据。
- 用关键点噪声注入 + 高层动作裁剪(HMS 约束)这一组合,缓解了视觉 RL 高层策略在人形大动作空间下的训练不稳定问题;作者的消融把这两项与接口设计、坐标系选择、蒸馏与否逐一拆开验证。
- 作者自陈的局限:目前只覆盖刚体物体交互,可变形物体和人机协作场景未探索;虽然在已测场景中 sim-to-real 有效,但扩展到长时程任务和更多样真实环境可能还需要域随机化和自适应控制方面的进一步工作。代码在论文发表时仅开源了 Sim2Sim 流程和四个任务的推理 checkpoint(Kick Ball/Lift Box/Push Box/Kick Box),训练代码承诺”论文接收后完全开源”。
原始链接
- arXiv: https://arxiv.org/abs/2509.20322
- PDF: https://arxiv.org/pdf/2509.20322
- 项目主页: https://visualmimic.github.io/
- GitHub: https://github.com/operator22th/VisualMimic
一手源存档(sources/)
- visualmimic—project-page — 项目主页快照(视频分类、相关工作、BibTeX)
- visualmimic—github-readme — GitHub README 快照(Sim2Sim 用法、发布进度)
- arXiv 原文 PDF(https://arxiv.org/pdf/2509.20322),不入 git