一句话定位
PhysHSI 是上海 AI Lab(联合 HKUST)提出的人形机器人”场景交互”系统:在仿真里用对抗动作先验(AMP) 从少量 MoCap 数据学出搬箱、坐椅、躺床、起身四类长时程任务的自然动作,再靠一套LiDAR 粗定位 + AprilTag 精定位的现实感知管线零样本部署到 Unitree G1 上,用真机实验证明 AMP 路线比”从零 RL 调奖励”和”逐帧动作跟踪”两条基线都更泛化、更像人。
背景与定位
人形机器人的”全身技能”(站起、跳舞、敏捷动作)近年进展很快,但让机器人在真实场景里和物体/家具交互(搬箱子、坐椅子)被认为更难:既要泛化到任意场景摆放,又要动作自然,还得有能在真机上跑的感知模块。论文把已有路线分两类,各有短板——经典的基于模型的运动规划/轨迹优化计算量大、假设强,难以泛化;从零学起的 RL(无论单一策略如 Wococo,还是多个专用策略如 FALCON、HOMIE)需要大量手工奖励和状态转移设计,长时程任务尤其难调。为了减少奖励工程负担、拿到自然动作,图形学里已有一条模仿 MoCap 先验的路线(DeepMimic、TokenHSI、SIMS 等),但这些方法基本停留在仿真、依赖理想的场景观测,“仿真到真实”这一步此前几乎没人做过。
PhysHSI 把这条对抗动作先验(AMP,Peng et al. 2021) 路线第一次系统性地搬到真实人形机器人上的长时程人-场景交互任务:simulation 侧沿用 AMP 生成自然、可泛化的动作,real-world 侧补上此前工作缺失的感知与 sim-to-real 环节。它与同期的 BeyondMimic(干净参考 + 极简奖励做逐帧跟踪)、OmniRetarget(保交互的数据增广 + 极简 RL 跟踪)走的是不同范式:后两者本质是”更好的跟踪”,PhysHSI 走的是”用判别器学动作风格而非逐帧对齐”的 AMP 范式,因此天然具备跨物体位置/尺寸的组合泛化能力,而不必像跟踪类方法那样依赖大量参考轨迹覆盖所有场景配置。
模型架构
策略与判别器(均为 MLP,隐层 [512, 256, 256]):
- 本体感知观测
o^P_t ∈ R^108:基座角速度(3) + 基座重力方向(3) + 29 个关节角(29) + 29 个关节角速度(29) + 5 个末端执行器(左右手/脚+头)在基座系下的 3D 位置(15) + 上一步动作(29),取最近 5 步历史。 - 任务观测
o^G_t:因任务而异,均在机器人基座系下表达——CarryBox 为R^15(箱子包围盒尺寸 3 + 位置 3 + 6D 旋转表示 6 + 目标位置 3);SitDown/LieDown 为R^9(椅子/床位置 3 + 6D 旋转 6);StandUp 为R^12。 - 判别器(特权)观测
o^D_t ∈ R^57:基座高度(1) + 基座线速度(3) + 角速度(3) + 重力方向(3) + 29 关节角(29) + 末端执行器位置(15) + 物体位置(3)。关键设计:把物体位置放进判别器观测,使其能隐式区分”接近/抓取/搬运/放置”这几个任务阶段,从而增强训练引导。 - 动作空间
a_t ∈ R^29:Unitree G1 全部 29 自由度的目标关节角,由 PD 控制器跟踪执行。 - 非对称 Actor-Critic:actor 只用部署时可得的
o^π_t(含真实系统会做的遮挡/掩码),critic 用更丰富的特权状态o^V_t(基座真实速度、未掩码的任务观测),用于弥补真机部分可观测带来的训练困难。
现实感知管线(非神经网络,规则+经典 SLAM 组件): LiDAR 粗定位(FAST-LIO 里程计 + 初始手动指定物体坐标)→ 进入相机视野后自动切到 AprilTag 精定位;对动态物体(箱子)在抓取阶段若物体离开视野则屏蔽物体位姿观测,仅靠本体感知完成剩余动作;静态物体(椅/床)则始终按里程计传播的固定位姿更新。
硬件:Unitree G1(内置 Livox Mid-360 LiDAR)+ 外挂 Intel RealSense D455 深度相机(水平 FOV 86°、垂直 FOV 57°,经 3D 打印支架固定于头部,相对躯干偏移 (0.08, 0.01, 0.40) m、俯仰约 40°);点云可视化、FAST-LIO、AprilTag 检测、正运动学与策略推理全部跑在机载 Jetson Orin NX 上,无需外部计算/动捕基础设施。
数据
- 来源:SMPL 人类动作从 AMASS(Mahmood et al. 2019)与 SAMP(Hassan et al. 2021)两个 MoCap 数据集取样,用优化方法重定向到 Unitree G1 上,并加平滑滤波抑制重定向抖动,得到纯机器人动作数据集
M_Robo。 - 物体轨迹后标注:人工标注拾取帧
φ1与放置帧φ2,φ1~φ2之间物体位置设为双手中点(朝向对齐机器人基座),φ1之前 /φ2之后保持在对应关键帧位置不变——一套简单的规则式流程,不需要额外的物体轨迹采集设备。 - 各任务数据规模(论文附录实测数字):
- CarryBox:Loco 子集 11 条 AMASS 基础行走/转身序列 + Carry 子集 3 条 AMASS 序列 + 2 条经 GVHMR 从视频重建、再人工修正部分关节的动作序列;进一步按 pickUp / carryWith / putDown 三段切分供 RSI 使用。
- SitDown:复用 Loco 子集 + 额外 4 条 SAMP 坐姿序列。
- LieDown:复用 Loco 子集 + 额外 6 条 SAMP 躺姿序列。
- StandUp:复用 Loco 子集 + 额外 2 条 SAMP 起身序列,另预先用已训练好的坐姿策略采集了一批”椅子高度不同的稳定坐姿”用于该任务的初始化。
- Tracking-Based 基线用的是同一份数据集,论文原话称每个任务”大致 2–5 条完整轨迹”——这也是 AMP 路线(组合泛化)对比跟踪路线(逐帧模仿)成立的关键前提:参考数据量很小。
- 场景随机化范围(训练侧,仿真内 domain randomization 的一部分):CarryBox 物体/目标 2D 位置
U(-4,4) m、高度U(0,0.6) m、箱宽U(0.2,0.5) m、箱高U(0.15,0.35) m、密度U(10,100) kg/m³;SitDown/LieDown 椅/床 2D 位置U(-5,5) m、高度U(0.2,0.5) m,椅子长宽U(0.3,0.6) m,床长U(1.2,3.2) m、宽U(0.38,0.63) m。 - 评测侧的场景划分:In-Distribution(只覆盖数据集里出现过的场景配置)与 Full-Distribution(物体/目标在
[0,5] m范围内均匀采样、箱高[0,0.6] m、箱尺寸[0.2,0.5] m均匀采样)——用来专门检验组合泛化能力。 - 未使用任何 co-training 的第三方大规模视频/机器人操作数据集;数据规模整体是”小而精”(几十条动作片段),依赖 AMP 判别器而非数据量本身撑起泛化。
训练方法
- 框架:Adversarial Motion Priors(AMP,Peng et al. 2021)——策略
π_θ生成动作,判别器D区分策略动作片段与数据集参考片段,二者对抗训练;判别器损失含 WGAN 式对数损失 + 梯度惩罚项w_gp=1.0(式 3),策略风格奖励r^S_t = -log(1-D(o^D_{t-t*:t}))(式 4)。 - 总奖励:
r_t = w^G r^G_t + w^R r^R_t + w^S r^S_t,其中r^G_t为任务奖励(各任务多阶段设计,如 CarryBox = 走位 loco + 搬运 carry + 拾起 pick + 放置 put 四段奖励之和)、r^R_t为正则(关节速度/加速度/位置限位/速度限位/力矩/力矩限位/动作变化率,共 7 项,见附录 Table VI)、r^S_t为风格奖励。用 PPO 最大化累计折扣奖励。 - 混合参考状态初始化(Hybrid RSI):在朴素 RSI(Peng et al. 2018,从数据集里随机采样参考状态起步)基础上做两点改造以避免过拟合到数据集里的少量场景:①利用任务阶段的可组合性——从动作数据采样初始相位
φ∈[0,1],但(φ,1]阶段的场景(如目标位置)完全随机化;②一部分 episode 直接从默认起始姿态出发、场景参数全随机。消融显示:无 RSI 比朴素 RSI 差,朴素 RSI 又明显差于混合 RSI(数字见评测部分),验证了这套设计对泛化和采样效率都关键。 - 非对称 Actor-Critic:actor 用部署时可得(含掩码)的观测,critic 用更丰富的特权状态(真实基座速度、未掩码任务观测),弥补真机部分可观测性对训练的影响。
- 动作平滑/写实性约束:训练早期给较小的风格奖励权重
w^S便于探索,随训练推进逐步增大以贴合数据风格,避免策略学出快速抖动的”作弊”动作;并额外引入 L2C2 平滑正则(Zhang et al. 引用 [64])提升硬件部署的平滑性与稳定性。 - Sim-to-real 对齐:训练时复现真机的观测掩码机制(动态物体在抓取阶段若被相机遮挡则遮蔽其位姿观测,判定条件含朝向、FOV、2.5 m 距离三重规则,见附录 VII-A1),并叠加标准 domain randomization(观测噪声、执行器/PD 增益随机化、物体摩擦/恢复系数随机化、定位位置/角度偏移与噪声,完整数值见 Table VII)。
Infra(训练 / 推理工程)
- 仿真环境:IsaacGym(NVIDIA 官方 GPU 并行物理仿真)。
- 并行规模:4096 个并行机器人环境;每次迭代 100 步、每次迭代 5 个 epoch;梯度裁剪 1.0,Adam epsilon 1e-8。
- PPO 超参:clip range 0.2,entropy 系数 0.01,折扣因子 γ=0.99,GAE λ=0.95,目标 KL 散度 0.01。
- GPU 型号 / 数量 / 总训练小时数:论文未披露(附录只给了并行环境数与迭代步数,未给具体 GPU 型号、卡数或墙钟训练时长)。
- 推理硬件:机载 Jetson Orin NX——点云可视化、FAST-LIO 里程计、AprilTag 检测、正运动学与策略推理全部在此单机上跑,实现无需外部计算设施的”便携式”部署。
- 控制频率 / 推理延迟(Hz/FPS):论文未披露具体的策略控制频率或推理延迟数值。
- 真机执行时间(作为系统整体性能的一部分披露,见评测部分):CarryBox 10.5±2.8 s、SitDown 6.2±1.3 s、LieDown 6.7±1.0 s、StandUp 2.3±0.4 s。
评测 benchmark
仿真基准(Table I,5 个随机种子 × 每种子 1000 episode × 3 条 demo clip,报告均值±标准差;R_succ 成功率,S_human 为 Gemini-2.5-Pro 打的 0–5 分人类相似度分,给定任务描述与轨迹回放):
| 场景 | 方法 | CarryBox R_succ/S_human | SitDown | LieDown | StandUp |
|---|---|---|---|---|---|
| In-Distribution | RL-Rewards | 72.92±8.29 / 1.67±0.47 | 83.60±5.98 / 1.50±0.24 | 76.72±9.43 / 0.50±0.00 | 93.02±0.71 / 1.50±0.24 |
| In-Distribution | Tracking-Based | 11.84±3.16 / 4.83±0.24 | 31.46±2.96 / 3.80±0.08 | 19.58±1.02 / 2.23±0.21 | 99.00±1.28 / 4.67±0.12 |
| In-Distribution | PhysHSI | 91.34±1.63 / 4.00±0.41 | 96.28±0.21 / 4.80±0.08 | 97.86±0.60 / 4.80±0.08 | 99.68±0.21 / 3.77±0.21 |
| Full-Distribution | RL-Rewards | 63.40±8.63 / 1.17±0.24 | 73.14±4.29 / 3.07±0.09 | 55.76±12.51 / 2.00±1.08 | 90.50±2.33 / 1.07±0.09 |
| Full-Distribution | Tracking-Based | 0.02±0.01 / 0.50±0.00 | 1.12±0.51 / 0.50±0.00 | 0.94±0.45 / 1.00±0.41 | 35.32±2.51 / 3.27±0.54 |
| Full-Distribution | PhysHSI | 84.60±3.74 / 3.83±0.24 | 91.32±2.48 / 4.77±0.05 | 81.28±3.99 / 4.43±0.33 | 92.24±0.75 / 3.77±0.52 |
关键结论:Tracking-Based 在 Full-Distribution 下几乎完全失败(CarryBox 仅 0.02%),因为参考轨迹只有 2–5 条,逐帧跟踪没有组合泛化能力;PhysHSI 靠 AMP 的风格对齐(而非逐帧位置对齐)在分布外场景仍保持高成功率。RL-Rewards 成功率尚可但 S_human 明显更低,说明手工奖励调出的动作不自然。论文正文提到 PhysHSI 在 CarryBox 上达到”81.34%“成功率并称其”与更简单的两步 SitDown 任务相当”——但 Table I 本身给出的 In-Distribution CarryBox 数值是 91.34%±1.63(与正文这句表述存在数字不一致,原文如此,未做主观改动)。
消融(Table II,均为 Full-Distribution 设置,CarryBox / SitDown 两任务):
- 数据处理:去掉平滑滤波(w/o Smoothness)CarryBox 降至 63.28±11.72(
S_human骤降到 2.33);去掉物体标注(w/o Object)降至 55.42±8.17;完整 PhysHSI 为 79.34±4.71 /S_human3.83±0.24。 - RSI 策略:无 RSI 41.24±6.92,朴素 RSI 反而更差(5.70±2.38,
S_human仅 0.50)——证明朴素 RSI 过拟合数据集场景;混合 RSI 79.34±4.71 明显最优。SitDown 上同样趋势(无 RSI 78.24±3.91,朴素 RSI 18.70±5.33,混合 RSI 91.32±2.48)。 - 掩码策略:不做观测掩码(w/o Obs Mask,代表性能上界)CarryBox 为 85.90±2.90,加入掩码后的 PhysHSI 为 79.34±4.71——掩码机制小幅拖慢训练但对最终成功率影响有限。
真机实验(Table III,每任务 10 次试验):
| 任务 | 成功率 | 精度(m) | 执行时间(s) | 最大移动范围(m) |
|---|---|---|---|---|
| CarryBox | 拾起 8/10,全流程 6/10 | 0.19±0.10 | 10.5±2.8 | 5.69 |
| SitDown | 9/10 | 0.07±0.03 | 6.2±1.3 | 4.14 |
| LieDown | 8/10 | 0.16±0.07 | 6.7±1.0 | 3.76 |
| StandUp | 8/10 | — | 2.3±0.4 | 1.74 |
CarryBox 全流程放置误差小于 20 cm;系统可在室外仅靠机载传感器与算力完成任务,无需外部动捕基础设施。
定位模块专项评测:17 次真机试验中 15 次成功;远距离(粗定位阶段)平均误差 0.35 m,进入 2.4 m 范围后自动切到 AprilTag 精定位,平均误差降到 0.05 m;2 次失败分别源于粗定位偏差过大导致标签未进入视野、以及一次系统崩溃。
CarryBox 边界测试(Table IV,每条件 3 次试验):箱高在 [0,60] cm 内可稳定搬运(0 cm 2/3、20 cm 3/3、40 cm 3/3、60 cm 1/3);箱重 [0.6,3.6] kg 内可行(0.6 kg 2/3、1.2 kg 3/3、2.3 kg 2/3、3.6 kg 1/3、4.5 kg 0/3 完全失败);箱子最大尺寸 [20,45] cm 均有一定成功率(20cm 2/3、30cm 3/3、40cm 2/3、45cm 3/3)。超出这些范围主要受限于机器人垂直视场角与橡胶手/臂长的抓取范围。
论文自述的局限:① 硬件层面依赖 Unitree G1 橡胶手做夹持,限制了能搬运的箱子重量/尺寸,负载过大还可能导致电机过热;② 大规模高质量 HSI 数据目前依赖人工后标注,难以规模化;③ 现有物体定位是模块化系统(LiDAR 粗定位靠人工指定初始点 + AprilTag),引入了复杂性和脆弱性,论文建议未来做更自动化的主动感知(active perception)。
创新点与影响
- 首次把 AMP 对抗动作先验这条此前主要停留在图形学仿真里的路线,系统性地打通到真实人形机器人的长时程人-场景交互任务(搬箱、坐、躺、起身),并验证其相对”从零 RL""逐帧跟踪”两条基线在分布外泛化(Full-Distribution 场景)上的显著优势——尤其是在参考轨迹极少(每任务仅 2–5 条完整轨迹)的数据稀缺条件下。
- 物体信息后标注流程:不需要专门采集物体运动轨迹的设备,只需人工标注人类 MoCap 数据里的拾取/放置关键帧,用简单规则(双手中点)推出物体轨迹,大幅降低构建人-物交互训练数据的门槛。
- 粗到精两级定位系统(LiDAR 里程计做长距离方向引导 + AprilTag 做近距离精定位),只需一次人工初始化坐标,后续全自动,且全部感知与策略推理跑在单块 Jetson Orin NX 上,支持室外无外部基础设施部署——这是此前依赖 MoCap/外部计算的人-场景交互工作没有解决的部署问题。
- 混合 RSI + 非对称 Actor-Critic + 渐进式风格奖励权重 + L2C2 平滑正则的组合,是让 AMP 训练出的动作既能长时程完成多阶段任务、又能扛住真机部分可观测性和硬件平滑性要求的关键工程细节,消融证明每一项都有实质贡献。
- 局限也很明确:橡胶手抓取能力有限(重箱/大箱失败)、数据构建依赖人工、感知系统是模块化拼接而非端到端主动感知——论文自己将其定位为”人-场景交互真机部署的一次初步探索”,而非终局方案。
原始链接
- arXiv 论文(HTML/PDF): https://arxiv.org/abs/2510.11072
- 项目主页(已核实实际可访问地址,与元数据里给出的
physhsi.github.io不同,后者返回 GitHub Pages 404): https://why618188.github.io/physhsi/ - GitHub 代码仓库: https://github.com/InternRobotics/PhysHSI
- 演示视频: https://youtu.be/dTj6FjoQ5u0
一手源存档(sources/)
- physhsi—project-page — 项目主页快照(含任务视频清单、系统概览图说明、摘要、BibTeX)
- physhsi—github-readme — GitHub README 快照(安装、六任务训练/播放命令、致谢、许可证)
- arXiv 原文 PDF(https://arxiv.org/pdf/2510.11072):不入 git,已读取 HTML 全文(含附录 VII 全部超参/域随机化/奖励函数表)