一句话定位
TWIST2 是 Stanford(Yanjie Ze 等,工作完成于 Amazon FAR 实习期间)做的一套便携、免动捕(mocap-free)的人形机器人全身遥操作与数据采集系统:用消费级 VR 设备 PICO 4 Ultra + 2 个脚踝动作追踪器获取全身人体姿态,配一个自研的 250 美元 2 自由度颈部模块提供第一人称视觉,在保留 TWIST 式全身控制能力的同时把动捕摄影棚的成本和搭建时间压缩到近乎零(PICO 设置约 1 分钟);在此基础上进一步训练了一个分层视觉运动策略,让 Unitree G1 仅凭第一人称视觉自主完成全身灵巧操作与踢腿等任务。
背景与定位
论文把现有人形遥操作系统分成三类:(a) 上下身解耦控制(如 homie 用外骨骼驾驶舱,下身仅跟踪根速度指令);(b) 部分全身控制(如 amo、clone-teleoperation,用 VR 但腿部仍简化为速度指令,牺牲了动态全身协调能力);(c) 全身控制(如 twist、HumanPlus,直接跟踪人体全部关节但依赖昂贵、不可移动的动捕摄影棚)。TWIST2 的定位是同时拿到 (c) 类的全身控制能力和 (a)/(b) 类的便携性——论文 Table I 用”可移动性、免标定、单操作员、全身跟踪、第一人称遥操作、脚部控制、手腕控制”七个维度逐项打勾对比,TWIST2 是表中唯一全部打勾的系统。
范式上,TWIST2 延续 twist 提出的”人体动作追踪控制器”思路,但把动捕数据源换成消费级 VR(PICO),并把 TWIST 的两阶段教师-学生蒸馏训练简化为单阶段 PPO;同时采用并改造了同组另一篇工作 GMR(“Retargeting Matters: General Motion Retargeting for Humanoid Motion Tracking”, arXiv:2510.02252)的重定向算法,下游视觉运动策略部分复用了 iDP3(“Generalizable Humanoid Manipulation with 3D Diffusion Policies”, arXiv:2410.10803)的 Diffusion Policy 框架。论文将其定性为”人形机器人数据采集基础设施”这一新方向的尝试——类比双臂操作领域 ALOHA/GELLO 之于 π0/π0.5 的角色,试图为人形全身操作补上等效的规模化数据采集管线。
模型架构
问题形式化(分层控制): 低层控制器 π_low(通用动作跟踪)+ 高层控制器 π_high(任务相关指令生成)。命令接口 p_cmd 包含:根部 x/y 平移速度、根部 z 高度、根部 roll/pitch 角、根部 yaw 角速度、全身关节位置目标;proprioception 输入 s 包含 IMU 读出的根部朝向/角速度 + 编码器读出的关节位置/速度。低层以 50Hz 输出目标关节位置,再经 PD 控制器 τ=K_P(q_tgt−q)−K_D·q̇ 转成扭矩。命令接口刻意用相对根部平移/旋转(而非绝对位姿),避免依赖精确全局状态估计,保证长时程操作稳定;并保留全身关节位置(而非只给根速度),支持踢腿等下肢精细动作。
本体硬件: Unitree G1,29 自由度(3 自由度腰 + 两条 6 自由度腿 + 两条 7 自由度臂),配两只 7 自由度 Unitree Dex31 灵巧手。
TWIST2 颈部(自研 add-on 模块): 2 自由度(yaw + pitch),用 2 个 Dynamixel XC330-T288 舵机(经 U2D2 驱动,由机身自带 12V/5A 供电),结构件全 3D 打印,成本 $250;摄像头用 ZED Mini 立体相机(额外 $400)。设计参考 ToddlerBot,不拆卸 G1 原装头部/LiDAR 即可即插即用;论文指出人类日常极少用到颈部 roll 自由度,故 2-DoF 设计已足以覆盖大部分人类颈部动作,并在 MuJoCo 中建了对应仿真模型以标准化该颈部。
人体动作源(免动捕): PICO 4 Ultra(PICO4U)VR 头显 + 2 个 PICO Motion Tracker(绑在人体小腿上),整套成本约 $1000;通过 XRoboToolkit 读取动作流,100Hz 输出;虽然 PICO 支持 2 个以上追踪器,论文发现 2-追踪器模式反而位姿估计更稳定;相比 Boston Dynamics 演示用的 HTC Vive Tracker,PICO 全身姿态估计不需要额外的第三人称视角相机,部署更灵活。
重定向(retargeting):
- 身体:改造 GMR 的两阶段优化——第一阶段解关节朝向一致性,第二阶段原本同时优化全局位置对齐;因 PICO 动捕的全局位姿估计不准,TWIST2 把第二阶段拆分为:下肢(骨盆/髋/膝/踝/脚)同时优化位置+朝向约束,上肢(脊柱/肩/肘/腕/头)只优化朝向约束(公式见论文 Eq.6),兼顾脚部防滑和上肢在全局位姿跳变/瞬移时的稳定性。
- 手:Dex31 只有 3 指、自由度有限,功能上更接近平行夹爪而非五指灵巧手,因此不做五指姿态映射,改用 PICO 手柄按键驱动:定义开(q_open)/合(q_close)两组关节构型,由人手信号算出抓取标量 α∈[0,1],插值 q_hand=(1−α)q_open+α·q_close;为力量抓取(如握杯)和精细捏合(如叠布)分别定义两套 open/close 构型。
- 颈:令 R_head、R_spine 为人体头部/脊柱在世界系下的全局旋转,相对旋转 R_rel=R_spine^T·R_head=[r_ij];颈部 yaw=atan2(r21,r11),pitch=asin(−r31)。
低层通用动作跟踪控制器: 不同于 TWIST/OmniH2O 等采用复杂教师-学生蒸馏管线,TWIST2 用单阶段 PPO 直接训练。actor 由卷积历史编码器 + MLP 主干组成,把历史 proprioception 与历史参考动作压缩成紧凑潜向量以提升学习效率。
高层视觉运动策略(π_high^auto): Diffusion Policy 框架,1D 卷积块做动作序列时序建模;视觉输入为 ZED Mini 的 360×640 RGB,降采样到 224×224;视觉编码器用 R3M 预训练的 ResNet-18 backbone;proprioception 输入用历史 p_cmd 指令序列(而非原始机器人状态 s),既解耦高层策略与低层控制器(可模块化训练/部署),也避免高维系统里对含噪原始状态的直接依赖导致误差累积;动作输出与遥操作时同一套 p_cmd 命令向量,保证采集与执行的一致性。
数据
- 低层动作跟踪控制器训练数据(动作片段库): 约 20k 条动作片段,由 7k 条经 GMR 重定向的片段 + TWIST 原始数据集的 13k 条片段构成;来源包括 AMASS、OMOMO,以及自建 in-house MoCap 数据,这一混合确保策略学到全方向行走能力。
- 另外单独收集 73 条经 PICO 采的动作,用于弥合遥操作设备与离线动捕数据之间的域差(domain gap)——论文指出这一小批设备自采数据已覆盖日常动作如行走、下蹲、操作,是缩小 sim-to-real/teleop-to-mocap 差距的关键。
- 遥操作数据采集(imitation learning 数据): 论文 Table II 报告:Bimanual Manip 1 任务 18.5 分钟内连续采集 98 条 episode、成功率 100%、平均单条 11 秒;Mobile Manip 任务 19.5 分钟内采集 46 条、成功率 100%、平均单条 25 秒。(项目主页给出的是后续更新的数字:15 分钟采 128 条双臂 pick&place / 15 分钟采 50 条移动 pick&place——与论文正文的 98/18.5min、46/19.5min 不完全一致,应为不同批次的复测结果,论文正文数字更可溯源,故以其为准。)
- 下游视觉运动策略训练数据: WB-Dex(全身灵巧 pick&place)用 170 条人类示教;Kick-T(踢 T 形箱到目标区)用 50 条示教,且示教中动作模式一致——左脚踢、右脚随后跨步保持平衡。
- 数据后处理: 自建演示后处理 GUI,把连续录制的长序列切分为多条对应完整任务的 episode,并做空闲动作裁剪与失败 episode 过滤。
- 发布数据集(HuggingFace,twist-data.github.io 索引): Bidexterous Manipulation 200 条(4 个 HF 仓库版本迭代,MIT License)、Kick-T 50 条(3 个版本)、Fold Towel 2 条、Pick Brick from Ground 5 条;统一格式为逐帧 PNG + data.json,body state 35 维(根位姿+全身关节位置)、每只手 state 7 维、neck state 2 维,图像 1280×360@30fps。
训练方法
- 低层控制器: 单阶段 PPO(而非教师-学生蒸馏),奖励 r=r_track+r_reg,其中 r_track=exp(−α‖p_cmd−p_cur‖)(跟踪参考指令与当前状态的距离),r_reg 含动作变化率等正则项;actor = 卷积历史编码器 + MLP。
- 高层视觉运动策略: Diffusion Policy,预测 64 步动作 chunk(对应策略执行频率下 2 秒的未来动作指令),采用基于采样的预测(sample-based prediction,复用 iDP3/Improved-3D-Diffusion-Policy 一脉的做法);部署时用 receding-horizon 方式只执行预测的 64 步中的 48 步,以 30Hz 与数据采集频率保持一致再重新规划。
- 数据增强与正则化: proprioception 输入注入 10% 高斯噪声,促使策略更依赖视觉观测而非精确状态信息;视觉输入做随机裁剪、随机旋转、色彩抖动,提升对光照/视角变化的泛化。
- 单操作员设计: 用 PICO 手柄按键充当”控制中心”,让示教者可独立完成启动/暂停/终止全流程,无需第二人协助(对比 AMO/MobileTV 需要两名操作员分管上下身,TWIST/CLONE 仍需第二人控制流程起止)。
- 安全控制: 所有状态转换用动作插值平滑处理,例如 PICO 手柄原点键触发”暂停”,暂停结束时从上一次机器人姿态插值到当前目标姿态,避免突变冲击,支持长时间安全运行,操作员疲劳时可随时停止。
Infra(训练 / 推理工程)
- 训练算力: 论文未披露 GPU 型号/数量/PPO 训练总时长等具体数字。
- 系统延迟: 全系统各模块流传输速率均高于 50Hz,端到端总延迟低于 0.1 秒;相比前作 TWIST(0.5 秒延迟)有显著改善。
- 低层控制频率: 输出目标关节位置频率 50Hz,PD 控制器实时转矩。
- 高层策略推理: 训练好的 Diffusion Policy 转换为 ONNX 格式,在单张 NVIDIA RTX 4090 上达到 20Hz 推理速率;执行时以 30Hz 下发动作(与采集频率一致)。
- 立体视觉流: ZED Mini 通过 GStreamer 以 H.265 编码流式传输到 PICO(供操作员查看),同时通过 ZMQ 以 JPEG 格式传输到数据采集进程。
- 通信: 高层指令 p_cmd 经 Redis 发送给低层控制器 π_low。
- 硬件成本: 颈部模块 $250(不含相机),ZED Mini 相机额外 $400,PICO 4U + 2 个动作追踪器整套约 $1000——均为消费级/低成本方案,相较专业动捕摄影棚(通常数万美元且固定于实验室)成本大幅下降。
评测 benchmark
- 数据采集效率对比(Table II,见上文”数据”节数字)。
- 用户研究(Table III,采 10 条示教耗时/成功率对比,专家 vs 新手,逐项消融关键组件):
- 完整 TWIST2:新手 10/12 成功、专家 10/11 成功,合计 20/23;平均耗时新手 75.6s、专家 59.9s、总平均 67.8s(四种配置中最优)。
- 去掉立体视觉(w/o Stereo):新手 10/12、专家 10/15,合计 20/27;平均耗时新手 90.6s、专家 105.9s、总平均 98.3s——论文指出无立体视觉时操作员倾向于抓取位置偏高,显著增加抓取失败率。
- 去掉颈部(w/o Neck):新手 7/17、专家 9/12,合计 16/29(四种配置中成功率最低);平均耗时新手 144.0s、专家 80.5s、总平均 112.3s——论文指出无颈部时操作员无法感知固定视野之外的物体,遥操作极其困难。
- 去掉第一人称视角、改用第三人称+VR透视(w/o Egocentric View):新手 10/13、专家 10/10,合计 20/23;平均耗时新手 94.3s、专家仅 43.0s、总平均 68.7s——专家用时看似很快(10 条示教仅 43 秒),但论文强调这只是因为专家可以直接站在机器人旁边操作,对需要远程操控的长时程移动操作任务并不可行。
- 视觉运动策略自主执行结果:
- WB-Dex(全身灵巧 pick&place,170 条示教训练):论文以 Figure 14 展示全部成功/失败案例,未给出汇总成功率数字;定性结论是策略在多数情况下能可靠地够到杯子,但杯子很轻、抓取需要高精度控制,轻微漂移常导致抓取失败。
- Kick-T(踢 T 形箱到目标区,50 条示教训练):策略在 7 次试验中 6 次成功把箱子踢到目标位置(6/7);当前策略只能朝前踢,尚不能像人一样绕到箱子侧面调整踢击角度,作者将其列为未来工作。
- 论文未与其他人形遥操作/数据采集系统(HOMIE、AMO、CLONE、TWIST)做统一任务下的定量策略成功率对比,只在 Table I 做能力矩阵对比、在长时程遥操作任务(叠毛巾、过门搬篮子)上做定性展示。
创新点与影响
- 首个同时满足”全身控制 + 便携免动捕 + 单操作员”三项的人形数据采集系统(论文 Table I 中唯一在全部 7 个维度打勾的方案),把 TWIST 式全身遥操作从动捕摄影棚搬到了任意场地,PICO 设置仅需约 1 分钟。
- $250 的即插即用 2-DoF 颈部模块,论文估计已覆盖约 80% 的核心人类颈部功能(讨论章节原话),且已复制出 3~4 套,验证了非专家用户也能自行组装。
- 单阶段 PPO 训练取代教师-学生蒸馏,简化了通用动作跟踪控制器的训练流程。
- 首个(据作者所知)基于视觉的全身自主控制策略学习框架——不再把下身简化为根速度指令,而是让视觉运动策略直接输出全身关节目标,论文将此能力的实现直接归功于 TWIST2 提供的高质量示教数据。
- 开源全部软硬件与数据:代码/控制器权重/颈部硬件设计开源在 GitHub(amazon-far/TWIST2),采集数据集开源在 HuggingFace 并托管于社区数据索引站 twist-data.github.io,鼓励社区贡献更多数据集(遵循统一状态/动作格式)。
- 论文自陈局限: (1) 通用动作跟踪器在高度动态动作(如疾跑)上表现不佳,难以跟踪快速复杂运动;(2) PICO 全身姿态估计精度低于高成本动捕系统,尤其肘部和膝部(未放置追踪器的部位)运动质量下降。
- 论文第六节专门讨论”如何规模化人形数据”:呼吁在扩大数据采集规模之前先统一人形硬件(推荐 Unitree G1),并强调第一人称视觉对采集人类级操作数据至关重要。
原始链接
- arXiv: https://arxiv.org/abs/2511.02832
- PDF: https://arxiv.org/pdf/2511.02832
- 项目主页: https://yanjieze.com/TWIST2/
- 代码仓库(完全开源): https://github.com/amazon-far/TWIST2
- 数据集索引站: https://twist-data.github.io/
- YouTube 视频: https://youtu.be/lTtEvI0kUfo
一手源存档(sources/)
- twist2—project-page — 项目主页快照(系统设计图、复现步骤、实验结果、相关工作)
- twist2—github-readme — GitHub README 快照(安装步骤、训练/部署/遥操作使用流程、sim2sim 实测 FPS)
- twist2—twist-data-page — 数据集索引站快照(TWIST2 已发布数据集清单、数据格式规范)
- arXiv 2511.02832 原文(arXiv 原文 PDF,不入 git,通过 arxiv.org/html 抓取阅读)