一句话定位

阿里 DAMO 提出”数字遥操作(digital teleoperation)“范式——用一个机器人中心、动作条件化的世界模型 RynnWorld-Teleop 替代真实机器人:操作员的手部动作流驱动模型从单张参考图合成高保真第一人称机器人执行视频,动作流本身经标准 retarget 即可变成任意机器人本体的动作标签,从而在不移动真实机器人的情况下产出完整的(视频,动作)轨迹对;蒸馏出的因果流式版本在单张 H100 上跑到 40+ FPS 实时交互,纯合成数据训出的策略能零样本 Sim2Real,混合真实数据能稳定涨点。

背景与定位

机器人学习的数据瓶颈根源在于物理遥操作——每条示范都绑定真实机器人硬件与固定工作空间,操作员时间 × 硬件可用性决定了采集吞吐上限,长尾场景(罕见物体、极端布局)几乎不可能靠人工摆环境覆盖。论文把已有的两条相关技术路线各自的短板挑明:

  • Human-to-Robot 视频翻译(Phantom、Masquerade、X-Humanoid、Mitty、H2R):把机器人手臂”画”到人类示范视频上跨越视觉域差距,但本质是被动的观察层翻译——不产生真实的机器人动作信号,也不支持闭环交互。
  • 动作条件化第一人称世界模型(Hand2World、GeneratedReality、InterDyn、CosHand):能根据人手动作信号合成未来帧,但渲染出的仍是”人手”,机器人本体差距(embodiment gap)没有被跨越。

论文认为一个真正的数字遥操作系统必须同时满足三条:机器人中心(robot-centric,画面里是机器人在执行)、动作可回溯(action-grounded,每帧都对应一个可恢复的关节级动作)、实时(real-time,操作员能保持在控制回路里串联复杂技能)。RynnWorld-Teleop 自称是第一个同时满足三者的系统。基座沿用 Wan 系列(Wan2.2 的 Wan2.2-TI2V-5B)图生视频 DiT,训练目标是标准的 conditional flow matching;与阿里同期发布的 alibaba-rynnworld-4d 同属 Rynn 世界模型系列,但后者面向 4D 场景重建/生成,本作专注”人手动作 → 机器人执行视频”的遥操作数据引擎场景。

模型架构

  • Backbone:基于 Wan2.2-TI2V-5BWan2.2)的图生视频(I2V)架构——3D VAE 编解码器 + Transformer 去噪器 $\mathcal{F}\Theta$。训练目标为 conditional flow matching(CFM):$z_t=(1-t)z_0+t\epsilon$,网络学习速度场 $v\Theta(z_t,t,z_{ref},c)$,条件包括参考图像 latent $z_{ref}=\mathcal{E}(I_{ref})$ 和动作控制 latent $c$。
  • 深度感知动作表示(Depth-Aware Action Representation):动作表示为 21 关节手部骨架视频;为解决 2D 投影固有的深度歧义,采用深度调制渲染——每个关节/骨节的颜色与直径按其相机空间深度动态缩放,兼顾双手与前臂结构。渲染出的骨架视频经预训练 VAE 编码为控制 latent $c\in\mathbb{R}^{C\times T\times H\times W}$,与目标视频 latent 在空间、时间上对齐。
  • 动作注入机制(Pose-to-Video Conditioning):新增一个与原视频 patch embedding 层并行的控制 patch embedding 层 $\mathrm{PatchEmbed}^c_{C\to D}$,二者输出通过可学习标量门控 $\alpha$(初始化为 0.1)相加融合:$x=\mathrm{PatchEmbed}^z_{C\to D}(z_t)+\alpha\cdot\mathrm{PatchEmbed}^c_{C\to D}(\tilde c)$;控制 latent 在送入前先做分布对齐——用运行均值/方差把 $c$ 的统计量对齐到视频 latent 的统计量($\tilde c=\frac{c-\mu_c}{\sigma_c}\cdot\sigma_z+\mu_z$)。$\mathrm{PatchEmbed}^c$ 零初始化,让控制信号平滑地叠加进去而不破坏预训练权重。消融显示这一”加性+分布对齐”方案显著优于直接拼接(concat)方案(FVD 585 vs 1191,见评测节)。
  • 因果流式蒸馏架构:把双向 teacher 蒸馏成因果 student,用因果时序掩码 + 定长 KV cache(预分配缓冲区、原地写入)支持逐帧生成;student 在时刻 $t$ 的注意力被限制在 ${1,\dots,t}$;为保持长时程一致性,把参考图 $I_{ref}$ 的 embedding 作为持久 sink token 常驻缓存,后续生成的 KV 状态依次追加。
  • 数字遥操作动作向量:Retarget 后每帧动作 $a_t\in\mathbb{R}^{54}$,即双 7-DoF 机械臂 + 双 20-DoF 灵巧手的绝对关节位置拼接向量。

数据

Table 1(预训练+机器人域适配统计):

数据集类型序列长度总帧数总切片数
VITRAHuman2530.7M1.23M
EgoDexHuman8174.0M0.91M
Ours (Real-Robot)Robot810.43M5.3K
  • Stage 1 预训练数据:EgoDex(切成 81 帧 clip,3D SE(3) 手部姿态投影为 2D 关节-连杆骨架视频,含双手与前臂)+ VITRA(切成 25 帧 clip,用其自带的 21 关节 MediaPipe 格式动作标注,按每个 clip 首帧相机内外参投影为 2D 骨架视频)。
  • Stage 2 机器人域适配数据:自采集的真实机器人双臂遥操作数据,共 4 类任务、1,800 条示范(全部 1,800 条都用于训练 RynnWorld-Teleop 本身,而非任务专用策略训练):Dual Picking 500、Block Pushing 500、Bimanual Lifting 500、Lid Placement 300。操作员手部动作由动作捕捉(MoCap)记录为同步 2D 骨架序列,轨迹统一切成 81 帧 clip 与 Stage 1 保持时序一致。人→机器人的动作映射通过逆运动学(IK)完成,所有数据统一转换为成对的 (2D 骨架, RGB) 序列。
  • 策略训练用合成数据:论文用 300 条真实示范 + 300 条 RynnWorld-Teleop 生成的合成示范做策略数据增广实验(见评测节),另有一组 π0 完全用 0 条真实 + 300 条合成数据训练的”零真实数据”对照。
  • 评测集:EgoDex-Test(50 条官方测试集视频序列,81 帧@16FPS,人本域);Robotic-Test(20 条自采集遥操作数据中留出的序列,81 帧,覆盖全部四类任务,Stage 2 训练未见过)。

训练方法

三阶段训练管线(论文实验节 + GitHub 训练脚本互相印证):

Stage 0 — TI2V 预热:不带动作条件,直接在人类和机器人视觉域上做标准 text+image-to-video 微调,让基座适应目标环境的视觉特性(光照、具体物体)。2,000 步,学习率 $2\times10^{-5}$,64×H100。

Stage 1 — 动作条件训练(Egocentric Human Pretraining):引入深度感知骨架条件分支,在大规模人类视频上学习手-物交互动力学与骨架配置到真实合成的映射,探索两种训练方案:

  • LoRA:只训 patch embedding 层 + LoRA 权重(rank 64),学习率 $2\times10^{-5}$。
  • 全参数 SFT:学习率 $2\times10^{-5}$,200 步 warmup,EMA(decay 0.999)。

Stage 2 — 机器人域适配(Robotic Domain Adaptation):在 1,800 条成对人-机器人示范上继续微调 Stage 1 checkpoint,跨越 embodiment gap:

  • LoRA:学习率 $1\times10^{-5}$。
  • 全参数 SFT:学习率 $1\times10^{-5}$,EMA(decay 0.999),200 步 warmup。

自回归蒸馏(Autoregressive Distillation)——把双向 teacher 变成因果流式 student,两阶段:

  1. 因果 Flow-Matching 预热:单步速度回归 MSE loss($\mathcal{L}{\text{MSE}}=\mathbb{E}{t,\epsilon}|v_\theta(x_t,t)-(\epsilon-x_0)|^2$),弥合双向/因果处理的结构差异,学习率 $1\times10^{-5}$。GitHub 给出默认 4,000 步、ZeRO-2、有效 batch = TOTAL_GPUS × 梯度累积步(默认 64×2=128)。
  2. Distribution Matching Distillation(DMD):借助可学习 critic + 冻结 teacher 做基于分数的梯度引导,把 student 输出分布推向 teacher 分布;student 做 4 步采样 rollout,关键是跨 chunk 反传梯度穿过持久化 KV cache,以消除 chunk 边界处的接缝伪影。生成学习率 $2\times10^{-6}$,critic 学习率 $5\times10^{-7}$;GitHub 默认再跑 3,000 步 DMD。

消融验证了每个设计的必要性(见评测节):加性+分布对齐融合优于拼接;人类预训练是必要的先验来源(无预训练直接在有限机器人数据上训练会”物体消失/重影”);两阶段蒸馏顺序不可颠倒(跳过因果预热直接 DMD 会训练失稳、纹理模糊)。

Infra(训练 / 推理工程)

  • 训练算力:TI2V 预热阶段 64×NVIDIA H100;Stage 1/2 与蒸馏阶段具体 GPU 数与总 GPU-hours 论文正文未披露(仅给出学习率/步数/EMA 等超参,GitHub 训练脚本给出蒸馏阶段默认有效 batch 128,多机多卡通过 WORLD_SIZE/RANK/MASTER_ADDR/NPROC_PER_NODE 环境变量配置)。
  • 并行/精度:蒸馏阶段用 ZeRO-2;GitHub 额外提供 FP8 量化推理选项(仅 Hopper 架构 H100/H800,依赖 torchao,自动探测算力等级并在非 Hopper GPU 上跳过)与 torch.compile 加速(首次样本含编译开销约 30–60s,后续样本提速 1.3–1.6×)。
  • 推理延迟/吞吐:蒸馏出的因果 student(RynnWorld-Teleop-Causal)用 4 步 flow matching schedule,单张 H100 上在 480×832 分辨率下达到 40.0 FPS,平均单帧延迟约 25ms,拆解为:骨架动作编码 ~5%、因果 DiT 去噪(4 步,滑窗 KV cache)~72%、VAE 视觉解码 ~23%。这一 ~40Hz 有效交互频率显著超过同类动作条件世界模型(Hand2World、InterDyn 的 2–10Hz),并达到/超过机器人相机标准 30Hz 帧率,从而把”感知到执行”的时延缺口降到最低。
  • 真实机器人控制栈(Appendix S7):策略推理频率 50Hz,指令下发延迟 18–30ms,底层接口 500Hz,控制策略与底层接口间通过 LCM(Lightweight Communications and Marshalling)通信;数据采集时 5 个 HTC Vive tracker(胸部+双手腕+双上臂)以 100–120Hz 计算腕-胸相对变换,送入独立进程运行的基于 Pinocchio 的 IK 求解器,输出经 Ruckig 轨迹生成器(速度/加速度/加加速度约束平滑)后以 200Hz 发送给机械臂;手部用 Manus 数据手套采集,原始信号转 21 点 MediaPipe 骨架格式后经专用 retarget 模块映射到 20-DoF WUJI 灵巧手关节空间,并用指数滑动平均滤波平滑。
  • Retargeting 数学(Appendix S8):坐标变换链 $\mathbf{T}{\text{target}}=\mathbf{T}{\text{base}}\cdot\text{Scale}(\mathbf{T}{\text{chest}}^{-1}\cdot\mathbf{T}{\text{wrist}})\cdot\mathbf{T}{\text{ee}}$,平移缩放因子 $s=1.5$ 把操作员工作空间映射到机器人工作空间;IK 用阻尼最小二乘(DLS)迭代求解,自适应阻尼 $\lambda=\lambda{\min}+\frac{0.01}{1+\sigma_{\max}}$(越接近奇异位形阻尼越大);额外注入基于上臂 tracker 的零空间肩部先验(权重 $w=0.5$)以获得自然人形臂姿。

评测 benchmark

世界模型生成质量(Table 4,EgoDex-Test,单卡 H100 测 FPS)

方法PSNR↑SSIM↑LPIPS↓FVD↓FPS↑
CogVideoX-1.5-I2V-5B(文本条件)18.220.7860.32227900.8
Wan-2.2-TI2V-5B(文本条件)18.610.7720.37319982.8
Wan-2.1-I2V-14B(文本条件)18.080.7350.41815400.3
Wan-2.2-I2V-14B(文本条件)21.050.8160.26513370.3
Wan-2.2-TI2V-5B (SFT,同数据直接微调)20.930.8060.28212232.8
InterDyn(动作条件)21.470.8310.2796552.9
CosHand(动作条件)18.140.7850.40615270.8
Mask2IV(动作条件)21.500.8360.21916500.9
RynnWorld-Teleop (LoRA)26.080.8760.1515852.8
RynnWorld-Teleop (SFT)26.780.8870.1195502.8
RynnWorld-Teleop-Causal(蒸馏后实时版)22.250.8300.207122640.0

同数据直接 SFT 微调 Wan2.2-TI2V-5B(不改架构)明显逊于本方法(FVD 1223 vs 585,PSNR 20.93 vs 26.08),说明专门化的深度感知骨架表示 + 分布对齐条件注入是关键,而非单纯多训数据。

消融(LoRA 设定,同 EgoDex-Test):Concatenation Fusion(拼接替代加性融合)FVD 585→1191;w/o Human Pre-training(跳过 Stage 1)FVD 585→2598(严重”物体消失/重影”);w/o DMD(只做因果 warm-up,Causal)PSNR 22.25→19.25;w/o Causal Warm-up(直接对双向 teacher 做 DMD)PSNR 进一步跌至 14.26、训练不稳定。

机器人专用域评测(Robotic-Test,20 条留出序列):RynnWorld-Teleop(SFT)PSNR 22.53 / SSIM 0.898 / LPIPS 0.148 / FVD 763;RynnWorld-Teleop-Causal PSNR 18.66 / SSIM 0.743 / LPIPS 0.249 / FVD 1534(FPS 均 2.8 / 40.0,与上表一致)。

真机策略性能(Table 3,35 次连续试验/任务,120s 超时判失败):用生成数据增广三种主流策略 Diffusion Policyπ0.5π0

方法数据来源Dual PickingBlock PushingBimanual LiftingLid Placement
Diffusion Policy300 真实82.8685.7188.5757.14
Diffusion Policy300 真实+300 合成88.5788.5794.2965.71
π0.5300 真实94.29100.0094.2942.86
π0.5300 真实+300 合成97.1497.14100.0062.86
π0300 真实88.5794.2991.4334.29
π00 真实+300 合成68.5782.8677.1428.57
π0300 真实+300 合成94.29100.0097.1454.29

真实+合成混训在几乎所有任务上一致提升,精度要求最高的 Lid Placement 增益最大:π0.5 从 42.86%→62.86%(+20pp),π0 从 34.29%→54.29%(+20pp)。更值得注意的是 π0 完全不用真实数据、纯靠 300 条合成轨迹训练,仍在 Block Pushing 拿到 82.86%、Bimanual Lifting 拿到 77.14% 的可用成功率,验证了合成视频不仅视觉逼真,也物理可信。t-SNE 特征分布分析(I3D 特征,各采样 1000 帧)显示真实与合成轨迹的特征分布高度重叠,与零样本迁移效果吻合。

OOD 泛化:仅靠现成图像编辑替换参考图中的物体(未见类别/形状)或背景(未见桌布纹理),模型在两个轴上都保持时序一致与物理合理的动作执行,支撑”从单张参考图即可实例化任意目标场景”的范式级主张。

创新点与影响

  • 首次把”数字遥操作”形式化为机器人数据生成新范式,并给出可操作的三条硬性要求(机器人中心、动作可回溯、实时)。
  • 深度调制骨架表示 + 分布对齐加性条件注入,在同一基座(Wan2.2-TI2V-5B)上远超朴素 SFT 与拼接式条件注入,且优于同类人本域动作条件模型(InterDyn/CosHand/Mask2IV)。
  • 因果流式蒸馏把双向 teacher 压缩到 4 步单遍推理,单卡 H100 做到 40+ FPS 实时闭环——远超同类动作条件世界模型的 2–10Hz。
  • 首次给出”纯合成数据训策略可零样本 Sim2Real、混合真实数据稳定涨点”的实证证据,且合成数据增益在高精度任务上最显著,作为数据引擎替代/放大物理遥操作。
  • 作者自述局限:(1) 深度调制渲染仍难处理细粒度液体动力学、高度可变形物体的操纵,需要覆盖此类交互的更丰富训练数据;(2) 跨越 embodiment gap目前依赖逐平台微调,限制了范式在机器人机型舰队间的可扩展性,作者认为可能条件化于机器人运动学描述符的跨本体基础世界模型是未来方向。

原始链接

一手源存档(sources/)