一句话定位
Alibaba DAMO Academy(联合 HK Embodied AI Lab、CUHK、Hupan Lab)提出的 RynnWorld-4D:把机器人具身世界模型的表示从 2D 像素视频升级为 RGB + Depth + 光流(RGB-DF)三模态同步生成的 4D 表示,用一个 tri-branch 扩散 Transformer 在同一个去噪循环里协同生成三路视频,并配套一个直接消费其内部 4D 特征、单次前向即可出动作的逆动力学策略头 RynnWorld-4D-Policy,属于阿里 “Rynn” 具身智能系列的世界模型分支。
背景与定位
论文的出发点是批评纯 2D 像素空间的视频世界模型(如 Wan、CogVideoX、Pandora 等):2D 投影天然丢失空间结构信息,导致无法做精确的 6-DoF 位姿估计和深度感知交互,且常出现物体尺度漂移、形状变形等跨帧不一致,限制了下游策略学习的可靠性。
现有 4D 场景建模路线分两类,各有明显短板:一类基于 NeRF / 3D Gaussian Splatting,其中优化式方法(如 SC-GS、HFGS 等)计算昂贵且逐场景专属,前馈式方法(L4GM、CAT4D)虽然快但通常局限于以物体为中心的生成;另一类是动态 Structure-from-Motion,能重建时变点云但缺乏从单帧预测未来的生成能力。两类都无法直接复用预训练视频扩散模型的强生成先验。
与本文最接近的两个工作:TesserAct(RGB-Depth-Normal 三模态,法线是静态几何量,需要额外的法线积分+光流一致性后处理才能重建 4D 点云)和 4DNeX(把 Wan2.1-I2V-14B 微调为直接输出 RGB + 逐像素 XYZ 点图)。RynnWorld-4D 的差异化在于用光流替代法线:光流本身就是逐点的运动信号,配合深度可直接反投影出 metric 3D scene flow,不需要 TesserAct 那套显式的法线积分+光流一致性优化算法,同时保留了 2D-对齐格式对视频扩散先验的兼容性。
模型架构
- Backbone:基于 Wan2.2-TI2V-5B 扩散 Transformer(30 层 DiT,隐藏维度 d=3072,FFN 维度 14,336,约 5B 参数),将其原生单分支 RGB 结构扩展为 tri-branch 架构,三个分支(RGB / Depth / Flow)各自独立处理一种模态;深度与光流分支通过复制预训练的 patch embedding、self-attention、归一化层、FFN 初始化,继承视频主干的时空先验。
- 文本条件:三个分支共享文本交叉注意力的 Key/Value 投影(语言任务描述对模态无关)。
- Joint Cross-Modal Attention(JA):每 3 个 Transformer block 插入一次,覆盖全部 30 层(第 0, 3, 6, …, 27 层),共 10 个 JA 模块。每个分支 m 先接一个零初始化的可学习模态嵌入 e^m,经 per-modality LayerNorm 归一化;每个分支只产生一个 Query,以及被其余分支共享复用的一对 Key/Value(把每 block 的参数量从朴素实现的 18d² 降到 12d²);Token 从 [B, T·S, d] reshape 为 [B·T, S, d],使跨模态注意力被限制在同一时间帧内,并对 Q/K 施加 3D RoPE 以在跨分支融合时保持空间位置对齐。
- 输出与门控:不采用 ControlNet 式的”双零初始化”(论文实测会导致鞍点式训练死锁),而是零初始化输出投影 + 一个初始化为 1 的可学习 tanh 门控 g,保证从 Stage-1 checkpoint 平滑热启动的同时,门控本身仍有非零梯度可以增大/减小/变号,避免联合通路被困在原点。
- 训练目标:逐模态 flow matching,速度场 v_θ^m 把高斯噪声 ε^m 传输到数据 z_0^m;三个模态共享同一个高斯噪声样本(ε^rgb=ε^depth=ε^flow)以保证三路去噪轨迹时序对齐;每个模态的第一帧是干净的 I2V 条件帧(真实 RGB 帧 / 真实深度帧 / 零光流帧),不参与监督,损失只算 [1:] 切片;模态权重 λ_rgb=λ_depth=1 恒定,λ_flow 在 Stage 1 为 0.5(flow 首帧无信息量,warm-up 阶段降权)、Stage 2/3 提升到 1.0。
- 训练分辨率:81×480×640(像素),经因果 VAE 4× 时间压缩后对应 T=21 个 latent 帧(T_latent=(T_pixel−1)/4+1)。
- RynnWorld-4D-Policy(逆动力学头):把冻结的 RynnWorld-4D 当作”预测式 4D 视觉编码器”——单次前向(扩散时间步 t=500,取第 15 个 Transformer block 的中间隐状态,N=1,不做多步去噪)提取 RGB/Depth/Flow 三分支各 3072 维特征并沿通道拼接,得到 F_p ∈ R^{B×T×3C×H×W};再用一个 Flow Former(可学习 Query 做逐帧空间交叉注意力 + 时序自注意力)把高维 4D 特征压缩成固定大小表征 Q”;动作生成头用 flow matching 策略,以 Q”、文本 embedding、本体感知 proprioception 为条件,推理时 4 步 Euler ODE(N=4)输出长度 10 的动作块,每个动作 54 维(对应双臂各 7-DoF + 双灵巧手各 20-DoF = 54 自由度)。
数据
- Rynn4DDataset 1.0:超过 2.544 亿帧(254.4M frames),来源为人类第一视角数据集 Epic-Kitchens、EgoVid,以及机器人操作数据集 RoboMIND、RDT-1B、Galaxea、RoboCoin、AgiBot 的混合集合。
- 伪标注流水线(三步,逐段处理):
- 视频描述:用 Qwen3-VL 生成结构化文本描述,视频先按 1 FPS 采样、切成 5 秒片段,每段限定 prompt(主体动作/环境背景/物体交互/场景氛围四要素),生成长度上限 512 token,temperature 0.7。
- 深度标注:用 Depth Anything 3(DA3NESTED-GIANT-LARGE-1.1 checkpoint)在 30 FPS 采样、392px 短边工作分辨率下产出逐帧深度和相机位姿;深度值裁剪到全局 [0.0, 5.0] 米范围,量化为 8-bit 灰度图后双线性上采样回原分辨率保存为深度视频。
- 光流标注:用 DPFlow(SOTA 光流模型)在原生分辨率逐帧对处理,估计的光流场按 Middlebury 色轮编码可视化,保存为 25 FPS 的 MP4。
- 真实机器人数据:硬件为 TIANJI M6 双臂(7-DoF ×2)+ WUJI Hand 双灵巧手(20-DoF ×2,合计 54 自由度),RealSense D435i 提供第一视角图像。遥操作:手臂侧用 5 个 HTC Vive tracker(胸口+双手腕+双上臂),100–120 Hz 计算腕-胸相对变换,接 Pinocchio 逆运动学求解器,再经 Ruckig 轨迹生成器(速度/加速度/加加速度约束平滑)以 200 Hz 下发到机械臂;手部侧用 Manus 数据手套,原始信号转 21 点 MediaPipe 手骨骼格式,重定向到 20-DoF Wuji 手关节空间(带指数滑动平均滤波)。
- 6 个真实任务及各自数据量(世界模型训练 / 策略训练,Table 3):Dual Picking 500/200、Block Pushing 500/200、Hand-over 300/200、Bimanual Lifting 500/200、Lid Placement 300/200、Bowl Stacking 300/200,合计 2,400 条(RynnWorld-4D)与 1,200 条(RynnWorld-4D-Policy,每任务固定 200 条预算以保证与 baseline 公平对比)。策略训练数据额外做 6-DoF 位姿随机化(工作空间坐标 + 轴向旋转)增强泛化。
- 世界模型评测集:从 RoboMIND / RDT-1B / Galaxea 中随机抽取 50 条held-out 视频序列。
训练方法
- 三阶段渐进式训练(论文正文,与 GitHub/HF 卡片一致):
- Stage 1 模态适配:关闭 JA,三分支独立训练,RGB 先验分别向几何(depth)/运动(flow)分布迁移;LR 2×10⁻⁵,warmup 500 步,λ_flow=0.5。
- Stage 2 冻结主干的联合注意力训练:插入 10 个 JA 模块(输出投影零初始化)、冻结主干及每分支自注意力/FFN,只训练 JA 投影、RMSNorm、per-modality LayerNorm、tanh 门控与 3 个模态嵌入;LR 5×10⁻⁵,warmup 200 步;对 {depth, flow} 施加 Branch Dropout(p_drop=0.2,依概率把某分支噪声 latent 的[1:]帧替换为纯高斯噪声,强迫 JA 从可见模态重建它;RGB 因作为外观锚点从不被 dropout);λ_flow=1.0。
- Stage 3 全参数联合 SFT:解冻全部参数,在完整 Rynn4DDataset 1.0 上继续训练;LR 1×10⁻⁵;Branch Dropout 降到 p_drop=0.1。每阶段从上一阶段的纯模型 checkpoint 初始化(优化器/调度器重置)。
- GitHub/HF 卡片额外披露 Stage 3 采用余弦衰减的联合注入(joint_video_decay):depth/flow→RGB 的门控乘子在
joint_video_decay_steps内从 1.0 退火到 0.0,让模型先吸收跨模态一致性、再逐步恢复独立的 RGB 生成质量(此细节论文正文未给出具体步数)。
- 优化器:AdamW(β1=0.9, β2=0.95, weight decay 1×10⁻⁴),余弦学习率调度 + 线性 warmup;EMA 衰减 0.9999,CPU 端保存 shadow 权重用于推理。
- 策略头训练:AdamW,LR 1×10⁻⁴,β=(0.9, 0.9),weight decay 0.05;三段式学习率调度(2% 线性 warmup + 8% 恒定保持 + 90% 余弦衰减到峰值的 10⁻⁶ 倍);batch size 1/GPU,训练 100 epoch;RynnWorld-4D 主干全程冻结,只训练 Flow Former 与 flow matching 动作头。
Infra(训练 / 推理工程)
- 训练硬件:GPU 型号、总卡数、总 GPU 小时未披露。仅知 Stage 2/3 用 DeepSpeed ZeRO-2 + optimizer offload 管理新增 JA 参数的显存;有效 batch size = 单卡 batch(1) × 梯度累积(2–4) × GPU 数(GPU 数未给出具体值)。
- 精度:全程 bf16 混合精度 + 梯度检查点(gradient checkpointing)。
- 推理硬件:单张 NVIDIA RTX 5090,FP8 量化 + FlashAttention 3(FA3)加速。
- 推理延迟分解(Table 1,K=10 动作/次前向):
| 阶段 | 延迟(ms) | 占比 |
|---|---|---|
| 深度估计(DA3) | 85 | 7.7% |
| VAE 编码与 latent 准备 | 18 | 1.6% |
| RynnWorld-4D 三分支 Transformer 前向 | 990 | 89.5% |
| 特征 reshape 与拼接 | 1 | 0.1% |
| Flow Former | 4 | 0.4% |
| 动作 flow matching 头 | 8 | 0.7% |
| 总计 | 1,106 | 100% |
瓶颈是三分支 Transformer 本身(占 89.5%)。
- 控制频率:单次前向约 1.1s → 规划频率 ≈0.9 Hz;但策略每次输出 K=10 步动作块,执行期间(约 1.1s 窗口内)以 50 Hz 缓存查表方式顺序下发,下一轮规划并行计算,从而达到有效控制频率 ≈9 Hz。
- 真实机器人:策略推理频率 50 Hz,底层接口频率 500 Hz,指令延迟 18–30 ms,控制策略与底层接口间通过 LCM(Lightweight Communications and Marshalling)通信。
- 发布权重体量(HF 模型卡):Stage-3 checkpoint 含全量权重(
mp_rank_00_model_states.pt,28 GB)与 EMA shadow 权重(ema_weights.pt,28 GB),推理需二者合计约 56 GB。
评测 benchmark
4D 世界建模质量(Table 4,自建 50 条 held-out 序列;RGB 生成/保真、深度、光流三组指标;N/A = baseline 不具备对应模态生成能力):
| 方法 | IQ↑ | MS↑ | SC↑ | Subj.↑ | SSIM↑ | PSNR↑ | LPIPS↓ | AbsRel↓ | δ₁↑ | AEPE↓ |
|---|---|---|---|---|---|---|---|---|---|---|
| CogVideoX | 0.604 | 0.976 | 0.866 | 0.917 | 0.534 | 12.17 | 0.577 | N/A | N/A | N/A |
| Wan-2.2-TI2V-5B | 0.555 | 0.970 | 0.886 | 0.909 | 0.593 | 14.54 | 0.489 | N/A | N/A | N/A |
| Wan-2.1-I2V-14B | 0.684 | 0.988 | 0.891 | 0.956 | 0.536 | 12.72 | 0.568 | N/A | N/A | N/A |
| Free4D | 0.354 | 0.993 | 0.787 | 0.848 | 0.492 | 12.40 | 0.597 | 0.804 | 0.179 | N/A |
| TesserAct | 0.608 | 0.992 | 0.904 | 0.956 | 0.693 | 16.91 | 0.335 | 0.699 | 0.279 | N/A |
| 4DNeX | 0.637 | 0.994 | 0.917 | 0.986 | 0.649 | 14.47 | 0.404 | 0.423 | 0.327 | N/A |
| RynnWorld-4D | 0.635 | 0.995 | 0.957 | 0.992 | 0.754 | 17.85 | 0.269 | 0.310 | 0.610 | 0.170 |
RynnWorld-4D 的视觉质量(IQ)与最强视频生成 baseline 相当,但深度/光流精度显著领先——δ₁ 达 0.610,较 4DNeX(0.327)和 TesserAct(0.279)几乎翻倍;是唯一能同步给出高精度光流(AEPE 0.170)的方法(其余 4D baseline 均不产出光流)。注:论文按”色轮编码可视化图”的归一化 RGB 色彩空间逐像素 L2 距离计算 AEPE(而非真实光流矢量的端点误差),这是附录里明确说明的度量方式,并非严格意义的像素位移误差。
真实世界双臂操作成功率(Table 5,%,35 次连续试验,120 秒内完成判定成功):
| 方法 | Dual Picking | Block Pushing | Hand-over | Bimanual Lifting | Lid Placement | Bowl Stacking |
|---|---|---|---|---|---|---|
| DP(diffusion-policy) | 77.14 | 85.71 | 17.14 | 88.57 | 57.14 | 57.14 |
| π₀ | 88.57 | 94.29 | 2.86 | 91.43 | 34.29 | 51.43 |
| π₀.₅ | 94.29 | 100.00 | 0.00 | 94.29 | 37.14 | 42.86 |
| RynnWorld-4D-Policy | 94.29 | 97.14 | 28.57 | 97.14 | 65.71 | 65.71 |
在需要高空间精度的 Lid Placement、Bowl Stacking 上均达到 65.71%,超过次优 baseline(DP)8.57 个百分点;在需要动态双手协同交接的 Hand-over 上(28.57%)远超 π₀/π₀.₅(后两者接近 0%,论文归因于基础模型预训练数据偏向平行夹爪、缺乏灵巧手协同先验,且 2D 策略难以推理两个高自由度末端执行器之间的相对 3D 距离与自遮挡)。
消融(世界建模,Table 4 下半):Independent Branches(三分支独立训练,无 JA)AbsRel 0.737 / δ₁ 0.245 / AEPE 0.247(均显著劣于完整模型);w/o MA(跳过 Stage 1 直接联合训练)δ₁ 从 0.610 降到 0.479;w/o 4D Pre-training(只用任务专属真实数据、不做 Rynn4DDataset 1.0 大规模预训练)AEPE 从 0.170 暴涨到 0.729,几何/运动精度全面崩溃;w/o RoPE in JA δ₁ 降到 0.450、AEPE 升到 0.210;shared FFN(三分支共享单个 FFN)AbsRel 0.580 / δ₁ 0.380 / AEPE 0.280。
消融(策略,Table 5 下半):w/o RynnWorld-4D(用 ResNet-18 图像编码器替代 4D 预测式编码器)Dual Picking 成功率从 94.29% 跌到 71.43%;仅 RGB / RGB+Depth / RGB+Optical Flow 三种模态子集依次提升,验证外观、几何、运动线索三者协同对操作任务都有贡献。
创新点与影响
- 提出 RGB-Depth-Flow(RGB-DF) 作为轻量级投影式 4D 表示——用光流替代 TesserAct 的表面法线,深度+光流可直接反投影为 metric 3D scene flow,提供显式动态线索,同时保持 2D-对齐格式以复用大规模视频扩散先验。
- tri-branch + Joint Cross-Modal Attention 架构:每分支独立 Query、共享 K/V 降低跨模态注意力参数量(12d² vs 18d²),配合 3D RoPE 保证跨分支像素级空间对齐;用”零初始化输出投影 + 非零 tanh 门控”替代 ControlNet 式双零初始化,避免训练早期的鞍点死锁。
- Rynn4DDataset 1.0(254.4M 帧混合人类/机器人操作视频 + 伪标注深度光流)被消融证明是决定性因素——去掉大规模 4D 预训练后 AEPE 暴涨 4 倍以上。
- RynnWorld-4D-Policy:把冻结世界模型当作单次前向(N=1,非多步去噪)的 4D 特征提取器,用 Flow Former 压缩后接 flow matching 动作头,在保留 4D 世界模型丰富几何/运动先验的同时避免了逐步生成视频再解码动作的高延迟路径,实现约 9 Hz 有效闭环控制频率。
- 作者自述局限(论文 Sec. 5):(1)扩散去噪过程仍是计算瓶颈,当前 RTX 5090 上约 9 Hz 有效控制频率,对超高频控制任务仍是瓶颈;(2)模型主要针对第一视角(egocentric)场景优化,扩展到多视角系统或多机器人协作场景仍是待解决的开放问题。
原始链接
- arXiv abs:https://arxiv.org/abs/2607.06559
- arXiv PDF:https://arxiv.org/pdf/2607.06559
- 项目主页:https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io
- GitHub:https://github.com/alibaba-damo-academy/RynnWorld-4D
- HuggingFace 模型权重:https://huggingface.co/Alibaba-DAMO-Academy/RynnWorld-4D
- ModelScope:https://www.modelscope.cn/models/DAMO_Academy/RynnWorld-4D
一手源存档(sources/)
- alibaba-rynnworld-4d—github-readme — GitHub alibaba-damo-academy/RynnWorld-4D README(fetched 2026-07-16)
- alibaba-rynnworld-4d—hf-card — HuggingFace Alibaba-DAMO-Academy/RynnWorld-4D model card(fetched 2026-07-16)
- arXiv 2607.06559 全文(arXiv 原文 PDF,不入 git,见上方链接)