一句话定位

GigaAI(联合清华大学)没有直接再造一个视频世界模型 SOTA,而是先系统研究”什么样的世界模型才能可靠地替代真实机器人做策略评估”——构建 WMBench 基准(324,000+ 人工标注 rollout、7 个视频世界模型、4 种动作表示的受控消融),据此提炼出数据/架构/评估三层设计路线图,再实例化为 evaluator 导向的世界模型 GigaWorld-1(Wan 骨干 + 像素对齐动作控制 + 分层历史记忆 + Relative RoPE + DMD2 少步蒸馏),在核心评测指标上比最强通用 backbone Wan2.2-5B 高 14.9%、比机器人域预训练的 Cosmos-Predict2.5 高 11.6%,代码、部分权重、数据与工具链全部开源。

背景与定位

大模型评估可以用数字基准秒级完成,机器人策略却必须绑定真实机器人做 rollout:论文引用 OpenVLA 的例子——评估 2,500 次 rollout 需要 100 人时,物理机器人还无法保证每次试验的初始状态完全一致。传统仿真器能降低成本,但 sim-to-real gap 与逐场景数字孪生搭建成本仍是硬瓶颈。世界模型由此被视为”折中方案”:既有仿真的可扩展性,又有更接近真实的视觉/物理保真度。但此前工作大多止步于”证明世界模型可以拿来评估”,没有回答”怎样的设计才能让世界模型成为一个可信赖的评估器”这个更根本的问题——这正是本文要填的空白。

论文把世界模型在具身智能中的角色归纳为四种已有范式:作为 data engine(生成合成数据扩充策略训练)、作为 policy(把预测动力学直接嵌入动作生成回路)、作为 interaction environment(提供闭环规划/RL 的可视化测试床)、作为 value critic(评估观测给出长程回报估计)。“作为 policy evaluator”——判断一个策略是否会在真实动力学下成功完成任务——被作者认定为第五种尚未被充分研究的角色,也是本文的核心问题。

方法论上,论文围绕三个问题展开受控实验:(1) 该用什么协议/指标去判断一个世界模型是不是好的评估器(而不只是”视频好看”);(2) 预训练和训练数据如何影响评估器质量;(3) 哪些架构/算法选择最影响评估器可靠性。回答这三问之后才落地为 GigaWorld-1。骨干选型上系统对比了 Cosmos-Predict2.5(机器人/自动驾驶域预训练)、Wan2.1Wan2.2、LTX-Video、CogVideoX、SVD 六个开源视频生成/世界模型 backbone,最终选择 Wan 系列作为基座(理由是同规模下最强的通用开源 backbone,且生态更成熟便于二次开发)。同一时间窗口内,阿里 DAMO 的 alibaba-rynnworld-teleop(动作条件化第一人称世界模型,服务数字遥操作数据引擎)与 alibaba-rynnworld-4d 也在做机器人世界模型,但落点不同:RynnWorld 系列聚焦数据生成,GigaWorld-1 聚焦策略评估这一独立环节。本文同时是 CVPR 2026 GigaBrain Challenge World Model Track 的官方基准提供方,社区提交(100+ 支队伍)被用来扩充评估器可靠性的实证样本。

模型架构

  • Backbone:Wan 系列两种规模——GigaWorld-1-Nano(1.3B,基于 Wan2.1-Fun-1.3B-Control)与 GigaWorld-1-Plus(5B,基于 Wan2.2-Fun-5B-Control;GitHub/HF 权重发布页称之为 “Pro”,与论文 “Plus” 为同一 5B 变体的不同命名)。VAE、文本编码器与预训练 backbone 权重全程冻结,可训练部分集中在 LoRA adapter 与控制分支。
  • 自回归化改造:把双向(bidirectional)视频扩散骨干重构为自回归视频续写模型:给定历史 latent 序列 $X_{hist}={x_1,…,x_t}$,模型学习条件分布 $p(X_{future}|X_{hist},C)$;训练时对未来窗口做 flow-matching 加噪 $X_\tau=\alpha_\tau X_{future}+\sigma_\tau\epsilon$,推理时把生成窗口写回历史 buffer 循环迭代,得到 $p(X_{1:T}|C)=\prod_k p(X_k|H_{k-1},C)$。
  • 统一控制注入(Unified Control Injection):区分头/腕相机的运动特性——头部相机相对机器人基座近似静止,用渲染的末端执行器(EE)姿态图编码操作意图;腕部相机随机械臂刚性运动,用 ray map(逐像素射线原点+归一化方向)编码相机几何。两路控制图沿图像宽度维拼接成统一控制图 $C_t=\mathrm{Concat}W(C_t^{ee},C_t^{ray})$,经编码器 $E(\cdot)$ 得到控制 latent $Z{ctrl}$,每个自回归窗口取时间对齐的分段 $Z_{ctrl}^{(k)}$ 参与去噪。消融显示”通道拼接式”(channel-concat,即让控制信号从去噪一开始就与噪声 latent 在同一空间维度对齐)显著优于 cross-attention 或 ControlNet 式空间条件(见评测节 Table 3)。
  • 分层历史注入 + 分层历史引导注意力(Hierarchical History Injection / Guidance Attention):历史记忆拆成三级 $H_t={H_t^{(L)},H_t^{(M)},H_t^{(S)}}$(长/中/短程),再加一个永不淘汰的首帧 latent anchor $x_{anchor}$ 防止身份/色彩/场景漂移,四者拼成 $\widetilde{H}t$。自注意力层把 Query/Key/Value 拆成 Noisy 与 Hist 两路拼接计算($X{Self}=\mathrm{Attn}([Q_{Noisy},Q_{Hist}],[K_{Noisy},K_{Hist}],[V_{Noisy},V_{Hist}])$),历史侧只提供指导不被重新生成;Cross-attention 只作用于当前噪声窗口(历史 token 已经吸收过任务语义,无需对文本条件重复计算)。
  • Relative RoPE:每个自回归步内为 [历史窗口, 未来窗口] 重新分配局部时间坐标 ${0,…,T_h+T_f-1}$,与生成视频的绝对时间戳解耦,避免长程 rollout 时位置编码外推到训练未见过的范围(这是解决”训练用固定绝对位置、推理要无限长 rollout”矛盾的关键手段)。
  • Prompt SLERP 过渡:跨任务阶段切换 prompt 时,用球面线性插值(SLERP)在两个文本 embedding 之间采样一串过渡条件,逐窗口注入,避免生硬切 prompt 导致的场景/动作突变(比线性插值更好保持语义结构)。
  • 全部四项模块(统一控制、分层记忆、Relative RoPE、SLERP)均由消融单独验证有效,详见”评测 benchmark”。

数据

GigaWorld-1 的训练语料共约 12,980 小时,来自四类互补来源(Table 6):

  • 互联网/物理视频:~1,298 小时,单视角,提供通用物理动态先验,无机器人本体标注。
  • 开源机器人数据:~5,377 小时(Open X-Embodiment、AgiBot 等),单臂/双臂/人形,单/多视角,含机器人示范动作。
  • 第一人称人手数据:~2,411 小时(EgoDex、SynData),RGB + 手部姿态,强调手-物交互但无机器人轨迹。
  • Giga 自采数据:~3,894 小时(Giga 人形、Giga 双臂),单/多视角,带标定过的机器人轨迹。

数据清洗采用三级过滤流水线:

  1. 视频质量门:对采样帧计算清晰度/曝光/噪声/对比度/压缩伪影的聚合分 $Q_{img}(v)$,叠加 LAION/CLIP 式美学-语义评分 $A(v)$ 过滤无关贴图/极端遮挡/非操作内容;再用相邻帧直方图+embedding 差值 $D_t$ 检测场景跳变、黑屏、静止片段,四项联合门控 $\mathbb{1}_{keep}(v)$。
  2. 运动/轨迹过滤:基于光流幅值 $M(v)$ 剔除静态或信息量不足的片段(等待/持握等任务段例外保留);用运动信号的二阶差分(jerk)$J(v)$ 剔除高频抖动/断续运动;机器人片段额外投影关节指令、末端位姿、夹爪状态到画面,用 VLM 校验动作流与观测运动是否一致,过滤同步误差/标定漂移样本。
  3. 分布再平衡:按来源类型、本体、相机视角、任务族、运动强度做层次化平衡。

Giga DataCrafter 为留存片段生成三路结构化标注:SAM2 输出逐帧语义 mask(物体/机械臂/手/任务相关背景);Depth Anything 3(DA3)输出稠密深度图(多视角按标定归一化);VLM 快慢双流 captioning(fast 流高频描述 reach/grasp/lift/place 等局部子任务,slow 流低频描述场景布局/工作空间约束等长期上下文)——三路标注离线算好并缓存复用,避免训练时反复调用大模型。

用于研究本体(而非训练语料)的 WMBench 基准数据:2,989 条配对轨迹覆盖 8 类任务,来自 teleop 真实数据与 GigaBrain policy checkpoint 的 rollout 数据(成功/失败都有),两者比例约 1:1;按 episode 不重叠、多样性保留、结果平衡三原则切分,过滤后训练集 82,470 秒/测试集 7,200 秒。另从 CVPR 2026 挑战赛 100+ 支参赛队提交中采样 324,000 条 世界模型 rollout 片段,每 20-30 段串成一条完整长程闭环 episode,由人工按 4 级 World Model as Evaluator Score(WMES,0-3 分)标注(每条 3 人标注 + 1 名资深标注员抽检)。

训练方法

四阶段渐进式训练管线(Figure 10):

  • Stage 1:机器人世界基座模型——从预训练视频 backbone 出发,在多源机器人语料上继续训练,flow-matching 目标 $\mathcal{L}{FM}=\mathbb{E}[|u_t-u\theta(x_t,t)|_2^2]$;此阶段是双向、非自回归的,只负责把通用时空先验迁移到具身域。
  • Stage 2:自回归世界建模——接入 Relative RoPE、分层历史注入、首帧 anchor、统一控制注入,把 Stage-1 模型转成自回归形式,目标 $\mathcal{L}{AR}=\mathbb{E}[|\epsilon-\epsilon\theta(X_\tau,H_t,C,\tau)|_2^2]$;训练时历史帧采样自真实轨迹,推理时用模型自己生成的帧回填历史(训练-推理对齐是控制长程复合误差的关键)。
  • Stage 3:场景 LoRA(可选)——冻结骨干只训练低秩矩阵 $W=W_0+BA$,用于适配特定工作空间/相机标定/物体清单;无场景专属数据时可跳过,直接进入蒸馏。
  • Stage 4:少步蒸馏——ODE 蒸馏为可选 warm start(构造师生 ODE 轨迹对并最小化 $\mathcal{L}{ODE}$),DMD2 为必需的最终蒸馏目标 $\mathcal{L}{DMD2}=\lambda_{dm}\mathcal{L}{distill}+\lambda{score}\mathcal{L}{score}+\lambda{GAN}\mathcal{L}_{GAN}$(分布匹配 + score 一致性 + 对抗监督),把去噪步数从 20 步压到 4-6 步。

具体超参(Table 7/8,AdamW β1/β2/ε 均为 0.9/0.999/1e-8,蒸馏阶段 β1=0,权重衰减 1e-3):

配置Stage1Stage2ODE(可选)DMD2
Global Batch32323232
Learning Rate5e-51e-42.0e-6 ($G_\theta$)2.0e-6 ($G_\theta$) / 4.0e-7 ($p_{fake}$)
ScheduleCosineCosineCosineCosine
Training Steps13k36k37592250
Grad Clip1.01.010.010.0
LoRA Rank/Alpha128/128256/256256/256 ($G_\theta$)256/256 (两者)
GAN / CFGReal-score CFG 3.0;GAN head 接第 5/15/25/35/39 层,dim 768,start step 1000
EMAdecay 0.99, start 250decay 0.99, start 750
精度 / GPUBF16 / 32×H20BF16 / 32×H20BF16 / 32×H20BF16 / 32×H20

关键消融验证的设计选择:动作控制接口对比 4 种(无控制 / cross-attention / ControlNet 式空间条件 / 通道拼接),通道拼接在 Trajectory Accuracy(0.3528)等全部配对指标上最优(详见评测节),说明控制信号必须从去噪一开始就与噪声 latent 空间对齐,而非靠 attention token 隐式传递;数据配比上单独用 GigaData 会过拟合窄机器人分布,追加 AgiBot 明显提升具身/相机视角保真但明显拉低结构性指标(JEPA 相似度 -0.2426、轨迹准确率 -0.1084),追加 PhysData 则综合最优(均分 0.5654→0.6144,+0.0490,主要增益来自 Photometric Consistency +0.3074)。

Infra(训练 / 推理工程)

  • 训练:论文披露的四个训练阶段(Stage1/Stage2/ODE/DMD2)均使用 32×NVIDIA H20、BF16 精度;GitHub 开源代码建议的最低复现硬件是单机 8×H20 或 8×A100(用于社区复现/续训,非论文实验本身用量)。论文未给出单步耗时或各阶段总 GPU-hours,故总训练算力未披露
  • 并行/精度优化(System Efficiency Optimization)
    • SageAttention:作为可插拔 attention backend,改善访存模式并用低精度执行,正向/反向均支持,可在同 GPU 预算下支撑更长历史记忆和更密的控制 token。
    • TinyVAE(基于 TAESD):用于开发期快速预览解码,最终评测/论文可视化仍用完整 VAE 解码器。
    • Ulysses 序列并行:沿 token 维度跨 GPU 切分,per-device 激活存储近似按 GPU 数成比例下降,支持更长时间窗口和更丰富控制条件。
    • Flash Normalization:融合 LayerNorm/RMSNorm 的 Triton kernel,反向只缓存逐行统计量而非完整归一化激活,内部统计用 FP32 计算,输入输出保持训练精度。
    • Flash RoPE:融合 Triton kernel 实现旋转位置编码,避免重复 reshape/chunk/indexing,只保留预计算 sin/cos 表,降低长序列 rollout 的激活内存占用。
  • 推理加速基准(H20 96G GPU,1920×480 视频,99 帧):仅替换 attention kernel 提速 1.25×–1.31×;叠加 SageAttention + 6 步 DMD2 + Ulysses 序列并行,论文给出的峰值加速比达 35.93×。项目主页另给出一组配置——4 GPU 张量并行 + DMD2 蒸馏组合达到 27.23×(与论文峰值配置口径不同,两个数字均如实转述,未做换算统一)。
  • 部署侧披露(项目主页):单卡 H20 上 12 秒可生成 33 秒的 1920×480 视频(>20 FPS);峰值显存 <24GB,可在单张消费级 RTX 4090 上运行;持续自回归 rollout 可达 **11,000+ 帧(>10 分钟)**而不崩溃或明显质量漂移。开源发布的一键推理脚本(run_infer_*.sh)默认参数为 10 FPS、单窗口 99 帧,长 rollout 需多窗口自回归拼接。
  • 跨域迁移成本:迁移到新领域(如自动驾驶)或新的控制模态(edge/depth 图条件)通常只需 8 GPU、数千训练步,一天内可完成。

评测 benchmark

WMBench 主表(Table 9,六项核心指标归一化均值,剔除易被静态视频”作弊”的外观稳定性指标):

ModelSize类型AestheticImageJEPASemanticSubjectTrajectoryAVG
SVD1.5B通用0.28610.64970.64540.84110.82670.09260.5569
Wan2.1 1.3B I2V1.3B通用0.34220.68560.60020.87050.55680.15760.5355
LTX 2.322B通用0.39000.69670.53800.86780.82480.14790.5775
CogVideoX5B通用0.33030.67750.64370.86330.69630.16090.5620
Wan2.2 5B TI2V5B通用0.35380.69800.58530.87890.88830.16430.5948
Cosmos-Predict2.52B机器人/自动驾驶0.34910.71840.67810.87640.87470.17700.6123
GigaWorld-1-Nano1.3B机器人/自回归0.35380.68020.89110.89200.86000.35280.6717
GigaWorld-1-Plus5B机器人/自回归0.35340.67650.93370.89260.88830.35610.6834

GigaWorld-1-Plus 比最强通用 backbone Wan2.2-5B(0.5948)高 14.9%,比机器人域预训练最强基线 Cosmos-Predict2.5(0.6123)高 11.6%(论文摘要采用前一数字作 headline);增益集中在评估器关键指标——JEPA 相似度(0.9337,全场最高)、语义对齐(0.8926,全场最高)、轨迹准确率(0.3561,全场最高)。

长程 rollout 质量(Table 4,每 8 秒一段共 40 秒,多视角 PSNR + 头视 FID/FVD):SVD 从 0-8s 的 PSNR 14.05 骤降到 32-40s 的 6.88,FID 从 142.84 恶化到 419-423;而 “Wan2.1+Mem.”(即 GigaWorld-1 采用的记忆增强配置)全程最优且最稳定:PSNR 19.82→17.41(仅降约 12%),FID 40.58→121.61,FVD 35.30→98.34,远优于其余 5 个无记忆 backbone(Cosmos2.5、LTX-Video、Wan2.2、Wan2.1、SVD)。

指标-WMES 相关性研究(决定了 GigaWorld-1 的指标选型,而非其自身跑分):分组层面 Visual Fidelity(ρ=0.78)、Geometry(ρ=0.71)、Semantics(ρ=0.59)是最强预测器;单指标层面 Subject Consistency(ρ=0.88)、Perspectivity(ρ=0.86)、Instruction Following(ρ=0.84)最强;Background Consistency(ρ=-0.45)、Photometric Consistency(ρ=-0.42)、Interaction Quality(ρ=-0.11)是负相关的”退化指标”——静态视频会在这些指标上刷分但完全无法评估策略好坏。

动作控制接口消融(Table 3,Wan2.1 1.3B 上对比):无控制(Trajectory Acc 0.1576)< cross-attention(0.1620,且拉低其余运动指标)< ControlNet 式(0.2566)< 通道拼接(0.3528,Dynamic Degree 0.3566、Motion Smoothness 0.5747、Subject Consistency 0.8600 均为该组最优)。

VLM 评估器(Qwen3-VL-8B-Instruct + LoRA rank16/alpha32/dropout0.05,2fps 采样 15-32 帧,score token 权重 8.0/格式 token 权重 1.0/理由 token 最低权重 0.05)在 5,000+ 视频上的一致性(Table 1):Exact Acc 87.80%,Adjacent Acc 99.16%,相差两档比例仅 0.84%,MAE 0.1304,RMSE 0.3836,二次加权 Kappa 0.7349,Spearman 0.7574,Kendall τ_b 0.7507,Weighted-F1 0.8744,|Bias| 0.0455——可作为人工标注的可靠低成本替代。

闭环策略一致性(Table 10,4 项任务、多个子任务级检查点):GigaWorld-1 的”生成成功率 vs 真实成功率”拟合线比 CVPR 挑战赛的三个基线模型更贴近对角线,说明校准更好;挑战赛基线普遍系统性高估策略成功率(生成视频看起来”完成了”但真实执行会失败),GigaWorld-1 这一偏差更小但论文承认并未消除(尤其在接触敏感型失败上)。

OOD 泛化(定性,Figure 15):容器颜色/材质、食物品类、桌面纹理变化下几何不崩溃,并能同时正确模拟成功与失败(如洒出)两种结局。

创新点与影响

  • 贡献:(1) 把”世界模型作为策略评估器”确立为独立于 data engine/policy/interaction environment/value critic 的第五种研究问题;(2) 构建 WMBench + 324,000+ 标注 rollout 的大规模实证研究,系统回答了”评估器质量该怎么测""数据配比怎么选""架构怎么设计”三个问题;(3) 把结论提炼为可操作的设计路线图(Table 5)并实例化为 GigaWorld-1(像素对齐通道拼接控制 + 分层记忆 + Relative RoPE + DMD2 蒸馏);(4) 代码、部分权重、数据集与工具链全部开源,同时是 CVPR 2026 GigaBrain Challenge World Model Track 的官方基准。
  • 反直觉发现:视频”看起来稳定/好看”(外观稳定性、光度一致性)与”能不能评估策略”经常负相关——静态或几乎不动的生成视频会在传统视频质量指标上刷分,却完全无法反映动作效果;模型规模不是决定性因素,机器人/自动驾驶域预训练物理先验(Cosmos-Predict2.5,仅 2B)比同/更大规模的通用 backbone(Wan2.2 5B、LTX 22B)更关键;短程视频生成质量与长程自回归评估器可靠性会脱钩,必须专门在 40 秒级长程 rollout 上评估才能发现视点漂移、物体身份坍塌等失败模式。
  • 论文自陈局限:WMBench 的 8 类任务尚未覆盖移动操作、灵巧手内操作、安全关键自主决策场景;研究只聚焦视频类世界模型,其他结构化状态空间/混合 3D 方法可能有不同权衡;VLM 自动标注虽大幅降低成本,但存疑样本仍需人工复核;闭环评估显示现有世界模型(含 GigaWorld-1 本身)对接触敏感型失败仍系统性偏乐观。
  • 开源进度(截至 2026-07 GitHub 页面状态):Stage-1 权重(Nano/Pro)、训练代码、推理代码、部分数据处理工具已发布;Stage-2 蒸馏权重、3D RL 后训练脚本、其他领域权重、加速框架仍标注”coming soon”。

原始链接

一手源存档(sources/)

  • arXiv 原文 HTML(2607.02642,正文全文精读)(arXiv 原文 PDF,不入 git)
  • gigaworld-1—project-page.md(项目主页,含数据构成表、模型对比 leaderboard、加速/显存/长程 rollout 指标)
  • gigaworld-1—github-readme.md(GitHub README,含硬件要求、四阶段训练脚本、推理参数、仓库结构)
  • gigaworld-1—hf-card.md(HuggingFace 模型卡,含权重目录结构)