一句话定位
GigaAI(联合清华大学)没有直接再造一个视频世界模型 SOTA,而是先系统研究”什么样的世界模型才能可靠地替代真实机器人做策略评估”——构建 WMBench 基准(324,000+ 人工标注 rollout、7 个视频世界模型、4 种动作表示的受控消融),据此提炼出数据/架构/评估三层设计路线图,再实例化为 evaluator 导向的世界模型 GigaWorld-1(Wan 骨干 + 像素对齐动作控制 + 分层历史记忆 + Relative RoPE + DMD2 少步蒸馏),在核心评测指标上比最强通用 backbone Wan2.2-5B 高 14.9%、比机器人域预训练的 Cosmos-Predict2.5 高 11.6%,代码、部分权重、数据与工具链全部开源。
背景与定位
大模型评估可以用数字基准秒级完成,机器人策略却必须绑定真实机器人做 rollout:论文引用 OpenVLA 的例子——评估 2,500 次 rollout 需要 100 人时,物理机器人还无法保证每次试验的初始状态完全一致。传统仿真器能降低成本,但 sim-to-real gap 与逐场景数字孪生搭建成本仍是硬瓶颈。世界模型由此被视为”折中方案”:既有仿真的可扩展性,又有更接近真实的视觉/物理保真度。但此前工作大多止步于”证明世界模型可以拿来评估”,没有回答”怎样的设计才能让世界模型成为一个可信赖的评估器”这个更根本的问题——这正是本文要填的空白。
论文把世界模型在具身智能中的角色归纳为四种已有范式:作为 data engine(生成合成数据扩充策略训练)、作为 policy(把预测动力学直接嵌入动作生成回路)、作为 interaction environment(提供闭环规划/RL 的可视化测试床)、作为 value critic(评估观测给出长程回报估计)。“作为 policy evaluator”——判断一个策略是否会在真实动力学下成功完成任务——被作者认定为第五种尚未被充分研究的角色,也是本文的核心问题。
方法论上,论文围绕三个问题展开受控实验:(1) 该用什么协议/指标去判断一个世界模型是不是好的评估器(而不只是”视频好看”);(2) 预训练和训练数据如何影响评估器质量;(3) 哪些架构/算法选择最影响评估器可靠性。回答这三问之后才落地为 GigaWorld-1。骨干选型上系统对比了 Cosmos-Predict2.5(机器人/自动驾驶域预训练)、Wan2.1、Wan2.2、LTX-Video、CogVideoX、SVD 六个开源视频生成/世界模型 backbone,最终选择 Wan 系列作为基座(理由是同规模下最强的通用开源 backbone,且生态更成熟便于二次开发)。同一时间窗口内,阿里 DAMO 的 alibaba-rynnworld-teleop(动作条件化第一人称世界模型,服务数字遥操作数据引擎)与 alibaba-rynnworld-4d 也在做机器人世界模型,但落点不同:RynnWorld 系列聚焦数据生成,GigaWorld-1 聚焦策略评估这一独立环节。本文同时是 CVPR 2026 GigaBrain Challenge World Model Track 的官方基准提供方,社区提交(100+ 支队伍)被用来扩充评估器可靠性的实证样本。
模型架构
- Backbone:Wan 系列两种规模——GigaWorld-1-Nano(1.3B,基于 Wan2.1-Fun-1.3B-Control)与 GigaWorld-1-Plus(5B,基于 Wan2.2-Fun-5B-Control;GitHub/HF 权重发布页称之为 “Pro”,与论文 “Plus” 为同一 5B 变体的不同命名)。VAE、文本编码器与预训练 backbone 权重全程冻结,可训练部分集中在 LoRA adapter 与控制分支。
- 自回归化改造:把双向(bidirectional)视频扩散骨干重构为自回归视频续写模型:给定历史 latent 序列 $X_{hist}={x_1,…,x_t}$,模型学习条件分布 $p(X_{future}|X_{hist},C)$;训练时对未来窗口做 flow-matching 加噪 $X_\tau=\alpha_\tau X_{future}+\sigma_\tau\epsilon$,推理时把生成窗口写回历史 buffer 循环迭代,得到 $p(X_{1:T}|C)=\prod_k p(X_k|H_{k-1},C)$。
- 统一控制注入(Unified Control Injection):区分头/腕相机的运动特性——头部相机相对机器人基座近似静止,用渲染的末端执行器(EE)姿态图编码操作意图;腕部相机随机械臂刚性运动,用 ray map(逐像素射线原点+归一化方向)编码相机几何。两路控制图沿图像宽度维拼接成统一控制图 $C_t=\mathrm{Concat}W(C_t^{ee},C_t^{ray})$,经编码器 $E(\cdot)$ 得到控制 latent $Z{ctrl}$,每个自回归窗口取时间对齐的分段 $Z_{ctrl}^{(k)}$ 参与去噪。消融显示”通道拼接式”(channel-concat,即让控制信号从去噪一开始就与噪声 latent 在同一空间维度对齐)显著优于 cross-attention 或 ControlNet 式空间条件(见评测节 Table 3)。
- 分层历史注入 + 分层历史引导注意力(Hierarchical History Injection / Guidance Attention):历史记忆拆成三级 $H_t={H_t^{(L)},H_t^{(M)},H_t^{(S)}}$(长/中/短程),再加一个永不淘汰的首帧 latent anchor $x_{anchor}$ 防止身份/色彩/场景漂移,四者拼成 $\widetilde{H}t$。自注意力层把 Query/Key/Value 拆成 Noisy 与 Hist 两路拼接计算($X{Self}=\mathrm{Attn}([Q_{Noisy},Q_{Hist}],[K_{Noisy},K_{Hist}],[V_{Noisy},V_{Hist}])$),历史侧只提供指导不被重新生成;Cross-attention 只作用于当前噪声窗口(历史 token 已经吸收过任务语义,无需对文本条件重复计算)。
- Relative RoPE:每个自回归步内为 [历史窗口, 未来窗口] 重新分配局部时间坐标 ${0,…,T_h+T_f-1}$,与生成视频的绝对时间戳解耦,避免长程 rollout 时位置编码外推到训练未见过的范围(这是解决”训练用固定绝对位置、推理要无限长 rollout”矛盾的关键手段)。
- Prompt SLERP 过渡:跨任务阶段切换 prompt 时,用球面线性插值(SLERP)在两个文本 embedding 之间采样一串过渡条件,逐窗口注入,避免生硬切 prompt 导致的场景/动作突变(比线性插值更好保持语义结构)。
- 全部四项模块(统一控制、分层记忆、Relative RoPE、SLERP)均由消融单独验证有效,详见”评测 benchmark”。
数据
GigaWorld-1 的训练语料共约 12,980 小时,来自四类互补来源(Table 6):
- 互联网/物理视频:~1,298 小时,单视角,提供通用物理动态先验,无机器人本体标注。
- 开源机器人数据:~5,377 小时(Open X-Embodiment、AgiBot 等),单臂/双臂/人形,单/多视角,含机器人示范动作。
- 第一人称人手数据:~2,411 小时(EgoDex、SynData),RGB + 手部姿态,强调手-物交互但无机器人轨迹。
- Giga 自采数据:~3,894 小时(Giga 人形、Giga 双臂),单/多视角,带标定过的机器人轨迹。
数据清洗采用三级过滤流水线:
- 视频质量门:对采样帧计算清晰度/曝光/噪声/对比度/压缩伪影的聚合分 $Q_{img}(v)$,叠加 LAION/CLIP 式美学-语义评分 $A(v)$ 过滤无关贴图/极端遮挡/非操作内容;再用相邻帧直方图+embedding 差值 $D_t$ 检测场景跳变、黑屏、静止片段,四项联合门控 $\mathbb{1}_{keep}(v)$。
- 运动/轨迹过滤:基于光流幅值 $M(v)$ 剔除静态或信息量不足的片段(等待/持握等任务段例外保留);用运动信号的二阶差分(jerk)$J(v)$ 剔除高频抖动/断续运动;机器人片段额外投影关节指令、末端位姿、夹爪状态到画面,用 VLM 校验动作流与观测运动是否一致,过滤同步误差/标定漂移样本。
- 分布再平衡:按来源类型、本体、相机视角、任务族、运动强度做层次化平衡。
Giga DataCrafter 为留存片段生成三路结构化标注:SAM2 输出逐帧语义 mask(物体/机械臂/手/任务相关背景);Depth Anything 3(DA3)输出稠密深度图(多视角按标定归一化);VLM 快慢双流 captioning(fast 流高频描述 reach/grasp/lift/place 等局部子任务,slow 流低频描述场景布局/工作空间约束等长期上下文)——三路标注离线算好并缓存复用,避免训练时反复调用大模型。
用于研究本体(而非训练语料)的 WMBench 基准数据:2,989 条配对轨迹覆盖 8 类任务,来自 teleop 真实数据与 GigaBrain policy checkpoint 的 rollout 数据(成功/失败都有),两者比例约 1:1;按 episode 不重叠、多样性保留、结果平衡三原则切分,过滤后训练集 82,470 秒/测试集 7,200 秒。另从 CVPR 2026 挑战赛 100+ 支参赛队提交中采样 324,000 条 世界模型 rollout 片段,每 20-30 段串成一条完整长程闭环 episode,由人工按 4 级 World Model as Evaluator Score(WMES,0-3 分)标注(每条 3 人标注 + 1 名资深标注员抽检)。
训练方法
四阶段渐进式训练管线(Figure 10):
- Stage 1:机器人世界基座模型——从预训练视频 backbone 出发,在多源机器人语料上继续训练,flow-matching 目标 $\mathcal{L}{FM}=\mathbb{E}[|u_t-u\theta(x_t,t)|_2^2]$;此阶段是双向、非自回归的,只负责把通用时空先验迁移到具身域。
- Stage 2:自回归世界建模——接入 Relative RoPE、分层历史注入、首帧 anchor、统一控制注入,把 Stage-1 模型转成自回归形式,目标 $\mathcal{L}{AR}=\mathbb{E}[|\epsilon-\epsilon\theta(X_\tau,H_t,C,\tau)|_2^2]$;训练时历史帧采样自真实轨迹,推理时用模型自己生成的帧回填历史(训练-推理对齐是控制长程复合误差的关键)。
- Stage 3:场景 LoRA(可选)——冻结骨干只训练低秩矩阵 $W=W_0+BA$,用于适配特定工作空间/相机标定/物体清单;无场景专属数据时可跳过,直接进入蒸馏。
- Stage 4:少步蒸馏——ODE 蒸馏为可选 warm start(构造师生 ODE 轨迹对并最小化 $\mathcal{L}{ODE}$),DMD2 为必需的最终蒸馏目标 $\mathcal{L}{DMD2}=\lambda_{dm}\mathcal{L}{distill}+\lambda{score}\mathcal{L}{score}+\lambda{GAN}\mathcal{L}_{GAN}$(分布匹配 + score 一致性 + 对抗监督),把去噪步数从 20 步压到 4-6 步。
具体超参(Table 7/8,AdamW β1/β2/ε 均为 0.9/0.999/1e-8,蒸馏阶段 β1=0,权重衰减 1e-3):
| 配置 | Stage1 | Stage2 | ODE(可选) | DMD2 |
|---|---|---|---|---|
| Global Batch | 32 | 32 | 32 | 32 |
| Learning Rate | 5e-5 | 1e-4 | 2.0e-6 ($G_\theta$) | 2.0e-6 ($G_\theta$) / 4.0e-7 ($p_{fake}$) |
| Schedule | Cosine | Cosine | Cosine | Cosine |
| Training Steps | 13k | 36k | 3759 | 2250 |
| Grad Clip | 1.0 | 1.0 | 10.0 | 10.0 |
| LoRA Rank/Alpha | 128/128 | 256/256 | 256/256 ($G_\theta$) | 256/256 (两者) |
| GAN / CFG | – | – | – | Real-score CFG 3.0;GAN head 接第 5/15/25/35/39 层,dim 768,start step 1000 |
| EMA | – | – | decay 0.99, start 250 | decay 0.99, start 750 |
| 精度 / GPU | BF16 / 32×H20 | BF16 / 32×H20 | BF16 / 32×H20 | BF16 / 32×H20 |
关键消融验证的设计选择:动作控制接口对比 4 种(无控制 / cross-attention / ControlNet 式空间条件 / 通道拼接),通道拼接在 Trajectory Accuracy(0.3528)等全部配对指标上最优(详见评测节),说明控制信号必须从去噪一开始就与噪声 latent 空间对齐,而非靠 attention token 隐式传递;数据配比上单独用 GigaData 会过拟合窄机器人分布,追加 AgiBot 明显提升具身/相机视角保真但明显拉低结构性指标(JEPA 相似度 -0.2426、轨迹准确率 -0.1084),追加 PhysData 则综合最优(均分 0.5654→0.6144,+0.0490,主要增益来自 Photometric Consistency +0.3074)。
Infra(训练 / 推理工程)
- 训练:论文披露的四个训练阶段(Stage1/Stage2/ODE/DMD2)均使用 32×NVIDIA H20、BF16 精度;GitHub 开源代码建议的最低复现硬件是单机 8×H20 或 8×A100(用于社区复现/续训,非论文实验本身用量)。论文未给出单步耗时或各阶段总 GPU-hours,故总训练算力未披露。
- 并行/精度优化(System Efficiency Optimization):
- SageAttention:作为可插拔 attention backend,改善访存模式并用低精度执行,正向/反向均支持,可在同 GPU 预算下支撑更长历史记忆和更密的控制 token。
- TinyVAE(基于 TAESD):用于开发期快速预览解码,最终评测/论文可视化仍用完整 VAE 解码器。
- Ulysses 序列并行:沿 token 维度跨 GPU 切分,per-device 激活存储近似按 GPU 数成比例下降,支持更长时间窗口和更丰富控制条件。
- Flash Normalization:融合 LayerNorm/RMSNorm 的 Triton kernel,反向只缓存逐行统计量而非完整归一化激活,内部统计用 FP32 计算,输入输出保持训练精度。
- Flash RoPE:融合 Triton kernel 实现旋转位置编码,避免重复 reshape/chunk/indexing,只保留预计算 sin/cos 表,降低长序列 rollout 的激活内存占用。
- 推理加速基准(H20 96G GPU,1920×480 视频,99 帧):仅替换 attention kernel 提速 1.25×–1.31×;叠加 SageAttention + 6 步 DMD2 + Ulysses 序列并行,论文给出的峰值加速比达 35.93×。项目主页另给出一组配置——4 GPU 张量并行 + DMD2 蒸馏组合达到 27.23×(与论文峰值配置口径不同,两个数字均如实转述,未做换算统一)。
- 部署侧披露(项目主页):单卡 H20 上 12 秒可生成 33 秒的 1920×480 视频(>20 FPS);峰值显存 <24GB,可在单张消费级 RTX 4090 上运行;持续自回归 rollout 可达 **11,000+ 帧(>10 分钟)**而不崩溃或明显质量漂移。开源发布的一键推理脚本(
run_infer_*.sh)默认参数为 10 FPS、单窗口 99 帧,长 rollout 需多窗口自回归拼接。 - 跨域迁移成本:迁移到新领域(如自动驾驶)或新的控制模态(edge/depth 图条件)通常只需 8 GPU、数千训练步,一天内可完成。
评测 benchmark
WMBench 主表(Table 9,六项核心指标归一化均值,剔除易被静态视频”作弊”的外观稳定性指标):
| Model | Size | 类型 | Aesthetic | Image | JEPA | Semantic | Subject | Trajectory | AVG |
|---|---|---|---|---|---|---|---|---|---|
| SVD | 1.5B | 通用 | 0.2861 | 0.6497 | 0.6454 | 0.8411 | 0.8267 | 0.0926 | 0.5569 |
| Wan2.1 1.3B I2V | 1.3B | 通用 | 0.3422 | 0.6856 | 0.6002 | 0.8705 | 0.5568 | 0.1576 | 0.5355 |
| LTX 2.3 | 22B | 通用 | 0.3900 | 0.6967 | 0.5380 | 0.8678 | 0.8248 | 0.1479 | 0.5775 |
| CogVideoX | 5B | 通用 | 0.3303 | 0.6775 | 0.6437 | 0.8633 | 0.6963 | 0.1609 | 0.5620 |
| Wan2.2 5B TI2V | 5B | 通用 | 0.3538 | 0.6980 | 0.5853 | 0.8789 | 0.8883 | 0.1643 | 0.5948 |
| Cosmos-Predict2.5 | 2B | 机器人/自动驾驶 | 0.3491 | 0.7184 | 0.6781 | 0.8764 | 0.8747 | 0.1770 | 0.6123 |
| GigaWorld-1-Nano | 1.3B | 机器人/自回归 | 0.3538 | 0.6802 | 0.8911 | 0.8920 | 0.8600 | 0.3528 | 0.6717 |
| GigaWorld-1-Plus | 5B | 机器人/自回归 | 0.3534 | 0.6765 | 0.9337 | 0.8926 | 0.8883 | 0.3561 | 0.6834 |
GigaWorld-1-Plus 比最强通用 backbone Wan2.2-5B(0.5948)高 14.9%,比机器人域预训练最强基线 Cosmos-Predict2.5(0.6123)高 11.6%(论文摘要采用前一数字作 headline);增益集中在评估器关键指标——JEPA 相似度(0.9337,全场最高)、语义对齐(0.8926,全场最高)、轨迹准确率(0.3561,全场最高)。
长程 rollout 质量(Table 4,每 8 秒一段共 40 秒,多视角 PSNR + 头视 FID/FVD):SVD 从 0-8s 的 PSNR 14.05 骤降到 32-40s 的 6.88,FID 从 142.84 恶化到 419-423;而 “Wan2.1+Mem.”(即 GigaWorld-1 采用的记忆增强配置)全程最优且最稳定:PSNR 19.82→17.41(仅降约 12%),FID 40.58→121.61,FVD 35.30→98.34,远优于其余 5 个无记忆 backbone(Cosmos2.5、LTX-Video、Wan2.2、Wan2.1、SVD)。
指标-WMES 相关性研究(决定了 GigaWorld-1 的指标选型,而非其自身跑分):分组层面 Visual Fidelity(ρ=0.78)、Geometry(ρ=0.71)、Semantics(ρ=0.59)是最强预测器;单指标层面 Subject Consistency(ρ=0.88)、Perspectivity(ρ=0.86)、Instruction Following(ρ=0.84)最强;Background Consistency(ρ=-0.45)、Photometric Consistency(ρ=-0.42)、Interaction Quality(ρ=-0.11)是负相关的”退化指标”——静态视频会在这些指标上刷分但完全无法评估策略好坏。
动作控制接口消融(Table 3,Wan2.1 1.3B 上对比):无控制(Trajectory Acc 0.1576)< cross-attention(0.1620,且拉低其余运动指标)< ControlNet 式(0.2566)< 通道拼接(0.3528,Dynamic Degree 0.3566、Motion Smoothness 0.5747、Subject Consistency 0.8600 均为该组最优)。
VLM 评估器(Qwen3-VL-8B-Instruct + LoRA rank16/alpha32/dropout0.05,2fps 采样 15-32 帧,score token 权重 8.0/格式 token 权重 1.0/理由 token 最低权重 0.05)在 5,000+ 视频上的一致性(Table 1):Exact Acc 87.80%,Adjacent Acc 99.16%,相差两档比例仅 0.84%,MAE 0.1304,RMSE 0.3836,二次加权 Kappa 0.7349,Spearman 0.7574,Kendall τ_b 0.7507,Weighted-F1 0.8744,|Bias| 0.0455——可作为人工标注的可靠低成本替代。
闭环策略一致性(Table 10,4 项任务、多个子任务级检查点):GigaWorld-1 的”生成成功率 vs 真实成功率”拟合线比 CVPR 挑战赛的三个基线模型更贴近对角线,说明校准更好;挑战赛基线普遍系统性高估策略成功率(生成视频看起来”完成了”但真实执行会失败),GigaWorld-1 这一偏差更小但论文承认并未消除(尤其在接触敏感型失败上)。
OOD 泛化(定性,Figure 15):容器颜色/材质、食物品类、桌面纹理变化下几何不崩溃,并能同时正确模拟成功与失败(如洒出)两种结局。
创新点与影响
- 贡献:(1) 把”世界模型作为策略评估器”确立为独立于 data engine/policy/interaction environment/value critic 的第五种研究问题;(2) 构建 WMBench + 324,000+ 标注 rollout 的大规模实证研究,系统回答了”评估器质量该怎么测""数据配比怎么选""架构怎么设计”三个问题;(3) 把结论提炼为可操作的设计路线图(Table 5)并实例化为 GigaWorld-1(像素对齐通道拼接控制 + 分层记忆 + Relative RoPE + DMD2 蒸馏);(4) 代码、部分权重、数据集与工具链全部开源,同时是 CVPR 2026 GigaBrain Challenge World Model Track 的官方基准。
- 反直觉发现:视频”看起来稳定/好看”(外观稳定性、光度一致性)与”能不能评估策略”经常负相关——静态或几乎不动的生成视频会在传统视频质量指标上刷分,却完全无法反映动作效果;模型规模不是决定性因素,机器人/自动驾驶域预训练物理先验(Cosmos-Predict2.5,仅 2B)比同/更大规模的通用 backbone(Wan2.2 5B、LTX 22B)更关键;短程视频生成质量与长程自回归评估器可靠性会脱钩,必须专门在 40 秒级长程 rollout 上评估才能发现视点漂移、物体身份坍塌等失败模式。
- 论文自陈局限:WMBench 的 8 类任务尚未覆盖移动操作、灵巧手内操作、安全关键自主决策场景;研究只聚焦视频类世界模型,其他结构化状态空间/混合 3D 方法可能有不同权衡;VLM 自动标注虽大幅降低成本,但存疑样本仍需人工复核;闭环评估显示现有世界模型(含 GigaWorld-1 本身)对接触敏感型失败仍系统性偏乐观。
- 开源进度(截至 2026-07 GitHub 页面状态):Stage-1 权重(Nano/Pro)、训练代码、推理代码、部分数据处理工具已发布;Stage-2 蒸馏权重、3D RL 后训练脚本、其他领域权重、加速框架仍标注”coming soon”。
原始链接
- arXiv: https://arxiv.org/abs/2607.02642
- arXiv PDF: https://arxiv.org/pdf/2607.02642
- 项目主页: https://open-gigaai.github.io/giga-world-1/
- GitHub: https://github.com/open-gigaai/giga-world-1
- HuggingFace 模型: https://huggingface.co/open-gigaai/Giga-World-1
- HuggingFace 数据集(Toy): https://huggingface.co/datasets/open-gigaai/Giga-World-1-Toydata
- HuggingFace 数据集(CVPR Track): https://huggingface.co/datasets/open-gigaai/CVPR-2026-WorldModel-Track-Dataset
- HuggingFace Leaderboard Space: https://huggingface.co/spaces/open-gigaai/CVPR-2026-WorldModel-Track-LeaderBoard
- ModelScope 模型: https://modelscope.cn/models/GigaAI/Giga-World-1/summary
- ModelScope 数据集: https://modelscope.cn/datasets/GigaAI/Giga-World-1-Toydata
- CVPR 2026 GigaBrain Challenge: https://gigaai-research.github.io/GigaBrain-Challenge-2026/
一手源存档(sources/)
- arXiv 原文 HTML(2607.02642,正文全文精读)(arXiv 原文 PDF,不入 git)
- gigaworld-1—project-page.md(项目主页,含数据构成表、模型对比 leaderboard、加速/显存/长程 rollout 指标)
- gigaworld-1—github-readme.md(GitHub README,含硬件要求、四阶段训练脚本、推理参数、仓库结构)
- gigaworld-1—hf-card.md(HuggingFace 模型卡,含权重目录结构)