世界模型数据:视频语料 · 驾驶数据 · 仿真 · 动作标注 · 配比
世界模型这个 scope 里,“数据”这一维几乎裂成两个不相干的世界。
一端是 RL 世界模型谱系(Dreamer / MuZero / TD-MPC):这里根本不存在一个预先备好的语料。“数据”是 agent 自己与模拟器交互、写进 replay buffer、再被世界模型在隐空间里放大上万倍的经验流——这一端谈的是 env-steps、replay ratio、想象:真实比,没有 mixture、没有 curation、没有 sim-to-real。另一端是 视频世界模型谱系(Cosmos / Genie / GAIA / Yan):数据重新变回 LLM 式的语料工程——小时数、帧数、clip 数、mixture 权重、七阶段 curation pipeline、pass rate。两端之间夹着 驾驶(多视角车队 + 合成增强)、游戏/仿真(引擎自采、动作天然对齐)、机器人操作(遥操作 + 逆动力学)三条各有数据形态的支线,以及 JEPA 表征 与 物理评测基准 两块专门的数据面。
贯穿所有支线的一条隐藏主线是 “动作标签从哪来”——它决定了一个世界模型能不能被当成可交互的策略/规划器,而非只是被动的视频预测器。下面按这条主线,从”无外部语料”走到”互联网规模语料”,逐段展开。
一、RL 世界模型:数据即回放,没有外部语料
从 World Models 到 DreamerV3 这一大族,数据永远是 agent 自己在模拟器里跑出来、写进 replay buffer 的经验序列。没有”数据来源/配比/清洗”的概念,动作标签天然内含在轨迹里(agent 每一步执行的动作被完整记录),也几乎不谈 sim-to-real(模拟器本身就是训练与评测的同一世界,DayDreamer 是罕见地全程在真实机器人上在线学习的例外)。这一端真正的数据变量只有三个:交互预算(env-steps)、回放缓冲结构、以及世界模型带来的 想象:真实放大比。
| 工作 | 环境/基准 | 交互预算 | Replay buffer | 想象:真实放大 |
|---|---|---|---|---|
| world-models-ha-schmidhuber | CarRacing / VizDoom | 各 10,000 条随机 rollout | — | 世界模型不接触奖励 |
| planet | DMC 6 任务 | ~1000 episode(seed S=5,每 100 步采 1 条) | 批 B=50×L=50 | — |
| dreamer-v1 | DMC 20 任务 | 5×10⁶ env steps(R=2 → 2.5M 决策步) | 从 S=5 seed 增长 | — |
| dreamer-v2 | 55 Atari | 200M steps(50M 真实帧) | FIFO 2×10⁶ | 468B 隐状态 ≈ 真实 50M 的 1 万倍 |
| dreamer-v3 | 8 领域 / 150+ 任务 | Minecraft/Atari 100–200M,Control 0.5–1M | 5×10⁶ 均匀+online queue | replay ratio 32–1024 参数化 |
| muzero | Atari / 棋类 | 自对弈生成 | Atari 12.5 万条长 200 序列;棋类 100 万局 | Atari 输入最近 32 帧 |
| director | Ant Maze / Pin Pad | 6–9M steps | 沿用 DreamerV2(未重述) | — |
| recall-to-imagine-r2i | BSuite/POPGym/Memory Maze | 在线 | FIFO 10⁷(DreamerV3 默认的 10×) | 大 buffer 稳定 SSM |
| td-mpc2 | 104 单任务 + 多任务离线 | 单任务 2M–14M | 10⁶ 均匀采样 | — |
DreamerV2 的那一行是整族的题眼:200M 训练步里,世界模型在隐空间”想象”出 4680 亿个紧凑状态 用于学策略,是从真实环境收到的 5000 万输入帧的约 1 万倍——这就是隐空间世界模型的样本放大效应,也是这一族敢于在极小交互预算下工作的底气。
1.1 Atari 100k:样本效率的公共熔炉
SimPLe 提出的 Atari 100k(26 个游戏,每个仅 10 万 agent step = 40 万帧 ≈ 2 小时真人游戏时长,对照无约束 Atari 的 2 亿步是其 1/500 到 1/2000)成了整族 transformer/diffusion 世界模型的标准擂台。它把”数据”彻底压成一个固定预算,逼所有方法在同一条极端样本受限的起跑线上比。
| 工作 | 世界模型骨干 | 采数据细节 | 世界模型训练批 | 想象展开 |
|---|---|---|---|---|
| simple-atari | 视频预测 CNN | 迭代 15 轮,每轮采 6400 步 | — | PPO 在 sim 里跑 1500 万步 |
| iris | Transformer + VQ | ε-greedy 0.01,采样温度 1 | AE 256 / Transformer 64 / AC 64,L=20 | 想象数百万条轨迹 |
| storm | Stochastic Transformer | 每步各更新世界模型/agent 一次 | B1=16×T=64 | B2=1024,C=8 起始想象 L=16 |
| twm-transformer-world-model | Transformer | 平衡采样 softmax(-v/τ),τ=20 | N=100×ℓ=16 | M=400 起点,H=15 |
| rem-parallel-observation-prediction | Transformer + POP | 前 500 epoch 每次采 200 步 | — | 并行观测预测加速 |
| delta-iris | Context-aware tokenizer | count-based 采样,逆计数 5 次方 | — | 每 epoch 采 100 步训 400 步 |
| DIAMOND | Diffusion | on-policy,每 epoch 采 100 步 | batch 32 | 26 游戏 × 5 seed |
| efficientzero | MuZero + SSL | prioritized α=0.6,400 步一段 | — | MCTS 想象 |
| unizero | Transformer latent | 单帧 RGB (3,64,64) | buffer 10⁶ 均匀 | 多任务共享骨干 |
| twister-contrastive-world-model | Transformer + CPC | 随机裁剪+缩放增强 | B=16×L=64 | AC-CPC 对比未来 |
| harmonydream | DreamerV2 变体 | 6 类任务混评 | 250K 离线诊断 buffer | — |
一个反复出现的数据面创新是 不均匀回放采样:因为 replay buffer 随训练缓慢增长,均匀采样会过度偏向早期经验、易过拟合。TWM 的 balanced sampling(softmax(-v/τ))与 Δ-IRIS 的逆计数 5 次方压权是同一动机的两种实现。STORM 则揭示另一条数据线:对 MsPacman/Pong/Freeway 这类探索困难的游戏,往 buffer 里塞 1 条预训练 DQN 采集的示范轨迹 就能显著提分——它诚实地同时报告了”含 Freeway 示范”的 126.7% 与”去掉”后的 122.3%。
1.2 离线 RL 与多任务:把”数据配比”重新引进来
当 RL 世界模型转向离线/多任务,数据才第一次有了配比与规模谱系。MuZero Unplugged 在 RL Unplugged(Atari 46 游戏 × 200M 帧,DM Control 9 任务 40–3000 episode 相差近百倍)上验证同一算法能覆盖 20M–2000M 帧跨数量级预算,并按 channels=√(datapoints/layers) 缩放网络防小数据过拟合。TD-MPC2 把 240 个单任务 agent 的 replay buffer 汇成 80-task(545M transitions / 34GB)与 30-task(345M / 20GB)离线集,天然覆盖 random→expert 全谱系;PWM 直接复用这批数据与 checkpoint(MT30 每任务 120k 轨迹、MT80 MetaWorld 每任务 40k)。DWM 与 DINO-WM 则在 D4RL 与自建仿真上做纯离线规划——后者五套环境(PointMaze 2000 条、Push-T 18500 样本、Rope/Granular 各 1000 条)统一 224×224,明确把”依赖采集轨迹里的 ground-truth 动作”列为局限。PLDM 更极端地自建 23 个 reward-free 数据集,专门扫描数据规模(634→150 万 transition 共 7 档)、数据质量(好/随机混比 6 档)、轨迹长度(须拼接才可达目标)三组消融。
二、视频世界模型:网络视频 + curation pipeline
跨过 UniSim / GenAD 这条线,世界模型的数据面彻底变回 LLM 式的语料工程。规模从 RL 族的”几千 episode”跳到”几千万 clip / 几千万小时”,核心问题换成:语料从哪爬、怎么切、怎么滤、怎么配比、怎么补 caption/动作。
| 工作 | 语料 | 规模 | curation | 动作/条件来源 |
|---|---|---|---|---|
| genad-generalized-predictive-model | OpenDV-2K | 2059h,65.1M 前视帧(YouTube 60.2M,40+ 国 244+ 城) | 手选 43 YouTuber,丢头 90s/尾 30s,BLIP-2 关键词去黑帧 | 光流 GMFlow+ResNet-18 分 13 类驾驶命令 |
| cosmos-predict2-5-world-simulation | 通用网络视频 | 处理 >2 亿视频 / ~3500 万小时 → >60 亿 clip → 约 2 亿可训 clip | 七阶段 pipeline,仅 ~4% 通过全部过滤(Predict1 是 30%) | Qwen2.5-VL 出 short/medium/long 三档 caption |
| Owl-1 | WebVid + Panda-70M | 40 万 + 200 万 = 240 万;世界模型阶段仅 ActivityNet+Vript 2 万条 | 密集描述数据补动力学 | 动力学 d_t 取自人工密集 caption |
| Pandora | 8 源混合 | 1.2M 视频-动作(Panda-70M 500k + 仿真 473k) | Panda-70M 五重过滤 + GPT-4 Turbo 动态 caption | 真实域=既有动作标注;仿真域=转向指令 |
| WorldDreamer | LAION-2B + WebVid-10M + 自采 + NuScenes | 自采 50 万高质量片段 + NuScenes 2.8 万 | PySceneDetect 切镜 + 光流滤慢动作 + Gemini caption | NuScenes 提 ego yaw+速度 |
| LWM | Books3 / LAION-2B+COYO / WebVid10M+InternVid3M | 图文 ~1B、视频 1300 万;1M 上下文用 800 篇长文档 | 按文档长度过滤成 5 档上下文 | 图:视频 50:50,前两阶段混 16% 纯文本 |
| Genesis | 程序化数值引擎 | 无训练语料(引擎非学出来的),生成层未随开源发布 | — | 加载 URDF/MJCF/mesh 驱动 |
| PAN | 公开视频(未披露规模) | 三阶段切分 + 三级过滤(规则/检测器/自训练 VLM) | 剔讲课/字幕/屏录/低质/重剪 | VLM 重打”聚焦时序动态”的稠密 caption |
Cosmos 那一行是整族 curation 工程化的极致样本:七阶段(shot-aware 切分 → GPU 转码 → 裁剪 → 多级过滤 → captioning → 语义去重 → sharding),多级过滤按”美学 → 运动 → OCR 去字幕 → 感知质量 → 语义 artifact → Qwen2.5-VL 兜底”层层收窄,通过率从 Predict1 的 30% 一路压到 4%,剔掉游戏/合成/动画/卡通等非物理分布内容,最后落到 PB 级 Delta Lake + Milvus 向量库。这套 pipeline 与 LLM 预训练的数据工程已经难以区分。
2.1 “未披露”俱乐部:闭源前沿的数据黑箱
视频世界模型的另一半是彻底的数据黑箱。前沿闭源模型几乎无一例外地对训练语料只字不提,这是本 scope 最大的一片系统性空白:
- DeepMind 系:Genie 2(仅”a large-scale video dataset”)、Genie 3(blog 与产品页对语料只字未提,谱系上是否沿用 Genie 1 的”无标注互联网游戏视频”、是否引入真实世界视频均未确认)。作为对照,Genie 1 论文曾披露 ~30k 小时 2D 平台游戏视频。
- Luma:Ray2 与 Ray3 整条视频线都不发数据说明,仅在融资博客把”reality”定性为”AGI 的数据集”。
- World Labs:Marble 与 RTFM 只用”large-scale video data”一词带过。
- Decart:Mirage / MirageLSD 技术报告聚焦方法与工程,无任何数据集章节——这是它与开源的 Oasis(Minecraft VPT 风格轨迹)之间最大的信息差。
- Odyssey:Explorer 披露了背包式采集设备(6 相机 + 2 LiDAR + IMU,13.5K 分辨率 360°)与”decades of real-life video”的理念,但具体小时数/场景数/真实合成比未给。
- AlayaWorld(alayaworld)、MoWorld(moworld-flash-world-model,“多达 500 名标注员的自建管线”)、DreamX-World(dreamx-world-1)、小米汽车世界模型(xiaomi-auto-world-model,仅提”private data”)同样只给流程不给数字。
这份名单本身就是一个信号:数据规模/来源正在成为世界模型厂商最不愿公开的核心资产,透明度与 GPT-3 时代早期 LLM 的走向如出一辙。
三、驾驶世界模型:多视角 + 私有车队 + 合成增强
驾驶是本 scope 里数据谱系最清晰、也最”卷规模”的一支。它有一个人人共用的公共底座——nuScenes(1000 场景,700 训练 / 150 验证 / 150 测试,6 路环视 360°,20 秒/段,2Hz 标注)——几乎所有生成类驾驶世界模型(drivedreamer、Drive-WM、magicdrive、wovogen、Panacea、drivingdiffusion)都在它上面训练。但真正的军备竞赛发生在 nuScenes 之外:谁能拿出更多小时数、更高帧率、更高分辨率的私有车队数据。DrivingWorld 论文的 Table 1 把这条规模阶梯完整排了出来:
| 工作 | 数据规模 | 帧率 | 分辨率 | 来源 |
|---|---|---|---|---|
| DriveSim | 7h | 5Hz | 80×160 | 仿真 |
| DriveGAN | 160h | 8Hz | 256×256 | — |
| drivedreamer | 5h | 12Hz | 128×192 | nuScenes(~1M 帧) |
| drive-wm-driving-into-the-future | 5h | 2Hz | 192×384 | nuScenes |
| wovogen | 5h | 2Hz | 256×448 | nuScenes |
| adriver-i | 300h | 2Hz | 256×512 | 私有 1.4M 帧 + nuScenes 23K |
| genad-generalized-predictive-model | 2000h | 2Hz | 256×448 | OpenDV-2K |
| gaia-1-wayve | 4700h | 25Hz | 288×512 | Wayve 伦敦 2019–23,420M 唯一图像 |
| vista-driving-world-model | 1740h | 10Hz | 576×1024 | OpenDV-YouTube |
| drivingworld-gpt | 120h+3336h | 10Hz | 512×1024 | NuPlan + 中国四城私有 |
| gaia-2-wayve | ~25M 序列 × 2s | 20/25/30Hz | — | 英美德 2019–24,3 车型+2 货车 |
| cosmos-drive-dreams | RDS ~20000h(3.6M clip) | 30Hz | — | NVIDIA 内部平台 |
| nvidia-omnidreams | RDS 16600h + RDS-HQ-1M 4944h ≈ 21544h | 30Hz | 704×1280 | 15 国真实驾驶日志 |
从 5 小时到 2 万小时,跨了三个半数量级。DrivingWorld 的 3336 小时私有数据披露得尤其细:北京约 1668 小时(占一半)+ 南京/合肥/天津均分,2/3 城市道路、1/3 高速乡村,全部白天晴天,标注由离线感知系统自动生成而非人工。这条规模线的尽头是 NVIDIA 的两万小时级 RDS,已经和视频世界模型的通用语料同量级了。
3.1 curation 的核心矛盾:动作分布失衡
驾驶数据几乎都有一个共同顽疾——转向/车速分布严重失衡:绝大多数帧是直行、中速。DOME 直接量化了这一点:nuScenes 训练集约 87% 场景是直行,且每个场景 ego 只经过一次。这逼出了一整套针对动作分布的 curation 手法:
- GAIA-1:主动特征平衡采样,按(分箱、预计算)经验分布的倒数加权,把纬度/经度/天气/转向行为/速度行为的联合概率纳入,平衡强度 e=0.5。
- GAIA-2:升级为按特征的联合概率分布平衡(而非单特征独立),以建模真实共现(如特定地理下的光照+天气)。
- Drive-WM:把每条轨迹切成单一行为片段得 1048 个 unique clip,再按 32×11 的(转向×车速)网格每 bin 采 N=36 得到 7272 clip 的平衡集。
- Vista:nuScenes 按命令类别重平衡以学稀有动作;第二阶段 OpenDV(无标注):nuScenes(有标注)按 1:1 采样协同训练,让可控性零样本泛化到新数据集——作者强调这避免了 GenAD 那种给 OpenDV 硬打命令标签带来的累积噪声。
- OmniDreams:held-out 5000 clip 按 VRU/大型车/雨雪雾夜/隧道铁道等类别平衡采样(而非按训练分布),并用 SIL-Wheel 平台专门上调罕见场景权重。
3.2 世界模型作为数据引擎:合成数据反哺感知
驾驶世界模型的一个独特数据主张是”生成即数据增强”——用世界模型合成新视频反哺下游感知/规划,往往只需极小合成比例就能见效:
- DriveDreamer4D:世界模型是”有效的 4D 数据机器”,用 Waymo 798 段切成 6.4 万 clip 训练,对每个评测场景合成变道/加速/减速三类新轨迹视频。
- Cosmos-Drive-Dreams:每条真实 clip 生成 7× 合成 clip(7 种天气/时段),开源 81,802 条合成视频(5843 clip × 2 chunk × 7 变体)。
- Panacea:合成 Gen-nuScenes 共 139,440 段视频喂 StreamPETR 辅助训练。
- Rethinking DWM:仅插入 420 个合成样本(<2% 训练集) 即提升 3D 检测。
- Delphi:仅生成 972 条(约 4%)失败案例驱动数据即把 UniAD 碰撞率从 0.33 降到 0.27。
- Drive&Gen:约 1000 万 clip 训练生成器,生成 100 万条合成视频微调规划器。
3.3 占据世界模型:从 RGB 转向 3D 语义体素
驾驶世界模型的另一分支不预测像素,而预测 3D 占据(occupancy)。这一支的数据面统一收敛到 Occ3D-nuScenes(体素 0.4m,200×200×16,17 类语义,2Hz,2 秒历史→3 秒未来),共享同一套协议:OccWorld、DOME、OccSora、Drive-OccWorld、I²-World、SparseWorld、SparseWorld-TC、GaussianWorld、GenieDrive、半监督占据 WM 全在此列。这一支的数据卖点是 标注可 scale——3D 占据可从稀疏 LiDAR、累积多帧 LiDAR 或视频自监督学出,昂贵的 HDMap/实例框在此范式里完全不需要。Cam4DOcc 与 Drive-OccWorld 共享同一套重组协议(把 GMO 实例框 + nuScenes-Occupancy 静态标注变换到当前帧体素化,nuScenes 23,930 训练 / 5,119 测试序列,Lyft 15,720 / 5,880)。DriveWorld 则引入 OpenScene(120+ 小时占据标注)做 4D 预训练,用数据规模消融论证 4D 预训练能把下游标注需求降低约 25%。
四、游戏 / 仿真世界模型:引擎自采 + 动作天然对齐
游戏与仿真环境是世界模型的天然数据金矿:动作标签随游玩录制天然对齐,无需逆动力学;且能无限量、可控地采集。这一支的数据规模常达数亿帧。Yan 论文的 Table 1 给了这条线一个清晰的横向对比:
| 数据集 | 分辨率 | FPS | 逐帧交互 | 动作维度 | 规模 |
|---|---|---|---|---|---|
| The Matrix | 720P | 60 | ✓ | 5 | 792M 帧 |
| PlayGen | 128P | 30 | ✓ | 5 | 250M 帧 |
| GameGenX | 720P–4K | 1–24 | ✗ | ✗ | 192M 帧 |
| GameFactory | 360P | 16 | ✓ | 9 | 4M 帧 |
| Matrix-Game | 720P | 16 | ✓ | 7 | 50M 帧 |
| Yan (元梦之星) | 1080P | 30 | ✓ | 8 | 400M 帧 |
再把本 scope 内其余游戏/仿真世界模型的数据规模补齐:
| 工作 | 来源 | 规模 | 动作标注 |
|---|---|---|---|
| gamengen | VizDoom agent 自玩 | 900M 帧(320×240) | 天然带按键,每动作重复 4 帧 |
| playable-game-generation | Mario-AI-Framework / ViZDoom | Mario 236M→均衡采 50M;Doom 900M→200M | 聚类+非负最小二乘均衡采样 |
| microsoft-wham-muse | Xbox《Bleeding Edge》真人 | 7 Maps 1.4B 帧 / 逾 7 年游玩(27.89 TiB) | 手柄动作随录制自带 |
| mineworld | OpenAI VPT 人类录像 | 1000 万 clip / 1.6 亿帧 / 55B token | VPT 逐帧键鼠标注 |
| decart-oasis | Minecraft VPT 风格 | 规模未披露 | VPT 式动作(画面-动作对) |
| skywork-matrix-game | MineDojo | 6000h→滤到 2700h→精选 870h;动作标注 1026h+ | MineRL VPT agent 16Hz 抽键鼠 + UE 程序化真值 |
| skywork-matrix-game-2 | UE5 + GTA5 + Minecraft + Sekai | ~1200h(训练 800h:153h MC + 615h UE + 85h 真实 Sekai) | UE tick 级同步 + GTA5 mod 帧级捕获 |
| skywork-matrix-game-3 | UE5 + AAA 游戏 + 真实 | 基座 4.8M clip;VAE 700K 个 17 帧 | UE tick 零误差对齐 + 物理式 WASD 推断 |
| the-matrix | Forza + Cyberpunk + 真实 | 75 万有标注 + 120 万无标注(真实互联网) | Forza 3 类 / Cyberpunk 5 类,5 种过滤 |
| tencent-hunyuan-gamecraft | 100+ AAA 游戏 + 渲染 | 100 万+ 片段 1080p + 渲染 3000 序列 | Monst3R 重建 6-DoF 相机轨迹 |
| GameFactory GF-Minecraft | MineDojo 程序化 | 70h / 2000+ clip / 每段 2000 帧 | 预设原子动作消除人类偏置 |
游戏世界模型的数据工程重心不在”爬取”而在 去偏与均衡:真实游玩数据天然偏”前进/直行”,PlayGen 用聚类+非负最小二乘构造均衡集,The Matrix 用 5 种过滤(平衡控制信号/碰撞/卡死/动作-位移不匹配/画面伪影)专治 Forza 自动化数据,GameFactory 干脆用预设原子动作序列采集以彻底消除人类行为偏置,Matrix-Game 2.0 用 PPO 训练采集 agent(奖励=碰撞规避+探索效率+轨迹多样性)来主动扩多样性。合成引擎数据(UE/GTA5)相对真实游玩的最大优势是动作与画面零时间误差对齐 + 附带几何真值——Matrix-Game 3.0 强调其 UE tick 级同步做到”时间对齐误差为零”,是外部录制方案做不到的。
五、动作从哪来:遥操作 / 逆动力学 / latent-action
这是贯穿全 scope 的隐藏主线。一个视频世界模型要变成可交互的世界模拟器或可执行的策略,就必须有动作条件。动作标签的来源,大致分四档,从最贵到最省:
① 天然自带(最省)——游戏/仿真引擎录制(见第四节)、机器人遥操作的 (s,a) 轨迹、驾驶的 ego-pose。这类无需额外标注环节。机器人操作世界模型基本都吃这一档现成数据:
| 工作 | 数据 | 规模 | 动作来源 |
|---|---|---|---|
| ivideogpt | OXE + SSv2(35 数据集) | 1,417,954 轨迹(~5TB) | 各数据集自带;Kuka 580k 最多 |
| 3d-vla | 12 OXE + Dobb-E/RH20T/RLBench/CALVIN + HOI | 2M pair / 316k episode | ZoeDepth+RAFT+Grounded-SAM 自动打 3D |
| irasim | RT-1/Bridge/Language-Table/RoboNet | RT-1 82k episode / 231 万 clip 等 | 统一转相对 delta 动作 |
| enerverse | 6 数据集(RT-1/LangTable/Bridge/RoboTurk/ManiSkill/自建 IsaacSim) | ~1977 万帧 / 62.6 万 episode | 各 domain embedding 区分 |
| genie-envisioner | AgiBot-World-Beta | 100 万 episode / 2967h | 遥操作三视角 + 指令对齐 |
| wow-world-omniscient-model | AgiBot+DROID+RoboMIND+自采 | 203 万 clip / 7300h / 6.33 亿帧,12 种本体 | FM-IDM 用 64.6 万图像-动作对 |
| vidar | AgiBot+RoboMind+RDT | 746,533 双臂 episode | 目标域仅 20 分钟/232 段微调(同类 ~1%) |
| roboscape | AgiBotWorld-Beta | 5 万 clip → 650 万训练片段 | 复用平台末端位姿序列 |
| gigaworld-1 | 互联网+开源机器人+人手+自采 | 12,980h(自采 3894h) | Giga DataCrafter 三路结构化标注 |
| alibaba-rynnworld-4d | Epic-Kitchens/EgoVid + 5 机器人集 | 2.544 亿帧 | Depth Anything 3 + DPFlow 伪标注 |
② 逆动力学模型(IDM)补标——视频有画面无动作时,训一个小 IDM(两帧观测→动作)反推。UniPi 用 20 万脚本视频训视频模型、只在 2 万带标注视频上训 IDM;VideoWorld 明确”视频生成器全程不用动作标签,动作标签只用于单独训 IDM”;RoboDreamer、AVDC 同理把 IDM 作为”视频计划→可执行动作”的转换器。
③ Latent action(无监督潜动作,最激进)——干脆不要真实动作标签,从视频里无监督地抽出潜在动作码。这是 Genie 谱系的核心数据主张。AdaWorld 把它推到规模化:预训练 ~2000M 帧、1016 个环境(Gym Retro 1000 环境各采 1M transition + Procgen + OXE + Ego4D + MiraData),配比 Gym Retro 49% / Robot 30% / 3D Rendering 14%,全程不需要显式动作标签,仅在下游适配时用真实动作(每动作 100 样本)初始化嵌入;还提出”偏置动作采样”(一段时间提高某动作概率再切换)比 Genie 的均匀采样生成更丰富场景。潜动作这条线的意义在于让世界模型得以直接吃纯互联网视频。
④ 纯无动作视频(观测预测)——完全放弃动作,只做未来预测/表征。Playable Video Generation 在 BAIR(44K)/Atari Breakout(1407)/Tennis(900)三个纯视频集上学,训练不含任何动作标签;CWM 只在 Kinetics-400 上 MSE 重建预训练、零标注;AVDC 的核心数据主张就是”训练视频全程不含任何与执行机器人相关的动作标签”,靠此实现人手→机器人的跨本体迁移。
一个反复出现的跨本体数据模式是”互联网视频预训练 → 少量真机数据微调”:UniPi(14M video-text + 60M image-text → Bridge 7.2k 微调)、AVDC(Bridge → 20 条人类演示)、Vidar(750K 预训练 → 20 分钟目标域)、TesserAct(CogVideoX 权重 → ~20-30 万标注微调)都走这条路,共同论点是真机数据昂贵、靠视频先验补。
六、表征学习(JEPA)与评测基准的数据面
6.1 JEPA 族:自监督表征,数据即”就地预训练”
JEPA 谱系(I-JEPA → V-JEPA → V-JEPA 2)的数据主张是”在任意规模/领域直接就地自监督预训练”,卖点常是样本效率而非规模。这一族多数不涉及动作、仿真、跨具身,“数据 mixture”往往退化为”数据增强的强度组合”(IWM 系统消融了增强强度,发现增强越弱越难学出等变世界模型)。
| 工作 | 预训练数据 | 规模 | 样本效率亮点 |
|---|---|---|---|
| i-jepa | ImageNet-1K / 22K | 128 万 / 1400 万 | 无手工视图增强,仅 masking |
| v-jepa | VideoMix2M | ~200 万(HT+K710+SSv2) | ViT-H 只”看过”2.1 亿样本,比 OpenCLIP 少两个数量级 |
| v-jepa-2 | VideoMix22M | 2200 万 / >100 万小时 | YT1B curation:316M 场景聚 150 万簇检索到 1.15 亿场景,+1.4 分 |
| intuitive-physics-vjepa | VideoMix2M 子集 | 仅 0.1% HowTo100M(128h)仍 >70% | 数据规模非关键,分布/来源才是 |
| brain-jepa | UK Biobank fMRI | 40,162 人(80% 预训练) | 跨种族泛化到 MACC 亚洲队列 |
| a-jepa | AudioSet-2M | 196 万音频片段 | 加权采样解类别不均衡 |
| stem-jepa-music | Sony 专有多轨 | 2 万曲 / 1350h(比基线少 ~100 倍) | 4 类分轨标签即条件 |
| jepa-speech-tokenizer-daam | LibriLight | ~9000h | 自陈规模仍偏小 |
| lejepa | 10+ 数据集 | ImageNet 到 flowers102 仅 1020 样本 | 任意规模就地预训练 |
| point-jepa | ShapeNet | 41,952 实例 / 55 类 | sim(ShapeNet)→real(ScanObjectNN) |
V-JEPA 的数据消融给了一个反直觉但重要的结论:单任务最优要各自挑数据源(K400 最优在纯 K710、SSv2 最优在 K710+SSv2、IN1K 最优在 K710+HT),只有跨任务平均最优才落在全量 VideoMix2M。直觉物理 进一步证明降低场景多样性的损伤小于降低动作多样性——这些是视频表征学习里少见的、把”数据配比 vs 数据分布”讲清楚的实证。
6.2 物理 / 视频评测基准:数据本身即产品
一大批工作的”数据”就是评测集本身(不训练生成模型,只标注/评测已生成视频)。这类数据的工程重心在 prompt 构造 + 人工标注质量控制:
| 基准 | 规模 | 被测模型 | 人工标注 |
|---|---|---|---|
| physion / physion-plus-plus | TDW 仿真 8/9 场景,训练 2000/场景 | — | >100 真人/条,OCP 配对设计 |
| videophy | 688 caption / 9300 视频 | 9 T2V | 30500 标注,$2800,MTurk |
| videophy-2 | 3940 caption(5.72×)/ 6800 视频 | 7 T2V | 102K 标注,$6115 |
| phygenbench | 160 caption / 1280 视频 | 8 T2V | 27 物理定律 4 域 |
| phyworldbench | 1050 prompt / 12600 视频 | 12 模型 | MTurk 3 人 Yes/No |
| vbench / vbench-2.0 | 16 维×100 / 18 维×70 prompt | 多 T2V | N×5×6 成对比较 |
| worldsimbench | HF-Embodied 35,701 视频 | 8 T2V/TI2V | OE/AD/RM 三场景 |
| worldmodelbench | 350 图文对 / 7 领域 | 14 模型 | 67K 人类标签,65 标注者 |
| worldscore-benchmark | 3000 样例(2000 静+1000 动) | — | 200 人 2AFC |
| physbench | 10,002 题 | VLM | STEM 研究生 4000 小时标注 |
| impossible-videos | IPV-Vid 902 视频 | 10 T2V | 15 人问卷各 31 分钟 |
| physics-iq | 396 真实视频 / 66 场景 | — | 无训练,纯真实拍摄 |
这些基准的数据构造反复用到同一批工具链:PySceneDetect 切镜、GPT-4o/Qwen2-VL 生成 caption、MTurk/Prolific 众包标注(时薪 $15.5–18)、多人多数票 + 抽检重标的质量流程。WorldModelBench 甚至把 350 prompt × 12 模型生成结果作为判官训练集(4421 段视频 × 8 标注)来训一个自动判官,把评测本身也变成了一个数据驱动的模型。
空白与趋势
1. 数据面正在两极分化。 RL 世界模型这端(Dreamer/MuZero)数据几乎已成定式——replay buffer + Atari 100k/DMC 固定预算,创新只剩采样策略(平衡采样、优先级);而视频世界模型那端(Cosmos/GAIA/游戏引擎)数据规模三年翻了三四个数量级,curation pipeline 复杂度直逼 LLM 预训练。两端之间几乎没有共享的数据方法论。
2. “未披露”成为前沿的默认状态。 最强的闭源世界模型(Genie 3、Ray3、Marble、Mirage、Odyssey)无一披露训练语料。可复现的规模数字几乎都来自开源阵营(NVIDIA Cosmos 全套、Skywork Matrix-Game、腾讯 Yan/GameCraft、OpenDV-2K)。数据规模/配比正取代模型架构成为最核心的竞争壁垒。
3. 动作标签是真正的稀缺资源。 天然带动作的数据(游戏引擎、遥操作)量少且贵;互联网视频海量但无动作。三条弥合路线——IDM 反推、latent action 无监督抽取(AdaWorld、Genie 谱系)、纯观测预测(AVDC、CWM)——决定了一个世界模型能否吃互联网视频并变成可交互策略。latent-action 是当前最被看好的方向,因为它让”无动作视频”直接可用。
4. 合成数据从”玩具”变成”数据引擎”。 驾驶端(DriveDreamer4D、Cosmos-Drive-Dreams、<2% 合成即提分)已证明世界模型生成的合成数据能高效反哺下游感知/规划;游戏端 UE/GTA5 引擎(Matrix-Game 3.0)靠”零时间误差对齐 + 几何真值”提供真实录制拿不到的监督信号。世界模型既是数据的消费者,也正在成为数据的生产者。
5. 分布 > 规模,正在被反复验证。 V-JEPA 直觉物理(0.1% 数据仍 >70%)、V-JEPA(单任务最优各挑数据源)、MuZero Unplugged(按数据量缩放网络防过拟合)都指向同一结论:在世界模型里,数据的来源分布/多样性往往比绝对规模更决定性能。这与视频端一味堆小时数的军备竞赛形成微妙张力,也是未来数据工程最值得深挖的方向。