世界模型数据:视频语料 · 驾驶数据 · 仿真 · 动作标注 · 配比

世界模型这个 scope 里,“数据”这一维几乎裂成两个不相干的世界。

一端是 RL 世界模型谱系(Dreamer / MuZero / TD-MPC):这里根本不存在一个预先备好的语料。“数据”是 agent 自己与模拟器交互、写进 replay buffer、再被世界模型在隐空间里放大上万倍的经验流——这一端谈的是 env-steps、replay ratio、想象:真实比,没有 mixture、没有 curation、没有 sim-to-real。另一端是 视频世界模型谱系(Cosmos / Genie / GAIA / Yan):数据重新变回 LLM 式的语料工程——小时数、帧数、clip 数、mixture 权重、七阶段 curation pipeline、pass rate。两端之间夹着 驾驶(多视角车队 + 合成增强)、游戏/仿真(引擎自采、动作天然对齐)、机器人操作(遥操作 + 逆动力学)三条各有数据形态的支线,以及 JEPA 表征物理评测基准 两块专门的数据面。

贯穿所有支线的一条隐藏主线是 “动作标签从哪来”——它决定了一个世界模型能不能被当成可交互的策略/规划器,而非只是被动的视频预测器。下面按这条主线,从”无外部语料”走到”互联网规模语料”,逐段展开。


一、RL 世界模型:数据即回放,没有外部语料

World ModelsDreamerV3 这一大族,数据永远是 agent 自己在模拟器里跑出来、写进 replay buffer 的经验序列。没有”数据来源/配比/清洗”的概念,动作标签天然内含在轨迹里(agent 每一步执行的动作被完整记录),也几乎不谈 sim-to-real(模拟器本身就是训练与评测的同一世界,DayDreamer 是罕见地全程在真实机器人上在线学习的例外)。这一端真正的数据变量只有三个:交互预算(env-steps)、回放缓冲结构、以及世界模型带来的 想象:真实放大比

工作环境/基准交互预算Replay buffer想象:真实放大
world-models-ha-schmidhuberCarRacing / VizDoom各 10,000 条随机 rollout世界模型不接触奖励
planetDMC 6 任务~1000 episode(seed S=5,每 100 步采 1 条)批 B=50×L=50
dreamer-v1DMC 20 任务5×10⁶ env steps(R=2 → 2.5M 决策步)从 S=5 seed 增长
dreamer-v255 Atari200M steps(50M 真实帧)FIFO 2×10⁶468B 隐状态 ≈ 真实 50M 的 1 万倍
dreamer-v38 领域 / 150+ 任务Minecraft/Atari 100–200M,Control 0.5–1M5×10⁶ 均匀+online queuereplay ratio 32–1024 参数化
muzeroAtari / 棋类自对弈生成Atari 12.5 万条长 200 序列;棋类 100 万局Atari 输入最近 32 帧
directorAnt Maze / Pin Pad6–9M steps沿用 DreamerV2(未重述)
recall-to-imagine-r2iBSuite/POPGym/Memory Maze在线FIFO 10⁷(DreamerV3 默认的 10×)大 buffer 稳定 SSM
td-mpc2104 单任务 + 多任务离线单任务 2M–14M10⁶ 均匀采样

DreamerV2 的那一行是整族的题眼:200M 训练步里,世界模型在隐空间”想象”出 4680 亿个紧凑状态 用于学策略,是从真实环境收到的 5000 万输入帧的约 1 万倍——这就是隐空间世界模型的样本放大效应,也是这一族敢于在极小交互预算下工作的底气。

1.1 Atari 100k:样本效率的公共熔炉

SimPLe 提出的 Atari 100k(26 个游戏,每个仅 10 万 agent step = 40 万帧 ≈ 2 小时真人游戏时长,对照无约束 Atari 的 2 亿步是其 1/500 到 1/2000)成了整族 transformer/diffusion 世界模型的标准擂台。它把”数据”彻底压成一个固定预算,逼所有方法在同一条极端样本受限的起跑线上比。

工作世界模型骨干采数据细节世界模型训练批想象展开
simple-atari视频预测 CNN迭代 15 轮,每轮采 6400 步PPO 在 sim 里跑 1500 万步
irisTransformer + VQε-greedy 0.01,采样温度 1AE 256 / Transformer 64 / AC 64,L=20想象数百万条轨迹
stormStochastic Transformer每步各更新世界模型/agent 一次B1=16×T=64B2=1024,C=8 起始想象 L=16
twm-transformer-world-modelTransformer平衡采样 softmax(-v/τ),τ=20N=100×ℓ=16M=400 起点,H=15
rem-parallel-observation-predictionTransformer + POP前 500 epoch 每次采 200 步并行观测预测加速
delta-irisContext-aware tokenizercount-based 采样,逆计数 5 次方每 epoch 采 100 步训 400 步
DIAMONDDiffusionon-policy,每 epoch 采 100 步batch 3226 游戏 × 5 seed
efficientzeroMuZero + SSLprioritized α=0.6,400 步一段MCTS 想象
unizeroTransformer latent单帧 RGB (3,64,64)buffer 10⁶ 均匀多任务共享骨干
twister-contrastive-world-modelTransformer + CPC随机裁剪+缩放增强B=16×L=64AC-CPC 对比未来
harmonydreamDreamerV2 变体6 类任务混评250K 离线诊断 buffer

一个反复出现的数据面创新是 不均匀回放采样:因为 replay buffer 随训练缓慢增长,均匀采样会过度偏向早期经验、易过拟合。TWM 的 balanced sampling(softmax(-v/τ))与 Δ-IRIS 的逆计数 5 次方压权是同一动机的两种实现。STORM 则揭示另一条数据线:对 MsPacman/Pong/Freeway 这类探索困难的游戏,往 buffer 里塞 1 条预训练 DQN 采集的示范轨迹 就能显著提分——它诚实地同时报告了”含 Freeway 示范”的 126.7% 与”去掉”后的 122.3%。

1.2 离线 RL 与多任务:把”数据配比”重新引进来

当 RL 世界模型转向离线/多任务,数据才第一次有了配比与规模谱系。MuZero Unplugged 在 RL Unplugged(Atari 46 游戏 × 200M 帧,DM Control 9 任务 40–3000 episode 相差近百倍)上验证同一算法能覆盖 20M–2000M 帧跨数量级预算,并按 channels=√(datapoints/layers) 缩放网络防小数据过拟合。TD-MPC2240 个单任务 agent 的 replay buffer 汇成 80-task(545M transitions / 34GB)与 30-task(345M / 20GB)离线集,天然覆盖 random→expert 全谱系;PWM 直接复用这批数据与 checkpoint(MT30 每任务 120k 轨迹、MT80 MetaWorld 每任务 40k)。DWMDINO-WM 则在 D4RL 与自建仿真上做纯离线规划——后者五套环境(PointMaze 2000 条、Push-T 18500 样本、Rope/Granular 各 1000 条)统一 224×224,明确把”依赖采集轨迹里的 ground-truth 动作”列为局限。PLDM 更极端地自建 23 个 reward-free 数据集,专门扫描数据规模(634→150 万 transition 共 7 档)、数据质量(好/随机混比 6 档)、轨迹长度(须拼接才可达目标)三组消融。


二、视频世界模型:网络视频 + curation pipeline

跨过 UniSim / GenAD 这条线,世界模型的数据面彻底变回 LLM 式的语料工程。规模从 RL 族的”几千 episode”跳到”几千万 clip / 几千万小时”,核心问题换成:语料从哪爬、怎么切、怎么滤、怎么配比、怎么补 caption/动作

工作语料规模curation动作/条件来源
genad-generalized-predictive-modelOpenDV-2K2059h,65.1M 前视帧(YouTube 60.2M,40+ 国 244+ 城)手选 43 YouTuber,丢头 90s/尾 30s,BLIP-2 关键词去黑帧光流 GMFlow+ResNet-18 分 13 类驾驶命令
cosmos-predict2-5-world-simulation通用网络视频处理 >2 亿视频 / ~3500 万小时 → >60 亿 clip → 约 2 亿可训 clip七阶段 pipeline,仅 ~4% 通过全部过滤(Predict1 是 30%)Qwen2.5-VL 出 short/medium/long 三档 caption
Owl-1WebVid + Panda-70M40 万 + 200 万 = 240 万;世界模型阶段仅 ActivityNet+Vript 2 万条密集描述数据补动力学动力学 d_t 取自人工密集 caption
Pandora8 源混合1.2M 视频-动作(Panda-70M 500k + 仿真 473k)Panda-70M 五重过滤 + GPT-4 Turbo 动态 caption真实域=既有动作标注;仿真域=转向指令
WorldDreamerLAION-2B + WebVid-10M + 自采 + NuScenes自采 50 万高质量片段 + NuScenes 2.8 万PySceneDetect 切镜 + 光流滤慢动作 + Gemini captionNuScenes 提 ego yaw+速度
LWMBooks3 / LAION-2B+COYO / WebVid10M+InternVid3M图文 ~1B、视频 1300 万;1M 上下文用 800 篇长文档按文档长度过滤成 5 档上下文图:视频 50:50,前两阶段混 16% 纯文本
Genesis程序化数值引擎无训练语料(引擎非学出来的),生成层未随开源发布加载 URDF/MJCF/mesh 驱动
PAN公开视频(未披露规模)三阶段切分 + 三级过滤(规则/检测器/自训练 VLM)剔讲课/字幕/屏录/低质/重剪VLM 重打”聚焦时序动态”的稠密 caption

Cosmos 那一行是整族 curation 工程化的极致样本:七阶段(shot-aware 切分 → GPU 转码 → 裁剪 → 多级过滤 → captioning → 语义去重 → sharding),多级过滤按”美学 → 运动 → OCR 去字幕 → 感知质量 → 语义 artifact → Qwen2.5-VL 兜底”层层收窄,通过率从 Predict1 的 30% 一路压到 4%,剔掉游戏/合成/动画/卡通等非物理分布内容,最后落到 PB 级 Delta Lake + Milvus 向量库。这套 pipeline 与 LLM 预训练的数据工程已经难以区分。

2.1 “未披露”俱乐部:闭源前沿的数据黑箱

视频世界模型的另一半是彻底的数据黑箱。前沿闭源模型几乎无一例外地对训练语料只字不提,这是本 scope 最大的一片系统性空白:

  • DeepMind 系Genie 2(仅”a large-scale video dataset”)、Genie 3(blog 与产品页对语料只字未提,谱系上是否沿用 Genie 1 的”无标注互联网游戏视频”、是否引入真实世界视频均未确认)。作为对照,Genie 1 论文曾披露 ~30k 小时 2D 平台游戏视频。
  • LumaRay2Ray3 整条视频线都不发数据说明,仅在融资博客把”reality”定性为”AGI 的数据集”。
  • World LabsMarbleRTFM 只用”large-scale video data”一词带过。
  • DecartMirage / MirageLSD 技术报告聚焦方法与工程,无任何数据集章节——这是它与开源的 Oasis(Minecraft VPT 风格轨迹)之间最大的信息差。
  • OdysseyExplorer 披露了背包式采集设备(6 相机 + 2 LiDAR + IMU,13.5K 分辨率 360°)与”decades of real-life video”的理念,但具体小时数/场景数/真实合成比未给。
  • AlayaWorldalayaworld)、MoWorldmoworld-flash-world-model,“多达 500 名标注员的自建管线”)、DreamX-Worlddreamx-world-1)、小米汽车世界模型xiaomi-auto-world-model,仅提”private data”)同样只给流程不给数字。

这份名单本身就是一个信号:数据规模/来源正在成为世界模型厂商最不愿公开的核心资产,透明度与 GPT-3 时代早期 LLM 的走向如出一辙。


三、驾驶世界模型:多视角 + 私有车队 + 合成增强

驾驶是本 scope 里数据谱系最清晰、也最”卷规模”的一支。它有一个人人共用的公共底座——nuScenes(1000 场景,700 训练 / 150 验证 / 150 测试,6 路环视 360°,20 秒/段,2Hz 标注)——几乎所有生成类驾驶世界模型(drivedreamerDrive-WMmagicdrivewovogenPanaceadrivingdiffusion)都在它上面训练。但真正的军备竞赛发生在 nuScenes 之外:谁能拿出更多小时数、更高帧率、更高分辨率的私有车队数据。DrivingWorld 论文的 Table 1 把这条规模阶梯完整排了出来:

工作数据规模帧率分辨率来源
DriveSim7h5Hz80×160仿真
DriveGAN160h8Hz256×256
drivedreamer5h12Hz128×192nuScenes(~1M 帧)
drive-wm-driving-into-the-future5h2Hz192×384nuScenes
wovogen5h2Hz256×448nuScenes
adriver-i300h2Hz256×512私有 1.4M 帧 + nuScenes 23K
genad-generalized-predictive-model2000h2Hz256×448OpenDV-2K
gaia-1-wayve4700h25Hz288×512Wayve 伦敦 2019–23,420M 唯一图像
vista-driving-world-model1740h10Hz576×1024OpenDV-YouTube
drivingworld-gpt120h+3336h10Hz512×1024NuPlan + 中国四城私有
gaia-2-wayve~25M 序列 × 2s20/25/30Hz英美德 2019–24,3 车型+2 货车
cosmos-drive-dreamsRDS ~20000h(3.6M clip)30HzNVIDIA 内部平台
nvidia-omnidreamsRDS 16600h + RDS-HQ-1M 4944h ≈ 21544h30Hz704×128015 国真实驾驶日志

从 5 小时到 2 万小时,跨了三个半数量级。DrivingWorld 的 3336 小时私有数据披露得尤其细:北京约 1668 小时(占一半)+ 南京/合肥/天津均分,2/3 城市道路、1/3 高速乡村,全部白天晴天,标注由离线感知系统自动生成而非人工。这条规模线的尽头是 NVIDIA 的两万小时级 RDS,已经和视频世界模型的通用语料同量级了。

3.1 curation 的核心矛盾:动作分布失衡

驾驶数据几乎都有一个共同顽疾——转向/车速分布严重失衡:绝大多数帧是直行、中速。DOME 直接量化了这一点:nuScenes 训练集约 87% 场景是直行,且每个场景 ego 只经过一次。这逼出了一整套针对动作分布的 curation 手法:

  • GAIA-1主动特征平衡采样,按(分箱、预计算)经验分布的倒数加权,把纬度/经度/天气/转向行为/速度行为的联合概率纳入,平衡强度 e=0.5。
  • GAIA-2:升级为按特征的联合概率分布平衡(而非单特征独立),以建模真实共现(如特定地理下的光照+天气)。
  • Drive-WM:把每条轨迹切成单一行为片段得 1048 个 unique clip,再按 32×11 的(转向×车速)网格每 bin 采 N=36 得到 7272 clip 的平衡集。
  • Vista:nuScenes 按命令类别重平衡以学稀有动作;第二阶段 OpenDV(无标注):nuScenes(有标注)按 1:1 采样协同训练,让可控性零样本泛化到新数据集——作者强调这避免了 GenAD 那种给 OpenDV 硬打命令标签带来的累积噪声。
  • OmniDreams:held-out 5000 clip 按 VRU/大型车/雨雪雾夜/隧道铁道等类别平衡采样(而非按训练分布),并用 SIL-Wheel 平台专门上调罕见场景权重。

3.2 世界模型作为数据引擎:合成数据反哺感知

驾驶世界模型的一个独特数据主张是”生成即数据增强”——用世界模型合成新视频反哺下游感知/规划,往往只需极小合成比例就能见效:

  • DriveDreamer4D:世界模型是”有效的 4D 数据机器”,用 Waymo 798 段切成 6.4 万 clip 训练,对每个评测场景合成变道/加速/减速三类新轨迹视频。
  • Cosmos-Drive-Dreams:每条真实 clip 生成 合成 clip(7 种天气/时段),开源 81,802 条合成视频(5843 clip × 2 chunk × 7 变体)。
  • Panacea:合成 Gen-nuScenes 共 139,440 段视频喂 StreamPETR 辅助训练。
  • Rethinking DWM:仅插入 420 个合成样本(<2% 训练集) 即提升 3D 检测。
  • Delphi:仅生成 972 条(约 4%)失败案例驱动数据即把 UniAD 碰撞率从 0.33 降到 0.27。
  • Drive&Gen:约 1000 万 clip 训练生成器,生成 100 万条合成视频微调规划器。

3.3 占据世界模型:从 RGB 转向 3D 语义体素

驾驶世界模型的另一分支不预测像素,而预测 3D 占据(occupancy)。这一支的数据面统一收敛到 Occ3D-nuScenes(体素 0.4m,200×200×16,17 类语义,2Hz,2 秒历史→3 秒未来),共享同一套协议:OccWorldDOMEOccSoraDrive-OccWorldI²-WorldSparseWorldSparseWorld-TCGaussianWorldGenieDrive半监督占据 WM 全在此列。这一支的数据卖点是 标注可 scale——3D 占据可从稀疏 LiDAR、累积多帧 LiDAR 或视频自监督学出,昂贵的 HDMap/实例框在此范式里完全不需要。Cam4DOccDrive-OccWorld 共享同一套重组协议(把 GMO 实例框 + nuScenes-Occupancy 静态标注变换到当前帧体素化,nuScenes 23,930 训练 / 5,119 测试序列,Lyft 15,720 / 5,880)。DriveWorld 则引入 OpenScene(120+ 小时占据标注)做 4D 预训练,用数据规模消融论证 4D 预训练能把下游标注需求降低约 25%。


四、游戏 / 仿真世界模型:引擎自采 + 动作天然对齐

游戏与仿真环境是世界模型的天然数据金矿:动作标签随游玩录制天然对齐,无需逆动力学;且能无限量、可控地采集。这一支的数据规模常达数亿帧。Yan 论文的 Table 1 给了这条线一个清晰的横向对比:

数据集分辨率FPS逐帧交互动作维度规模
The Matrix720P605792M 帧
PlayGen128P305250M 帧
GameGenX720P–4K1–24192M 帧
GameFactory360P1694M 帧
Matrix-Game720P16750M 帧
Yan (元梦之星)1080P308400M 帧

再把本 scope 内其余游戏/仿真世界模型的数据规模补齐:

工作来源规模动作标注
gamengenVizDoom agent 自玩900M 帧(320×240)天然带按键,每动作重复 4 帧
playable-game-generationMario-AI-Framework / ViZDoomMario 236M→均衡采 50M;Doom 900M→200M聚类+非负最小二乘均衡采样
microsoft-wham-museXbox《Bleeding Edge》真人7 Maps 1.4B 帧 / 逾 7 年游玩(27.89 TiB)手柄动作随录制自带
mineworldOpenAI VPT 人类录像1000 万 clip / 1.6 亿帧 / 55B tokenVPT 逐帧键鼠标注
decart-oasisMinecraft VPT 风格规模未披露VPT 式动作(画面-动作对)
skywork-matrix-gameMineDojo6000h→滤到 2700h→精选 870h;动作标注 1026h+MineRL VPT agent 16Hz 抽键鼠 + UE 程序化真值
skywork-matrix-game-2UE5 + GTA5 + Minecraft + Sekai~1200h(训练 800h:153h MC + 615h UE + 85h 真实 Sekai)UE tick 级同步 + GTA5 mod 帧级捕获
skywork-matrix-game-3UE5 + AAA 游戏 + 真实基座 4.8M clip;VAE 700K 个 17 帧UE tick 零误差对齐 + 物理式 WASD 推断
the-matrixForza + Cyberpunk + 真实75 万有标注 + 120 万无标注(真实互联网)Forza 3 类 / Cyberpunk 5 类,5 种过滤
tencent-hunyuan-gamecraft100+ AAA 游戏 + 渲染100 万+ 片段 1080p + 渲染 3000 序列Monst3R 重建 6-DoF 相机轨迹
GameFactory GF-MinecraftMineDojo 程序化70h / 2000+ clip / 每段 2000 帧预设原子动作消除人类偏置

游戏世界模型的数据工程重心不在”爬取”而在 去偏与均衡:真实游玩数据天然偏”前进/直行”,PlayGen 用聚类+非负最小二乘构造均衡集,The Matrix 用 5 种过滤(平衡控制信号/碰撞/卡死/动作-位移不匹配/画面伪影)专治 Forza 自动化数据,GameFactory 干脆用预设原子动作序列采集以彻底消除人类行为偏置,Matrix-Game 2.0 用 PPO 训练采集 agent(奖励=碰撞规避+探索效率+轨迹多样性)来主动扩多样性。合成引擎数据(UE/GTA5)相对真实游玩的最大优势是动作与画面零时间误差对齐 + 附带几何真值——Matrix-Game 3.0 强调其 UE tick 级同步做到”时间对齐误差为零”,是外部录制方案做不到的。


五、动作从哪来:遥操作 / 逆动力学 / latent-action

这是贯穿全 scope 的隐藏主线。一个视频世界模型要变成可交互的世界模拟器或可执行的策略,就必须有动作条件。动作标签的来源,大致分四档,从最贵到最省:

① 天然自带(最省)——游戏/仿真引擎录制(见第四节)、机器人遥操作的 (s,a) 轨迹、驾驶的 ego-pose。这类无需额外标注环节。机器人操作世界模型基本都吃这一档现成数据:

工作数据规模动作来源
ivideogptOXE + SSv2(35 数据集)1,417,954 轨迹(~5TB)各数据集自带;Kuka 580k 最多
3d-vla12 OXE + Dobb-E/RH20T/RLBench/CALVIN + HOI2M pair / 316k episodeZoeDepth+RAFT+Grounded-SAM 自动打 3D
irasimRT-1/Bridge/Language-Table/RoboNetRT-1 82k episode / 231 万 clip 等统一转相对 delta 动作
enerverse6 数据集(RT-1/LangTable/Bridge/RoboTurk/ManiSkill/自建 IsaacSim)~1977 万帧 / 62.6 万 episode各 domain embedding 区分
genie-envisionerAgiBot-World-Beta100 万 episode / 2967h遥操作三视角 + 指令对齐
wow-world-omniscient-modelAgiBot+DROID+RoboMIND+自采203 万 clip / 7300h / 6.33 亿帧,12 种本体FM-IDM 用 64.6 万图像-动作对
vidarAgiBot+RoboMind+RDT746,533 双臂 episode目标域仅 20 分钟/232 段微调(同类 ~1%)
roboscapeAgiBotWorld-Beta5 万 clip → 650 万训练片段复用平台末端位姿序列
gigaworld-1互联网+开源机器人+人手+自采12,980h(自采 3894h)Giga DataCrafter 三路结构化标注
alibaba-rynnworld-4dEpic-Kitchens/EgoVid + 5 机器人集2.544 亿帧Depth Anything 3 + DPFlow 伪标注

② 逆动力学模型(IDM)补标——视频有画面无动作时,训一个小 IDM(两帧观测→动作)反推。UniPi 用 20 万脚本视频训视频模型、只在 2 万带标注视频上训 IDM;VideoWorld 明确”视频生成器全程不用动作标签,动作标签只用于单独训 IDM”;RoboDreamerAVDC 同理把 IDM 作为”视频计划→可执行动作”的转换器。

③ Latent action(无监督潜动作,最激进)——干脆不要真实动作标签,从视频里无监督地抽出潜在动作码。这是 Genie 谱系的核心数据主张。AdaWorld 把它推到规模化:预训练 ~2000M 帧、1016 个环境(Gym Retro 1000 环境各采 1M transition + Procgen + OXE + Ego4D + MiraData),配比 Gym Retro 49% / Robot 30% / 3D Rendering 14%,全程不需要显式动作标签,仅在下游适配时用真实动作(每动作 100 样本)初始化嵌入;还提出”偏置动作采样”(一段时间提高某动作概率再切换)比 Genie 的均匀采样生成更丰富场景。潜动作这条线的意义在于让世界模型得以直接吃纯互联网视频。

④ 纯无动作视频(观测预测)——完全放弃动作,只做未来预测/表征。Playable Video Generation 在 BAIR(44K)/Atari Breakout(1407)/Tennis(900)三个纯视频集上学,训练不含任何动作标签;CWM 只在 Kinetics-400 上 MSE 重建预训练、零标注;AVDC 的核心数据主张就是”训练视频全程不含任何与执行机器人相关的动作标签”,靠此实现人手→机器人的跨本体迁移。

一个反复出现的跨本体数据模式是”互联网视频预训练 → 少量真机数据微调”:UniPi(14M video-text + 60M image-text → Bridge 7.2k 微调)、AVDC(Bridge → 20 条人类演示)、Vidar(750K 预训练 → 20 分钟目标域)、TesserAct(CogVideoX 权重 → ~20-30 万标注微调)都走这条路,共同论点是真机数据昂贵、靠视频先验补。


六、表征学习(JEPA)与评测基准的数据面

6.1 JEPA 族:自监督表征,数据即”就地预训练”

JEPA 谱系(I-JEPAV-JEPAV-JEPA 2)的数据主张是”在任意规模/领域直接就地自监督预训练”,卖点常是样本效率而非规模。这一族多数不涉及动作、仿真、跨具身,“数据 mixture”往往退化为”数据增强的强度组合”(IWM 系统消融了增强强度,发现增强越弱越难学出等变世界模型)。

工作预训练数据规模样本效率亮点
i-jepaImageNet-1K / 22K128 万 / 1400 万无手工视图增强,仅 masking
v-jepaVideoMix2M~200 万(HT+K710+SSv2)ViT-H 只”看过”2.1 亿样本,比 OpenCLIP 少两个数量级
v-jepa-2VideoMix22M2200 万 / >100 万小时YT1B curation:316M 场景聚 150 万簇检索到 1.15 亿场景,+1.4 分
intuitive-physics-vjepaVideoMix2M 子集仅 0.1% HowTo100M(128h)仍 >70%数据规模非关键,分布/来源才是
brain-jepaUK Biobank fMRI40,162 人(80% 预训练)跨种族泛化到 MACC 亚洲队列
a-jepaAudioSet-2M196 万音频片段加权采样解类别不均衡
stem-jepa-musicSony 专有多轨2 万曲 / 1350h(比基线少 ~100 倍)4 类分轨标签即条件
jepa-speech-tokenizer-daamLibriLight~9000h自陈规模仍偏小
lejepa10+ 数据集ImageNet 到 flowers102 仅 1020 样本任意规模就地预训练
point-jepaShapeNet41,952 实例 / 55 类sim(ShapeNet)→real(ScanObjectNN)

V-JEPA 的数据消融给了一个反直觉但重要的结论:单任务最优要各自挑数据源(K400 最优在纯 K710、SSv2 最优在 K710+SSv2、IN1K 最优在 K710+HT),只有跨任务平均最优才落在全量 VideoMix2M。直觉物理 进一步证明降低场景多样性的损伤小于降低动作多样性——这些是视频表征学习里少见的、把”数据配比 vs 数据分布”讲清楚的实证。

6.2 物理 / 视频评测基准:数据本身即产品

一大批工作的”数据”就是评测集本身(不训练生成模型,只标注/评测已生成视频)。这类数据的工程重心在 prompt 构造 + 人工标注质量控制

基准规模被测模型人工标注
physion / physion-plus-plusTDW 仿真 8/9 场景,训练 2000/场景>100 真人/条,OCP 配对设计
videophy688 caption / 9300 视频9 T2V30500 标注,$2800,MTurk
videophy-23940 caption(5.72×)/ 6800 视频7 T2V102K 标注,$6115
phygenbench160 caption / 1280 视频8 T2V27 物理定律 4 域
phyworldbench1050 prompt / 12600 视频12 模型MTurk 3 人 Yes/No
vbench / vbench-2.016 维×100 / 18 维×70 prompt多 T2VN×5×6 成对比较
worldsimbenchHF-Embodied 35,701 视频8 T2V/TI2VOE/AD/RM 三场景
worldmodelbench350 图文对 / 7 领域14 模型67K 人类标签,65 标注者
worldscore-benchmark3000 样例(2000 静+1000 动)200 人 2AFC
physbench10,002 题VLMSTEM 研究生 4000 小时标注
impossible-videosIPV-Vid 902 视频10 T2V15 人问卷各 31 分钟
physics-iq396 真实视频 / 66 场景无训练,纯真实拍摄

这些基准的数据构造反复用到同一批工具链:PySceneDetect 切镜、GPT-4o/Qwen2-VL 生成 caption、MTurk/Prolific 众包标注(时薪 $15.5–18)、多人多数票 + 抽检重标的质量流程。WorldModelBench 甚至把 350 prompt × 12 模型生成结果作为判官训练集(4421 段视频 × 8 标注)来训一个自动判官,把评测本身也变成了一个数据驱动的模型。


空白与趋势

1. 数据面正在两极分化。 RL 世界模型这端(Dreamer/MuZero)数据几乎已成定式——replay buffer + Atari 100k/DMC 固定预算,创新只剩采样策略(平衡采样、优先级);而视频世界模型那端(Cosmos/GAIA/游戏引擎)数据规模三年翻了三四个数量级,curation pipeline 复杂度直逼 LLM 预训练。两端之间几乎没有共享的数据方法论。

2. “未披露”成为前沿的默认状态。 最强的闭源世界模型(Genie 3Ray3MarbleMirageOdyssey)无一披露训练语料。可复现的规模数字几乎都来自开源阵营(NVIDIA Cosmos 全套、Skywork Matrix-Game、腾讯 Yan/GameCraft、OpenDV-2K)。数据规模/配比正取代模型架构成为最核心的竞争壁垒。

3. 动作标签是真正的稀缺资源。 天然带动作的数据(游戏引擎、遥操作)量少且贵;互联网视频海量但无动作。三条弥合路线——IDM 反推、latent action 无监督抽取(AdaWorld、Genie 谱系)、纯观测预测(AVDCCWM)——决定了一个世界模型能否吃互联网视频并变成可交互策略。latent-action 是当前最被看好的方向,因为它让”无动作视频”直接可用。

4. 合成数据从”玩具”变成”数据引擎”。 驾驶端(DriveDreamer4DCosmos-Drive-Dreams<2% 合成即提分)已证明世界模型生成的合成数据能高效反哺下游感知/规划;游戏端 UE/GTA5 引擎(Matrix-Game 3.0)靠”零时间误差对齐 + 几何真值”提供真实录制拿不到的监督信号。世界模型既是数据的消费者,也正在成为数据的生产者。

5. 分布 > 规模,正在被反复验证。 V-JEPA 直觉物理(0.1% 数据仍 >70%)、V-JEPA(单任务最优各挑数据源)、MuZero Unplugged(按数据量缩放网络防过拟合)都指向同一结论:在世界模型里,数据的来源分布/多样性往往比绝对规模更决定性能。这与视频端一味堆小时数的军备竞赛形成微妙张力,也是未来数据工程最值得深挖的方向。