一句话定位

Oasis 是 Decart(以色列)与 Etched(美国)2024-10-31 联合发布的第一个可实时游玩的开放世界 AI 世界模型:一个基于扩散 Transformer(ViT-VAE + DiT)的模型,接收玩家键盘 + 鼠标输入,自回归地逐帧生成一个类 Minecraft 的可交互游戏画面——没有任何游戏引擎、没有物理引擎,物理、规则、光照、库存全部由基础模型内部”想象”出来,在单台 H100 上以 360p / 20fps(每帧 47ms) 实时运行。团队开源了 500M 参数的下采样版权重与推理代码,并上线了更大 checkpoint 的实时 Demo。

背景与定位

Oasis 属于「神经网络游戏引擎 / 可玩世界模型(playable / interactive world model)」范式:把游戏画面当作一段条件视频,用户动作作为条件,模型逐帧续写,取代传统渲染管线。它直接对标同期两条工作——Google 的 GameNGen(《Diffusion Models Are Real-Time Game Engines》,用 UNet 扩散实时跑 DOOM)与 DIAMOND(《Diffusion for World Modeling: Visual Details Matter in Atari》),并与 genie-generative-interactive-environments(Genie,潜动作、2D 平台)同处一个赛道;其世界模型血统可上溯 world-models-ha-schmidhuber

与 GameNGen / DIAMOND 用 U-Net 不同,Oasis 刻意选择纯 Transformer(ViT VAE 编码器 + dit-scalable-diffusion-transformers 扩散骨干),官方给出的理由有二:一是 Transformer 的 scaling 更稳定可预测;二是为了在 Etched 自研的 Transformer 专用 ASIC Sohu 上取得极致推理效率。与 sora 这类双向(bidirectional)视频模型也不同——Sora 一次性生成整段视频、不能实时交互,而 Oasis 自回归逐帧、每一帧都能条件化到该时刻的用户输入,才实现”边玩边生成”。训练范式采用 Diffusion Forcing(Chen et al.,每 token 独立噪声级别)。团队的核心论点是:快速 Transformer 推理是让生成式视频落地的”缺失环节”,Decart 提供实时推理引擎、Etched 提供 Sohu 芯片,二者合力把实时生成视频从”离线渲染”变成一种新的实时交互界面。

论文/作者:Decart AI 团队 + Etched(Julian Quevedo、Quinn McIntyre、Spruce Campbell、Robert Wachen,Xinlei Chen 致谢)。无 arXiv 论文,方法披露在联合博客与 Decart / Etched 各自博客。

模型架构

模型由两部分组成,均为 Transformer:一个空间自编码器(ViT-based VAE)+ 一个潜空间扩散骨干(DiT)。以下配置来自开源的 Oasis-500M 代码(open-oasisDiT_S_2 + vit-l-20-shallow-encoder):

空间自编码器(ViT-VAE)

  • 型号 vit-l-20(ViT-L,patch_size = 20,浅编码器);输入图像 resize 到 360×640,按 patch 20 压成 18×32 的潜网格,潜通道 16
  • 潜空间缩放系数 scaling_factor ≈ 0.0784(= 1/12.75)。扩散在这个低维潜空间进行,让骨干专注高层特征。

扩散骨干(DiT,Oasis-500M)

  • DiT-S/2 配置:hidden_size=1024depth=16 个 block、num_heads=16patch_size=2mlp_ratio=4;输入潜网格 18×32,in_channels=16,动作条件维 external_cond_dim=25,上下文窗口 max_frames=32 帧。
  • 每个 block 是 SpatioTemporalDiTBlock空间轴向注意力(SpatialAxialAttention)与时间轴向注意力(TemporalAxialAttention,因果 causal)交错堆叠(Latte 式时空分解),各自带 AdaLN-Zero 调制与 MLP。
  • 位置编码用 RoPE:空间用 pixel-freq 旋转编码(max_freq=256),时间用标准旋转编码。时间注意力是因果的,保证自回归性。

动作条件(action-conditioning)

  • 动作是一个 25 维向量 = 23 个二值键鼠按键(inventory、ESC、hotbar.1–9、forward/back/left/right、jump、sneak、sprint、swapHands、attack、use、pickItem、drop)+ 2 个连续相机轴(cameraX/cameraY,即鼠标移动,分桶归一到 [-1,1])。动作格式直接沿用 OpenAI VPT(Video-Pre-Training)
  • 条件注入方式:external_cond 用一个 Linear(25 → hidden) 把动作投影后加到 AdaLN 的条件向量 c(与 timestep embedding 同一通道),逐帧作用——因此每一帧的生成都被该时刻的用户输入调制。

时序稳定 / 一致性(temporal stability)

  • 自回归模型误差会累积(小瑕疵滚雪球成 glitch)。Oasis 用 dynamic noising(动态噪声):推理时按 schedule 调整噪声——前几个扩散前向注入噪声以抑制误差累积,后几步逐步去噪,让模型从历史帧里找回并保持高频细节。因为训练时就见过噪声(Diffusion Forcing 的独立噪声级别),推理时能处理带噪样本。
  • 代码实现:上下文帧被钉在固定低噪声级 stabilization_level=15,只有新生成帧走 DDIM 噪声调度;噪声按 noise_abs_max=20 截断。

数据

  • 领域:Minecraft。仓库 sample_data/ 里的样本(Player729-f153ac423f61-...treechop-...snippy-chartreuse-mastiff-...)是 VPT / MineRL 风格的人类玩家录制轨迹.mp4 + .actions.pt / .one_hot_actions.pt),动作格式明确”derived from VPT”。博客称模型”all by watching the demonstration directly”——即从人类演示视频(画面-动作对)中直接学会移动、跳跃、拾取、破坏方块等。
  • 训练数据规模(小时/帧/轨迹数)、来源配比、清洗/过滤策略:官方未披露。仅能确定语料是 Minecraft 玩法录像 + VPT 式动作标注。动作标注来自录制时捕获的键鼠事件(无需逆动力学额外标注,区别于 VPT 需训 IDM 打标——此处 Decart 未说明是否复用 VPT 的 IDM)。sim-vs-real、co-training 不适用(纯游戏域)。

训练方法

  • 目标函数:潜空间扩散,v-prediction 参数化(代码从预测的 v 反解 x_start);sigmoid_beta_schedule(start=-3, end=3, tau=1),max_noise_level=1000
  • Diffusion Forcing:训练时对序列中每一帧施加独立的 per-token 噪声级别(而非全序列同一噪声),这既是稳定训练的关键,也解锁了推理端的 dynamic noising / 滑窗自回归解码方案。
  • 架构消融:博客提到做了”in-depth sensitivity analysis on different configurations of the architecture alongside the data and model size”,据此推断多数缺陷可通过 scale 模型 + 数据解决(具体消融数字未公开)。
  • 关键工程数字:训练每次迭代 150ms(Decart 博客)。其余超参(batch、总步数、学习率、总算力)未披露。开源的是”downscaled” 500M 版;线上 Demo 用更大的 checkpoint(规模未公开)。

Infra(训练 / 推理工程)

  • 训练硬件:Decart 自研推理/训练框架针对 NVIDIA H100 深度调优;GPU 数量、总 GPU-hours、并行策略、精度均未披露(仅知每迭代 150ms、推理走 fp16 autocast)。
  • 推理(核心卖点)每帧 47ms → 20fps 实时,在 H100 上 360p / 20fps。要实时交互必须每 0.04s 出一帧,比同架构 SOTA 文生视频快 >100×(Sora / Mochi-1(mochi-1)/ Runway Gen-3 生成 1s 视频要 10–20s,且需多卡)。
  • Decart 自研推理栈:发现开源 LLM 推理 kernel 大多不适配该扩散-Transformer 架构,遂自研了从 PyTorch 原语到复合算子的全套加速 kernel;并用优化的通信原语吃透 NVLink / PCIe Gen5 / NUMA,实现单卡到多卡的实时推理,最终视频经 web 串流给用户。
  • 开源 500M 推理默认 DDIM 10 步、32 帧、fps=20。
  • Etched Sohu ASIC:同一模型在 Sohu 上可跑到 4K;因 Oasis 是端到端 Transformer,Sohu 在与 H100 同等价格/功耗下可服务 10× 用户,并能扩展到 4K 分辨率下的 100B+ 参数模型。团队认为”服务成本”才是生成式视频量产的隐藏瓶颈。

评测 benchmark

Oasis 是技术 Demo,博客未给出任何定量 benchmark 表格 / 命名基线的数值对比(这是本工作的明确局限)。展示的是定性能力:

  • 内部机制理解:建造、光照物理、库存管理、物体理解;放置非立方块;吃东西回血;铲子比手快(工具速度差异);打开箱子/库存;与动物交互。
  • 场景多样性:夜间渲染、太空般的暗环境、放置多种物体、多样动物与角色——据此认为可”有限额外训练”适配新地图/玩法。
  • 唯一的量化数字是推理性能:47ms/帧、20fps、比同类文生视频快 100×(对比 Sora / Mochi-1 / Runway 的 10–20s/1s,均为估算吞吐,注明 “Estimated throughput figures”)。

创新点与影响

贡献

  1. 第一个可实时游玩(20fps)的开放世界 AI 世界模型:无游戏引擎、无物理引擎,纯基础模型逐帧生成一个键鼠可控的类 Minecraft 世界,把”神经网络当游戏引擎”从离线/低分辨率(GameNGen 的 DOOM、DIAMOND 的 Atari)推进到开放世界、web 实时串流。
  2. 纯 Transformer 路线(ViT-VAE + DiT),区别于 GameNGen/DIAMOND 的 UNet,理由是 scaling 可预测 + Sohu ASIC 亲和;证明扩散-Transformer 也能做到实时逐帧。
  3. Diffusion Forcing + dynamic noising 系统性解决自回归长时程的误差累积/时序一致性问题。
  4. 开放生态:开源 Oasis-500M 权重 + 推理代码,配大 checkpoint 的公开 Demo,成为该赛道被广泛复现/引用的标志性开源工作。

作者自陈局限

  • 远景画面模糊(distant sand fuzziness)、不确定物体的时序一致性差;
  • 域泛化弱——喂入分布外的初始图会产出不清晰结果;
  • 库存/物体的精确控制困难;
  • 长上下文记忆有限(recall many frames back 难);
  • 某些情况下先产出 hazy 输出再恢复。
  • 团队认为多数问题可由扩大模型 + 数据集缓解,并需要新的推理技术来平衡大模型的延迟/成本。

原始链接

一手源存档(sources/)