一句话定位
Oasis 是 Decart(以色列)与 Etched(美国)2024-10-31 联合发布的第一个可实时游玩的开放世界 AI 世界模型:一个基于扩散 Transformer(ViT-VAE + DiT)的模型,接收玩家键盘 + 鼠标输入,自回归地逐帧生成一个类 Minecraft 的可交互游戏画面——没有任何游戏引擎、没有物理引擎,物理、规则、光照、库存全部由基础模型内部”想象”出来,在单台 H100 上以 360p / 20fps(每帧 47ms) 实时运行。团队开源了 500M 参数的下采样版权重与推理代码,并上线了更大 checkpoint 的实时 Demo。
背景与定位
Oasis 属于「神经网络游戏引擎 / 可玩世界模型(playable / interactive world model)」范式:把游戏画面当作一段条件视频,用户动作作为条件,模型逐帧续写,取代传统渲染管线。它直接对标同期两条工作——Google 的 GameNGen(《Diffusion Models Are Real-Time Game Engines》,用 UNet 扩散实时跑 DOOM)与 DIAMOND(《Diffusion for World Modeling: Visual Details Matter in Atari》),并与 genie-generative-interactive-environments(Genie,潜动作、2D 平台)同处一个赛道;其世界模型血统可上溯 world-models-ha-schmidhuber。
与 GameNGen / DIAMOND 用 U-Net 不同,Oasis 刻意选择纯 Transformer(ViT VAE 编码器 + dit-scalable-diffusion-transformers 扩散骨干),官方给出的理由有二:一是 Transformer 的 scaling 更稳定可预测;二是为了在 Etched 自研的 Transformer 专用 ASIC Sohu 上取得极致推理效率。与 sora 这类双向(bidirectional)视频模型也不同——Sora 一次性生成整段视频、不能实时交互,而 Oasis 自回归逐帧、每一帧都能条件化到该时刻的用户输入,才实现”边玩边生成”。训练范式采用 Diffusion Forcing(Chen et al.,每 token 独立噪声级别)。团队的核心论点是:快速 Transformer 推理是让生成式视频落地的”缺失环节”,Decart 提供实时推理引擎、Etched 提供 Sohu 芯片,二者合力把实时生成视频从”离线渲染”变成一种新的实时交互界面。
论文/作者:Decart AI 团队 + Etched(Julian Quevedo、Quinn McIntyre、Spruce Campbell、Robert Wachen,Xinlei Chen 致谢)。无 arXiv 论文,方法披露在联合博客与 Decart / Etched 各自博客。
模型架构
模型由两部分组成,均为 Transformer:一个空间自编码器(ViT-based VAE)+ 一个潜空间扩散骨干(DiT)。以下配置来自开源的 Oasis-500M 代码(open-oasis,DiT_S_2 + vit-l-20-shallow-encoder):
空间自编码器(ViT-VAE)
- 型号
vit-l-20(ViT-L,patch_size = 20,浅编码器);输入图像 resize 到 360×640,按 patch 20 压成 18×32 的潜网格,潜通道 16。 - 潜空间缩放系数
scaling_factor ≈ 0.0784(= 1/12.75)。扩散在这个低维潜空间进行,让骨干专注高层特征。
扩散骨干(DiT,Oasis-500M)
DiT-S/2配置:hidden_size=1024、depth=16个 block、num_heads=16、patch_size=2、mlp_ratio=4;输入潜网格 18×32,in_channels=16,动作条件维external_cond_dim=25,上下文窗口max_frames=32帧。- 每个 block 是 SpatioTemporalDiTBlock:空间轴向注意力(SpatialAxialAttention)与时间轴向注意力(TemporalAxialAttention,因果 causal)交错堆叠(Latte 式时空分解),各自带 AdaLN-Zero 调制与 MLP。
- 位置编码用 RoPE:空间用 pixel-freq 旋转编码(
max_freq=256),时间用标准旋转编码。时间注意力是因果的,保证自回归性。
动作条件(action-conditioning)
- 动作是一个 25 维向量 = 23 个二值键鼠按键(inventory、ESC、hotbar.1–9、forward/back/left/right、jump、sneak、sprint、swapHands、attack、use、pickItem、drop)+ 2 个连续相机轴(cameraX/cameraY,即鼠标移动,分桶归一到 [-1,1])。动作格式直接沿用 OpenAI VPT(Video-Pre-Training)。
- 条件注入方式:
external_cond用一个Linear(25 → hidden)把动作投影后加到 AdaLN 的条件向量c上(与 timestep embedding 同一通道),逐帧作用——因此每一帧的生成都被该时刻的用户输入调制。
时序稳定 / 一致性(temporal stability)
- 自回归模型误差会累积(小瑕疵滚雪球成 glitch)。Oasis 用 dynamic noising(动态噪声):推理时按 schedule 调整噪声——前几个扩散前向注入噪声以抑制误差累积,后几步逐步去噪,让模型从历史帧里找回并保持高频细节。因为训练时就见过噪声(Diffusion Forcing 的独立噪声级别),推理时能处理带噪样本。
- 代码实现:上下文帧被钉在固定低噪声级
stabilization_level=15,只有新生成帧走 DDIM 噪声调度;噪声按noise_abs_max=20截断。
数据
- 领域:Minecraft。仓库
sample_data/里的样本(Player729-f153ac423f61-...、treechop-...、snippy-chartreuse-mastiff-...)是 VPT / MineRL 风格的人类玩家录制轨迹(.mp4+.actions.pt/.one_hot_actions.pt),动作格式明确”derived from VPT”。博客称模型”all by watching the demonstration directly”——即从人类演示视频(画面-动作对)中直接学会移动、跳跃、拾取、破坏方块等。 - 训练数据规模(小时/帧/轨迹数)、来源配比、清洗/过滤策略:官方未披露。仅能确定语料是 Minecraft 玩法录像 + VPT 式动作标注。动作标注来自录制时捕获的键鼠事件(无需逆动力学额外标注,区别于 VPT 需训 IDM 打标——此处 Decart 未说明是否复用 VPT 的 IDM)。sim-vs-real、co-training 不适用(纯游戏域)。
训练方法
- 目标函数:潜空间扩散,v-prediction 参数化(代码从预测的
v反解x_start);sigmoid_beta_schedule(start=-3, end=3, tau=1),max_noise_level=1000。 - Diffusion Forcing:训练时对序列中每一帧施加独立的 per-token 噪声级别(而非全序列同一噪声),这既是稳定训练的关键,也解锁了推理端的 dynamic noising / 滑窗自回归解码方案。
- 架构消融:博客提到做了”in-depth sensitivity analysis on different configurations of the architecture alongside the data and model size”,据此推断多数缺陷可通过 scale 模型 + 数据解决(具体消融数字未公开)。
- 关键工程数字:训练每次迭代 150ms(Decart 博客)。其余超参(batch、总步数、学习率、总算力)未披露。开源的是”downscaled” 500M 版;线上 Demo 用更大的 checkpoint(规模未公开)。
Infra(训练 / 推理工程)
- 训练硬件:Decart 自研推理/训练框架针对 NVIDIA H100 深度调优;GPU 数量、总 GPU-hours、并行策略、精度均未披露(仅知每迭代 150ms、推理走 fp16 autocast)。
- 推理(核心卖点):每帧 47ms → 20fps 实时,在 H100 上 360p / 20fps。要实时交互必须每 0.04s 出一帧,比同架构 SOTA 文生视频快 >100×(Sora / Mochi-1(mochi-1)/ Runway Gen-3 生成 1s 视频要 10–20s,且需多卡)。
- Decart 自研推理栈:发现开源 LLM 推理 kernel 大多不适配该扩散-Transformer 架构,遂自研了从 PyTorch 原语到复合算子的全套加速 kernel;并用优化的通信原语吃透 NVLink / PCIe Gen5 / NUMA,实现单卡到多卡的实时推理,最终视频经 web 串流给用户。
- 开源 500M 推理默认 DDIM 10 步、32 帧、fps=20。
- Etched Sohu ASIC:同一模型在 Sohu 上可跑到 4K;因 Oasis 是端到端 Transformer,Sohu 在与 H100 同等价格/功耗下可服务 10× 用户,并能扩展到 4K 分辨率下的 100B+ 参数模型。团队认为”服务成本”才是生成式视频量产的隐藏瓶颈。
评测 benchmark
Oasis 是技术 Demo,博客未给出任何定量 benchmark 表格 / 命名基线的数值对比(这是本工作的明确局限)。展示的是定性能力:
- 内部机制理解:建造、光照物理、库存管理、物体理解;放置非立方块;吃东西回血;铲子比手快(工具速度差异);打开箱子/库存;与动物交互。
- 场景多样性:夜间渲染、太空般的暗环境、放置多种物体、多样动物与角色——据此认为可”有限额外训练”适配新地图/玩法。
- 唯一的量化数字是推理性能:47ms/帧、20fps、比同类文生视频快 100×(对比 Sora / Mochi-1 / Runway 的 10–20s/1s,均为估算吞吐,注明 “Estimated throughput figures”)。
创新点与影响
贡献
- 第一个可实时游玩(20fps)的开放世界 AI 世界模型:无游戏引擎、无物理引擎,纯基础模型逐帧生成一个键鼠可控的类 Minecraft 世界,把”神经网络当游戏引擎”从离线/低分辨率(GameNGen 的 DOOM、DIAMOND 的 Atari)推进到开放世界、web 实时串流。
- 纯 Transformer 路线(ViT-VAE + DiT),区别于 GameNGen/DIAMOND 的 UNet,理由是 scaling 可预测 + Sohu ASIC 亲和;证明扩散-Transformer 也能做到实时逐帧。
- Diffusion Forcing + dynamic noising 系统性解决自回归长时程的误差累积/时序一致性问题。
- 开放生态:开源 Oasis-500M 权重 + 推理代码,配大 checkpoint 的公开 Demo,成为该赛道被广泛复现/引用的标志性开源工作。
作者自陈局限
- 远景画面模糊(distant sand fuzziness)、不确定物体的时序一致性差;
- 域泛化弱——喂入分布外的初始图会产出不清晰结果;
- 库存/物体的精确控制困难;
- 长上下文记忆有限(recall many frames back 难);
- 某些情况下先产出 hazy 输出再恢复。
- 团队认为多数问题可由扩大模型 + 数据集缓解,并需要新的推理技术来平衡大模型的延迟/成本。
原始链接
- 联合博客(主源): https://oasis-model.github.io/
- Decart 工程博客: https://www.decart.ai/articles/oasis-interactive-ai-video-game-model (原站已改版,存档见下)
- GitHub(开源 500M + 推理代码): https://github.com/etched-ai/open-oasis
- HuggingFace 权重(gated): https://huggingface.co/Etched/oasis-500m
- 实时 Demo / 项目页: https://oasis.decart.ai/ (及 README 中 https://oasis.us.decart.ai/)
一手源存档(sources/)
- decart-oasis—joint-blog — oasis-model.github.io 联合博客全文快照(架构 / 性能 / 未来方向 / 引用)
- decart-oasis—decart-blog — Decart 工程博客(含 47ms/帧、150ms/迭代、H100 360p@20fps、Sohu 4K/10×,via web.archive.org 20250622)
- decart-oasis—github-readme — open-oasis README(安装、权重清单、DiT+ViT-VAE 说明)