一句话定位

Google DeepMind 于 2025-08-05 发布的 Genie 3——首个通用、可实时交互的世界模型:给一段文本描述就能自回归地逐帧生成可自由导航的动态世界,720p、24fps 实时交互,环境一致性可维持数分钟、视觉记忆可回溯约 1 分钟;除方向键式导航外还支持用文本触发的 promptable world events(可提示世界事件)(改天气 / 加物体 / 加角色),并已接入 DeepMind 的 SIMA 智能体(原文 “a recent version of our SIMA agent”;SIMA 2 迟至 2025-11 才发布、晚于 Genie 3,故此处并非 SIMA 2)做具身智能体训练环境的可行性验证,被定位为面向 AGI 的”无限课程”仿真环境基座。以有限研究预览(limited research preview) 形式对少量学者与创作者开放。

背景与定位

DeepMind 十余年来一直在做仿真环境(AlphaStar 打星际、open-ended learning、机器人仿真)。世界模型(world model)的意义在于:AI 用自己对世界的理解去模拟世界如何演化、以及自身动作如何改变世界,从而为智能体提供”无限课程”的丰富仿真环境——这被 DeepMind 明确称为通往 AGI 的关键垫脚石。

Genie 系列的谱系(blog 自述):

  • Genie 1(2024) — 首批 foundation world model,能为智能体生成新环境(隐动作模型 + 视频 tokenizer + ST-transformer,从无标注互联网游戏视频无监督学出可控动作,此为家族方法论起点,Genie 3 未复述其架构细节)。
  • Genie 2(2024) — 大规模基础世界模型(自回归 latent diffusion)。
  • Veo 2 / Veo 3 — 视频生成 SOTA,展现对直觉物理的深刻理解。

Genie 3 的新增质变是:家族里第一个支持实时交互的世界模型,同时相比 Genie 2 显著提升一致性与真实感。blog 用一张对比表(图片,单元格文字不可机读)把 Genie 3 与 GameNGen、Genie 2、Veo 在控制性 / 分辨率 / 交互延迟等维度对比。

范式定位上,Genie 3 属于交互式、动作条件的自回归世界模拟器这一派,与同期的 MuseSkywork Matrix-GameMatrix-Game 2.0Tencent Hunyuan-GameCraft 的”可玩游戏世界模型”、以及 NVIDIA CosmosWayve GAIA-2World Labs Marble 等世界模型同处一个赛道;但 Genie 3 主打通用域(不限于游戏/驾驶)+ 真·实时 + 长时一致三者兼得,且一致性是”涌现”而非依赖显式 3D 表示。与 V-JEPA 2 那类”latent 预测式世界模型”路线不同,Genie 3 走的是像素级可观看、可交互的生成式路线。

模型架构

说明:Genie 3 没有技术报告 / 论文 / model card,官方仅以 blog + 产品页披露。以下均为官方明确写出的架构性事实,未披露处如实标注。

  • 生成范式自回归、逐帧生成(auto-regressive generation of each frame)。每生成一帧都要回看随时间增长的既往轨迹——例如用户 1 分钟后重访某地,模型要引用 1 分钟前的相关信息。为了实时交互,这套”回看 + 生成”的计算必须每秒执行多次以响应不断到来的新用户输入。
  • backbone 具体形态(RSSM / DiT / AR-transformer / diffusion-forcing 等):未披露。blog 强调其为”frame by frame based on world description and actions”的生成,但未公开网络结构、参数量、tokenizer / latent 表示、上下文长度
  • 动作条件(action-conditioning)
    • 导航输入(navigational inputs) — 类似方向键的实时控制,角色可 walking / jumping / driving / flying(prompt guide 明确列出)。角色的移动还能影响世界(车辆在泥地留下车辙、割草机边走边割草)。动作编码格式(离散 token / 连续向量)未披露。
    • promptable world events(可提示世界事件) — 除导航外的更具表达力的文本交互:改变天气、引入新物体 / 新角色。它拓宽了 counterfactual(“what if”)场景的广度,可供从经验学习的智能体应对意外情况。
  • 一致性 / 记忆机制:环境一致性可维持数分钟视觉记忆可回溯约 1 分钟(视觉上表现为出画再入画的物体保持一致,如古希腊神庙左侧的树)。DeepMind 强调这种一致性是涌现能力(emergent capability):不同于 NeRF / Gaussian Splatting 需要提供显式 3D 表示,Genie 3 的世界是纯粹按世界描述 + 用户动作逐帧生成的,因此更动态、更丰富。记忆的具体实现(KV-cache / 显式 memory / 状态压缩)未披露。
  • 配置数字(分辨率 / 帧率):720p、24fps。参数量、层数、上下文窗口等均未披露

数据

  • 训练数据规模(小时 / 帧 / token)、来源、配比、筛选、动作标注方式、sim-vs-real 混合、co-training 策略:全部未披露
  • 官方 blog 与产品页对训练语料只字未提,仅通过大量 demo prompt 间接展示覆盖面极广:真实世界第一人称 / egocentric 机器人视角、自然生态(冰川湖、深海生物发光水母群、日式枯山水)、极端天气(飓风、火山熔岩)、动画 / 幻想(彩虹桥上的绒毛生物、戴礼帽的巨型大猩猩)、载具(喷气艇、雪地摩托、直升机、越野车)等。
  • 谱系上,Genie 1 的数据是”无标注互联网游戏视频”,但 Genie 3 是否沿用同类来源、是否引入真实世界视频,官方未确认

训练方法

  • 训练目标(objective)、多阶段流水线、模仿学习 / RL、动作 tokenization、蒸馏、关键超参:全部未披露
  • 官方唯一给出的方法学线索是定性的工程难点表述:自回归生成比一次性生成整段视频更难,因为误差会随时间累积(inaccuracies accumulate over time);实现高可控性 + 实时交互”需要重大技术突破(significant technical breakthroughs)“,但突破的具体做法未公开。
  • 一致性被描述为训练涌现而非显式监督或显式 3D 约束的产物。

Infra(训练 / 推理工程)

  • 训练侧:GPU 型号 / 数量、GPU-hours、并行策略、精度(fp8/bf16)等全部未披露
  • 推理侧:官方明确给出实时交互 = 24fps @ 720p,且”回看 + 生成”计算需每秒多次响应用户输入——这是对推理吞吐/延迟的强约束,但具体部署硬件(TPU/GPU 型号、单会话算力、latency 数字)未披露
  • 交付形态:以云端 Project Genie 研究原型(labs.google/projectgenie)对少量用户开放,无边缘 / 端侧部署披露,无权重 / 代码 / API 公开发布

评测 benchmark

  • 无定量 benchmark。Genie 3 的 blog / 产品页不含任何量化评测表(无 FVD、无一致性指标、无人类偏好打分、无 benchmark 数字)。
  • 唯一”能力对比”是那张与 GameNGen / Genie 2 / Veo 的定性对比表(控制性、分辨率、交互延迟维度),单元格文字不可机读,且非标准化 benchmark。
  • 具身智能体可行性验证(定性,非量化):把较新版本的 SIMA 智能体(原文 “a recent version of our SIMA agent”;注意 SIMA 2 于 2025-11 才发布、晚于 Genie 3,故此处并非 SIMA 2)接入 Genie 3 生成的世界,在每个世界里给智能体若干目标,智能体通过向 Genie 3 发送导航动作去达成;Genie 3 不知道智能体的目标,只根据其动作模拟未来。因为能保持一致性,现在可以执行更长的动作序列、完成更复杂的目标。官方未给出成功率等数字。
  • 换言之:作为 landmark 工作,其证据形态是大量真实实时交互录屏 + SIMA 定性联动,而非跑分。

创新点与影响

  • 核心贡献:首个把”通用域 + 实时交互 + 720p/24fps + 数分钟长时一致 + 约 1 分钟视觉记忆 + 文本可提示世界事件”这些能力同时做到的世界模型。相比 Genie 2 的质变在于真·实时可交互一致性/真实感的显著提升
  • 改变了什么
    1. 让世界模型从”生成一段可看的视频 / 生成初始可玩片段”走向”可长时导航、可回访、记忆一致的持续环境”,把自回归世界模拟的可用时长从秒级推到分钟级。
    2. 一致性作为涌现能力而非依赖显式 3D 重建(NeRF/3DGS),意味着世界更动态、可凭文本无中生有并动态改动。
    3. 具身智能体训练/评测提供了”无限课程”环境的雏形(SIMA 联动 + promptable 反事实场景),DeepMind 将其定位为通往 AGI 的关键垫脚石,并展望用于教育培训、机器人 / 自动驾驶智能体训练与弱点探查。
  • 官方自陈局限(限制其影响的边界)
    • 动作空间受限 — promptable world events 是环境干预,不等于智能体自身能执行的动作;智能体可直接执行的动作范围目前受限。
    • 多智能体交互 — 共享环境中多个独立智能体的复杂交互建模仍是开放难题。
    • 真实地理位置 — 目前无法以完美地理精度模拟真实世界地点。
    • 文字渲染 — 清晰可读的文字通常只在世界描述里显式提供时才能生成。
    • 交互时长 — 目前仅支持数分钟连续交互,而非长达数小时。
  • 发布策略:limited research preview,仅对少量学者与创作者开放,凸显 open-ended + real-time 带来的新安全/责任挑战(与 Responsible Development & Innovation Team 协作)。

原始链接

一手源存档(sources/)

  • genie-3—blog — 官方 blog 全文快照(含能力分节、实时/一致性/promptable events 技术表述、Limitations、Acknowledgments)
  • genie-3—model-page — deepmind.google/models/genie 产品页快照
  • genie-3—prompt-guide — Prompt guide 快照(environment/character/world-sketch 三要素、导航与角色动作、world remixing / image upload)
  • 注:Genie 3 无 arXiv 论文 / 无技术报告 / 无 model card / 无开源权重,本页所有事实均来自上述官方 blog 与产品页。