一句话定位

RTFM(Real-Time Frame Model)是 World Labs 于 2025-10-16 发布的研究预览:一个在单张 H100 GPU上以交互帧率运行的实时生成式世界模型,用自回归扩散 Transformer把输入图像/视频的多视角帧转成隐式世界表示(KV cache),通过”位姿帧作为空间记忆”+“context juggling”机制,在不让上下文无限增长的前提下让世界可以被无限期持久探索;可与 Marble 组合,从单张图片生成能实时漫游的 3D 世界。

背景与定位

World Labs 的”世界模型即渲染器”路线的第二块拼图——第一块是 world-labs-marble:一次性生成持久 3D 高斯世界(离线 ~5 分钟,导出 splat/mesh)。RTFM 与 Marble 定位互补:Marble 造静态 3D 场景资产,RTFM 是实时渲染器,消费 Marble(或任意来源)生成的图像/视频,让用户实时探索——博客明确写”We can create 3D worlds from a single image by combining RTFM with Marble”。

针对传统图形学管线(显式 3D 表示:三角网格 / 高斯泼溅,经硬编码算法渲染出图)的替代:RTFM 训练单个网络直接从 2D 图像输入到 2D 图像输出,不构建任何显式 3D 表示,把”输入视图 → 世界表示 → 新视角渲染”整条流程端到端学出来,自称”learned renderer”。

针对同代自回归交互式视频世界模型存在的共性痛点——genie-3 逐帧自回归生成动态世界但记忆窗口有限(视觉记忆可回溯约 1 分钟);skywork-matrix-game-2 用滚动 KV-cache + Self-Forcing 蒸馏在单 H100 上 25FPS 实时流式生成,但同样面临”上下文随探索时长增长”的问题;decart-mirage-lsd 关注任意视频流的实时逐帧转换而非空间持久性——RTFM 指出核心症结在于:“世界只通过 2D 图像帧隐式表示,持久性要求模型对随用户探索不断增长的帧集合做推理,每一帧都比上一帧更贵,模型对世界的记忆因此被压缩进有限的计算预算”。RTFM 的解法是给每一帧关联一个 3D 位姿(posed frame),把隐式记忆变成有空间结构的记忆;推理时按空间邻近性从记忆库里检索一组帧,为当前生成位置动态组装定制上下文(“context juggling”),从而把上下文规模从”随时间增长”转成”随局部空间范围有界”,实现博客所称的”unbounded persistence”。

博客明确引用 The Bitter Lesson 作为设计哲学:选择能随算力扩展的简单方法(自回归扩散 Transformer + 大规模视频数据端到端训练),而非依赖硬编码的 3D 数据结构与算法。

范式命名:位姿索引空间记忆的自回归扩散渲染器(pose-indexed spatial-memory autoregressive diffusion renderer)——把”世界模型”当作一个从数据中学出来的实时渲染器,而非”先重建几何再渲染”或”生成整段离线视频”。

模型架构

World Labs 作为闭源商业公司,未披露 backbone 具体层数、参数量、分辨率、上下文帧数上限等训练细节(与 world-labs-marble 页面一致的信息披露水平)。博客明确披露的架构骨架:

  • 骨干:自回归扩散 Transformer(autoregressive diffusion transformer),在帧序列上运作,以先前帧为条件预测下一帧,端到端在大规模视频数据上训练。
  • 无显式 3D 表示:不构建 mesh / 点云 / 高斯泼溅等中间几何,直接从输入的一张或多张 2D 图像生成新视角的 2D 图像。
  • 隐式世界状态 = KV cache:输入帧被转换为神经网络激活(KV cache),这份激活隐式代表世界;生成新帧时网络通过 attention 从这份表示里读取信息,渲染出与输入视图一致的新视角。
  • 位姿条件化(pose-conditioning):每一帧被建模为在 3D 空间中拥有一个位姿(位置 + 朝向);生成新帧时用目标位姿去查询模型。这给模型一个”世界是三维欧几里得空间”的弱先验,但不强制显式预测场景几何。
  • 空间记忆 + context juggling:所有已生成的位姿帧构成一个具有空间结构的记忆库;生成新帧时系统按空间邻近性从记忆库检索一组帧,为当前位置动态组装定制上下文——不同空间区域使用不同的上下文帧集合。这是解决”自回归帧模型上下文随探索时长无界增长”问题的核心机制。
  • 输入弹性:一张或多张图像(单图或短视频均可);输入视图多时任务偏”重建”(在已有视图间插值),视图少时偏”生成”(外推出输入视图之外的新内容)——二者由输入视图数量连续调节,而非拆成两个独立任务。
  • 推理栈做了”架构设计 + 模型蒸馏 + 推理优化”的联合优化以塞进单张 H100;具体蒸馏方法(是否类似 Self-Forcing / 一致性蒸馏)、扩散步数、去噪调度器等均未披露。

数据

World Labs 完全未披露训练数据规模(小时数 / 帧数 / 场景数)、来源(自采 / 公开数据集 / 生成数据混合)、真实 vs 合成配比、位姿 / 相机轨迹标注方式或任何过滤 / 清洗策略。博客仅以”large-scale video data”一词带过。可间接观察到的能力边界(均为演示,非披露的数字):

  • 从单张图片渲染出生成式 3D 场景(演示涵盖冰川户外场景、粉色飞船等风格化内容),常与 Marble 组合展示。
  • 从真实世界短视频重建带反射 / 光泽的真实空间(钢琴、玻璃大堂等实拍演示),说明训练数据覆盖真实到渲染的能力。
  • 覆盖多种视觉风格与光照 / 反射 / 阴影 / 眩光效果,暗示训练数据的场景与风格覆盖面较广。

以上均如实标注为未披露的定量事实,不代入具体数字。

训练方法

训练目标为下一帧预测(next-frame prediction),以扩散损失在帧序列上做端到端训练,无中间 3D 监督或显式几何损失——几何一致性完全从数据中”涌现”。博客自陈”RTFM learns to model complex effects like reflections and shadows simply by observing them during training”,即未引入显式物理 / 光照模型作为归纳偏置。多阶段训练流水线、具体损失函数形式、是否使用 RL 或模仿学习、蒸馏的 teacher-student 关系与蒸馏损失、关键超参数(batch size、学习率、训练步数、扩散步数)均未披露。

Infra(训练 / 推理工程)

训练 Infra:GPU 型号 / 数量、GPU-hours、并行策略、训练精度均未披露。

推理工程:目标且已验证——单张 H100 GPU上达到”交互帧率(interactive framerates)“;博客未给出具体 FPS 数字、分辨率或延迟毫秒数(对比同期 skywork-matrix-game-2 明确披露 25FPS/单 H100,odyssey-explorer 披露 30FPS/约 40ms 延迟,RTFM 在这一维度的披露粒度更粗)。作者明确写”our current model targets real-time inference on a single H100 GPU, but we expect larger models targeting larger inference budgets to continue improving”,说明当前档位是刻意选择的、面向单卡部署的效率优先配置,而非算力无约束下的质量上限。部署形态为网页可直接试玩的研究预览(rtfm.worldlabs.ai),无本地安装说明、无开源代码或权重发布。

评测 benchmark

无定量评测。 博客未提供任何量化指标(几何一致性误差、FID、用户研究分数等)、消融实验或与其他世界模型的对照数字,全部论证依赖演示视频(冰川、飞船、水面反射、钢琴光泽、玻璃大堂等场景)与文字描述。作为知识库如实记录:该条目没有一手定量评测数据可引用。

创新点与影响

贡献

  1. 把”世界模型”重新定义为”学出来的实时渲染器(learned renderer)“——用一个网络端到端替代”显式 3D 重建 + 硬编码渲染”的传统图形学管线,复杂光照 / 反射 / 阴影效果从数据中涌现而非手工建模。
  2. 位姿帧作为空间记忆 + context juggling:针对自回归帧模型”上下文随探索时长无界增长”这一行业共性瓶颈,提出用 3D 位姿给隐式记忆一个空间索引结构,按空间邻近性动态检索有界上下文,把”持久性”和”计算预算”工程上解耦。
  3. 效率优先的产品化路线:在”世界模型极度算力饥渴”(博客测算天真方案下 4K60fps 需要 100K token/s、小时级持久化需要 100M+ token 上下文)的行业共识下,刻意约束到单张 H100 可部署,把未来技术的一个”预览版”提前带到今天——博客称之为”pulling the future forward”。
  4. world-labs-marble 组合形成”生成静态 3D 世界(Marble)+ 实时探索渲染(RTFM)“的产品闭环,也可直接消费真实世界短视频做实时重渲染。

改变了什么:把”交互式世界模型”从”逐帧自回归、记忆随时间线性膨胀”的普遍范式,推进到”记忆按空间索引、上下文有界”的新设计,为同类模型(Genie 3、Matrix-Game 2 等)面临的持久性瓶颈提供了一条工程可行的解法方向。

自陈局限(一手源承认)

  • 当前只建模静态世界,博客明确列为未来方向:“We can augment it to model dynamic worlds, and allow users to interact with generated worlds”——即当前版本不支持世界内动态元素或与生成世界的双向交互(与 Marble 的局限一致)。
  • 未披露任何具体性能数字(FPS / 延迟 / 分辨率 / 上下文帧数上限)、训练数据规模或定量评测,透明度与 Marble 一致地低——无论文、无技术报告、无架构参数披露,外部无法独立复核质量或效率主张。
  • 明确定位为”研究预览(research preview)“而非成熟产品;当前模型是”面向单 H100 部署”的效率优先选择,作者自陈更大算力预算下的更大模型”将持续提升”,暗示当前版本在质量 / 世界复杂度上有意做了取舍。

原始链接

一手源存档(sources/)