一句话定位
Odyssey(前 Wayve/Cruise/Waymo 自动驾驶背景团队创立的世界模型实验室)2025 年 5 月发布的研究预览 Odyssey-1:“可玩的世界模型”——一个动作条件的自回归视频世界模型,能以最高 30 FPS、每帧约 40ms 延迟持续流式生成 5 分钟以上连贯视频,玩家用键盘/触屏/手柄的连续动作实时”驾驶”画面;这条产品线的起点是该公司 2024 年 12 月发布的Explorer——一个把单张图片变成可编辑 3D 高斯泼溅(Gaussian Splatting)世界的”图生世界”模型。两者代表 Odyssey 从静态 3D 世界重建走向实时交互视频世界模拟的两步演进。
背景与定位
Odyssey 由 Oliver Cameron 与 Jeff Hawke(现任 CTO)共同创立,公司技术团队中超过 90% 的人此前在 Cruise、Wayve、Waymo、Tesla 等自动驾驶公司从事多年研发(gaia-2-wayve 是这条自动驾驶世界模型脉络的另一个代表;任务简报称团队来自”ex-Wayve founders”,与官方博客披露的自动驾驶公司名单口径一致,但博客未逐一指明创始人具体来自哪家公司)。团队将自动驾驶行业”用大规模、多传感器真实世界数据训练模型理解动态 3D 世界”的方法论,迁移到”从零生成世界”这一相反命题上:不是让模型学会在真实世界中导航,而是让模型学会凭空生成一个可交互的世界。
Odyssey 的产品演进分两步:
- Explorer(2024-12-18 发布,见 world-labs-marble 同类的”图生 3D 世界”路线):图像 → 3D 高斯泼溅场景,非实时(单次生成约 10 分钟),产出可导入 Unreal/Houdini/Blender 等传统 DCC 工具二次编辑的静态(或局部带运动)3D 世界。
- Odyssey-1(2025-05-28 发布,本页对应实体的核心工作,也是任务简报中”实时交互视频、连续动作输入、streams a navigable video world”描述的直接来源):不生成 3D 表示,而是逐帧预测视频流,属于经典的动作条件自回归世界模型范式——与 genie-3(DeepMind Genie)、decart-mirage(Decart,前身 Oasis)同属”实时可玩视频世界模型”这一新兴范式,但 Odyssey 明确将自己与 Oasis(Minecraft)、WHAM(Microsoft,Quake)等”游戏世界模型”划清界限,强调训练数据来自真实世界视频而非受限的游戏画面。
需要说明的口径:本条目标题沿用来源简报给出的 “Explorer”,但简报的 one-line 描述(实时流式交互视频、连续动作、“holodeck”)与可核实的一手链接(odyssey.world/introducing-interactive-video,经 Wayback CDX 核实最早快照为 2025-05-28,与 odyssey.ml/introducing-odyssey-1 内容一致)实际指向的是 Odyssey-1,而非 2024 年 12 月发布、架构完全不同(3D 高斯泼溅、非实时)的 Explorer。本页以 Odyssey-1 为主线撰写,同时完整呈现 Explorer 作为其前身的技术细节。
模型架构
Odyssey-1(实时交互视频世界模型)
- 官方定义:“a world model is, at its core, an action-conditioned dynamics model. Given the current state, an incoming action, and a history of states and actions, the model attempts to predict the next state in the form of a video frame”——即标准的自回归、动作条件视频世界模型范式。
- 与”视频模型”的明确区分(官方对比表):视频模型一次性生成整段固定长度片段,生成后不可再改变;世界模型逐帧预测,交互间隔可短至单帧,动作可在任意时刻注入。
- 稳定性策略:为缓解自回归生成中生成帧被重新喂回上下文导致的”漂移”(drift out of training distribution)问题,本次研究预览采用”窄分布”策略——先在广泛世界视频上预训练,再在覆盖密度更高、地点范围更小的视频集合上做后训练(post-train),以稳定性换取部分泛化能力(官方原话:“we lose some generality, but gain more stable, long-running autoregressive generation”)。
- 具体参数量、分辨率、上下文帧数、tokenizer/backbone 结构均未披露(研究预览的产品博客,非技术论文)。
- 已知性能数字:单帧生成/流式输出间隔约 40ms;流式帧率最高 30 FPS;单次交互可连贯输出 5 分钟以上。
Explorer(图生 3D 世界模型,2024-12)
- 输入:单张图像;输出:3D 高斯泼溅(Gaussian Splatting)场景,而非视频。
- 选择高斯泼溅作为世界表示的理由(官方博客):相比多边形网格(editable、渲染高效,但不适配生成式建模)与 NeRF(新视角合成质量高,但不可编辑、不易融入生成式管线),高斯泼溅是显式 3D 表示、可编辑,且更擅长毛发/植被等网格难以建模的细节,但在大块平面、光照/relighting 建模上仍有局限。
- 公司自述的长期目标:统一网格的可编辑性、泼溅对真实感外观的建模能力、NeRF 的真实世界学习能力于一种新表示,“fits natively into diffusion transformer pipelines”(暗示生成流程基于扩散 Transformer,但未给出具体架构细节)。
- 支持动态(“moving worlds”)场景,泼溅结果可直接导入 Unreal/Houdini/Blender/Maya/3ds Max/After Effects 手工编辑。
- 单次生成平均耗时约 10 分钟,非实时。
数据
- 数据采集基础设施(2024-11 Series A 博客披露,两代模型共享的数据管线基座):Odyssey 与光学成像合作方 Mosaic 共同研发了一套背包式采集设备——重 25 磅,搭载 6 个摄像头 + 2 个激光雷达 + 1 个 IMU,可采集 13.5K 分辨率的 360° 全景画面并附带物理精度的深度信息;采集范围不受限于车辆可达区域(“Google Street View for everywhere that cars don’t drive”),首站部署在加州,此后扩展到其他州/国家。
- 数据理念承袭自动驾驶:团队认为大规模、多传感器、真实世界数据是训练可靠动态模型的关键,合成数据无法替代真实世界人类交互观测的价值。
- Odyssey-1 训练数据描述为”decades of real-life video”——学习真实世界视频中的像素与动作,而非 Minecraft/Quake 等游戏画面(这是官方与 Oasis/WHAM 的核心差异化论点);研究预览阶段的后训练集合被描述为”a smaller set of places with dense coverage”(窄分布、高覆盖密度地点集合),以换取自回归稳定性。
- 具体训练小时数/帧数/场景数量、真实与合成数据比例、是否做动作标注(action labeling)等均未披露。
训练方法
- Odyssey-1:两阶段流程——(1)在广泛真实世界视频上预训练(学习像素与隐含动作动态);(2)在覆盖密度更高但地点范围更窄的视频子集上后训练,专门优化长时程自回归生成的稳定性(显式承认此举牺牲了模型的泛化能力)。自回归训练目标是给定历史状态-动作序列预测下一帧视频,属于典型的世界模型训练范式;未披露强化学习、蒸馏或额外对齐阶段,也未披露具体超参数(batch size、学习率、训练步数等)。
- Explorer:训练/生成流程未在博客中详细披露,仅提及生成管线希望”natively fit into diffusion transformer pipelines”;未披露具体的图像到 3D 泼溅生成算法细节、损失函数或训练数据配对方式。
- 两条产品线均未发表配套技术论文或预印本,可核实信息仅限于官方博客与融资公告。
Infra(训练 / 推理工程)
- Odyssey-1 推理:由部署在美国与欧洲的 H100 GPU 集群提供服务,流式帧率最高 30 FPS,单帧从用户操作输入到画面回传的往返延迟约 40ms;官方披露的服务成本约为 每用户小时 1–2 美元(视输出质量档位而定),并表示该成本正因模型优化、基础设施投入及语言模型技术红利而快速下降。
- 训练所用 GPU 数量、总训练 GPU-小时、并行策略、训练精度(fp16/bf16/fp8 等)均未披露。
- Explorer 的生成推理耗时约 10 分钟/次(非实时),未披露具体硬件配置或并行方案。
评测 benchmark
官方渠道(博客)均未给出任何量化基准表格或与命名基线模型的对比指标——两篇公告都是产品/研究预览性质的博客文章,而非技术论文,因此没有可引用的定量评测数字。可查证的验证方式仅为定性/演示性质:
- Explorer:与伦敦 Garden Studios 合作,将 Explorer 生成的世界投射到其虚拟制片(virtual production)舞台上,验证生成的 3D 世界”可用于真实制片流程”(定性验证,无量化指标)。
- Odyssey-1:官方自我描述体验”like exploring a glitchy dream—raw, unstable, but undeniably new”,明确承认”utility is limited for now”;未提供任何用户测试数据、成功率或与 Genie / Oasis / WHAM 等模型的正面量化对比。
创新点与影响
- Explorer:把高斯泼溅(而非网格或 NeRF)确立为生成式 3D 世界表示,并首次证明这类生成结果可以直接进入 Unreal/Houdini/Blender 等工业标准工具链、乃至虚拟制片舞台的真实生产流程——把”生成式世界”从研究演示往影视/游戏工业管线上推进了一步。同时通过引入 Pixar 联合创始人、图灵奖得主 Ed Catmull 加入董事会,释放”叙事逻辑优先于技术”的产品哲学信号。
- Odyssey-1:明确将”世界模型”与”视频模型”在架构层面区分开——前者逐帧、任意时刻可插入动作、交互粒度可细到单帧;后者一次性生成定长片段、生成后不可再交互。同时把”自回归漂移”点名为世界模型区别于语言模型的核心难题,并给出一个可复核的、坦诚的权衡方案(窄分布后训练换取稳定性,牺牲泛化)。相比 Oasis(Minecraft)、WHAM(Quake)等此前的”游戏世界模型”,Odyssey-1 主张从无约束的真实世界视频学习像素与动作,以突破游戏逻辑固有的”低天花板”。
- 自述局限性:Explorer——非实时(约 10 分钟/次生成)、世界补全度不足(需后续填补空洞、扩展至完整球形世界)、可控性有限(video-to-world、world-to-world 输入尚未实现);Odyssey-1——后训练窄分布换稳定性、牺牲了通用性,官方称这只是”a humble beginning”,且明确表示下一代模型(在博客发布时已在研发中)将改善泛化能力。
原始链接
- https://odyssey.ml/introducing-odyssey-1 (Odyssey-1 官方发布博客,2025-05-28;原始 slug https://odyssey.world/introducing-interactive-video 已 301 重定向至此)
- https://odyssey.ml/introducing-explorer (Explorer 官方发布博客,2024-12-18)
- https://odyssey.systems/learning-from-our-world (Series A / 数据采集管线博客,2024-11-13;原域名已下线,经 Wayback Machine 存档核实)
- https://odyssey.ml/ (公司官网 / 产品总览)
- https://experience.odyssey.ml/ (交互式体验入口)
一手源存档(sources/)
- odyssey-explorer—blog-odyssey1.md —— Odyssey-1 发布博客全文快照
- odyssey-explorer—blog-explorer2024.md —— Explorer 发布博客全文快照
- odyssey-explorer—blog-seriesA-data.md —— Series A / 数据采集管线博客全文快照(经 Wayback Machine)