一句话定位

VideoWorld 用自回归视频生成模型(VQ-VAE + Llama 架构 transformer)配合一个新提出的「潜动力学模型」(Latent Dynamics Model, LDM),证明纯靠观看无标签视频(不含文字、动作标签或奖励信号)就能学会围棋规则、多步推理与前瞻规划、以及机器人操作技能——300M 参数模型在自建的 Video-GoBench 上打到 Elo 2317,超过人类职业 5 段水平(KataGo-5d,Elo 2253),且不依赖搜索算法或强化学习的奖励机制。CVPR 2025 收录。

背景与定位

论文的核心问题是:“知识”是否必须通过语言学习——LLM 的 next-token prediction 范式已证明文本足以承载规则、推理、规划能力,但视觉信号(如灵长类动物靠观察而非语言习得觅食/社交技能)是否也能承载同等复杂度的知识,此前研究罕有触及。作者构造两个环境验证:围棋(强调长程推理与前瞻规划,且能把低层视觉细节与高层策略知识解耦)和机器人操作(CALVIN / RLBench)。

方法谱系上,VideoWorld 与「从视频学潜动作」一脉工作直接相关但目标不同:genie-generative-interactive-environments(Genie)用因果潜动作模型从视频抽取单步潜动作以构建可交互生成环境;lapa-latent-action-pretraining(LAPA)用无监督潜动作预训练 VLA 策略,聚焦短时程机器人控制的跨本体迁移。VideoWorld 的 LDM 不是”从帧对预测单个潜动作”,而是把未来 H 帧的多步视觉变化压缩进一组时序潜编码,与逐帧视频生成联合训练,目标是验证这条纯视觉自监督路径能否支撑围棋这类需要长程规划的复杂知识,而不只是短时程动作模仿。论文也与 unipi-universal-policies-video(UniPi,文本条件视频生成 + 逆动力学执行策略)、ChessGPT/Othello-GPT/ChessBench(用带标注的棋局状态序列训练 transformer 学规则推理)做了对比:前者仍依赖语言指令,后两者依赖显式状态/动作标注;VideoWorld 完全不使用状态标注或语言指令训练主干模型。

模型架构

Stage 0 基础框架(消融基线):VQ-VAE(自定义 MAGVIT-v2 编码器-解码器 + FSQ 量化器)把视频帧转成离散 token,Llama 架构的自回归 transformer 在这些 token 上做 next-frame 预测;推理时生成的新帧经解码器还原到像素空间。

LDM(Latent Dynamics Model,核心创新)

  • 采用 MAGVITv2 风格的因果编码器-解码器,刻意不做时间下采样以保留逐帧细节。
  • 对每帧 x_t,连同其后续 Hx_{t+1:t+H}(不足 H 帧时做复制填充)一起输入;因果编码器先提取未量化的视觉特征图 f_{t:t+H}
  • 定义 H 组可学习 query embedding {q^h}_{h=1..H}:每个 q^h 通过 cross-attention 在 f_{t:t+h} 上捕获变化信息,得到连续潜表示 z̃_t^h,再经 FSQ 量化为离散码 z_t^h——量化瓶颈的作用是防止 LDM 学到”直接把 f_{t+h} 抄进 z_t^h”的捷径。
  • 解码器用首帧特征 f_t + 潜变化编码 {z_t^h} 因果地重建后续帧 x̂_{t+1:t+H},训练目标是重建帧与真实帧的 L2 距离。
  • Stage 2 自回归 transformer:把 LDM 产生的潜编码与(另一套独立编解码器产生的)离散视频 token 拼进同一序列做 next-token 预测;两个编解码器码本不同,transformer 词表是二者的并集,因此模型在同一交叉熵损失下同时学习”生成下一帧”和”生成下一组潜编码”。
  • 默认 FSQ 档位 [8,8,8,5,5,5](即 64,000 个码,8×8×8×5×5×5=64000),Go/CALVIN 场景把编码器下采样加深到每帧压缩到 4×4 空间网格。
  • 压缩长度 H:论文正文(§5.6)给出”默认 Go 用 5 步、CALVIN 用 10 步”;实现细节章节(§5.1)另给出”Go 用 frame length 6、CALVIN 用 10”这一表述(含首帧在内的窗口长度,二者未完全对齐,原文未做进一步说明,此处如实并列);§5.5 中机器人潜编码可视化用的是 H=9(针对该小节的具体可视化实验,非全文统一默认值)。
  • IDM(Inverse Dynamics Model):独立训练的小型网络,把生成的视频帧(+ 潜编码)映射为具体动作;不参与视频生成器的训练,只用少量带动作标签数据训练。围棋场景下输出落子位置;机器人场景下,ResNet-18 处理预测帧、全局平均池化取 (1,512) 特征,潜编码经共享 MLP 变换为 (H,512),二者拼接为 (H+1,512) 后过 MLP (512→7) 再全局平均池化,输出 7 维控制信号(末端 XYZ 位移 + 欧拉角 + 夹爪开合)。IDM 用 AdamW(lr 1e-4)训练 100 万步,MSE 目标。
  • 模型规模:围棋任务测了 50M / 150M / 300M 三档自回归 transformer;机器人任务(Table 2/3)统一用 300M 参数。

数据

Video-GoBench(自建):

  • 10M 局 9×9 围棋对局记录:320 万局来自 KataGo 自对弈,780 万局来自 OGS 人类对局记录;人类数据经 KataGo 重新标注每个局面下的最优下一手。
  • 训练集含约 4 亿个唯一棋局状态,每个渲染为 256px 图像。
  • 测试集:1,000 局对局(同样由 KataGo 重新标注);为提升泛化评估的有效性,剔除开局阶段(早期局面多样性有限),得到 5.6 万个唯一测试棋局状态。
  • 数据质量消融(Table 4e,50M 模型):用未经 KataGo 重标注的原始人类落子(6.8M,Human†)训练,Action-Value/Action-Acc 仅 34.6/34.8;同样 6.8M 但经 KataGo 重标注最优手(Human)后跃升到 71.5/75.7;纯 KataGo 自对弈(3.2M)70.8/77.5;全部 10M 数据 73.9/80.9——说明”用最优手重标注取代原始人类落子”对最终效果影响巨大。

CALVIN / RLBench

  • CALVIN 用官方数据集,ABCD→D 划分,控制 Franka Emika Panda 机械臂(平行夹爪),评测 Push Blocks / Open-Close Drawer / Turn On-Off Light 三个任务,语言指令(如 “go push the red block right”)作为 transformer 的生成条件。
  • 数据扩展实验:用一个监督学习 agent 额外生成 1 万条、3 万条 CALVIN 轨迹加入训练,验证数据扩展带来的性能提升(Table 2)。
  • RLBench:用自定义脚本生成 2 万条轨迹(Close Microwave / Close Fridge),与 CALVIN 共用机械臂和动作空间,但环境外观、相机视角不同;与 CALVIN 数据联合训练 LDM 和 transformer,IDM 各环境单独训练(Table 3 多环境联合训练实验)。
  • 关键点:视频生成器(LDM + AR transformer)训练全程不使用动作标签;动作标签只用于单独训练 IDM(小型映射网络),且用量”少”(原文未给出具体条数)。

训练方法

两段式训练管线:

  1. LDM 阶段(重建目标):AdamW,学习率 5.4e-5,权重衰减 0.01,动量 β=(0.5, 0.9),batch size 16,WarmupDecayLR 调度,warmup 3万步,训练总计 10万步,损失为 L2 重建。
  2. AR transformer 阶段(next-token 预测):冻结已训练好的视频编码器;AdamW,学习率 3.0e-5,权重衰减 0,动量 β=(0.9, 0.98),batch size 256(Go)/32(CALVIN),同样 WarmupDecayLR、warmup 3万步,训练总计 100万步,损失为交叉熵,训练目标是同时预测下一帧 token 和下一组 LDM 潜编码。
  3. IDM 作为第三个独立组件单独训练(见”模型架构”节),与视频生成器解耦。
  4. 推理执行方式:机器人动作以开环方式执行——每步预测动作后送入环境引擎获得新观测,再将其拼接进输入序列驱动下一轮生成(即每步都重新观测,但生成过程本身不做重规划)。

核心消融结论(均基于 50M 模型,Table 4/5):

  • LDM 必要性:不用 LDM 的纯视频预测基线(baseline)Go Action-Value/Acc 仅 47.5/44.3,CALVIN 三任务仅 12.7/20.8/15.6;加入 LDM 后 Go 最高到 73.9/80.9(H=5),CALVIN 最高到 50.3/71.1/69.7(H=10)。
  • 压缩长度 H:Go 上 H=5 最优,继续增大 H 会因棋局状态组合爆炸导致 LDM 训练不收敛;CALVIN 动态更简单,H 可以开到 10 仍持续受益。
  • 码本大小:FSQ 档位对应码本从 729 → 15,625 → 64,000 → 262,144,Go 与 CALVIN 均在 64,000 处取得最优(Go 73.9/80.9,CALVIN 50.3/71.1/69.7),过大(262,144)导致训练难收敛、性能明显下降(Go 降到 50.1/53.2)。
  • 仅预测潜编码 vs 联合预测(Table 5):去掉下一帧监督、只对潜编码做交叉熵损失,Go 由 baseline 47.5 提升到 73.0(Action-Value),但仍略逊于”潜编码+下一帧”联合训练的 73.9;作者认为下一帧预测能强化模型对环境的理解,间接提升潜编码质量。
  • 因果依赖验证:把不同时间步的潜编码替换为随机 token 做干预实验,替换最早的编码对下游决策影响最大,印证潜编码之间存在因果依赖结构(越早的编码影响越长的未来决策链)。

Infra(训练 / 推理工程)

  • 训练硬件:8×A100 GPU;Go 任务约需 4 天,CALVIN 任务约需 2 天(原文未明确注明这一天数覆盖 LDM+transformer 全流程还是仅指某一阶段)。折算 GPU-小时:Go 约 8×4×24 = 768 GPU-hours,CALVIN 约 8×2×24 = 384 GPU-hours。
  • 并行策略 / 精度(fp16/bf16 等):论文未披露。
  • 推理 FPS / 控制 Hz / 延迟 / 端侧硬件:论文未披露具体数值;仅说明机器人动作以开环方式逐步执行(每步生成→执行→重新观测)。
  • IDM 训练:AdamW lr 1e-4,100 万步,单独训练,硬件配置未披露。

评测 benchmark

Video-GoBench(Table 1,8 智能体锦标赛,400 局/对,共 11.2K 局,BayesElo 计算,KataGo-9d 锚定 Elo 2700)

Agent训练方式是否用搜索输入合法率(%)Action-Value(%)最优手命中率(%)Elo
KataGo-human-1dRL用搜索State10067.664.52019±23
KataGo-human-5dRL用搜索State10083.583.72253±20
KataGo-human-9d (Oracle)RL用搜索State1001001002700
Transformer 300MSL无搜索State99.879.787.22308±21
Transformer 300MSL无搜索Video99.659.758.91998±38
VideoWorld 50MSL无搜索Video99.573.980.92093±25
VideoWorld 150MSL无搜索Video99.782.086.72218±23
VideoWorld 300MSL无搜索Video99.783.788.12317±25

头条结论:VideoWorld-300M(Elo 2317)超过人类职业 5 段水平的 KataGo-5d(2253),VideoWorld-50M(2093)超过 KataGo-1d(2019);相比不用 LDM 的纯视频 Transformer 基线(1998),VideoWorld-300M 净提升 319 Elo;三档模型规模(50M→300M)性能单调提升,显示良好的 scaling 趋势。

CALVIN(Table 2,300M 参数,ABCD→D):Push / Open-Close / Turn-on-off 成功率(%)——MCIL 33.0/38.7/41.2,HULC 65.8/80.9/85.3,Transformer(Oracle,带动作标签) 75.4/95.3/96.2,Transformer(纯视频,无LDM) 17.3/24.1/19.2,VideoWorld 56.2/75.4/72.1,VideoWorld+1万条额外数据 65.3/81.2/79.3,VideoWorld+3万条额外数据 72.7/91.0/93.8(持续逼近 Oracle)。

多环境联合训练(Table 3,CALVIN+RLBench,300M):Transformer(Oracle) CALVIN 61.3/79.5/78.0、RLBench(Microwave/Fridge) 72.1/69.0;Transformer(纯视频) 6.5/13.0/15.6/12.0/10.9(多环境下性能崩溃);VideoWorld 56.0/74.8/74.5/67.1/62.5(同时掌握两个环境的技能,逼近 Oracle)。

前瞻规划探针:自对弈时”想象”对手落子,平均 Action-Value 71.2%、命中率 74.3%,表明模型在潜空间里对局势的长程变化有前瞻性建模,而非只看一步。

创新点与影响

  • 贡献:首次系统检验”仅靠观看无标签视频能否学会需要规则理解、推理与前瞻规划的复杂知识”,给出正面证据;提出 LDM 把多步未来视觉变化压缩为紧凑潜编码、与逐帧视频生成联合训练,同时提升学习效率与效果;构建 Video-GoBench 这一大规模纯视觉围棋基准及配套评测协议(合法率/锦标赛 Elo/最优手命中率/Action-Value),供后续研究复用。
  • 改变了什么:证明”纯视频 next-token prediction”这条自监督路径本身足以学到围棋级别的规则、战术(挤子、弃子诱杀等)与机器人操作技能,不需要 RL 的搜索或奖励机制,也不需要语言监督或动作标签;相比 genie-generative-interactive-environmentslapa-latent-action-pretraining 等聚焦短时程动作模仿的潜动作工作,VideoWorld 把这一范式的验证场景扩展到需要长程推理规划的任务(围棋),为”视频生成模型可作为通用知识学习者”提供了更强的实证支持。
  • 作者自陈局限(Conclusion):应用到真实世界场景仍面临挑战,包括高质量视频生成的保真度、跨场景泛化能力都待提升;目前只是”初步探索”(initial step),模型规模仅到 300M 参数,环境局限于受控模拟(9×9 简化围棋盘、CALVIN/RLBench 模拟机械臂),尚未验证于真实世界视频或更大规模预训练;机器人执行为开环方式,IDM 仍需少量带标签动作数据训练。

原始链接

一手源存档(sources/)