一句话定位
LeCun 的纲领性立场论文(Version 0.9.2,2022-06-27),提出一套模块化「自主机器智能」认知架构:以一个可被 configurator 动态配置的预测式世界模型为核心,用非生成、在表征空间做预测的联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA)及其层级版 H-JEPA 学习世界模型,用非对比(regularized)自监督训练以避免坍缩,并把推理/规划形式化为能量最小化(Mode-2 = 模型预测控制 MPC)。本文不训练任何模型、不报任何 benchmark,是给未来十年世界模型研究定方向的”路线图”,直接催生了后续 jepa-predictive 系(I-JEPA / V-JEPA)与 VICReg/Barlow Twins 一脉的落地。
背景与定位
论文开篇给出三个核心挑战:(1) 机器如何主要靠观察学会表示世界、预测、行动(现实交互昂贵且危险,应尽量少 trial);(2) 如何做与梯度学习兼容的推理与规划(best approaches 依赖 loss 梯度,难以调和符号逻辑推理);(3) 如何在多层抽象、多时间尺度上表示感知与动作计划。贯穿全文的动机锚点:一个青少年约 20 小时练习即可学会开车,而当下自动驾驶要数百万到十亿级标注样本 + 数百万次 RL trial 仍不及人类可靠——差距被归因于人/动物会学世界模型(world model = 关于世界如何运转的内部模型),即 common sense 的载体。
范式定位上,本文把世界模型显式放到「optimal control(模型预测控制)+ 自监督学习 + 能量模型」三者交汇处,而非主流 RL。它与同期路线形成鲜明对照:相对 world-models-ha-schmidhuber 的 RNN 世界模型、dreamer-v3/planet 的重建式隐空间 RL 世界模型、iris 的离散 token 生成式世界模型,本文的独门主张是 world model 应是非生成的、在抽象表征空间里预测(JEPA),并反对生成式 + token 化 + 对比式这条 LLM 主线。论文第 8.3 节点名反驳两派立场:反驳「scaling is enough」(Brown et al. GPT-3)与「reward is enough」(Silver et al.)。这是理解本文的关键坐标:它不是又一个世界模型,而是给”世界模型该长什么样”下的一个规范性定义。
注:本页对象是 OpenReview 上 Yann LeCun 直接上传的 position paper(v0.9.2)。配套还有一篇 Meta AI 官方博客(Inside the Lab 活动,2022-02-23)作为大众科普预告,两者内容一致、博客更浅。
模型架构
本文是 position paper,不给出任何具体网络配置数字(层数 / 隐维 / 参数量 / tokenizer 码本大小均未披露)——它定义的是架构范式与约束,不是可训练实例。以下是被明确提出的结构。
(一)自主智能的整体认知架构(Figure 2,六大模块,全部可微)
- configurator(配置器):执行控制中枢,接收所有其他模块输入,通过调制参数 / 注意力回路,为当前任务预配置 perception、world model、cost、actor。论文坦言这是”最神秘、最不清楚”的模块。
- perception(感知):从传感器估计当前世界状态 $s[0]=\text{Enc}(x)$,可分层表示、多抽象层级。
- world model(世界模型):架构中最复杂的一块,双重职责——(1) 补全感知未提供的缺失信息,(2) 预测未来世界状态;须能表示多个可能的未来(用 latent variable 参数化不确定性),是”相关部分世界的模拟器”。
- cost module(代价模块)= 标量”能量”:$C(s)=\text{IC}(s)+\text{TC}(s)$。Intrinsic Cost (IC) 硬编码、不可训练(痛/愉悦/饥饿等基本驱动与安全护栏,类比杏仁核);Trainable Critic (TC) 可训练,预测未来 intrinsic energy(类比前额叶奖励预测)。两者各由多个子模块线性组合,权重 $u_i,v_j$ 由 configurator 调制:$\text{IC}(s)=\sum_i u_i \text{IC}_i(s)$、$\text{TC}(s)=\sum_j v_j \text{TC}_j(s)$。IC 必须不可变,以防行为坍缩 / 漂移。
- short-term memory(短期记忆):key-value 关联记忆(类 Key-Value Memory Networks / 类海马体),存 (time, state, intrinsic energy) 三元组,供 critic 检索训练、供世界模型读写世界状态。
- actor(执行器):产生动作序列提案,经世界模型+cost 评估后,用(梯度或搜索)优化出最小代价动作序列,输出第一个动作。
(二)两种感知-行动回路(对应 Kahneman System 1/2)
- Mode-1(反应式,System 1):策略模块直接 $a[0]=A(s[0])$,不经世界模型与规划,快但只能靠 policy-gradient 式扰动估梯度。
- Mode-2(推理+规划,System 2):actor 提议动作序列 → world model 递归展开 $s[t{+}1]=\text{Pred}(s[t],a[t])$ → cost 逐步求和 $F(x)=\sum_{t=1}^{T}C(s[t])$ → 因全链可微,梯度反传到动作变量做优化,取最小代价序列的首动作。这本质是带 receding-horizon 的模型预测控制(MPC),区别仅在世界模型与代价函数是学出来的。“reasoning” 被广义定义为 constraint satisfaction / energy minimization。Mode-2 的最优解可反过来蒸馏成 Mode-1 策略网络(amortized inference,把技能”编译”成反应式策略)。
(三)世界模型的核心:JEPA(Figure 12) 两路编码器把 $x,y$ 编成 $s_x,s_y$(编码器可不同构、不共享参数,允许跨模态如视频×音频),predictor 从 $s_x$(可借助 latent $z$)预测 $s_y$,能量即表征空间的预测误差: $$E_w(x,y,z)=D\big(s_y,\ \text{Pred}(s_x,z)\big),\quad F_w(x,y)=\min_{z\in Z}E_w(x,y,z)$$ JEPA 的关键在于非生成:它不重建 $y$ 的每个像素,而是预测 $y$ 的表征,从而让 $y$ 编码器主动丢弃不可预测的无关细节(树叶、水波纹、地毯纹理)。表示”一个 $x$ 对应多个可能 $y$“的两种机制:① $y$ 编码器的不变性(一组 $y$ 映到同一 $s_y$);② latent 变量 $z$ 扫过集合 $Z$ 产生一组可能预测 ${\text{Pred}(s_x,z)}$(如”车到岔路口左转还是右转”用二值 $z$)。
(四)action-conditioning 与 memory/consistency
- 动作条件化:世界模型预测统一写成 $\text{Pred}(s,a)$(含 latent 时 $\text{Pred}(s,a,z)$);论文强调”action 与 latent 变量本质无区别”,都是 actor 需探索的变量。
- ego-model / world-model 分离:外部世界不可预测需带 latent 的强模型;而智能体自身(本体感觉)较确定,应有无 latent 的独立自模型,且自模型可作为”他者模型”的模板。
- 世界状态维护:用可微 key-value 关联记忆做”可写内存”,每次事件只更新受影响的少量 entry(如瓶子从厨房挪到餐厅只改三个 entry),$\text{Mem}(q)=\sum_j c_j v_j$。
数据
本文是纯提案,不使用任何数据集、不给规模数字(无 hours / frames / tokens / episodes)。它讨论的是”世界模型该从哪种数据流学”这一方法论问题,给出五种信息采集模式(4.10 节),从被动到主动排序:
- passive observation:被动喂传感器流(视频/音频)。
- active foveation:可在不改变环境的前提下主动导向注意力焦点(转动视/听觉传感器)。
- passive agency:观察”另一个 agent 作用于环境”,据此推断动作对环境状态的因果效应。
- active egomotion:可移动传感器位置但基本不影响环境(可转向的主动传感器、触觉)。
- active agency:动作影响传感器流,可学”动作→后果”因果模型,带来 exploration-exploitation 困境。
核心开放问题被明确留白:多少能力可靠纯被动观察学到、多少需 egomotion、多少需完整 agency——论文自认这是未解问题。数据多样性依赖动作策略(4.10),且高维复杂环境下被动数据可能不足,需要 intrinsic motivation(好奇心/新颖性)驱动探索去”世界模型当前预测最不准的角落”。
训练方法
论文把训练世界模型定义为自监督学习(SSL)= pattern completion,并用**能量模型(EBM)**统一框架给出训练理论,核心贡献是”如何不坍缩”。
(1)EBM 训练与坍缩分类(Figure 10):训练 EBM 即塑形 $F_w(x,y)$,让训练样本能量低、其他 $y$ 能量高。难点是防能量坍缩(landscape 变平)。论文枚举四类架构的坍缩风险:(a) 确定性生成/回归——不会坍缩;(b) 生成式 latent 变量架构——会($z$ 容量过大);(c) auto-encoder——会($s_y$ 容量过大,可学恒等函数);(d) 联合嵌入架构 JEA——会(编码器忽略输入输出常量 $s_x=s_y$)。
(2)两条防坍缩路线:
- 对比法(contrastive):压训练样本能量、抬”精心制造的负样本”$\hat y$ 能量。含 hinge loss $\big[F_w(x,y)-F_w(x,\hat y)+\mu\lVert y-\hat y\rVert^2\big]^+$ 与 InfoNCE。涵盖 Siamese/DrLIM/PIRL/MoCo/SimCLR,以及(论文的独到归类)去噪自编码器/掩码自编码器(如 BERT)本质是对比法。致命缺陷:负样本数在最坏情形随 $y$ 维度指数增长(维度诅咒)——这是 LeCun 反对对比法、反对 LLM 式掩码生成的核心论据。
- 正则化 / 非对比法(regularized):压训练样本能量的同时,用正则项最小化低能量区体积,把低能量区”收缩包裹”到高数据密度区。规避维度诅咒,被本文力主为长期正解。
(3)训练 JEPA 的四条非对比准则(Figure 13,本文最可操作的部分):
- 最大化 $s_x$ 关于 $x$ 的信息量;
- 最大化 $s_y$ 关于 $y$ 的信息量;
- 让 $s_y$ 易从 $s_x$ 预测(即能量项 $D(s_y,\tilde s_y)$);
- 最小化 latent $z$ 的信息量(否则 predictor 可直接 copy $z=s_y$ 令能量恒为 0,导致坍缩)。 准则 1/2/4 联合防坍缩;$z$ 的信息量通过**离散化 / 低维 / 稀疏(L1)/ 加噪(VAE 式)**四类手段压缩(点名 VQ-VAE、Implicit Rank-Minimizing AE、sparse coding/LISTA、noisy AE/VAE)。
(4)VICReg(4.5.1,给准则 1/2 落地):把 $s_x,s_y$ 经 expander 映到高维 $v_x,v_y$,用两个可微项——Variance(每维标准差保持在阈值以上,hinge)+ Covariance(不同维协方差压向 0 做去相关)——近似”信息量最大化”;第三项是表征预测误差 $D(s_y,\tilde s_y)$。论文精辟总结:VICReg 是”对分量做对比”(dimension-contrastive),而传统对比法是”对样本向量做对比”(sample-contrastive),故 VICReg 不需大量负样本。Barlow Twins、whitening、MCR² 属同类。最简实例:$x,y$ 为同一内容的两视图、predictor 取恒等、$D=\lVert s_y-s_x\rVert^2$,即学不变表征。
(5)H-JEPA 与层级规划训练(4.6/4.7):JEPA 学到的抽象表征可堆叠——JEPA-1 低层短时预测、JEPA-2 高层长时预测,可 level-wise 或全局训练。层级 Mode-2 规划中,高层”动作”$a2$ 并非真实动作,而是给下层设定的子目标/约束(下层状态须满足的条件),top-down 贪心或跨层联合优化。
(6)不确定性下的规划(4.8,Figure 17):predictor 带 latent $z$,规划时对 $z$ 按”正则项取负对数作为 Gibbs 分布”采样,每个样本给一条轨迹;离散 latent 下轨迹数随步数 $k^t$ 指数膨胀,需 MCTS 式定向搜索+剪枝;据此可优化”最小化平均代价 或 平均+方差(控风险)“的动作序列。
(7)critic 训练:从短期关联记忆检索 $(τ,s_τ,\text{IC}(s_τ))$,用后续时刻 intrinsic energy 作目标最小化 $\lVert \text{IC}(s_{τ+δ})-\text{TC}(s_τ)\rVert^2$(类 A2C actor-critic)。
Infra(训练 / 推理工程)
全部未披露。 本文为纯概念性 position paper,不涉及任何工程实现:无 GPU 型号 / 卡数 / GPU-hours / 并行策略 / 精度,也无推理 FPS / control-Hz / 延迟 / 边缘硬件。论文明确说”实例化该架构、让它在非平凡任务上工作绝非易事,很可能要多年才能逐一解决”,并把”世界模型的架构与训练范式”称为未来数十年 AI 进步的主要障碍。
评测 benchmark
无。 本文不含任何定量实验、表格、baseline 对比或消融——它不训练模型,因此没有可报的 benchmark 数字。其”论证”完全是概念性与理论性的(EBM 坍缩分析、维度诅咒论证、认知科学/神经科学类比)。文中出现的经验性支撑均为引用他人工作(如引 VICReg (Bardes et al. 2021)、Barlow Twins (Zbontar et al. 2021)、Director (Hafner et al. 2022) 等),非本文实验。唯一的”量化”是启发性锚点(人类 ~20 小时学会开车、负样本随维度指数增长、$k^t$ 轨迹膨胀)。
创新点与影响
论文自述的四点原创贡献(7 节):
- 一套所有模块可微、许多模块可训练的整体认知架构(六模块 + Mode-1/Mode-2)。
- JEPA / H-JEPA:非生成、在表征空间预测、可学多层抽象的预测式世界模型架构。
- 一族非对比自监督范式,产出”既信息完整又可预测”的表征。
- 用 H-JEPA 作为不确定性下层级规划世界模型的基础。
更深的范式影响:
- 把世界模型从生成式拉向非生成式。明确反对”预测每个像素/token”的生成路线,主张编码器丢弃不可预测细节、在抽象空间预测——这一主张直接落到后续 jepa-predictive(I-JEPA 图像、V-JEPA 视频)等 Meta FAIR 工作,成为”非生成自监督世界模型”这一子领域的开山纲领。
- 给”scaling/reward is enough”提供了系统的反方立场:LLM 因 token 化+生成+(掩码=对比)三重限制,难以在高维连续模态表示不确定性、且缺抽象 latent 无法探索多解与动态设目标;纯 RL 因标量奖励信息量低而样本效率极差,世界模型才是学习主体、reward 只占次要角色。
- 把推理统一为能量最小化 / MPC,为”神经网络里做规划”给了一个可微、可与深度学习共存的形式,区别于符号 AI 补丁路线(点名反驳 Marcus & Davis)。
论文自陈的局限(8.1 节,坦率):H-JEPA 能否真从视频学出抽象概念层级尚未验证;latent 正则化”离散/低维/稀疏/随机”哪种最优不清楚;离散/非光滑动作空间下梯度优化可能失效需搜索法;Mode-2 里如何系统枚举 latent 的多解无机制;各模块(predictor 的门控/路由微架构、short-term memory、critic)架构均未指定;configurator 如何把复杂任务自动分解为子目标序列”最神秘、未解”。全篇无一行代码、无一次实验——它是路线图而非成果。
原始链接
- OpenReview 论文页(canonical):https://openreview.net/forum?id=BZ5a1r-kVsf
- 论文 PDF(Version 0.9.2, 2022-06-27):https://openreview.net/pdf?id=BZ5a1r-kVsf
- Meta AI 官方博客(Inside the Lab, 2022-02-23,配套科普预告):https://ai.meta.com/blog/yann-lecun-advances-in-ai-research/
- 相关方法:VICReg (arXiv:2105.04906)、Barlow Twins (arXiv:2103.03230)
一手源存档(sources/)
- lecun-path-autonomous-machine-intelligence—blog — Meta AI 官方博客快照(sources/world-model/2022/)
- lecun-path-autonomous-machine-intelligence—openreview — OpenReview 论文页(摘要+元数据)快照(sources/world-model/2022/)
- 论文原文 PDF(OpenReview
pdf?id=BZ5a1r-kVsf,v0.9.2,62 页):经 Cloudflare Turnstile 保护,正文已抓取通读,按约定不入 git,见上方 PDF 链接重取。