一句话定位

Physion 是一个用 ThreeDWorld 物理仿真器生成、覆盖 8 类物理现象(碰撞 / 支撑 / 容纳 / 附着 / 下落 / 滚动 / 悬垂布料等)的直觉物理预测评测基准:用一个统一的、对模型架构无关的「物体接触预测(Object Contact Prediction, OCP)」任务——看前 1.5 秒视频,预测红色 agent 与黄色 patient 是否会接触——同时测 800 名真人与十余个 SOTA 视觉/动力学模型,直接对齐人机行为。核心发现是没有任何视觉算法达到人类水平,而拿到 ground-truth 物理状态的粒子图神经网络(DPI)能逼近人类,由此论证「从视觉中抽取物理表征」才是通向类人物理理解的主要瓶颈。它是把”世界模型是否真的懂物理”这件事变成可复现、可与人类对齐的量化标尺的奠基性工作。

背景与定位

本文属于直觉物理(intuitive physics)评测这一范式,是”世界模型能否理解物理”这个问题的评测侧奠基工作,与 world-models-ha-schmidhuber 这类”学习环境动力学”的建模侧工作互补——后者训练能预测未来的世界模型(如本文测试的 GNS/DPI 学习式模拟器就是显式动力学世界模型),本文提供的是判定这些模型是否达到人类物理直觉的统一考卷。

论文明确批评了此前两条割裂的评测标准:

  • 机器人 / 视频合成路线:追求逐帧像素或逐粒子轨迹的精确预测(Finn 等、RoboNet),只有近乎”拉普拉斯妖”式掌握完整物理状态的模型才可能做到,在多样场景下欠拟合,且高保真视频输出不代表学到了通用物理知识。
  • 认知/发展心理学路线:只探测离散事件的定性理解(积木塔会不会倒、物体会不会从遮挡后重现,如 IntPhys、ShapeStacks、PHYRE),但要么依赖结构化输入(物体分割),要么局限于少数简单/2D 场景,泛化性存疑。

Physion 的定位是兼取两者并超越:要求模型在高度多样、非结构化的视觉输入上,对广谱物理现象做基于事件的预测,且能与人类判断直接比较。它由 Stanford(Bear/Yamins/Fei-Fei 等)、MIT(Tenenbaum/Kanwisher/Smith)、UCSD(Fan)联合完成,收录于 NeurIPS 2021 Datasets & Benchmarks track,隶属 DARPA Machine Common Sense 计划。

模型架构

本条目是评测基准,“架构”维度记录 基准的任务/评测框架设计被测模型的四大类结构

任务设计:OCP(Object Contact Prediction)

每个刺激场景恒定有一个 agent 物体(测试集永久染红) 和一个 patient 物体(永久染黄),多数场景另有一个 probe 物体(绿色) 的初始运动触发物理连锁反应。任务:给定”观测到”的前段视频与探针初始运动,预测在所有物体静止时 agent 与 patient 是否会接触,输出 $P(\text{contact})$。形式化为函数 $F_\Theta:({X_{1:t_{vis}}}, o_a, o_p)\mapsto P(\text{contact})$。真人只需 10 个带反馈的熟悉试次就能学会该任务。

图像可计算模型的统一适配管线

任意图像可计算模型被分解为三段(图 4):

  • 视觉编码器:把输入视频每帧映射为状态向量表征;
  • 动力学预测器:从”观测”状态向量预测未观测的未来状态;
  • 任务适配器(task adaptor):从观测+预测状态向量的拼接产出试次级 $P(\text{contact})$。适配器统一实现为逻辑回归 / 广义线性模型,在评测阶段冻结预训练模型参数后单独拟合,从而免去显式的物体掩码提示,也让基准能测任何未针对 OCP 优化的预训练模型(迁移学习范式)。

被测模型四大类

  1. 无监督联合编码-动力学预测器(只在基准数据上训练):SVG(卷积隐状态 + LSTM 动力学 + 变分下界,image-like latent)、OP3(K 因子 object-like latent + 递归图网络,靠逐像素渲染未来帧的 L2 损失学习)、CSWM(对比铰链损失直接作用于 object-like latent,不重渲染像素);
  2. 有监督视觉-物理动力学模型RPIN(Region Proposal Interaction Network,R-CNN 式检测 + RoIPooling 抽 object-centric 特征 + Interaction Network 预测未来 2D 物体位置,需人工标注 bbox 监督,用 4 帧输入以估计速度/加速度);
  3. ImageNet 预训练编码器 + RNN 动力学pVGG-mlp/lstm(VGG-19)、pDeIT-mlp/lstm(Transformer 架构 DeiT)——编码器冻结,外接单隐层 MLP 或 LSTM 动力学头,用无监督前向预测 L2 损失训练;
  4. 物理状态可计算的粒子图网络(不看 RGB,直接吃 ground-truth 仿真状态并被其监督,等于”假设完美可观测”的显式动力学世界模型):GNS(扁平粒子图,距离阈值 $\delta{=}0.08$ 动态建边)、GNS-RANSAC / GNS-R(在 GNS 前向展开时用 RANSAC 求 6-DoF 刚体变换、强制刚体保持刚性以抑制长程展开的形变漂移)、DPI-Net / DPI(2 层层级图:叶级粒子 + 物体级根节点传递远程效应;本文相对原版改用相对粒子位置提升泛化,并加入物体内 leaf-leaf 边)。粒子图由每个物体的碰撞体网格顶点转成粒子构建。

数据

全部数据由 ThreeDWorld(TDW)——基于 Unity3D 的多模态物理仿真环境——生成。8 类场景:Dominoes(多米诺连环碰撞)/ Support(可能倒塌的堆叠)/ Collide(两物体碰撞)/ Contain(容器约束)/ Drop(重力下落弹跳)/ Link(附着约束运动)/ Roll(滚动或滑动)/ Drape(布料悬垂)。场景由基础”toy blocks”搭建以避免真实世界物体配置带来的先验捷径。

每个场景三套刺激集(共 8 场景):

  • Training(训练集):2000 段视频/场景,无 agent/patient 视觉标记,供无监督学习/微调物理动力学表征;训练时看整段视频,不给 OCP 标签。
  • Readout Fitting(读出拟合集):1000 段/场景,与测试集同分布,红黄恒定染色,供拟合 OCP 任务适配器(ground-truth 接触标签作监督)。
  • Testing(测试集):150 段/场景,与真人所见完全相同(agent/patient 永久染红黄),接触/不接触各占 50%,每条附 ground-truth 标签 + >100 名真人的响应。8×150 = 1.2K 测试刺激

每段刺激:5–10 秒、30 fps 渲染的电影;真人/模型只看前 1500 ms。TDW 逐帧输出:① 视觉数据(彩色图、深度图、表面法向图、物体分割掩码、光流图);② 物理状态(物体质心、位姿、速度、表面网格→可转粒子、物体间/物体-环境碰撞的位置与法向);③ 刺激级元数据(各物体的模型名/尺度/颜色、相机内外参、agent/patient 掩码与接触指示、外力施加时刻与向量、场景特定参数如塔的积木数)。场景配置刻意引入不影响物理结果的视觉变异(相机位姿、物体颜色纹理、干扰物体、背景外观)以增加视觉多样性。

数据集下载规格(GitHub):PhysionTest-Core 270 MB(评测所需最小集)、PhysionTest-Complete(含逐帧 HDF5 完整元数据)380 GB、PhysionTrain-Dynamics 770 MB(~2K/场景)、PhysionTrain-Readout(1K/场景);24 个分场景完整 HDF5 合计约 1 TB(~40 GB/文件)。数据于 2021 年 5 月初生成。全部代码与数据以 MIT 许可发布。仿真依赖 tdw_physics,建模评测依赖 physopt 仓库。

训练方法

基准本身不训练单一模型,而是规定三训练协议 × 三读出协议的统一评测流程:

训练协议(图 4 左):

  • all:在全部 8 场景训练集上并发训练(论文认为这是物理理解的最佳测试,因为得到的模型不特化于单一场景);
  • all-but:训练时留出待测场景(测跨场景泛化);
  • only:只在待测场景类型上训练(测对单场景的过拟合/特化)。

训练细节按模型原架构:含编码器+动力学的多帧模型端到端训练;仅含预训练编码器的模型外接 RNN 动力学头,损失为预测输出与观测输出的 MSE,并训练冻结/微调两版编码器。

读出协议(图 4 右,逻辑回归适配器):

  • observed:只用前 $t_{vis}$(1.5 s)帧特征拟合;
  • observed+simulated:观测特征拼接模型动力学预测器”模拟”出的特征(图 5A 主结果用此协议);
  • full:用整段视频(非仅测试段)特征——因为等于”检测”而非”预测”,不能直接与人比,但用来衡量物理信息在视觉特征里的编码程度。

人机对比三指标:整体准确率、模型与平均人类响应的 Pearson 相关、衡量模型二值预测与单个真人相似度的 Cohen’s κ(对参与者平均)。三指标均以 “human zone”(该统计量在真人/真人对间经验分布的 2.5–97.5 百分位)为参照带。

真人实验:800 名参与者(每场景 100 人;447 女/343 男/7 未表明;均英语母语),Prolific 招募,报酬 $4.00(约 $12/hr);每人看单一场景全部 150 试次;因未通过预注册的注意力检查标准剔除 112 人。试次结构:注视十字 500–1500 ms → 首帧红黄掩码以 2 Hz 闪烁 2000 ms 提示 agent/patient → 播放前 1500 ms → 移除刺激后作 Yes/No 预测;正式测试前有 10 个带反馈的熟悉试次。分析计划预注册(版本控制存于 GitHub),经 Stanford 与 UCSD IRB 批准。

Infra(训练 / 推理工程)

  • 训练硬件:实验在 Google Cloud Platform 上跨 80 张 GPU(NVIDIA T4 与 V100 混用)跑约 2 天
  • 粒子模型训练:DPI-Net 与 GNS 用 Adam(初始学习率 1e-4)训练 1.5M–2M 迭代至收敛,单次实验约 2–5 天
  • 算力资助:HAI-Google Cloud Credits Grant、IBM-Watson AI Lab,及 NVIDIA 硬件捐赠。
  • 推理 / 部署:本工作为离线评测基准,无实时控制/FPS/边缘部署指标——未披露

评测 benchmark

所有结果取自论文一手数据(all-scenarios 训练 + observed+simulated 读出为主结果,图 5、表 S1)。

总体结论

  • 真人跨 8 场景总体准确率 0.71(proportion correct,t=27.5, p<10⁻⁷),显著高于随机;human zone 紧且远离随机,说明人类响应模式高度可靠、足以区分模型。
  • 粒子模型逼近人类:GNS / GNS-R / DPI 在多个场景匹配人类准确率,其中 object-centric 的 DPI 达到跨场景人类水平;且在 all / all-but 协议下即远高于随机(不止 only 协议)——单个图网络能跨多样场景做人类级预测。
  • 视觉模型远逊人类:无一接近人类。无监督类里 SVG(纯卷积隐状态)近随机,OP3 略好(b=0.06, t=7.6, p<10⁻¹¹),CSWM(对比 object-centric latent)显著超过 SVG/OP3。有监督 RPIN 仅在 all-but/only 协议下比 CSWM 准(all 协议下不显著,b=0.035, t=3.7, p<10⁻³)。
  • ImageNet 预训练编码器有效:pVGG 显著超过最好的纯 TDW 训练模型(CSWM/RPIN,b=0.015, t=2.9, p<0.01);pDeIT(Transformer 编码器)又显著超过 pVGG(b=0.067, t=16.5, p<10⁻¹⁵)——好的、“物体感知”的视觉表征即便不显式模拟未来也更利于物理预测。

人机误差模式一致性:错误模式一致性(Pearson r / Cohen’s κ)与绝对性能强相关——预测越准的模型犯错越像人;但无一模型完全进入 human zone(即输出与真人统计上不可区分)。粒子模型在”对抗性”刺激(人类系统性低于随机的边界态/遮挡态)上与人类预测不相关,提示给前向动力学加噪声或概率化读出可更好匹配人类。

视觉模型学到了什么:observed+simulated 读出整体并不优于 observed(p=0.53)——视觉动力学模型的”模拟”对 OCP 无帮助;但 full 读出显著更高(b=0.094, t=12.0, p<10⁻¹⁵)——视觉特征确实编码了可用于接触检测的空间关系信息,其在 observed 协议下的失败可归为缺乏物理”理解”。

场景多样性促进泛化:视觉模型 only 协议仅略好于 all(b=0.21, t=4.4, p<10⁻⁴),all-but 也未显著更差(b=0.009, t=1.9, p=0.057);单场景训练不能泛化到多数其他场景,说明观测多样性对学通用物理前向预测器至关重要。

分场景准确率(表 S1,人类 vs. 最强粒子模型 DPI):

场景HumanDPI备注
Dominoes0.6930.715
Support0.7630.626DPI 逊于人
Collide0.8090.850
Contain0.7670.711
Drop0.7440.755
Link0.6430.657人类最难场景之一
Roll0.8830.789人类最易,但无模型达人类
Drape0.6780.556布料,DPI 明显逊于人

(对比:视觉模型如 CSWM/pDeIT 各场景多在 0.55–0.69 区间,普遍显著低于人类。)

创新点与影响

贡献

  1. 首个把广谱直觉物理(8 类刚体+软体现象)视觉真实的 3D 仿真统一且架构无关的 OCP 评测协议与真人逐刺激对齐四者合一的基准,超越此前只测单一现象或只在简化 2D 环境的工作。
  2. 提出”human zone + 三训练协议 × 三读出协议 × 三指标”的可复现人机对比方法论,能诊断物理理解失败的具体环节(视觉表征 vs. 动力学)。
  3. 系统性实证结论:从视觉抽取物理表征(尤其把场景元素分组为物体)是通向类人物理理解的主要瓶颈;object-centric > non-object-centric,拿 ground-truth 状态的粒子图网络才逼近人类——为”符号/结构化表征在物理理解上或优于纯分布式表征”提供了量化证据。

影响:Physion 成为世界模型”物理预测能力”评测的锚点基准(如 NVIDIA Cosmos 等后续物理 AI 世界模型评测其物理对齐时的参照谱系),推动”用人类行为对齐来判定模型是否真懂物理”的评测范式。作者后续发布了升级版 Physion V1.5(项目页公告)。

作者自陈局限

  • 8 场景仍未覆盖”软/squishy”材料、流体、多部件铰接物体,以及更大范围的质量/摩擦/密度参数;需持续扩充场景。
  • 粒子模型享有巨大不公平优势——直接吃真实世界永不可直接观测的 3D 位姿/轨迹/遮挡面精细形状;DPI 对遮挡不敏感、确定性二值预测,其与人类匹配存在上界。
  • 视觉模型的上述”above-chance”可能部分源于非因果的 shortcut learning,需更细粒度对比编码器架构/训练数据/损失来厘清。

原始链接

一手源存档(sources/)

  • physion—github-readme — GitHub README 快照(数据集下载规格 / 三协议 / 被测模型清单,fetched 2026-07-16)
  • physion—project-page — 项目主页 physion-benchmark.github.io 快照(含 Physion V1.5 公告,fetched 2026-07-16)
  • arXiv 原文 PDF(2106.08261,全文含 Table S1 分场景准确率 / 模型细节 / 数据表 / 预注册,不入 git,见上方 arXiv PDF 链接)