一句话定位

Physion++(NeurIPS 2023)在 physion 的物体动力学预测任务上叠加一层”先在线推断潜变量物理属性、再据此预测结果”的双阶段视频刺激设计——9 个场景覆盖质量/摩擦/弹性/可变形性四种潜在力学属性,用”paired”配对刺激切断视觉表观与正确答案的相关性,逼模型必须真正做属性推断才能稳定得分;结果是除了能直接读取 3D ground-truth 状态的 oracle 模型 DPI-Net,几乎没有模型表征里真正编码了这些属性,且所有模型与人类判断的逐条相关性都很低。

背景与定位

  • 此前的物理/动力学预测 benchmark(KITTI、Human3.6M、ShapeStacks、CATER、RoboNet、CLEVRER、CoPhy、PHYRE、ESPRIT、CRAFT、physion、IntPhys、ComPhy)要么不要求物体拥有个体化的力学属性(如 physion v1 中所有物体密度、弹性相同),要么只测直接可观察的属性(大小、颜色),模型和人类都可能只是在依赖视觉表观而非真正的属性推断。
  • Physion++ 与前作 physion 用同一套模拟引擎(TDW)和同一个 OCP(object contact prediction,预测红色物体是否会碰到黄色物体)任务范式,核心区别是新增”推断期”(inference phase):在预测期之前插入一段视频展示物体如何运动/互动,让力学属性(而非仅几何/位置)变得可从视觉线索推断,并强制同一模型在一个 pipeline 里完成”属性推断→动力学预测”两步。
  • 与同时期聚焦生成式视频模型物理理解的评测(如 physics-iq,DeepMind 2025)相比,Physion++ 更早、更聚焦”潜变量属性”这一维度,且直接对比一组代表性物理预测范式(像素级视频扩散、ImageNet 编码器+MLP、object-centric 动力学模型、3D 粒子图神经网络 oracle),而非仅评测视频生成模型。
  • 定位是”世界模型物理理解”评测方法论上的一个关键补丁:证明”预测准确率高”不等于”理解了物理属性”,两者可以脱钩——模型可能靠视觉表观捷径蒙对,而非真的推断了质量、摩擦、弹性、软硬度。

模型架构

Benchmark 本身不预设架构,而是对比 4 类代表性范式(论文用于评测的 7 个基线):

  • 像素级视频预测:MCVD(Masked Conditional Video Diffusion)——直接在原始帧上做未来帧预测,图像重建损失。
  • ImageNet 预训练编码器 + MLP:pRESNet-mlp(ResNet50)、pVGG-mlp(VGG16)、pDeiT-mlp(DeiT-small)——用监督预训练视觉编码器抽特征,readout 阶段接 MLP。
  • object-centric 动力学模型:SlotFormer、ALOE——先各自用自监督 slot 表征学习(SlotFormer 用 STEVE、ALOE 用 MONet)做场景分解,再在 slot 表征上学习未来 rollout。
  • 3D 粒子图神经网络(oracle):DPI-Net——不经过视觉编码器,直接吃 ground-truth 3D 粒子状态(及可选的 ground-truth 力学属性)做输入,学习粒子间的力/变换做显式 3D flow rollout;有属性输入时把属性值加进 attribute embedding,无属性输入时用全零 padding 向量遮蔽。接触判定:计算两目标物体最近粒子间距离 d_min,若小于阈值 η=0.075(从训练集学出)判定接触。
  • 输入规格:每段视频(推断期+过渡期+预测期)按 160 帧截断/补齐,再降采样 5 倍用于训练;所有帧 resize 到 128×128
  • Readout 头:统一用隐藏维 256、64 的两层 MLP 做 logistic 回归式二分类,从 rollout 出的场景表征(图像特征图 / slot 向量 / 3D 粒子接触距离)映射到 OCP 的 YES/NO。

数据

  • 生成引擎:TDW(ThreeDWorld,Unity3D-based),与 physion 同一套模拟器和 OCP 范式。
  • 9 个场景 × 4 种力学属性:Mass-{Dominoes, Waterpush, Collision}、Elasticity-{Wall, Platform}、Friction-{Slide, Collision, Clothslide}、Deform-Roll。
  • 三段式刺激设计:推断期(展示物体运动/互动,泄露力学属性信息)→(可选)过渡期(帘幕遮挡场景,期间重新摆放物体但属性保持不变)→预测期(红/黄两个目标物体闪烁提示,问”红色物体是否会碰到黄色物体”)。过渡期只在”推断期会不可逆改变场景配置”的场景中插入(如多米诺骨牌推倒后无法复原);Elasticity-Platform、Friction-Slide、Friction-Clothslide 等场景推断与预测可在同一段连续视频内完成。
  • 数据规模(每种力学属性):动力学训练集 2000 条无 YES/NO 标签的轨迹(正负样本各半,用于 dynamics pretraining);readout 拟合集 192 条(96 对);测试集 192 条(96 对),与人类实验用同一批刺激。
  • “paired”配对设计:同一场景配置下,固定预测期首帧完全一致的两条轨迹,仅通过重新采样目标物体的力学属性值(最多采 5 次,全真/全假的场景会被丢弃)得到一个 YES 结局和一个 NO 结局,避免模型靠表观视觉线索猜答案。
  • 人类数据:200 名 Prolific 参与者(每种属性 50 人),时薪 $15.50,每人看 32 条刺激(16 YES/16 NO,来自同一属性的一个不相交子集),经 MIT 和 UC San Diego IRB 批准;数据采集于 2022 年下半年。
  • 无 sim-to-real 迁移(纯模拟数据);无跨模态 co-training。动作/属性标注均由模拟器自动生成——每帧的 dynamic/static friction、初始位姿、mass、elasticity、颜色、mesh 及碰撞事件的 ground truth 记录在 .pkl 元数据中。
  • 数据集以 MIT 许可开源,托管在 Amazon S3(train_data.zip / readout_data.zip / test_data.zip / human_data.zip)。

训练方法

  • 两种训练协议:“separate”(每种力学属性单独学一个动力学模型)vs “unified”(所有场景合训一个统一动力学模型)。
  • 三种测试变体(仅 separate 协议下全测,unified 只测第一种):“w/ property”(标准推断期+预测期视频)、“w/o property”(去掉推断期中物体首次交互的关键帧,即不给属性推断信息,用于检验模型是否真的依赖属性推断)、“fully observed”(把预测期延伸到接触结果实际发生之后,直接测表征质量上限)。
  • Pipeline:①在训练集上用未来帧预测损失预训练动力学模型;②在 readout 拟合集上用预训练模型做 rollout,抽取观测帧+预测帧的表征;③训练 MLP readout(logistic 回归式)从表征映射到 OCP 的 YES/NO;④在测试集上评估,报告所有 readout 训练 epoch 中的最佳结果。
  • 显式 vs 隐式属性推断消融:为 4 个代表模型(DeiT-mlp、ResNet-mlp、ALOE、SlotFormer)在 readout 阶段加一个并行 MLP 分支做”多任务”(OCP + 显式属性数值回归),对比是否能提升 OCP 准确率——用于区分”模型不会用属性”还是”模型压根没编码属性”。
  • 优化:所有 readout 模型用 Adam,学习率 1e-4;DPI-Net 沿用 physion 的其余超参设置。
  • 无 RL;无蒸馏。

Infra(训练 / 推理工程)

  • 训练硬件:全部实验跑在 8× NVIDIA TITAN X GPU 上;GPU-hours、并行策略、训练精度未披露
  • 推理 FPS / 控制频率 / 边缘硬件:纯离线评测 benchmark,不涉及实时推理或机器人部署,不适用
  • 代码:项目页只提供 S3 数据下载链接(train/readout/test/human 四个 zip)和 arXiv 论文 PDF;未发现独立的 GitHub 评测代码仓库——entry 元数据给出的 github_urlHsiaoYu/Physion2)经核实为 404,论文与项目页均未提及公开代码仓库地址。

评测 benchmark

全部为论文 Table 2/3/5 一手结果(chance level = 50%,二分类任务)。

Overall(4 种属性平均,论文 Table 2 “Overall” 行)

测试变体MCVDDeiT-mlpResNet-mlpVGG-mlpALOESlotFormerDPI-Net(oracle)
unified, w/ property54.353.352.251.851.952.253.0
separate, w/ property54.355.455.155.553.456.760.2
separate, w/o property54.354.154.855.152.556.257.5
separate, fully observed59.963.961.256.055.565.192.2

按力学属性拆分(separate, w/property,论文 Table 2):Mass 上 DPI-Net 75.9(w/o property 时仅 60.1,+15.8 分);Friction 上 DPI-Net 52.5;Elasticity 上 DPI-Net 52.1;Deformability 上 VGG-mlp 61.5 略高于 DPI-Net 60.2。除 DPI-Net 在 Mass 场景上 w/property 相对 w/o property 有明显提升外,其余所有模型的 w/property 与 w/o property 分数普遍接近甚至反超,说明”给了属性推断信息”基本没有帮助大多数视觉模型。

人类对照(论文 Fig. 4 I, IV):人类整体准确率约 60%(高于 chance 但远非满分);除 DPI-Net(用 ground-truth 3D 状态,表现与人类相当)外,所有视频模型都略低于人类。模型-人类逐条相关性(Pearson r)全部很低——SlotFormer 最高,r=0.12,而人类内部 split-half 相关 r=0.37,即便相关性最高的模型也远未捕捉到人类的判断模式。

难易度对照(易/难配对试次,论文 Fig. 4 II/III/V/VI,易=人类准确率>67%、难=人类准确率<33%):所有模型在人类觉得”容易”的试次上表现不如人类,却在人类觉得”困难”的试次上超过人类——即模型和人类依赖的是不同线索/能力,而非同一种物理理解在程度上的强弱差异。

训练数据量消融(论文 Table 3,4 个代表模型,separate + w/property,4 属性均值):

# 训练轨迹/属性DeiT-mlpResNet-mlpALOESlotFormer
20049.050.050.551.6
50053.651.652.154.2
100054.754.754.256.3
200055.455.153.456.7

1000→2000 轨迹的提升已经很小,论文据此认为 2000 轨迹/属性足够,性能差异更多来自架构而非数据规模。

显式属性推断消融(论文 Table 5,OCP-only vs. 加一个属性回归辅助任务):

方法DeiT-mlpResNet-mlpALOESlotFormer
implicit(仅 OCP)55.455.153.456.7
explicit(+属性回归辅助任务)54.255.754.756.7

加了显式属性估计辅助任务后准确率几乎不变(部分甚至略降),论文据此推断:这些模型的表征里根本没有编码物理属性信息,而非”编码了但选择不用”。

创新点与影响

  • physion 的”物体动力学预测”基础上,首次把”必须先在线推断潜变量力学属性(质量/摩擦/弹性/可变形性),才能正确预测接触结果”直接设计进 benchmark 的刺激结构本身(推断期+可选过渡期+预测期三段式视频),而不是靠事后分析间接推断模型是否用到了属性。
  • 用”paired”配对刺激(同一初始画面、仅属性不同导致结局相反)系统性地切断”视觉表观捷径”与”正确答案”之间的相关性,逼模型必须真正做属性推断才能稳定得分。
  • 系统对比 4 类代表性物理预测范式在同一套刺激上的表现,发现:①object-centric 模型总体优于纯像素/纯 ImageNet 编码器模型(与 physion 的发现一致);②只有能直接访问 ground-truth 3D 状态与属性的 DPI-Net 才表现出”用上了属性推断”的迹象(且仅在 Mass 场景上明显);③几乎所有视觉模型的表征里都提取不出可用的属性信息(显式辅助任务也无济于事)。
  • 首次系统性对比模型与人类在同一批力学属性推断刺激上的逐条判断相关性(而非仅整体准确率),揭示”准确率相近不代表判断机制相近”——所有模型都在人类觉得难的题上超常发挥、在人类觉得容易的题上失手,提示当前视觉学习模型的物理理解与人类走的是不同路径。
  • 论文自陈局限(Discussion 节):属性推断本身可能就是困难任务,2000 条轨迹/属性对某些模型可能仍不够;视频跨越多阶段(推断+过渡+预测,总长 13–20 秒),而评测模型多在更短视频上训练/测试,这本身可能构成额外瓶颈;未来出现更强的多阶段长时依赖视频/动力学模型后,Physion++ 可继续作为衡量”是否学到属性推断能力”及”与人类相关性”的标尺。

原始链接

一手源存档(sources/)