一句话定位

PhysBench 是南加大(USC)联合 UC Berkeley、丰田研究院(TRI)提出的视觉语言模型(VLM)物理世界理解基准:10,002 条交错图像/视频/文本的四选一问答,覆盖物理属性、物理关系、物理场景、物理动态四大类 19 个子任务,在 75 个代表性 VLM 上测得平均准确率约 40%、最好的 GPT-4o 也只有 49.49%(人类 95.87%),并配套提出免训练的 PhysAgent 框架(融合 Depth Anything/SAM/GroundingDINO 等视觉专家模型 + 物理知识记忆 + CoT 自我验证),把 GPT-4o 在本基准上的零样本表现整体提升约 18.4%,并验证这种提升可以迁移到 MOKA 式的机器人抓取任务上。论文发表于 ICLR 2025。

背景与定位

VLM 被广泛用作具身智能体的”大脑”(如 MOKA 这类先生成 affordance 表示、再转成机器人动作的范式,以及 OpenVLA(openvla-oft 的前身路线)这类直接输出动作 token 的范式),但论文指出这条路线普遍缺一个环节验证:VLM 到底懂不懂物理世界(质量、摩擦、弹性、碰撞顺序、光影/视角变化、流体行为等),而不是仅仅”看图说话”式的常识推理。此前的物理理解数据集要么面向纯视觉模型、局限于合成场景里的简单几何体和刚体碰撞(CLEVRER、Physion、Physion++、ContPhy、CRIPP-VQA、ComPhy 等),要么是聚焦 3D 几何关系的 Spatial VQA(EmbSpatial 等),都只覆盖物理理解的一个切面。PhysBench 定位为首个综合性、交错多模态输入、四维度全覆盖的 VLM 物理理解基准,同一时期的 physics-iq(Google DeepMind)则从另一个角度切入——不测 VLM 的问答能力,而是测视频生成模型能不能通过真实拍摄的物理场景续写来隐式证明理解物理;intuitive-physics-vjepa(Meta FAIR V-JEPA)又是另一条路线——不用语言问答,直接在表征空间里测”预测误差/惊讶度”。三者共同构成了 2025 年前后”世界模型/VLM 到底懂不懂物理”这场评测热潮里三种互补的方法论(语言问答式 vs 视频续写式 vs 表征探针式)。

模型架构

PhysBench 本身是基准数据集 + 免训练评测/增强框架,不训练新的骨干网络。两个核心产物:

PhysBench-test 数据结构:每条 entry 是一个 JSON,字段包括 scene(场景描述,主要记录仿真数据用的 HDR 环境贴图)、object(涉及的主体物体)、sourcereal/simulation/web 三选一,标注数据来源)、file_name(按顺序排列的 <video>/<image> 序列,可与题干中的占位符一一对应)、question(题干+四个选项)、answertask_type/sub_type/ability_type(四大类/19 子类/能力维度的三级标签)、description(视频场景描述,人工标注 + VILA-1.5 生成的详细描述)。题目形式统一为四选一单选,支持”纯图像""纯视频""图文视频交错”三种输入形态。

PhysAgent 框架(图 8):给定问题,走三步流水线——① 任务专属提示激活:先用 VLM 自己把问题分类到某个物理子任务,再注入该类任务对应的物理知识 prompt(如”光问题”会注入”影子移动方向与光源移动方向相关”这类先验规则);② 视觉专家模型集成:调用 Depth Anything(深度估计)、SAM(分割)、GroundingDINO(开放词表目标检测,用于识别物体类型和空间位置)等现成视觉基础模型,把结果与知识记忆检索结果一起喂回 VLM,用于弥补 VLM 自身在深度估计、数值距离计算等任务上的短板;③ 思维链推理 + 自我验证:VLM 做 CoT 推理并对答案做一次逻辑自检后再输出最终选项。整个框架不需要额外训练,是纯推理时(inference-time)的 agent 编排,区别于 ContPhy 这类依赖预训练 R-CNN/MPM/DPI-Net 等专用模块、只能处理预定义模板任务的”神谕模型”路线。

数据

  • 规模:PhysBench-test 共 10,002 条(含 200 条验证集用于调参),另有 89,998 条留作后续研究扩展池;GitHub/HF 页面披露 ICLR camera-ready 后额外放出了训练集(WeiChow/PhysBench-train)、素材集(WeiChow/PhysBench-assets)、多媒体集(WeiChow/PhysBench-media)。
  • 输入构成(Table 2):10,002 题中仅单图 1,766 条(18.6%)、仅单视频 2,749 条(44.8%)、图文视频交错 1,902 条(20.1%)(原文百分比未标注是否有其余”纯文本”类目使其和不为 100%,此处照抄原文数字);唯一图片数 10,058、唯一视频数 3,260;题干平均长度 16.5 词(最长 48)、选项平均长度 4.4 词(最长 20)。
  • 数据来源三条线(Appendix A):
    • 仿真:以 Blender 为平台,用 678–679 个 3D 物体资产 + 470 张 HDR 环境贴图(正文与图注数字略有出入,均为原文所写)批量渲染图像/视频,同步保存深度图、法线图、反照率图与位置/角度/光源等配置文件;用 GroundingDINO(box/text threshold 均设 0.2,网格搜索得出,见 Table 14)过滤物体检测不匹配的样本以保证标注质量;流体/绳索/布料/球类另用 ContPhy 资产 + Unity 渲染,四类各 350/250/200/200 段视频
    • 网络:以物理主题(如中学物理实验)做预定义查询 + LLM 引导检索 YouTube 视频;Unsplash 下载 57,859 张高质量图片、筛选后仅用约 6,000 张;操作类任务从 DROID、Ego4D、MimicPlay 采样约 500 段视频,配合 FunKPoint 标注 affordance 关键点;nuScenes(mini+test)裁剪标注得到 1,356 条空间移动(左转/直行/右转)QA。
    • 真实拍摄:预先设计场景和物体后人工实拍。
  • 标注流程:全部由 STEM 研究生标注(分 3 组各 6 人:视频采集组、质检组、中间处理组),经”视频采集→视频描述(GPT-4o 生成字幕+人工核对)→题目设计(GPT-4o 生成候选题+人工筛选)→文件整理→两阶段质检”五步流程,累计 4,000 小时人工标注/审核。
  • 人类基线:招募 12 名 STEM 研究生,设资格测试筛选合格标注者,题目分 10 个在线问卷 session 完成,取平均分作为人类表现(95.87%)。
  • 无跨具身/无动作标签(除操作任务用 FunKPoint 标注 affordance 点外)——这是一个感知/推理评测集,不是机器人策略学习数据集,但论文第 4.2 节额外验证了拿它做微调数据对 MOKA 式具身任务有正向迁移。

训练方法

PhysBench 本身不训练新模型;论文围绕”评测 + 免训练增强”设计了两条实验线:

  1. 75 个 VLM 的统一评测协议:按输入能力分三档——Image VLM(单图,如 LLaVA-1.5、BLIP-2)、Video VLM(视频,如 Chat-UniVi、PLLaVA)、General VLM(支持多图/交错输入,如 VILA-1.5、GPT-4o)。不支持多图的模型用两种适配方式:merge(视频帧拼接成一张大图)和 seq(逐帧顺序输入,唯一能处理真正交错文本-图像序列的方式)。Image/Video VLM 只在去掉交错数据的子集(8,099 条)上测,General VLM 在全量 10,002 条上测。多数模型沿用 VLMEvalKit 协议、温度设为 0;开源模型按各自开源实现选择 float16 或 bfloat16。
  2. PhysAgent 的推理时增强:与三种提示法(CoT、Desp-CoT 描述式思维链、PLR 纯语言推理)以及一个神谕基线 ContPhy(用 ViperGPT 复现,因原 ContPro 代码未开源:MASK R-CNN 检测物体静态属性 + MPM/DPI-Net 预测动态 + GPT-4o 做程序解析与符号执行)对比。结果:纯语言提示(CoT/Desp-CoT/PLR)效果不稳定甚至倒退;ContPhy 在四个任务里三个上不增反降(因为绕开 GPT-4o 直接感知、依赖 R-CNN 造成信息损失);PhysAgent 在 Phi-3V 和 GPT-4o 上都稳定提升,GPT-4o 整体提升约 18.4%(对应四类平均分从约 49.5 提升到约 59.7),其中 Scene 类单项相对提升 49.5%(30.1→45.0)。
  3. 微调实验(Table 24 / Figure 9c):把 PhysBench 数据用于 Phi-3V 微调,在 ContPhy-Property/Dynamics、Physion++、EmbSpatial 三个已有基准上做迁移评测,微调后普遍优于零样本 PhysAgent(如 Physion++ 上微调 82.20% vs PhysAgent 78.40% vs 原始 68.80%);具身任务上把 GPT-4o 用作 MOKA 流水线里的动作推理模块,分别对比”用 PhysBench 微调该 VLM”与”零样本套 PhysAgent”两种增强方式。

Infra(训练 / 推理工程)

PhysBench/PhysAgent 是评测 + 推理时框架,论文未披露自身的训练 GPU/GPU-hours(PhysAgent 本身无需训练)。唯一披露的训练规模是 ContPhy 复现基线里 MASK R-CNN 检测模块的训练配置——8 卡、batch size 16(每卡 2 图)、训练约 10k 迭代、学习率 0.01——但这是对照基线的训练细节,非 PhysBench/PhysAgent 本身。评测侧为纯 API/本地推理调用 75 个 VLM,无 FPS/延迟等实时指标披露;具身实验用 MuJoCo 仿真 + 7-自由度 Franka Emika 机械臂(Menagerie 资产库)跑 MOKA 流水线,同样未披露控制频率或延迟数字。(脚注:论文在相关工作中提到 OpenVLA 这类直接输出动作的路线训练用了 64×A100,但这是引用其他工作作对比,不是 PhysBench 自身的训练开销。)

评测 benchmark

主表(Table 3,75 个 VLM 中的代表性子集;GitHub/HF 页面公布的最新完整 40 模型排行榜见下)

模型参数/接口方式PropertyRelationshipsSceneDynamicsAvg
Random Choice--25.0025.0025.0025.0025.00
BLIP-212Bmerge41.7040.8336.2536.9338.61
LLaVA-1.5-13B13Bmerge41.3142.5034.4044.3840.45
InternVL-Chat1.526Bmerge53.0870.1437.0144.7847.51
Claude-3.5-sonnet-merge46.4641.1127.8937.6038.05
LLaVA-interleave-dpo7Bseq47.9742.6726.4741.2740.83
VILA-1.5-13B13Bseq40.5340.1531.9636.0737.15
GPT-4V-seq49.5945.7726.3442.1541.26
GPT-4o-mini-seq53.5444.2430.5942.9043.15
Gemini-1.5-flash-seq57.4152.2434.3240.9346.07
Gemini-1.5-pro-seq57.2663.6136.5241.5649.11
GPT-4o-seq56.9164.8030.1546.9949.49
Human--97.1095.6794.9195.6895.87

论文原文结论:75 个 VLM 平均准确率约 40%,最好的 GPT-4o 仅 49.49%,远低于人类的 95.87%;GPT 系列/Gemini-1.5 明显强于开源模型,最好开源模型 LLaVA-interleave 被 GPT-4 系列拉开 20.7 个百分点;Claude 系列没有表现出优势(与其他基准的观察一致)。

GitHub/HF 页面上的最新完整排行榜(2024-12-23 更新,累计 75 个 VLM,此处列前 5+人类基线):InternVL2.5-38B 51.94(当前榜首)> InternVL2.5-78B 51.16 > GPT-4o 49.49(第三)> Gemini-1.5-pro 49.11 > InternVL2.5-26B 48.56;人类基线 95.87。即 ICLR 评审期间新增的 InternVL2.5 系列反超了论文正文强调的 GPT-4o。

规模/数据/帧数不敏感性(Section 3.4):VILA-1.5 从 3B 扩到 7B,在常规 VQA 上提升 7.1%,但在 PhysBench 上反而下降 3.8%;PLLaVA、VILA-1.5(LLaVA-1.5 的更多数据变体)相对 LLaVA-1.5 提升有限甚至下降;增加视频帧数(超过 8 帧后)也不再带来提升,Mantis 甚至在帧数增多后频繁拒答。

错误归因(Section 3.4,随机抽 500 题、GPT-4o/Gemini-1.5-flash/Phi-3V 三模型):感知错误占比分别为 37%/40%/45%,知识缺失占比 34%/35%/23%,为两类主要错误来源;补充物理知识示例(微调或上下文学习)后三模型表现均有提升,说明训练数据缺乏物理知识是核心瓶颈之一。

PhysAgent 消融(Figure 9a,GPT-4o 基线 Property/Relationships/Scene/Dynamics = 56.9/64.8/30.1/46.9):+CoT 58.6/70.5/36.0/47.7,+Desp-CoT 57.7/64.0/36.9/46.2,+PLR 51.5/45.6/31.1/33.6(三种提示法均不稳定甚至倒退),+PhysAgent 58.4/84.2/45.0/51.3(全面提升,Scene 相对提升 49.5%);ContPhy 神谕基线 52.1/52.9/37.2/42.8,在 Property/Scene/Dynamics 三项上都不如其base 模型 GPT-4o。

具身任务成功率(Figure 9c,5 个 MOKA 抓取任务:Affordance/Force/Color/Location/Tool):MOKA 基线 success = 0.6/0.2/0.7/0.7/0.4;+PhysAgent(零样本)success = 0.8/0.5/0.8/0.7/0.5;+Fine-tune(用 PhysBench 微调)success = 0.9/0.6/0.8/0.8/0.7——微调整体优于零样本 PhysAgent,两者都优于原始 MOKA+GPT-4o。

迁移到已有基准(Table 24):Phi-3V 基线/微调/PhysAgent 在 ContPhy-Property(49.25/64.50/52.00)、ContPhy-Dynamics(43.25/62.75/44.75)、Physion++(68.80/82.20/78.40)、EmbSpatial(55.91/66.95/62.28)上均一致提升,Physion++ 上微调提升 19.50pp、PhysAgent 提升 9.6pp(原文措辞)。

创新点与影响

  • 首个四维度全覆盖的 VLM 物理理解基准:把物理世界理解拆成物体属性、物体关系、场景理解、物理动态四大类,19 子类 × 8(论文摘要原文)/10(GitHub·HF·项目主页更新版本一致注明为 10,晚于 arXiv v2 摘要,可能是 ICLR camera-ready 后的修订)项能力维度(含识别、比较、定位、静态/动态关系、预测、判断、推理、感知等),并首次证明”VLM 物理理解能力不随模型规模、数据量、输入帧数单调提升”这一反直觉结论——区别于常规 VQA 基准上”越大越好、越多数据越好”的一般规律。
  • PhysAgent 是一个免训练、可插拔的推理时框架:论文强调它与 ContPhy 这类依赖预定义模板 + 专用感知模块的”神谕模型”路线本质不同——保留了 VLM 面向开放式问题的推理与泛化能力,同时用现成视觉专家模型(Depth Anything/SAM/GroundingDINO)弥补感知短板,用知识记忆弥补训练数据里缺失的物理常识。
  • 连接了”理解物理”与”具身部署”两件事:通过在 MOKA 流水线上做微调/零样本两种增强实验,实证了提升 VLM 物理理解能达到直接改善机器人抓取成功率的效果,为”物理理解基准 → 机器人能力”这条因果链提供了少见的直接实验证据。
  • 论文自陈的局限(Section 4/5 及附录 J 讨论,原文未展开具体条目清单,此处仅转述正文明确写出的部分):PhysAgent 仍依赖 VLM 自身完成任务分类和最终推理,专家模型集成的收益上限受限于这些专家模型本身的精度;ContPhy 复现用 ViperGPT 而非原始 ContPro(代码未开源),可能低估神谕类方法上限;具身实验仅覆盖 5 个基础抓取任务,未涉及需要高层-低层分解的复杂多步操作。

原始链接

一手源存档(sources/)