一句话定位

EmbodiedBench 是 UIUC/西北大学/多伦多大学/TTIC 团队提出的、面向”视觉驱动具身智能体”的 MLLM 基准——四个环境(高层任务 EB-ALFRED、EB-Habitat + 低层动作任务 EB-Navigation、EB-Manipulation)共 1,128 个测试任务,配 6 个能力维度子集(Base/常识/复杂指令/空间感知/视觉外观/长程规划);评测 13 个主流 MLLM(GPT-4o、Claude-3.5-Sonnet、Gemini 系列、Llama-3.2-Vision、InternVL2.5、Qwen2-VL),发现 MLLM 擅长高层任务但在低层操作上普遍很差(最好的 GPT-4o 在 EB-Manipulation 上仅 28.9%),且视觉输入对低层任务至关重要(去除后掉 40%–70%),对高层任务影响很小甚至持平。ICML 2025(Oral)。

背景与定位

放在”用现成 MLLM 做具身智能体的评测基准”这条脉络里:此前 AgentBench、Lota-Bench 等只做纯文本 LLM 的高层规划评测;VisualAgentBench 是首个引入视觉的 MLLM 基准,但仅覆盖高层任务(户内 + Minecraft),没有回答”低层导航/操作里视觉到底起多大作用""细粒度能力子集下模型差距在哪”这两个问题。EmbodiedBench 用一张对照表(Table 1)把 ALFWorld、Alfred、VLMbench、Behavior-1K、Language Rearrangement、GOAT-bench、AgentBench、Lota-bench、VisualAgentBench、Embodied Agent Interface、VLABench 逐一列出,指出自己是唯一同时具备”多环境 + 高低层动作 + 多模态 + 细粒度评测 + 支持 LLM/VLM”全部特征的基准。

范式关键词:MLLM embodied agent benchmark、capability-oriented fine-grained evaluation、hierarchical action level、vision-driven agent pipeline。vault 内可与同样基于 AI2-THOR 的 ai2-thor、基于 Habitat 2.0 的 habitat-2,以及另一路”用基础模型做操作”的基准 vlabenchliberocalvin 对照——EmbodiedBench 的差异化在于横跨高层任务规划到低层连续控制的完整层级,并首次系统量化”去掉视觉”对不同层级任务的影响差异。

作者团队:Rui Yang、Hanyang Chen、Junyu Zhang、Mark Zhao(并列一作),Cheng Qian、Kangrui Wang、Qineng Wang、Teja Venkat Koripella、Marziyeh Movahedi、Manling Li、Heng Ji、Huan Zhang、Tong Zhang;机构为 University of Illinois Urbana-Champaign、Northwestern University、University of Toronto、Toyota Technological Institute at Chicago (TTIC)。2025.10 该团队后续发布 Embodied Reasoning Agent (ERA) 训练配方(不在本文范围)。

模型架构

EmbodiedBench 本身不提出新策略,而是提出一套统一的”视觉驱动智能体流水线”(Figure 2)供所有被测 MLLM 复用:

  • 输入:语言指令 + 当前步图像观测(默认仅用当前帧,多历史帧被实验证明无效,见下)+ few-shot 图文 in-context 示例 + 交互历史与环境反馈 + 任务专属信息(高层任务/EB-Navigation 提供可用技能集,EB-Manipulation 额外提供动作格式说明 + 检测框 + 物体位姿)。
  • 规划器(Task Planner):每步让 MLLM 依次完成 (1) 描述当前视觉状态 (2) 反思历史动作与环境反馈 (3) 推理如何达成目标 (4) 生成语言化计划 (5) 转成结构化可执行计划,全部输出为 JSON。与此前”每步只输出一个动作”的做法(VisualAgentBench)不同,EmbodiedBench 支持多步规划(一次输出多个动作),既更贴合 in-context 示例里的连续决策形式,也减少低层任务中单动作对画面影响很小导致的 API 调用冗余。若某步计划失败或触发无效动作,从最新状态重新规划。
  • 四个环境的动作空间
    • EB-ALFRED:8 种高层技能(pick up/open/close/turn on/turn off/slice/put down/find),因物体实例数量不同,动作空间动态变化,171~298 个动作
    • EB-Habitat:70 个高层技能,分 5 类(navigation/pick/place/open/close)。
    • EB-Navigation:8 个低层动作(前后左右平移 Δx/Δy、左右旋转 Δθ、相机俯仰 Δφ),仅靠视觉观测与文本反馈定位,无直接位置信息。
    • EB-Manipulation:7 维连续动作向量 [X,Y,Z,Roll,Pitch,Yaw,Gripper],采用动作空间离散化——位置 (x,y,z) 各分 100 个 bin,姿态 (roll,pitch,yaw) 各分 120 个 bin(例:[57,61,20,10,60,25,1]),并叠加 YOLO 检测框 + 索引标记 + 3D 物体位姿估计,降低 MLLM 直接估计精确三维坐标的难度。
  • 评测配置:所有模型 temperature=0,最大输出 token 2048,图像统一缩放到 500×500;最大环境步数:高层任务 30 步、EB-Navigation 20 步、EB-Manipulation 15 步。被测模型精确 API/权重版本见 Table 4,例如 gpt-4o-2024-08-06、claude-3-5-sonnet-20241022、gemini-2.0-flash-exp、meta-llama/Llama-3.2-90B-Vision-Instruct、OpenGVLab/InternVL2_5-78B、Qwen/Qwen2-VL-72B-Instruct。

数据

四个环境共 1,128 个测试实例,全部按六个能力子集(Base 基础任务、Common Sense 常识指代、Complex Instruction 长上下文干扰、Spatial Awareness 相对位置指代、Visual Appearance 外观指代、Long Horizon 长程规划)组织:

  • EB-ALFRED(300 实例,6 子集各 50):基于 ALFRED 数据集 + AI2-THOR 模拟器,沿用 Lota-Bench 的 8 种高层技能实现,但修复其三处缺陷(不支持同类多实例物体、“放下”动作误放到水槽外表面、原始指令质量问题如 potato/tomato 混淆);引入物体实例后缀(如 “cabinet_2”)以支持全部 7 种 ALFRED 任务类型(Pick&Place / Stack&Place / Pick Two&Place / Clean&Place / Heat&Place / Cool&Place / Examine in Light)。数据来自 ALFRED valid-seen 集:按 oracle 策略步数切分,<15 步中选 50 条并精炼指令构成 base(GPT-4o 改写生成 common sense / complex instruction 子集),>15 步选 50 条构成 long-horizon;visual appearance / spatial awareness 直接按原始语言描述(颜色/形状、相对位置)筛选。
  • EB-Habitat(300 实例,6 子集各 50):基于 Language Rearrangement 基准(282 条指令模板)+ Habitat 2.0 模拟器 + YCB/ReplicaCAD 物体资产,70 个高层技能分 5 类;不同于 ALFRED 可导航到任意物体,EB-Habitat 限制只能导航到”容器类”物体。数据集通过重组 Habitat 已有的多个子集得到(如合并 new scenes/novel objects/instruction rephrasing 为 base;用 context 集为 common sense;合并 conditional instructions/irrelevant instruction text 为 complex instruction;referring expressions 为 visual appearance;spatial relationship 为 spatial awareness;合并 multiple rearrangements/multiple objects 为 long-horizon)。
  • EB-Navigation(300 实例,5 子集各 60,无 spatial awareness 子集):基于 AI2-THOR,90 个场景各设计一个导航任务,配自动 Python 脚本生成,参数含初始机器人位姿、目标物体信息(类型/ID/3D 坐标)、导航距离阈值 α;complex instruction / common sense 子集由 GPT-4 做指令增强生成,visual appearance 人工构造外观描述,long horizon 通过确保目标物体在初始视野外构造。
  • EB-Manipulation(228 实例:4 子集各 48 + visual appearance 36):在 VLMBench 之上扩展,用 CoppeliaSim 模拟器控制 Franka Emika Panda 7 自由度机械臂,四类任务(Pick & Place / Stack / Shape Sorter Placement / Table Wiping);base/spatial 子集取自 VLMBench,其余子集由 GPT-4o 基于 10 个 in-context 示例生成指令改写;visual appearance 排除 table wiping(无法按外观区分物体)故仅 36 条。

数据获取方式:人工标注 + GPT-4/4o 指令增强(EB-ALFRED、EB-Navigation、EB-Manipulation);已有数据集重组(EB-Habitat)。数据集经 Hugging Face 组织 EmbodiedBench 分发(EB-ALFRED、EB-Manipulation 等各自独立数据集仓库);GitHub README 披露 2025.06 另发布一批由多种闭源/开源模型生成的轨迹数据集,可用于训练更好的具身智能体。

训练方法

本工作是纯评测基准,不训练新模型,13 个被测 MLLM 均为零样本 / few-shot in-context 评测(无微调)。关键消融结论:

  • 语言中心消融(EB-ALFRED base 子集):去掉环境反馈使 GPT-4o 掉 10 个百分点、Claude-3.5-Sonnet 掉 8 个百分点;默认使用 10 个文本 in-context 示例,若降到 0-shot,成功率跌到约 40%。
  • 视觉中心消融(均在 EB-Manipulation base 子集上做):
    • 相机分辨率:中等分辨率 500×500 优于 300×300 与 700×700(论文以图示呈现趋势,未给出可独立提取的具体数值)。
    • 检测框:去掉后 GPT-4o 从 39.6% 降到 27.1%,Claude-3.5-Sonnet 从 37.5% 降到 29.2%;但检测框在 EB-Navigation 上反而造成困惑降低成功率,因此最终只对 EB-Manipulation 默认启用。
    • 多步图像(额外提供前两步历史帧):模型难以利用时序信息,反而造成性能下降(EB-Manipulation 最明显)。
    • 多视角图像(EB-Navigation 前视+俯视,EB-Manipulation 前视+腕部视角):同样导致性能下降,尤其 GPT-4o。
    • 视觉 in-context learning(示例带图像而非纯文本):显著优于纯文本 ICL,Claude-3.5-Sonnet 提升 16.7 个百分点(受限于输入体量,视觉 ICL 示例数限制为 2 个,故该消融基线本身略低于主表用 10 个纯文本示例的设置)。
  • 开源模型本地部署走 LMDeploy(离线执行)或 API 风格的模型服务(vLLM/自建 Flask server),张量并行度 tp 按经验公式 tp = ceil(模型参数量(B) / 10)(针对 48GB 显卡)粗估。

Infra(训练 / 推理工程)

  • 本文为纯推理评测,无训练 GPU-hours。
  • 闭源模型:通过官方 API 调用(OpenAI / Anthropic / Google / DashScope)。
  • 开源模型(7B~90B):本地部署经 LMDeploy 离线执行,或解耦为”模型服务”模式(LMDeploy/vLLM 起 API server,评测端用 OpenAI 风格调用);新发布模型(如 Phi-4-multimodal、Ovis2、Gemma-3)走自建 Flask server 定制适配。
  • 具体 GPU 型号、卡数、评测总耗时/吞吐(FPS)均未披露;仅给出张量并行度的经验分配公式(tp = ceil(参数量B/10),48GB 显卡)。
  • 三套模拟器分属三个独立 conda 环境(AI2-THOR 系 EB-ALFRED/EB-Navigation 一套、Habitat 2.0 系 EB-Habitat 一套、CoppeliaSim 系 EB-Manipulation 一套),均需 headless X server 支持(startx.py)。

评测 benchmark

高层任务(Table 2,EB-ALFRED / EB-Habitat,六子集成功率均值,各子集 50 实例)

模型EB-ALFRED AvgEB-Habitat Avg
GPT-4o56.359.0
GPT-4o-mini24.032.7
Claude-3.5-Sonnet64.068.0
Gemini-1.5-Pro62.356.3
Gemini-2.0-flash52.342.3
Gemini-1.5-flash39.339.3
GPT-4o(去视觉/Lang)58.056.0
GPT-4o-mini(Lang)31.336.7
Llama-3.2-90B-Vision-Ins32.040.3
Llama-3.2-11B-Vision-Ins13.725.0
InternVL2_5-78B(开源最佳)37.749.0
InternVL2_5-38B23.338.3
InternVL2_5-8B2.011.3
Qwen2-VL-72B-Ins33.735.7
Qwen2-VL-7B-Ins1.718.3

低层任务(Table 3,EB-Navigation / EB-Manipulation,五子集成功率均值)

模型EB-Navigation AvgEB-Manipulation Avg
GPT-4o57.728.9
GPT-4o-mini32.84.8
Claude-3.5-Sonnet44.725.4
Gemini-1.5-Pro24.321.1
Gemini-2.0-flash48.716.7
Gemini-1.5-flash41.75.0
GPT-4o(去视觉/Lang)17.416.2
Llama-3.2-90B-Vision-Ins30.014.9
InternVL2_5-78B(开源最佳)30.718.0
InternVL2_5-38B30.315.8
Qwen2-VL-72B-Ins21.213.6

要点:

  • 高层 vs 低层的巨大落差:即便最强模型 GPT-4o,在 EB-Manipulation 上也只有 28.9%;Claude-3.5-Sonnet 高层任务最强(EB-ALFRED 64.0% / EB-Habitat 68.0%),但低层任务 GPT-4o 反超(EB-Navigation 57.7% / EB-Manipulation 28.9%)——不同模型在不同层级各有所长。
  • 视觉的作用因层级而异:去掉视觉(Lang 变体),GPT-4o 在 EB-Navigation 从 57.7% 暴跌到 17.4%(长程子集直接归零),但在 EB-ALFRED 反而从 56.3%(有视觉)略升到 58.0%(Lang)——高层任务更依赖文本信息,低层任务视觉降幅达 40%–70%
  • 长程规划最难:EB-Habitat 上 Claude-3.5-Sonnet 从 base 96 掉到 long-horizon 58,GPT-4o 从 86 掉到 64,长程子集在两个高层环境中均是全局最差子集。
  • 子集粒度揭示模型差异:GPT-4o 在长程子集反超 Claude-3.5-Sonnet(64 vs 58,EB-ALFRED),Gemini-1.5-Pro 在空间感知子集比 GPT-4o 高约 10 分但其余维度落后——细粒度评测能发现总分掩盖的能力差异。
  • 开源模型规模效应明显:InternVL2_5 家族综合表现最佳(78B 版本全面超过 Llama-3.2-90B-Vision 与 Qwen2-VL-72B),但大型开源模型与顶尖闭源模型(GPT-4o/Claude-3.5-Sonnet)之间仍有明显差距,仅逐渐追平 GPT-4o-mini。
  • 格式错误统计(Table 10,每条轨迹平均 JSON 格式错误数):GPT-4o 在 EB-ALFRED/EB-Habitat 上均仅 0.0067,InternVL2_5-8B 高达 8.04/4.40,整体呈现”模型越大格式错误越少”的趋势。
  • 错误归因(GPT-4o,共采样 110 条失败轨迹,每环境每子集 10 条):EB-ALFRED 中规划错误占 55%(其中漏步 23%、无效动作 22%)、推理错误 41%(含反思失败 17%、过早终止 13%)、感知错误仅 4%;EB-Manipulation 中规划错误 44%(主因动作/位姿不准)、感知错误 33%(错误识别 22% 最多,即便有检测框仍常出现物体属性识别错误)。

创新点与影响

  • 首个覆盖”高层语义任务 → 低层连续控制”完整层级的 MLLM 具身智能体基准:此前基准要么只测高层(VisualAgentBench/AgentBench/Lota-bench),要么只测单一低层领域(VLMbench/GOAT-bench),EmbodiedBench 首次在同一套评测协议下系统对比二者。
  • 六维能力子集的细粒度评测框架:跳出”整体成功率”单一指标,系统量化常识、复杂指令、空间感知、视觉外观、长程规划各维度上的模型差异。
  • 首次系统量化视觉输入在不同动作层级任务中的作用差异:视觉对低层任务是决定性的(去除后掉 40%–70%),对高层任务影响很小甚至可能起负作用,为后续 agent 设计(何时需要视觉、何时纯文本足够)提供了实证依据。
  • 视觉/语言中心消融给出可操作的设计建议:检测框对操作类任务有效但对导航有害;多步/多视角图像目前普遍降低性能(现有 MLLM 尚不能有效利用时序/多视角信息);视觉 in-context learning 是被低估但有效的方向。
  • 论文自陈局限 / 未来方向:任务多样性仍有限(未覆盖自动驾驶、多智能体协作、人机交互等场景);长程规划、空间推理、低层控制仍是现有 MLLM 的显著短板;多步/多视角图像理解目前是负面结果,需要更好的时序/多视角融合方法;论文本身只做评测未做训练,作者建议未来探索具身预训练、模仿学习与在线/离线强化学习来提升 MLLM 的具身决策能力。

原始链接

一手源存档(sources/)