具身智能评测:仿真基准 · 真机成功率 · 泛化协议 · 可复现性
概述:具身智能没有 ImageNet 式的单一擂台,它的评测是一张按”控制对象 × 能力维度 × 真机对齐度”三轴铺开的谱系。操作这一域最热闹,走过四代:从单任务/多任务技能库(meta-world rlbench maniskill maniskill2),到语言条件 + 长程(calvin vima-bench libero),到场景/资产规模化与生成式(robocasa behavior-1k robogen genmanip),再到双臂/移动/域随机化(bigym robotwin robotwin-2 robomind)。泛化被单拎出来做压力测试(the-colosseum gembench vlabench roboverse)。真机-仿真对齐催生了 real2sim 范式(simpler-env maniskill3)与分布式真机 A/B 评测(roboarena)。腿式/人形/导航各有专属指标(barkour-benchmark-quadruped-agility humanoidbench habitat procthor)。MLLM 规划层又是一套(embodiedbench robocerebra robobrain-2)。贯穿全表的三个结构性事实是:长程近乎清零、语义泛化基本失效、真机数字普遍只有仿真的一半——而这套评测体系自身的可复现性(口径漂移、正文-表格自相矛盾、榜单持续被刷)也是一个尚未解决的治理问题。
一、基准全景:三轴谱系
真正区分这些基准的不是任务多不多,而是它想量什么能力、用什么指标量、以及离真机有多远。下表把主要仿真/真机基准按”时代 × 侧重维度”对齐(成功率类指标除非注明均为策略在测试集上的任务成功率)。
| 基准 | 年代 | 本体/域 | 任务规模 | 核心指标 | 主打的能力维度 | 真机对齐 |
|---|---|---|---|---|---|---|
| meta-world | 2019 | 单臂桌面 | MT10/MT50 · ML10/ML45 | 成功率 | 多任务 RL / 元 RL | 纯仿真 |
| rlbench | 2019 | 单臂桌面 | 100+ 任务 | 成功率(few-shot) | 3D 操作策略刷分场 | 纯仿真 |
| maniskill / maniskill2 | 2021/23 | 单臂 + 铰接/软体 | 4 类 / 20 任务 | 成功率 | 物体级泛化、高精度装配 | 少量 sim2real |
| calvin | 2021 | 单臂 Franka | 34 子任务 → 1000 指令链 | Avg. Len(连续完成数,满分 5) | 语言条件 + 长程 | 纯仿真 |
| vima-bench | 2022 | 单臂桌面 | 17 任务 × 4 泛化级 | 成功率 | 多模态 prompt 泛化 | 纯仿真 |
| libero | 2023 | 单臂 Franka | 130 任务(5 套件) | FWT/NBT/AUC + 套件均值 SR | 终身学习 / VLA 通用擂台 | 纯仿真 |
| robocasa | 2024 | 单臂厨房 | 100 原子 + 复合 | 成功率 | 场景/资产规模化、生成数据 | 真机共训 |
| behavior-1k | 2024 | 移动操作 | 1000 日常活动 | 成功率 + 效率 | 超长程、全流程家务 | 数字孪生 sim2real |
| bigym | 2024 | 移动双臂人形 | 40 任务 | 成功率 | 移动 + 双臂 + 人类示教 | 纯仿真 |
| robotwin / robotwin-2 | 2024/25 | 双臂 | 14 / 50 任务 | 成功率(Easy/Hard) | 生成数字孪生 + 域随机化 + 真机迁移 | sim2real 强对齐 |
| robomind | 2024 | 5 本体(Franka/人形/双臂…) | 45 任务 | 真机 SR(/10) | 多本体标准化数据 + 评测 | 真机 |
| the-colosseum | 2024 | 单臂(RLBench 基) | 20 任务 × 14 扰动 | 扰动前后 SR 降幅 | 系统性泛化压力测试 | 4 任务真机对齐 |
| gembench | 2024 | 单臂(RLBench 基) | 4 级泛化 | 各级均值 SR | 新物体/铰接/长程外推 | UR5 真机 |
| vlabench | 2024 | 单臂桌面 | 100+ 长程推理任务 | Progress Score(细粒度) | 世界知识 + 长程语义 | 纯仿真 |
| simpler-env | 2024 | Google Robot / WidowX | 8 任务 | MMRV ↓ / Pearson r ↑ | real2sim 评测保真度 | real2sim 金标准 |
| roboarena | 2025 | DROID 分布式真机 | 开放任务 | 成对 A/B → Elo/BT 排名 | 通才策略真机排名 | 全真机 |
| roboverse | 2025 | 多本体统一平台 | 多任务 × 4 级 | 成功率 | 统一平台 + 分级泛化 | sim2real |
| barkour-benchmark-quadruped-agility | 2023 | 四足 | 敏捷障碍赛道 | Barkour Score(狗=1.0) | 动物级运动敏捷 | 全真机 |
| humanoidbench | 2024 | 人形全身 | 27 任务 | Reward vs Target 阈值 | 全身运动 + 操作 | 纯仿真 |
| embodiedbench | 2025 | 高层+低层四环境 | 1128 任务 | 成功率(按子集) | MLLM 具身智能体 | 纯仿真 |
| robocerebra | 2025 | 单臂长时程 | 60 任务 | 成功率 + 规划质量 | System-2 记忆/重规划 | 纯仿真 |
三条线索贯穿全表:
- 指标随能力维度而变。测运动学技能用二值成功率;测长程用”连续完成数”(calvin Avg. Len)或”进度分”(vlabench PS,比 0/1 更细);测终身学习用前向迁移/遗忘(libero FWT/NBT);测真机对齐不看绝对分而看相关系数(simpler-env MMRV/Pearson r);测通才策略干脆放弃绝对分、改用成对偏好排名(roboarena Elo)。
- 难度设计从”任务多”转向”扰动多”。第一代靠堆任务数(rlbench 100+),新一代靠在同一任务上叠加受控扰动(the-colosseum 14 类)或分级外推(gembench L1–L4、roboverse Level 0–3)——因为”再多的独立任务”也测不出”对同一任务的分布偏移有多脆”。
- 真机对齐是新的一等公民。早期基准(meta-world rlbench calvin)纯仿真、与真机脱节;simpler-env 用 real2sim 证明”仿真分能预测真机分”,roboarena 索性把评测搬回真机、用分布式众测换统计功效。
二、操作仿真基准的四代演进
2.1 第一代:多任务技能库与”看似接近、实则插不进”(2019–2023)
meta-world 是最早把”一套桌面任务 + 标准化协议”当基准卖的工作,它的一手数字直接暴露了当年方法的天花板——即便只有 10 个任务,多任务学习就已很吃力:
| 设定 | 最强方法 | 成功率 |
|---|---|---|
| MT10(10 任务多任务训练) | Multi-task SAC | 68.3% |
| MT50(扩到 50 任务) | Multi-task SAC | 38.5%(骤降) |
| ML10 meta-test(10 任务元学习) | RL² | 35.8% |
| ML45 meta-test(45 任务元学习) | MAML | 39.9% |
论文的结论振聋发聩:当前方法既不能泛化到全新任务,甚至在多个质变任务上连 meta-train 都学不好。同期 rlbench 走了另一条路——它本身不跑任何算法、不给 baseline 表,只定义任务/观测/动作与 few-shot 协议,把刷分权完全交给社区。这个”只搭台不唱戏”的设计反而让它成了 3D 操作策略(peract RVT act3d gembench)最主流的擂台。
maniskill/maniskill2 把重心压到物体级泛化与高精度装配这两个当时的硬骨头上,一手数字说明现有方法离”解决”还很远:物体级泛化测试集成功率普遍只有 8–12%(maniskill OpenCabinetDoor 测试 0.11、PushChair 0.08);maniskill2 更设计了”表面精度接近、实际插不进”的诊断——Transporter Networks 做 AssemblingKits 按原论文位姿精度指标(1cm/15°)达 99%,但按 ManiSkill2 的”实际插入”严格指标只有 18%;刚体高精度装配任务上,无论 BC(50k 步)还是 DAPG+PPO(25M 步)成功率都趋近 0(PegInsertion 0.01、AssemblingKits 0.00),而 sim2real 让 PickCube 从仿真 91% 掉到真机 60%。这一代基准的共同贡献是:把”哪些能力还没解决”用可量化的方式钉死。
2.2 第二代:语言条件 + 长程(2021–2023)
当策略开始吃语言指令,评测的重点从”会不会做一个动作”转向”能不能顺着一串语言把长任务走完”。calvin 是这条线的定义者,它把 34 个子任务串成 1000 条唯一指令链,主指标 Avg. Len(连续完成的子任务数,满分 5),并在评测前把机器人复位到中性位、逼策略靠语言而非初始状态推断任务。发布时的 SOTA(MCIL)成绩堪称”长程近乎失败”,而如今 VLA/扩散策略已把它刷到近满分——这条时间线本身就是范式跃迁的缩影:
| 设定 | 发布时 MCIL 基线 | 当前榜首(2026 抓取) | 代表刷榜工作 |
|---|---|---|---|
D → D(单环境) | LH-MTLC 5 连 0.08% | FLOWER 4.35 | — |
A,B,C,D → D | 原始基线 Avg. Len 0.40 | FLOWER 4.67 / univla 4.63 | robovlm KosMos 4.49、GR-1 4.21 |
A,B,C → D(零样本跨场景) | 第 2 条起趋近 0 | FLOWER 4.53 / univla 4.41 | robovlm KosMos 4.25、3D Diffuser Actor 3.27 |
robovlm 的一手数字给出跨场景零样本的绝对提升幅度:ABC→D 上 KosMos 相对 GR-1 单任务 +12.6 个点、5 连续任务 +30.3 个点。
vima-bench 换了个角度测泛化——用多模态 prompt(文字里夹图像/物体)定义任务,按泛化难度分 L1–L4 四级。它证明了 object-centric 表征在低数据区的威力:VIMA 在全部 4 级、7 档模型上都超基线,最难的 L4、20M 尺寸相对最强基线高达 2.9×;1% 数据即可媲美基线 10× 数据。
libero 则把语言操作与终身学习绑在一起,130 任务分 5 套件(Spatial/Object/Goal/Long/90),提出 FWT(前向迁移)/NBT(负后向迁移)/AUC 三指标。它的五条发现有几条相当反直觉:所有被评估的终身算法都损害了前向迁移(顺序微调 SeqL 的 FWT 反而最高);语义丰富的语言嵌入并不比 Task-ID 更好(BERT/CLIP/GPT-2/Task-ID 无统计显著差异,说明句子嵌入退化成了 bag-of-words);朴素监督预训练会拖累下游终身学习。有意思的是,libero 后来的历史地位并非作为终身学习基准,而是成了 VLA 时代事实上的统一擂台(见第五节)。
2.3 第三代:场景/资产规模化与生成式数据(2024)
当模仿学习的瓶颈从”算法”转向”数据”,基准开始承担”造数据 + 量 scaling”的职责。robocasa 在厨房场景里用生成式管线扩数据,一手数字画出清晰的 scaling 曲线,并证明机器生成数据能超过人类数据:
| 数据配置 | 轨迹数 | 24 原子任务平均成功率 |
|---|---|---|
| Human-50(人类演示) | 1,250 | 28.8% |
| Generated-300 | 7,200 | 35.0% |
| Generated-3000 | 72,000 | 47.6% |
但它也诚实地暴露了长程的墙:复合任务从零训练 5 个里 4 个为 0%,微调后仍只有个位数(PrepareCoffee 始终 0%)。真机侧共训仿真数据把 seen 物体成功率相对提升 79%(13.6%→24.4%)。
behavior-1k 把野心拉到极致——1000 个日常活动、全流程家务。它的基线实验(3 个范式级活动)给出了长程与抓取这两堵墙的量化证据:端到端视觉运动控制(RL-VMC)在三个任务上全部 0%(长程导致完全学不出来),必须靠原语分解 + 历史记忆(RL-Prim.Hist. 0.55/0.63/0.88)才能推进;一旦撤掉抓取简化、启用完全物理抓取,成功率又骤降回 0/0/0——抓取是关键瓶颈。数字孪生公寓的 sim-real gap 触目惊心:仿真约 40% → 真机最优策略 22% → 真机迁移的视觉策略 0%。
生成式基准还有两支:robogen 用 LLM 自动生成 106 个任务,多样性指标(Self-BLEU、CLIP 相似度)全面优于人工构建的 meta-world/rlbench/maniskill2 与并发的 GenSim,69 个基准任务平均技能学习成功率 0.774。genmanip 则用 LLM 驱动 200 场景,主打长程语义推理——模块化 MLLM 流水线最佳组合(CoPA+GPT-4.5)综合仅 23.0% SR,长程任务平均只有 9.07% SR;端到端 GR-1 单任务随数据从 100 增到 1K episode 从 33%→95%,但未见指令/未见物体直接 0.0%,把”位置级泛化可行、语义泛化完全失效”钉得死死的。
2.4 双臂 / 移动 / 域随机化(2024–2025)
随着硬件从单臂走向双臂与移动人形,基准也补上了这些设定。bigym 是首个”移动 + 双臂 + 人类示教 + 长程(1000–7000 步)“的基准,40 任务上生成式策略(ACT)显著优于 BC 与 demo-driven RL:
| 算法 | 类型 | 40 任务平均成功率 |
|---|---|---|
| ACT | 模仿学习 | 46.3% |
| Diffusion Policy | 模仿学习 | 20.8% |
| BC | 模仿学习 | 18.0% |
| DrQV2 / AWAC / IQL / CQN | demo-driven RL | 10.5–13.9% |
任务级分布极度两极:drawer_top_close(单关节)全部 7 算法都 100%,而 stack_blocks、store_groceries 等高精度/长程任务全部算法 0%——移动基座叠加高精度操作是当前公认的死角。
robotwin/robotwin-2 主打生成数字孪生 + 域随机化 + 真机迁移的闭环。robotwin 的一手数字证明”仿真数据可大幅替代真机采集”:真机单臂只用 20 条演示平均 1.2%,加入 300 条仿真后飙到 72%(双臂 20%→62%)。robotwin-2 把规模拉到 50 任务并做成榜单,一手数据显示预训练 VLA 在域偏移下仍明显退化(Easy→Hard):
| 模型 | Easy 平均 SR | Hard 平均 SR |
|---|---|---|
| ACT | 9.4% | 2.0% |
| DP / DP3 | 35.1% / 31.8% | 1.4% / 2.2% |
| RDT | 47.8% | 19.6% |
| pi0 | 64.9% | 24.6% |
它还量化了域随机化对真机迁移的贡献:加入 R2.0 合成数据后,unseen/cluttered 真机成功率 9.0%→42.0%(摘要口径 367% 相对提升)。robomind 走标准化路线,覆盖 5 种本体、45 任务,一手结论是全量预训练对多本体成功率有稳定提升(CrossFormer 双臂从”全 0/10”跃到 10/10),而”定位不准”是各本体首要失败因(人形高达 48%)。
三、泛化与鲁棒性评测协议
第三代之后,社区意识到”任务成功率”掩盖了脆弱性,于是把泛化单独拎出来做压力测试。这类基准不比”能不能做”,而比”在受控扰动/外推下掉多少”。
the-colosseum 是最系统的一个:20 任务 × 14 类扰动(干扰物、颜色、光照、纹理、相机位姿、物理属性…)。一手结论——单个扰动下 5 个 SOTA 模型任务平均成功率普遍下跌 30%–50%,14 项叠加时下跌 ≥75%;最伤成绩的是干扰物数量与颜色类扰动,物体尺寸影响最小;3D 模型对相机位姿基本免疫(先转体素/重渲染),2D 端到端模型对颜色/纹理/视角最敏感。它还做了 4 任务真机对齐,14 项里至少 7 项仿真结论与真机强相关(R²=0.74–0.94),真机侧 MO_Color 扰动导致成功率暴跌 82.6%。
gembench 把泛化做成 4 级递进外推(新摆放→新刚性物体→新铰接物体→长程),一手数字把”长程是全员坟墓”钉死:
| 方法 | L1 新摆放 | L2 新刚体 | L3 新铰接 | L4 长程 |
|---|---|---|---|---|
| 3D Diffuser Actor | 91.9 | 43.4 | 37.0 | 0.0 |
| RVT-2 | 89.1 | 51.0 | 36.0 | 0.0 |
| 3D-LOTUS(本文) | 94.3 | 49.9 | 38.1 | 0.3 |
| 3D-LOTUS++(LLM+VLM 组合) | 68.7 | 64.5 | 41.5 | 17.4 |
所有纯端到端 SOTA 在 L4 都跌到 ≈0%;只有引入 LLM 规划 + VLM 定位的组合式方法(3D-LOTUS++)能在 L4 拿到两位数,但代价是 L1 反而下滑(零样本定位会混淆同类物体)。同一模式在 roboverse 的 4 级随机化(任务空间→环境→相机→光照)上重现:Diffusion Policy 在 PickCube 上从 Level 0 的 52.7% 骤降到 Level 1 的 11.1%、Level 2/3 直接 0。
vlabench 则从”世界知识 + 长程语义推理”切入,用 Progress Score(比 0/1 更细的进度分)评测。原始论文里所有 VLA(Octo/OpenVLA/RDT-1B)在所有泛化维度得分都是个位数到十几分(RDT-1B 原子任务 Seen 最高 15.37 PS),远未表现出 LLM 式的”预训练涌现”泛化——这是对”VLA 会自动继承大模型泛化”的一次冷水。有意思的后续是:官方放出 pi0 系列 checkpoint 后,in-distribution 成功率提到 47–51%,侧面印证了”更强骨干 + 更好动作表征”这条判断。
四、真机-仿真对齐:real2sim 与分布式真机评测
纯仿真基准的老问题是”仿真高分不等于真机能用”。simpler-env 提出的解法不是”复刻绝对成功率”,而是量化仿真分与真机分的相关性——用 MMRV(越低越好)与 Pearson r(越高越好)衡量。它的一手数字证明 real2sim 评测可以准确排名策略:
| 任务(Google Robot, Visual Matching) | MMRV ↓ | Pearson r ↑ |
|---|---|---|
| Pick Coke Can | 0.031 | 0.976 |
| Open / Close Drawer | 0.055 | 0.915 |
| Open Drawer & Place Apple | 0.000 | 0.969 |
| WidowX+Bridge(整体) | 0.014 | 0.890 |
关键对照——传统模仿学习常用的”验证集 action MSE 选模型”在多任务上甚至出现 −0.857 / −1.000 的负相关(越”准”越差),而 simpler-env 完胜;换物理引擎(Isaac Sim r=0.919 vs SAPIEN r=0.923)结论一致。maniskill3 把 SIMPLER 移植到 GPU 并行版复现了这一相关性(Octo/RT-1X real2sim r=0.9284、MMRV=0.0147),并成为任务类别覆盖最广的仿真器(12 类 vs Isaac Lab 5 / RLBench 1)。
roboarena 走到另一个极端——放弃仿真、把评测搬回真机,用分布式众测做通才策略的成对 A/B,再用 Elo/BT 拟合排名。它的核心贡献是证明”评测方法本身”的可靠性:传统”常规评测”(因复现难只覆盖少量任务)不能可靠估计通才性能;任务感知法约 100 次成对比较即收敛到高质量排名;VLM 自动做任务分类准确率 94.6%;最终最强策略是 π0-FAST-DROID。它同时给出策略强弱画像——自回归策略(FAST 系)在抓放/堆叠/分类等需精确语言跟随的任务上更强,扩散策略在滑动/擦拭等流畅连续运动上更好,binning 策略几乎全面垫底。
五、VLA/策略横向擂台:LIBERO / SimplerEnv / CALVIN
到 2024–2026,libero、simpler-env、calvin 事实上成了 VLA 论文的”三大必刷擂台”。把散落在各模型页的一手数字聚合起来,能看到一条清晰的”两年内从 76% 刷到 99%“的军备竞赛。
LIBERO 四套件平均成功率(Spatial/Object/Goal/Long 均值,各家论文一手微调数字;注意基线复现口径略有差异):
| 模型 | LIBERO 均值 | 备注 |
|---|---|---|
| octo | 75.1% | 生成式通才基线 |
| openvla | 76.5% | 7B,OpenX 预训练 |
| spatialvla | 78.1% | Long 套件仅 55.5%(长程短板) |
| molmoact | 86.6% | Long 比第二名高 6.3 点 |
| villa-x | 90.1% | 隐动作建模 |
| groot-n1 | 93.9% | GR00T-N1.7 达 97.0 |
| pi0 | 94.4% | flow matching |
| univla | 95.2% | 任务中心隐动作 |
| internvla-m1 | 95.9% | Long 项 92.6 领先 |
| pi0-5 | 96.9% | 开放世界泛化 |
| openvla-oft | 97.1% | 更弱底座刷到当期 SOTA |
| rynnvla-002 | 97.4% | 连续动作,无预训练 |
| hume-vla | 98.0% | System-2 thinking |
| galaxea-g0-5 | 98.9% | Long 套件 98.6 |
| internvla-a1-5 | 98.9% | 全表最优平均 |
榜单本身也在讲故事:长程套件(LIBERO-Long)始终是分水岭——即便总平均逼近 99%,各家在 Long 上仍普遍低 5–15 个点(spatialvla 只有 55.5%)。而 libero 原本的终身学习指标(FWT/NBT/AUC)在 VLA 时代几乎被弃用——大家只报套件均值 SR,这本身也是”基准被重新诠释”的一例。
SimplerEnv Google Robot(Visual Matching / Variant Aggregation 平均成功率):
| 模型 | 参数量 | VM 平均 | VA 平均 |
|---|---|---|---|
| octo-Base | 93M | 11.0 | 1.2 |
| rt-1-X | 35M | 42.4 | 30.2 |
| rt-2-X | 55B | 46.3 | 54.4 |
| rt-1 | — | 52.4 | 43.7 |
| openvla | 7B | 34.3 | 39.3 |
| cogact | 7.6B | 74.8 | 61.3 |
WidowX+Bridge 上同样悬殊(cogact 51.3% vs openvla 4.2%、octo-Base 17.5%);一个反直觉的跨本体发现来自 lapa-latent-action-pretraining——无动作预训练的 LAPA(Bridge) 36.8 反超用真实动作预训练的 OpenVLA(Bridge) 30.8,作者归因于真实动作模型过拟合了 WidowX 动作空间、跨本体迁到 Franka 时受损。
这三大擂台的共同软肋是它们量的是”分布内做得多好”,而 the-colosseum/gembench 量的”分布外掉多少”才是部署真正关心的——高 LIBERO 分与高鲁棒性并不等价。
六、腿式 / 人形 / 导航的专属基准
操作之外的三域各有自成体系的评测口径。
四足敏捷由 barkour-benchmark-quadruped-agility 定义,它借敏捷犬竞赛设计赛道,用 Barkour Score(狗=1.0 为满分)量化动物级敏捷:
| 策略 | Barkour Score | 完成时间 | 前向速度 |
|---|---|---|---|
| 小型犬(对照) | 1.00 | 9.02 s | — |
| Specialist(专精策略) | 0.77 | 24.6 s | 0.74 m/s |
| Locomotion-Transformer(通才) | 0.73 | 25.8 s | 0.69 m/s |
差距一目了然:最好的机器人策略得分只有真狗的 ~77%、耗时近 3 倍。
人形全身由 humanoidbench 定义,27 任务用”Reward vs Target 阈值”判定,一手结论是几乎全员不及格——只有 walk、crawl、stand 等少数运动任务达标,push/package 甚至是大负值,唯一的离散稀疏奖励任务 kitchen 全为 0;分层 RL 能在 push 上翻盘但在更难的 package 上仍”举不起来”(低层从未在训练中经历举起)。这与操作域的”长程清零”是同构现象。
导航自成谱系,主指标是 SPL(Success weighted by Path Length,兼顾成功率与路径效率)。habitat 用它跑出了一个方法论级结论:RL(PPO) Depth 在 PointNav 上起点差、但训到 10M–30M 步后追平并超越经典 SLAM(Gibson SPL 0.79),若像前人一样在 5M 步就终止实验反而会得出”SLAM 占优”的相反结论——直接靠算力推翻了此前多篇论文。procthor 把场景规模化(10→10000 栋房屋预训练),四个 ObjectNav 基准的零样本 SPL/SR 随规模单调提升(RoboTHOR 微调后 SPL 比此前 SoTA 高 8.8 点、Habitat 2022 挑战赛登顶)。真机导航则多用成功率(gnm-general-navigation-model 单一策略跨 4 本体每台都超专用策略、部分提升 5×;nomad-goal-masked-diffusion-navigation 探索成功率 98% 且模型小 15×)。
roboverse 是少数把三域打通的统一平台——既做操作 4 级泛化,又能把 humanoidbench 任务从 MuJoCo 迁移过来稳定收敛,还做语言引导抓取的 sim2real(OpenVLA 零样本迁真机抓未见物体得分 7.0/8.0/5.0,满分 10)。
七、MLLM / 规划层的具身评测
当”大脑”(VLM/LLM 规划器)与”小脑”(底层策略)解耦,评测也分了层。embodiedbench 覆盖高层(EB-ALFRED/EB-Habitat)与低层(EB-Navigation/EB-Manipulation)四环境,一手数字揭示了几个非平凡结论:
| 模型 | EB-ALFRED(高层) | EB-Habitat(高层) | EB-Navigation(低层) | EB-Manipulation(低层) |
|---|---|---|---|---|
| Claude-3.5-Sonnet | 64.0 | 68.0 | 44.7 | 25.4 |
| GPT-4o | 56.3 | 59.0 | 57.7 | 28.9 |
| InternVL2.5-78B(开源最佳) | 37.7 | 49.0 | 30.7 | 18.0 |
要点:高层强的模型未必低层强(Claude 高层最强、GPT-4o 低层反超);视觉的作用因层级而异(去视觉后 GPT-4o 在 EB-Navigation 从 57.7 暴跌到 17.4,但在 EB-ALFRED 反而略升——高层任务更依赖文本);长程规划是全局最难子集;开源模型与顶尖闭源仍有明显差距。robocerebra 把长时程做得更极致(60 任务、含记忆探索/观测错配/动态扰动),一手数字显示纯 System-1 策略(微调 OpenVLA)在含记忆与动态变化的 Mix 设定下完全失败(0.00%),必须靠 System-2 分层框架(GPT-4o 规划 + 记忆/重规划闭环)才达 13.21%,但离人工计划上界(GT-plan 25.16%)仍差 9 个点以上。
纯 VLM 的空间/时序推理则由 robobrain-2 这类工作用 12 个公开评测(BLINK/CV-Bench/RoboSpatial/VSI-Bench 等)横向刷分(RoboBrain-7B-2.0 在 BLINK 达 83.95 刷新 SOTA),vlabench 也附带一套 VLM 六维雷达评测(发现”仅 GPT-4o 在推理维度达到与其他维度均衡”,其余模型推理维度普遍只有约 20 分)。这一层的共性是评测已从”任务成功率”退化/升维成”多项选择/结构化打分”,因为规划正确不代表底层能执行成功。
八、可复现性:这套评测体系自身的债
具身评测的一个尴尬现实是:基准自身的可复现性也成问题。从本轮全量阅读里能直接观察到几类系统性问题:
- 正文数字与表格自相矛盾,且往往无法核实。tinyvla 正文写”双臂平均 65%“但三任务表格算术平均只有 47.8%;bunny-visionpro 正文自陈”38% 整任务成功率”与三任务简单平均 50% 不一致;robobrain-2 在 Multi-Robot Planning 一段里先说 32B(80.33) 超过 7B(81.50)、随后又说 7B 是 81.50,措辞自相矛盾;act3d 的叙述提升幅度(+8.7%/+16.9%)与表格相减(+11.7/+19.9)对不上。这些都是论文自身的不一致,只能如实标注、无法外推修正。
- 榜单持续被刷、口径随时间漂移。calvin 官方 leaderboard 从发布时基线 5 连近乎 0 到如今 FLOWER 4.67,主指标含义未变但绝对水位天翻地覆;vlabench 论文原始数字(个位数 PS)与官方后续放出的 pi0 checkpoint(47–51%)差一个数量级——引用时必须带版本快照与抓取日期。
- 仿真高分与真机高分脱节。behavior-1k 数字孪生 sim 40%→real 22%→视觉策略 0%、robomind 仅用仿真数据真机仅 10%、maniskill2 sim 91%→real 60%——接触密集任务的 sim-real 物理差距仍是硬伤,这正是 simpler-env/roboarena 存在的理由。
- 评测协议本身缺乏标准化。真机评测的试验数(10 次/任务是常见但非统一)、随机化方式(bridge-data-original 每 5 次改变机器人相对环境位置、bridgedata-v2 跨机构 Lab1→Lab2)、成功判据(人工目视 vs 环境状态判定)各家不一,使得跨论文的绝对成功率几乎不可直接比较——这也是 roboarena 用成对偏好排名绕开绝对分的动机。
空白与趋势
贯穿全局的张力是”仿真里能量的,恰恰是真机部署最不缺的能力;真机上最缺的能力,恰恰仿真最难量”。可观察到的趋势与空白:
- 长程与语义泛化是所有域的共同天花板。操作(gembench L4≈0、genmanip 长程 9%、behavior-1k 端到端 0%)、人形(humanoidbench kitchen 全 0)都在同一堵墙上撞。绝对成功率军备竞赛(libero 逼近 99%)掩盖了这一点——分布内刷分已接近饱和,评测重心正被迫从”做得多好”转向”分布外掉多少”(the-colosseum gembench roboverse 的分级/扰动协议是这一转向的产物)。
- real2sim 与分布式真机评测是对”仿真-真机脱节”的两种应答。simpler-env/maniskill3 证明用相关性而非绝对分可以低成本预测真机排名;roboarena 用众测换统计功效。但二者都还只覆盖少数本体/任务,尚未成为社区默认。
- 评测口径缺乏治理是隐性可复现性债。正文-表格自相矛盾、榜单漂移、协议不统一三者叠加,使得”某模型 LIBERO 97%“这类陈述在缺少版本/复现细节时近乎不可比。领域尚无 ImageNet 式的中心化、冻结版本、第三方托管的评测基础设施。
- 触觉/力/音频、双臂长程、人形操作仍是评测长尾。多模态基准(bigym 移动双臂、robotwin-2 域随机化双臂)刚起步,触觉/力反馈几乎没有标准化擂台,人形”操作”(而非纯运动)的基准(humanoidbench 操作任务几乎全不及格)仍在起点。
- MLLM 规划层评测正与底层执行评测脱钩。embodiedbench/robocerebra/robobrain-2 把”大脑”单独打分(多选/结构化),但”规划对 ≠ 执行成”——如何把规划质量与端到端任务成功率重新耦合起来评测,是这一层的开放问题。