具身智能评测:仿真基准 · 真机成功率 · 泛化协议 · 可复现性

概述:具身智能没有 ImageNet 式的单一擂台,它的评测是一张按”控制对象 × 能力维度 × 真机对齐度”三轴铺开的谱系。操作这一域最热闹,走过四代:从单任务/多任务技能库(meta-world rlbench maniskill maniskill2),到语言条件 + 长程(calvin vima-bench libero),到场景/资产规模化与生成式(robocasa behavior-1k robogen genmanip),再到双臂/移动/域随机化(bigym robotwin robotwin-2 robomind)。泛化被单拎出来做压力测试(the-colosseum gembench vlabench roboverse)。真机-仿真对齐催生了 real2sim 范式(simpler-env maniskill3)与分布式真机 A/B 评测(roboarena)。腿式/人形/导航各有专属指标(barkour-benchmark-quadruped-agility humanoidbench habitat procthor)。MLLM 规划层又是一套(embodiedbench robocerebra robobrain-2)。贯穿全表的三个结构性事实是:长程近乎清零、语义泛化基本失效、真机数字普遍只有仿真的一半——而这套评测体系自身的可复现性(口径漂移、正文-表格自相矛盾、榜单持续被刷)也是一个尚未解决的治理问题。


一、基准全景:三轴谱系

真正区分这些基准的不是任务多不多,而是它想量什么能力用什么指标量、以及离真机有多远。下表把主要仿真/真机基准按”时代 × 侧重维度”对齐(成功率类指标除非注明均为策略在测试集上的任务成功率)。

基准年代本体/域任务规模核心指标主打的能力维度真机对齐
meta-world2019单臂桌面MT10/MT50 · ML10/ML45成功率多任务 RL / 元 RL纯仿真
rlbench2019单臂桌面100+ 任务成功率(few-shot)3D 操作策略刷分场纯仿真
maniskill / maniskill22021/23单臂 + 铰接/软体4 类 / 20 任务成功率物体级泛化、高精度装配少量 sim2real
calvin2021单臂 Franka34 子任务 → 1000 指令链Avg. Len(连续完成数,满分 5)语言条件 + 长程纯仿真
vima-bench2022单臂桌面17 任务 × 4 泛化级成功率多模态 prompt 泛化纯仿真
libero2023单臂 Franka130 任务(5 套件)FWT/NBT/AUC + 套件均值 SR终身学习 / VLA 通用擂台纯仿真
robocasa2024单臂厨房100 原子 + 复合成功率场景/资产规模化、生成数据真机共训
behavior-1k2024移动操作1000 日常活动成功率 + 效率超长程、全流程家务数字孪生 sim2real
bigym2024移动双臂人形40 任务成功率移动 + 双臂 + 人类示教纯仿真
robotwin / robotwin-22024/25双臂14 / 50 任务成功率(Easy/Hard)生成数字孪生 + 域随机化 + 真机迁移sim2real 强对齐
robomind20245 本体(Franka/人形/双臂…)45 任务真机 SR(/10)多本体标准化数据 + 评测真机
the-colosseum2024单臂(RLBench 基)20 任务 × 14 扰动扰动前后 SR 降幅系统性泛化压力测试4 任务真机对齐
gembench2024单臂(RLBench 基)4 级泛化各级均值 SR新物体/铰接/长程外推UR5 真机
vlabench2024单臂桌面100+ 长程推理任务Progress Score(细粒度)世界知识 + 长程语义纯仿真
simpler-env2024Google Robot / WidowX8 任务MMRV ↓ / Pearson r ↑real2sim 评测保真度real2sim 金标准
roboarena2025DROID 分布式真机开放任务成对 A/B → Elo/BT 排名通才策略真机排名全真机
roboverse2025多本体统一平台多任务 × 4 级成功率统一平台 + 分级泛化sim2real
barkour-benchmark-quadruped-agility2023四足敏捷障碍赛道Barkour Score(狗=1.0)动物级运动敏捷全真机
humanoidbench2024人形全身27 任务Reward vs Target 阈值全身运动 + 操作纯仿真
embodiedbench2025高层+低层四环境1128 任务成功率(按子集)MLLM 具身智能体纯仿真
robocerebra2025单臂长时程60 任务成功率 + 规划质量System-2 记忆/重规划纯仿真

三条线索贯穿全表:

  • 指标随能力维度而变。测运动学技能用二值成功率;测长程用”连续完成数”(calvin Avg. Len)或”进度分”(vlabench PS,比 0/1 更细);测终身学习用前向迁移/遗忘(libero FWT/NBT);测真机对齐不看绝对分而看相关系数simpler-env MMRV/Pearson r);测通才策略干脆放弃绝对分、改用成对偏好排名roboarena Elo)。
  • 难度设计从”任务多”转向”扰动多”。第一代靠堆任务数(rlbench 100+),新一代靠在同一任务上叠加受控扰动(the-colosseum 14 类)或分级外推(gembench L1–L4、roboverse Level 0–3)——因为”再多的独立任务”也测不出”对同一任务的分布偏移有多脆”。
  • 真机对齐是新的一等公民。早期基准(meta-world rlbench calvin)纯仿真、与真机脱节;simpler-env 用 real2sim 证明”仿真分能预测真机分”,roboarena 索性把评测搬回真机、用分布式众测换统计功效。

二、操作仿真基准的四代演进

2.1 第一代:多任务技能库与”看似接近、实则插不进”(2019–2023)

meta-world 是最早把”一套桌面任务 + 标准化协议”当基准卖的工作,它的一手数字直接暴露了当年方法的天花板——即便只有 10 个任务,多任务学习就已很吃力:

设定最强方法成功率
MT10(10 任务多任务训练)Multi-task SAC68.3%
MT50(扩到 50 任务)Multi-task SAC38.5%(骤降)
ML10 meta-test(10 任务元学习)RL²35.8%
ML45 meta-test(45 任务元学习)MAML39.9%

论文的结论振聋发聩:当前方法既不能泛化到全新任务,甚至在多个质变任务上连 meta-train 都学不好。同期 rlbench 走了另一条路——它本身不跑任何算法、不给 baseline 表,只定义任务/观测/动作与 few-shot 协议,把刷分权完全交给社区。这个”只搭台不唱戏”的设计反而让它成了 3D 操作策略(peract RVT act3d gembench)最主流的擂台。

maniskill/maniskill2 把重心压到物体级泛化高精度装配这两个当时的硬骨头上,一手数字说明现有方法离”解决”还很远:物体级泛化测试集成功率普遍只有 8–12%(maniskill OpenCabinetDoor 测试 0.11、PushChair 0.08);maniskill2 更设计了”表面精度接近、实际插不进”的诊断——Transporter Networks 做 AssemblingKits 按原论文位姿精度指标(1cm/15°)达 99%,但按 ManiSkill2 的”实际插入”严格指标只有 18%;刚体高精度装配任务上,无论 BC(50k 步)还是 DAPG+PPO(25M 步)成功率都趋近 0(PegInsertion 0.01、AssemblingKits 0.00),而 sim2real 让 PickCube 从仿真 91% 掉到真机 60%。这一代基准的共同贡献是:把”哪些能力还没解决”用可量化的方式钉死

2.2 第二代:语言条件 + 长程(2021–2023)

当策略开始吃语言指令,评测的重点从”会不会做一个动作”转向”能不能顺着一串语言把长任务走完”。calvin 是这条线的定义者,它把 34 个子任务串成 1000 条唯一指令链,主指标 Avg. Len(连续完成的子任务数,满分 5),并在评测前把机器人复位到中性位、逼策略靠语言而非初始状态推断任务。发布时的 SOTA(MCIL)成绩堪称”长程近乎失败”,而如今 VLA/扩散策略已把它刷到近满分——这条时间线本身就是范式跃迁的缩影:

设定发布时 MCIL 基线当前榜首(2026 抓取)代表刷榜工作
D → D(单环境)LH-MTLC 5 连 0.08%FLOWER 4.35
A,B,C,D → D原始基线 Avg. Len 0.40FLOWER 4.67 / univla 4.63robovlm KosMos 4.49、GR-1 4.21
A,B,C → D(零样本跨场景)第 2 条起趋近 0FLOWER 4.53 / univla 4.41robovlm KosMos 4.25、3D Diffuser Actor 3.27

robovlm 的一手数字给出跨场景零样本的绝对提升幅度:ABC→D 上 KosMos 相对 GR-1 单任务 +12.6 个点、5 连续任务 +30.3 个点。

vima-bench 换了个角度测泛化——用多模态 prompt(文字里夹图像/物体)定义任务,按泛化难度分 L1–L4 四级。它证明了 object-centric 表征在低数据区的威力:VIMA 在全部 4 级、7 档模型上都超基线,最难的 L4、20M 尺寸相对最强基线高达 2.9×;1% 数据即可媲美基线 10× 数据。

libero 则把语言操作与终身学习绑在一起,130 任务分 5 套件(Spatial/Object/Goal/Long/90),提出 FWT(前向迁移)/NBT(负后向迁移)/AUC 三指标。它的五条发现有几条相当反直觉:所有被评估的终身算法都损害了前向迁移(顺序微调 SeqL 的 FWT 反而最高);语义丰富的语言嵌入并不比 Task-ID 更好(BERT/CLIP/GPT-2/Task-ID 无统计显著差异,说明句子嵌入退化成了 bag-of-words);朴素监督预训练会拖累下游终身学习。有意思的是,libero 后来的历史地位并非作为终身学习基准,而是成了 VLA 时代事实上的统一擂台(见第五节)。

2.3 第三代:场景/资产规模化与生成式数据(2024)

当模仿学习的瓶颈从”算法”转向”数据”,基准开始承担”造数据 + 量 scaling”的职责。robocasa 在厨房场景里用生成式管线扩数据,一手数字画出清晰的 scaling 曲线,并证明机器生成数据能超过人类数据

数据配置轨迹数24 原子任务平均成功率
Human-50(人类演示)1,25028.8%
Generated-3007,20035.0%
Generated-300072,00047.6%

但它也诚实地暴露了长程的墙:复合任务从零训练 5 个里 4 个为 0%,微调后仍只有个位数(PrepareCoffee 始终 0%)。真机侧共训仿真数据把 seen 物体成功率相对提升 79%(13.6%→24.4%)。

behavior-1k 把野心拉到极致——1000 个日常活动、全流程家务。它的基线实验(3 个范式级活动)给出了长程与抓取这两堵墙的量化证据:端到端视觉运动控制(RL-VMC)在三个任务上全部 0%(长程导致完全学不出来),必须靠原语分解 + 历史记忆(RL-Prim.Hist. 0.55/0.63/0.88)才能推进;一旦撤掉抓取简化、启用完全物理抓取,成功率又骤降回 0/0/0——抓取是关键瓶颈。数字孪生公寓的 sim-real gap 触目惊心:仿真约 40% → 真机最优策略 22% → 真机迁移的视觉策略 0%

生成式基准还有两支:robogen 用 LLM 自动生成 106 个任务,多样性指标(Self-BLEU、CLIP 相似度)全面优于人工构建的 meta-world/rlbench/maniskill2 与并发的 GenSim,69 个基准任务平均技能学习成功率 0.774。genmanip 则用 LLM 驱动 200 场景,主打长程语义推理——模块化 MLLM 流水线最佳组合(CoPA+GPT-4.5)综合仅 23.0% SR,长程任务平均只有 9.07% SR;端到端 GR-1 单任务随数据从 100 增到 1K episode 从 33%→95%,但未见指令/未见物体直接 0.0%,把”位置级泛化可行、语义泛化完全失效”钉得死死的。

2.4 双臂 / 移动 / 域随机化(2024–2025)

随着硬件从单臂走向双臂与移动人形,基准也补上了这些设定。bigym 是首个”移动 + 双臂 + 人类示教 + 长程(1000–7000 步)“的基准,40 任务上生成式策略(ACT)显著优于 BC 与 demo-driven RL:

算法类型40 任务平均成功率
ACT模仿学习46.3%
Diffusion Policy模仿学习20.8%
BC模仿学习18.0%
DrQV2 / AWAC / IQL / CQNdemo-driven RL10.5–13.9%

任务级分布极度两极:drawer_top_close(单关节)全部 7 算法都 100%,而 stack_blocksstore_groceries 等高精度/长程任务全部算法 0%——移动基座叠加高精度操作是当前公认的死角。

robotwin/robotwin-2 主打生成数字孪生 + 域随机化 + 真机迁移的闭环。robotwin 的一手数字证明”仿真数据可大幅替代真机采集”:真机单臂只用 20 条演示平均 1.2%,加入 300 条仿真后飙到 72%(双臂 20%→62%)。robotwin-2 把规模拉到 50 任务并做成榜单,一手数据显示预训练 VLA 在域偏移下仍明显退化(Easy→Hard):

模型Easy 平均 SRHard 平均 SR
ACT9.4%2.0%
DP / DP335.1% / 31.8%1.4% / 2.2%
RDT47.8%19.6%
pi064.9%24.6%

它还量化了域随机化对真机迁移的贡献:加入 R2.0 合成数据后,unseen/cluttered 真机成功率 9.0%→42.0%(摘要口径 367% 相对提升)。robomind 走标准化路线,覆盖 5 种本体、45 任务,一手结论是全量预训练对多本体成功率有稳定提升(CrossFormer 双臂从”全 0/10”跃到 10/10),而”定位不准”是各本体首要失败因(人形高达 48%)。


三、泛化与鲁棒性评测协议

第三代之后,社区意识到”任务成功率”掩盖了脆弱性,于是把泛化单独拎出来做压力测试。这类基准不比”能不能做”,而比”在受控扰动/外推下掉多少”。

the-colosseum 是最系统的一个:20 任务 × 14 类扰动(干扰物、颜色、光照、纹理、相机位姿、物理属性…)。一手结论——单个扰动下 5 个 SOTA 模型任务平均成功率普遍下跌 30%–50%,14 项叠加时下跌 ≥75%;最伤成绩的是干扰物数量与颜色类扰动,物体尺寸影响最小;3D 模型对相机位姿基本免疫(先转体素/重渲染),2D 端到端模型对颜色/纹理/视角最敏感。它还做了 4 任务真机对齐,14 项里至少 7 项仿真结论与真机强相关(R²=0.74–0.94),真机侧 MO_Color 扰动导致成功率暴跌 82.6%

gembench 把泛化做成 4 级递进外推(新摆放→新刚性物体→新铰接物体→长程),一手数字把”长程是全员坟墓”钉死:

方法L1 新摆放L2 新刚体L3 新铰接L4 长程
3D Diffuser Actor91.943.437.00.0
RVT-289.151.036.00.0
3D-LOTUS(本文)94.349.938.10.3
3D-LOTUS++(LLM+VLM 组合)68.764.541.517.4

所有纯端到端 SOTA 在 L4 都跌到 ≈0%;只有引入 LLM 规划 + VLM 定位的组合式方法(3D-LOTUS++)能在 L4 拿到两位数,但代价是 L1 反而下滑(零样本定位会混淆同类物体)。同一模式在 roboverse 的 4 级随机化(任务空间→环境→相机→光照)上重现:Diffusion Policy 在 PickCube 上从 Level 0 的 52.7% 骤降到 Level 1 的 11.1%、Level 2/3 直接 0。

vlabench 则从”世界知识 + 长程语义推理”切入,用 Progress Score(比 0/1 更细的进度分)评测。原始论文里所有 VLA(Octo/OpenVLA/RDT-1B)在所有泛化维度得分都是个位数到十几分(RDT-1B 原子任务 Seen 最高 15.37 PS),远未表现出 LLM 式的”预训练涌现”泛化——这是对”VLA 会自动继承大模型泛化”的一次冷水。有意思的后续是:官方放出 pi0 系列 checkpoint 后,in-distribution 成功率提到 47–51%,侧面印证了”更强骨干 + 更好动作表征”这条判断。


四、真机-仿真对齐:real2sim 与分布式真机评测

纯仿真基准的老问题是”仿真高分不等于真机能用”。simpler-env 提出的解法不是”复刻绝对成功率”,而是量化仿真分与真机分的相关性——用 MMRV(越低越好)与 Pearson r(越高越好)衡量。它的一手数字证明 real2sim 评测可以准确排名策略:

任务(Google Robot, Visual Matching)MMRV ↓Pearson r ↑
Pick Coke Can0.0310.976
Open / Close Drawer0.0550.915
Open Drawer & Place Apple0.0000.969
WidowX+Bridge(整体)0.0140.890

关键对照——传统模仿学习常用的”验证集 action MSE 选模型”在多任务上甚至出现 −0.857 / −1.000 的负相关(越”准”越差),而 simpler-env 完胜;换物理引擎(Isaac Sim r=0.919 vs SAPIEN r=0.923)结论一致。maniskill3 把 SIMPLER 移植到 GPU 并行版复现了这一相关性(Octo/RT-1X real2sim r=0.9284、MMRV=0.0147),并成为任务类别覆盖最广的仿真器(12 类 vs Isaac Lab 5 / RLBench 1)。

roboarena 走到另一个极端——放弃仿真、把评测搬回真机,用分布式众测做通才策略的成对 A/B,再用 Elo/BT 拟合排名。它的核心贡献是证明”评测方法本身”的可靠性:传统”常规评测”(因复现难只覆盖少量任务)不能可靠估计通才性能;任务感知法约 100 次成对比较即收敛到高质量排名;VLM 自动做任务分类准确率 94.6%;最终最强策略是 π0-FAST-DROID。它同时给出策略强弱画像——自回归策略(FAST 系)在抓放/堆叠/分类等需精确语言跟随的任务上更强,扩散策略在滑动/擦拭等流畅连续运动上更好,binning 策略几乎全面垫底。


五、VLA/策略横向擂台:LIBERO / SimplerEnv / CALVIN

到 2024–2026,liberosimpler-envcalvin 事实上成了 VLA 论文的”三大必刷擂台”。把散落在各模型页的一手数字聚合起来,能看到一条清晰的”两年内从 76% 刷到 99%“的军备竞赛。

LIBERO 四套件平均成功率(Spatial/Object/Goal/Long 均值,各家论文一手微调数字;注意基线复现口径略有差异):

模型LIBERO 均值备注
octo75.1%生成式通才基线
openvla76.5%7B,OpenX 预训练
spatialvla78.1%Long 套件仅 55.5%(长程短板)
molmoact86.6%Long 比第二名高 6.3 点
villa-x90.1%隐动作建模
groot-n193.9%GR00T-N1.7 达 97.0
pi094.4%flow matching
univla95.2%任务中心隐动作
internvla-m195.9%Long 项 92.6 领先
pi0-596.9%开放世界泛化
openvla-oft97.1%更弱底座刷到当期 SOTA
rynnvla-00297.4%连续动作,无预训练
hume-vla98.0%System-2 thinking
galaxea-g0-598.9%Long 套件 98.6
internvla-a1-598.9%全表最优平均

榜单本身也在讲故事:长程套件(LIBERO-Long)始终是分水岭——即便总平均逼近 99%,各家在 Long 上仍普遍低 5–15 个点(spatialvla 只有 55.5%)。而 libero 原本的终身学习指标(FWT/NBT/AUC)在 VLA 时代几乎被弃用——大家只报套件均值 SR,这本身也是”基准被重新诠释”的一例。

SimplerEnv Google Robot(Visual Matching / Variant Aggregation 平均成功率)

模型参数量VM 平均VA 平均
octo-Base93M11.01.2
rt-1-X35M42.430.2
rt-2-X55B46.354.4
rt-152.443.7
openvla7B34.339.3
cogact7.6B74.861.3

WidowX+Bridge 上同样悬殊(cogact 51.3% vs openvla 4.2%、octo-Base 17.5%);一个反直觉的跨本体发现来自 lapa-latent-action-pretraining——无动作预训练的 LAPA(Bridge) 36.8 反超用真实动作预训练的 OpenVLA(Bridge) 30.8,作者归因于真实动作模型过拟合了 WidowX 动作空间、跨本体迁到 Franka 时受损。

这三大擂台的共同软肋是它们量的是”分布内做得多好”,而 the-colosseum/gembench 量的”分布外掉多少”才是部署真正关心的——高 LIBERO 分与高鲁棒性并不等价。


六、腿式 / 人形 / 导航的专属基准

操作之外的三域各有自成体系的评测口径。

四足敏捷barkour-benchmark-quadruped-agility 定义,它借敏捷犬竞赛设计赛道,用 Barkour Score(狗=1.0 为满分)量化动物级敏捷:

策略Barkour Score完成时间前向速度
小型犬(对照)1.009.02 s
Specialist(专精策略)0.7724.6 s0.74 m/s
Locomotion-Transformer(通才)0.7325.8 s0.69 m/s

差距一目了然:最好的机器人策略得分只有真狗的 ~77%、耗时近 3 倍。

人形全身humanoidbench 定义,27 任务用”Reward vs Target 阈值”判定,一手结论是几乎全员不及格——只有 walk、crawl、stand 等少数运动任务达标,push/package 甚至是大负值,唯一的离散稀疏奖励任务 kitchen 全为 0;分层 RL 能在 push 上翻盘但在更难的 package 上仍”举不起来”(低层从未在训练中经历举起)。这与操作域的”长程清零”是同构现象。

导航自成谱系,主指标是 SPL(Success weighted by Path Length,兼顾成功率与路径效率)habitat 用它跑出了一个方法论级结论:RL(PPO) Depth 在 PointNav 上起点差、但训到 10M–30M 步后追平并超越经典 SLAM(Gibson SPL 0.79),若像前人一样在 5M 步就终止实验反而会得出”SLAM 占优”的相反结论——直接靠算力推翻了此前多篇论文。procthor 把场景规模化(10→10000 栋房屋预训练),四个 ObjectNav 基准的零样本 SPL/SR 随规模单调提升(RoboTHOR 微调后 SPL 比此前 SoTA 高 8.8 点、Habitat 2022 挑战赛登顶)。真机导航则多用成功率(gnm-general-navigation-model 单一策略跨 4 本体每台都超专用策略、部分提升 5×;nomad-goal-masked-diffusion-navigation 探索成功率 98% 且模型小 15×)。

roboverse 是少数把三域打通的统一平台——既做操作 4 级泛化,又能把 humanoidbench 任务从 MuJoCo 迁移过来稳定收敛,还做语言引导抓取的 sim2real(OpenVLA 零样本迁真机抓未见物体得分 7.0/8.0/5.0,满分 10)。


七、MLLM / 规划层的具身评测

当”大脑”(VLM/LLM 规划器)与”小脑”(底层策略)解耦,评测也分了层。embodiedbench 覆盖高层(EB-ALFRED/EB-Habitat)与低层(EB-Navigation/EB-Manipulation)四环境,一手数字揭示了几个非平凡结论:

模型EB-ALFRED(高层)EB-Habitat(高层)EB-Navigation(低层)EB-Manipulation(低层)
Claude-3.5-Sonnet64.068.044.725.4
GPT-4o56.359.057.728.9
InternVL2.5-78B(开源最佳)37.749.030.718.0

要点:高层强的模型未必低层强(Claude 高层最强、GPT-4o 低层反超);视觉的作用因层级而异(去视觉后 GPT-4o 在 EB-Navigation 从 57.7 暴跌到 17.4,但在 EB-ALFRED 反而略升——高层任务更依赖文本);长程规划是全局最难子集;开源模型与顶尖闭源仍有明显差距。robocerebra 把长时程做得更极致(60 任务、含记忆探索/观测错配/动态扰动),一手数字显示纯 System-1 策略(微调 OpenVLA)在含记忆与动态变化的 Mix 设定下完全失败(0.00%),必须靠 System-2 分层框架(GPT-4o 规划 + 记忆/重规划闭环)才达 13.21%,但离人工计划上界(GT-plan 25.16%)仍差 9 个点以上。

纯 VLM 的空间/时序推理则由 robobrain-2 这类工作用 12 个公开评测(BLINK/CV-Bench/RoboSpatial/VSI-Bench 等)横向刷分(RoboBrain-7B-2.0 在 BLINK 达 83.95 刷新 SOTA),vlabench 也附带一套 VLM 六维雷达评测(发现”仅 GPT-4o 在推理维度达到与其他维度均衡”,其余模型推理维度普遍只有约 20 分)。这一层的共性是评测已从”任务成功率”退化/升维成”多项选择/结构化打分”,因为规划正确不代表底层能执行成功。


八、可复现性:这套评测体系自身的债

具身评测的一个尴尬现实是:基准自身的可复现性也成问题。从本轮全量阅读里能直接观察到几类系统性问题:

  • 正文数字与表格自相矛盾,且往往无法核实。tinyvla 正文写”双臂平均 65%“但三任务表格算术平均只有 47.8%;bunny-visionpro 正文自陈”38% 整任务成功率”与三任务简单平均 50% 不一致;robobrain-2 在 Multi-Robot Planning 一段里先说 32B(80.33) 超过 7B(81.50)、随后又说 7B 是 81.50,措辞自相矛盾;act3d 的叙述提升幅度(+8.7%/+16.9%)与表格相减(+11.7/+19.9)对不上。这些都是论文自身的不一致,只能如实标注、无法外推修正。
  • 榜单持续被刷、口径随时间漂移calvin 官方 leaderboard 从发布时基线 5 连近乎 0 到如今 FLOWER 4.67,主指标含义未变但绝对水位天翻地覆;vlabench 论文原始数字(个位数 PS)与官方后续放出的 pi0 checkpoint(47–51%)差一个数量级——引用时必须带版本快照与抓取日期
  • 仿真高分与真机高分脱节behavior-1k 数字孪生 sim 40%→real 22%→视觉策略 0%、robomind 仅用仿真数据真机仅 10%、maniskill2 sim 91%→real 60%——接触密集任务的 sim-real 物理差距仍是硬伤,这正是 simpler-env/roboarena 存在的理由。
  • 评测协议本身缺乏标准化。真机评测的试验数(10 次/任务是常见但非统一)、随机化方式(bridge-data-original 每 5 次改变机器人相对环境位置、bridgedata-v2 跨机构 Lab1→Lab2)、成功判据(人工目视 vs 环境状态判定)各家不一,使得跨论文的绝对成功率几乎不可直接比较——这也是 roboarena 用成对偏好排名绕开绝对分的动机。

空白与趋势

贯穿全局的张力是”仿真里能量的,恰恰是真机部署最不缺的能力;真机上最缺的能力,恰恰仿真最难量”。可观察到的趋势与空白:

  • 长程与语义泛化是所有域的共同天花板。操作(gembench L4≈0、genmanip 长程 9%、behavior-1k 端到端 0%)、人形(humanoidbench kitchen 全 0)都在同一堵墙上撞。绝对成功率军备竞赛(libero 逼近 99%)掩盖了这一点——分布内刷分已接近饱和,评测重心正被迫从”做得多好”转向”分布外掉多少”the-colosseum gembench roboverse 的分级/扰动协议是这一转向的产物)。
  • real2sim 与分布式真机评测是对”仿真-真机脱节”的两种应答simpler-env/maniskill3 证明用相关性而非绝对分可以低成本预测真机排名;roboarena 用众测换统计功效。但二者都还只覆盖少数本体/任务,尚未成为社区默认。
  • 评测口径缺乏治理是隐性可复现性债。正文-表格自相矛盾、榜单漂移、协议不统一三者叠加,使得”某模型 LIBERO 97%“这类陈述在缺少版本/复现细节时近乎不可比。领域尚无 ImageNet 式的中心化、冻结版本、第三方托管的评测基础设施。
  • 触觉/力/音频、双臂长程、人形操作仍是评测长尾。多模态基准(bigym 移动双臂、robotwin-2 域随机化双臂)刚起步,触觉/力反馈几乎没有标准化擂台,人形”操作”(而非纯运动)的基准(humanoidbench 操作任务几乎全不及格)仍在起点。
  • MLLM 规划层评测正与底层执行评测脱钩embodiedbench/robocerebra/robobrain-2 把”大脑”单独打分(多选/结构化),但”规划对 ≠ 执行成”——如何把规划质量与端到端任务成功率重新耦合起来评测,是这一层的开放问题。