一句话定位
RoboArena 是”机器人版 Chatbot Arena”:不再标准化任务与环境,而是让一个跨机构的评测者网络在任意场景、任意任务上对两个通才策略做**双盲、成对(A/B)**真机对比,把海量成对偏好聚合成一个全局策略排名(类 Elo)。作者在 droid 平台上实例化,跨 7 所高校、612 次成对真机评测、7 个通才策略,证明这种去中心化评测比传统集中式标准化评测能更准确地给通才策略排序。CoRL 2025。
背景与定位
范式:crowd-sourced / decentralized pairwise real-robot evaluation。灵感直接来自 LLM 的 Chatbot Arena(Chiang et al.)与 GenAI Arena(Jiang et al.)——用大量人类成对偏好 + Bradley-Terry/Elo 聚合出排名,把它搬到真机机器人评测。
要解决的痛点:通才策略(openvla、octo、pi0、open-x-embodiment RT-X、Gemini Robotics 等)设计上要跨大量任务/场景工作,但传统真机评测靠”标准化”——固定任务集、复刻场景布局/光照/相机角度,或办集中式”机器人挑战赛”。这类做法:(1) 只能覆盖极少数任务/场景(代表性不足);(2) 跨机构复刻初始条件极难、维护集中式机器人机队昂贵;(3) 难扩展。仿真评测(libero、robocasa、calvin、rlbench、meta-world、simpler-env)虽可复现,但 sim-to-real gap 使其常常无法反映真机表现。
核心洞察(反直觉):通才策略的”高泛化性”本身正是去中心化评测的前提——因为任一策略都能在任意场景/任务上被有意义地评测,就不必再标准化。RoboArena 只在”单次 A/B 对比内”要求两个策略共享相同初始条件(保证该次对比公平),跨不同 A/B 对比之间允许自由改变场景/任务,从而把多样性做大。与 Dasari et al. 的跨机构机器人 benchmark 不同(后者每换一个机构/任务都要重训策略、覆盖面受限),RoboArena 直接评测开箱即用的通才策略,因此能覆盖远更广的任务分布。
模型架构
RoboArena 是”评测系统 + 排名模型 + 质性分析流水线”三件套,而非某个策略/世界模型。
1) DROID-RoboArena 评测系统(4 大组件)
- Policy inference servers(策略推理服务器):所有被测策略远程托管(非机器人端本地跑)。好处:多评测者共享同一策略服务器(资源利用高)、评测客户端轻量(客户端无需推理算力,降低参与门槛)、提交者自托管保证策略正确运行/算力充足/闭源权重无需公开即可参评。代价是远程推理带来额外延迟——作者称对 DROID 上的静态操作任务影响可忽略。
- Evaluation clients(评测客户端):一个客户端脚本引导评测者走完 §3.1 协议,负责与中央服务器、策略服务器通信;无需客户端推理算力,任何联网并接 DROID 机器人的电脑都能跑。
- Evaluation database:存储指令、进度分/偏好、自然语言反馈、rollout 视频。
- Central evaluation server:给评测者分派策略、维护策略池(新注册/弃用)、超时自动取消(客户端崩溃/断网时)。
- 策略服务器实现:WebSocket 服务器(
WebsocketPolicyServer),配置项含image_resolution=(224,224)、needs_wrist_camera、n_external_cameras、needs_stereo_camera、action_space(如joint_position)——只传策略需要的观测,最小化通信延迟。
DROID 机器人硬件:Franka Panda 7-DoF 机械臂 + Robotiq 2F-85 平行夹爪 + ZED-mini 立体腕部相机 + 一或多个 ZED 2 外部立体相机;机器人装在可调高度的移动桌上(便于快速重排场景/视角)。选 DROID 因其关联开源 droid 大规模真机数据集,且已部署在全球多所高校(分布式评测的先决条件)。
2) 全局排名模型:任务感知的 Bradley-Terry 扩展 + EM
- 基线 Bradley-Terry:$p(\pi_A>\pi_B)=\sigma(\theta_A-\theta_B)$,$\theta$ 为对数能力,可用 Elo(在线)或迭代 MLE(离线,可扩展支持平局)拟合。
- 问题:BT 假设所有成对比较在相同条件下发生;但 A/B 机器人评测里任务会变,且任务难度显著影响偏好(对双方都太难/太易的任务会抹掉区分信号;专才策略在某任务子集上会反超通才)。标准 BT 会把任务效应当噪声,排名变差。
- RoboArena 扩展:为每个策略保留对数能力 $\theta=(\theta_1..\theta_N)$,再引入任务难度 $\tau=(\tau_1..\tau_T)$、边际任务概率 $\nu=(\nu_1..\nu_T)$($\sum_t\nu_t=1$,即任一 A/B 试验属于潜在桶 $t$ 的先验)、策略-任务偏移 $\psi_{p,t}$(建模策略相关的任务难度)。混合式似然: $$p(\pi_A>\pi_B)=\sum_{t=1}^{T}\nu_t\cdot\sigma(\theta_A+\psi_{A_t}-\tau_t)\cdot(1-\sigma(\theta_B+\psi_{B_t}-\tau_t))$$
- 关键:所有参数仅从偏好数据学习,无需任何辅助任务标注($\tau,\nu,\psi$ 通过 MLE 自动拟合);潜在任务桶数 $T$ 为超参。
- 拟合:近似 MLE 的 EM 算法——迭代计算当前参数下数据似然、一二阶导、带 clipped Newton 更新的 M 步、再中心化参数保持零均值。
3) 质性分析流水线(LLM/VLM 辅助)
- 用 VLM(论文 §3.3 写 OpenAI GPT-4.5)读每段评测视频的首帧 + 任务指令,给任务分类(pick-place / open-close / tool use 等 11 类)并描述场景光照、杂乱度、物体可见性。
- 用 LLM(OpenAI o3,Appendix E 精确到
o3-2025-04-16)为每个策略生成 policy report:汇总偏好标注、分类结果、自由文本反馈,沿任务类别对比各策略强弱;强制引用具体评测 episode 作为证据,并自动挂上对应 rollout 视频供核验。
被测策略池(7 个,均基于 pi0 或 PaliGemma 底座,来自 openpi 公开实现):
π0-flow-DROID(π0 flow-matching VLA,DROID 微调)、π0-FAST-DROID(π0-FAST 自回归 VLA,DROID 微调);PG-flow-DROID / PG-FAST-DROID / PG-FAST+-DROID / PG-FSQ-DROID / PG-Bin-DROID:PaliGemma VLM 在 DROID 上分别用 π0 式 flow matching、FAST/FAST+ 分词、有限标量量化(FSQ)、简单 binning 分词等不同动作表征微调(Pertsch et al. FAST 论文的动作表征系列)。
数据
评测数据(本作产出的是”评测数据集”而非训练集):
- 规模:RoboArena 评测共 4284 个策略 rollout(作者称”迄今对通才策略最全面的评测”),横跨数十个场景、数百条任务指令;用于 RoboArena 排名的核心是 612 次成对(A/B)真机评测。
- 网络:7 所高校评测网络(UC Berkeley、Stanford、UW、Université de Montréal、UPenn、UT Austin、Yonsei);作者机构列表另含 NVIDIA(第 5 家,企业而非高校,论文未说明其具体分工,故不计入”7 所高校”)。
- 反馈三件套(每次 A/B 由评测者给):连续进度分 $\in[0,100]$(正比于策略在任务上达到的最大进度:0=无进展,100=完成,中间=部分成功);二元成对偏好标签(哪个策略更好,判据由评测者自定);自由文本语言解释。
- 任务/物体多样性:任务动词包含 uncapping / unplugging / finding / dusting / wiping 等长尾;物体类别广(Appendix C 图 10/11 展示 32 个样例环境,即便同一物理位置也常改光照、视角、桌布、物体)。任务归为 11 类:Pick and Place、Open/Close、Move/Slide、Knock Over/Topple、Cover/Drape/Fold、Group/Organize/Stack、Find/Search、Minimal or No Action、Object Manipulation、Sorting/Classification、Tool Use。
- 偏好 ≠ 进度分的信息量:作者发现 11% 的 A/B 评测中,偏好反馈与进度分不一致(进度分相同但偏好不同,或两者趋势相反)——评测者常给两策略相同进度分却明确偏好其一(因其动作更果断/迅速/少纠错)。说明偏好与进度是互补信号,应同时报告。
- 对照的”常规评测”基线:复用 Pertsch et al.(FAST)的 DROID 评测流程——17 个任务、每策略 44 个 episode,代表典型集中式标准化真机评测。
- “Oracle”排名:对全部策略在全部已测任务上穷举评测、比较平均进度分得到;由评测者在每次 A/B 后再给其余 5 个策略打分获得,合计 4284 次评测。
- 公开数据:项目页提供 HF Data Dump 数据集(
RoboArena/DataDump_02-03-2026),全部评测公开可审计。
训练方法
此处”训练”指评测协议与排名算法的拟合方法。
成对评测协议(Algorithm 1):评测者 $E$ 向中央服务器 $C$ 请求两个策略 → $C$ 从策略池随机采样 $(\pi_A,\pi_B)$ 并分派(评测者不知道是哪两个策略,仅拿到远程服务器 IP,实现双盲)→ $E$ 重排场景、用自然语言定义任务 $T_i$ → 背靠背跑 $\pi_A,\pi_B$ 的 rollout(完成任务或超时为止),在单次 A/B 内严格匹配初始条件保证公平 → $E$ 提交进度分/偏好/语言反馈 $F_i$ → $C$ 聚合所有 ${F_i}$ 出全局排名 + 质性特征。单次成对比较之外的一切都可全异步进行。
排名算法拟合(EM 超参,Table 1):EM_ITERS=60(搜 {50,100,200})、潜在任务桶 T=60(搜 {10..200})、step_clip=1.0([0.1,10])、l2_theta=1e-2、l2_psi=1e-2(均搜 {1e-3,1e-2,1e-1})、step_decay=0.99({0.9,0.99,0.999})、tol=1e-4({1e-5,1e-4})。支持把部分成功信息(进度分)纳入。
对比的排名基线:Elo(在线更新)、Bradley-Terry MLE(离线)、进度分平均(“PROG”),对照本作任务感知法(“TASK”)。排名质量度量:Pearson 相关系数 $r$、Mean Maximum Rank Violation(MMRV,考虑策略间性能差的排名指标,随 Li et al. SIMPLER 用法)。
无策略训练:7 个被测策略全部来自已有工作的公开权重/实现(openpi),本作不训练策略。
Infra(训练 / 推理工程)
- 训练算力:未披露(被测策略均来自先前工作,本作不训练模型;排名 EM 为轻量 CPU 数值优化)。
- 推理/评测工程:策略远程 WebSocket 托管,评测客户端零推理算力,任何联网 + 接 DROID 的机器即可当评测节点;只传策略声明需要的观测(腕相机/外相机/立体/动作空间)以压低通信延迟。远程推理延迟对静态操作任务”可忽略”;作者指出未来评测更动态的任务时可能需(至少部分)本地推理。
- 控制频率 / FPS / 边端硬件:未披露具体数值。
- 安全层:新提交的策略服务器先校验输入输出格式 → 在”测试环境”由受训评测者盯着跑几组场景/任务(能随时干预防止损坏机器人,类比自动驾驶测试司机)→ 通过后才进公共池分发。
- 激励机制:“评测信用”系统平衡供需——每跑一次成对评测得 1 信用,可用于换取等量”自己策略 vs 池内策略”的成对比较;多机构还”赞助”一批免费评测预算,让无真机的研究者也能参与。
评测 benchmark
核心实验(RoboArena 评测的是”评测方法本身”,以 oracle 穷举排名为金标准):
- 排名准确性(RQ1):以 Pearson $r$ 与 MMRV 衡量各方法排名与 oracle 排名的一致性。结论——传统”常规评测”(Regular,因复现难而只覆盖少量任务/环境)不能可靠估计通才策略性能;本作任务感知法(TASK)排名最准,优于标准 Elo 与常规 BT;进度分平均(PROG)相关性也不错,但会丢失更细的偏好信息。(注:$r$/MMRV 的具体数值只在论文 Figure 6/7 的图中给出,正文未列表格数字,此处只能转述定性排序。)
- 样本效率(RQ2):RoboArena 在约 100 次成对比较内即收敛到高质量排名,收敛速度与常规评测相当,但排名质量显著更高;比较越多质量继续提升(Figure 7)。
- 排名结论符合先验:oracle 与 TASK 排名一致地显示——表达力强的动作表征优于简单 binning;离散动作分词(FAST、FSQ)在语言条件评测中优于扩散策略(Flow / π0-DROID);最强策略为
π0-FAST-DROID。 - 质性分析质量(RQ3):VLM 任务分类准确率约 95%(Figure 8 标注 GPT-4o、448 样本、94.6%,与人类专家标注对比);LLM 生成的 policy report 中”π0-FAST-DROID 优于/持平/劣于其他策略”的比较性论断,绝大多数被评测数据里对应的胜率支持(Figure 9)。
- 策略强弱画像(Appendix F):自回归策略(PG-FAST、PG-FAST+、π0-FAST)在 pick-and-place / 堆叠 / 分类上胜率更高(语言跟随更精确);扩散策略(PG-flow、π0-flow)在流畅连续运动如滑动/擦拭上更好,但在需精确语言指令的任务(如敲倒指定物体)落后;binning 策略(PG-Bin)几乎全面垫底,常出现不动作/低完成。整体:直接物体操作(抓放、推、开合)比工具使用、布料操作、复杂语义理解可靠得多;变形物体(折叠、覆盖)与工具动作(擦、舀)仍是主要难点,常见部分动作或”冻结”。
创新点与影响
贡献:
- 首个”真机机器人版 Chatbot Arena”——用去中心化、双盲、成对偏好评测替代集中式标准化,天然获得开放式(任务不设限)、鲁棒(无单点操纵)、可扩展(跨机构异步)、自适应(任务随策略能力前沿演进)四性质。
- 任务感知的 Bradley-Terry 扩展:仅凭偏好数据即可把”策略能力”与”任务难度/策略-任务交互”解耦($\theta$ vs $\tau,\nu,\psi$),比朴素 Elo/BT 排名更准;EM + clipped Newton 拟合。
- LLM/VLM 辅助的质性策略报告:把数百段 rollout 视频 + 语言反馈自动汇总成带证据引用(可点开视频核验)的策略强弱报告,替代”研究者亲自跑完所有评测才形成直觉”的旧范式。
- 产出迄今最全面的通才策略真机评测数据(4284 rollout),并开源整套系统 + 公开全部评测供社区审计,让无真机的研究者也能训练并评测真机通才策略。
改变了什么:把 LLM 社区成熟的”arena 式偏好排名”正式引入具身智能真机评测,给通才策略提供了一个跨机构、可持续、可审计的公共 leaderboard(计划运行至 2026 年 12 月)。
真实世界的 Goodhart 验证(项目页 ~2026-02 更新):论文自己在 Limitations 里预警了”度量一旦成为目标就失效”(Goodhart’s law);上线后果然观察到 benchmark 操纵证据。团队据此改为只接受”与提交策略无利益关系的第三方评测者”,并追溯剔除”评测模式可疑”的机构——判据之一是请求评测的完成率 < 20% 即标记,追溯自 2026-04-02 起的评测。这既印证了其局限,也展示了去中心化 + 全公开评测下社区监督的自净能力。
作者自陈局限:
- 跨具身:实验只在 DROID 单一具身上;如何扩展到多具身、以及支持只能在特定具身上评测的策略,留待未来。
- 受控实验难:不设限的去中心化设计难以”只变单一变量”(如只变相机角度/物体位置),因此与聚焦单一泛化轴的小规模针对性评测互补。
- 对抗性评测者:双盲 + 分布式对单点影响有天然鲁棒性,但未研究对”故意给随机偏好/误导性语言反馈”的对抗者的鲁棒性(上线后确实出现,见上)。
- 过度优化 / Goodhart:crowd-sourced 评测同样可能被过拟合;当前策略性能有限使风险较低,但需持续检验排名是否仍与真实感知的策略性能相关。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2506.18123 (CoRL 2025)
- 论文 PDF:https://arxiv.org/pdf/2506.18123
- 项目主页:https://robo-arena.github.io/
- 代码(GitHub):https://github.com/robo-arena/roboarena
- Leaderboard:https://robo-arena.github.io/leaderboard | A/B 评测查看器:https://robo-arena.github.io/results
- 提交策略:https://robo-arena.github.io/submit | 报名评测者:https://robo-arena.github.io/volunteer
- 评测数据 Dump(HF dataset):https://huggingface.co/datasets/RoboArena/DataDump_02-03-2026
- 仿真评测仓库:https://github.com/arhanjain/sim-evals | 基线训练(openpi π0-FAST-DROID):https://github.com/Physical-Intelligence/openpi
- DROID 数据集/平台:https://droid-dataset.github.io/
一手源存档(sources/)
- roboarena—project-page — 项目主页快照(robo-arena.github.io,含 2026-02 benchmark 操纵/追溯剔除整改声明、作者列表、TL;DR、资源链接、引用)
- roboarena—github-readme — GitHub README 快照(robo-arena/roboarena,策略服务器接口
PolicyServerConfig、WebSocket 托管、仿真评测与 openpi 训练指引) - arXiv 原文 PDF(2506.18123,arXiv 原文 PDF,不入 git):见上方 arXiv 链接