一句话定位
Stanford CRFM 与 UC Berkeley 团队提出 RoboReward——一个把 Open X-Embodiment(OXE)与 roboarena 两大真机语料改造成”奖励模型训练/评测数据集”的方法与基准:用”反事实重标注 + 时序截断”的”逆向 HER”负样本增广管线,把成功样本占主导的 OXE 转成正负均衡的 54,135 条打分数据,训出 RoboReward 4B/8B(微调 Qwen3-VL),在覆盖 22 个前沿 VLM、2,831 条人工核验测试集的 RoboRewardBench 上排名第一,并在真机 WidowX 强化学习中验证奖励质量能直接转化为策略提升。
背景与定位
真机强化学习长期受限于奖励信号:要么靠人工逐幕打分(劳动密集),要么靠手工设计的、脆弱的奖励函数(需要大量调参)。VLM 作为”零样本奖励模型”这条路此前已有不少探索(Rocamonde et al. 2023 的 VLM-RM、RoboCLIP、RL-VLM-F 等),但大多针对单一机器人/单一任务训练单个奖励模型,缺少跨任务、跨具身的系统评测。RoboReward 把这条路线系统化:它是第一个评测 22 个现代 VLM(含 GPT-5 系列、Gemini 3/2.5 系列、Gemini Robotics-ER 1.5、Qwen2.5/3-VL、Llama 4)作为通用具身奖励模型的基准,并给出一套可复用的”成功样本→负样本”数据增广方法。
与最相关的两支工作对比:(1)Robo-Dopamine(Tan et al. 2025,arXiv:2512.23703)是同期工作,做高精度操作的过程奖励建模,但论文写作时其数据集/权重未发布,故未被纳入评测;(2)OpenGVL leaderboard 只用成功演示评测 VLM 作为”价值函数”(Value-Order Correlation),仅 6 个任务、14 个 VLM,而 RoboRewardBench 同时评测成功与失败轨迹、覆盖 22 个 VLM 和更广的任务/具身分布,并公开全部 prompt、视频与原始生成结果。
范式关键词:VLM-as-reward-model、offline reward benchmark、inverse hindsight experience relabeling(反向 HER)、离线奖励精度—在线 RL 表现相关性。作者:Tony Lee(Stanford,通讯)、Andrew Wagenmaker(UC Berkeley,通讯)、Karl Pertsch(UC Berkeley/Stanford,通讯)、Percy Liang(Stanford)、Sergey Levine(UC Berkeley)、Chelsea Finn(Stanford)。基准依托 Stanford CRFM 的 HELM 评测框架搭建排行榜(致谢 HELM 维护者 Yifan Mai);资助方 ONR、Toyota Research Institute。
模型架构
RoboReward 不是新的策略/世界模型架构,而是把通用 VLM 改造为”情景末态进度打分器”:
- 骨干:分别微调 Qwen3-VL Instruct 的 4B 和 8B 版本(Bai et al. 2025a),冻结视觉编码器,只微调融合层与 LLM 层。
- 输入:任务自然语言指令 + 机器人 rollout 视频。视频统一按 1 FPS 采样为图像帧序列(含真实末帧),不做逐步(per-step)奖励,只做情景级(episodic)末态奖励。
- 输出:离散 5 档进度分 {1,…,5},对应固定 rubric——1 无进展 / 2 极小进展 / 3 部分完成(违反≥1 项主要或多项要求)/ 4 接近完成(仅缺 1 项次要要求)/ 5 完美完成。推理提示词格式为
ANSWER: <score>(HF 模型卡给出的官方推理 prompt)。 - 奖励类型选择的前置实验:作者先在 Robomimic 仿真(Lift/Can/Square 三个操作任务)上用 DSRL(Wagenmaker et al. 2025)微调扩散策略,对比三种奖励:二值成功、连续进度、离散 5 档进度。结果显示离散/连续进度奖励收敛速度相近且明显快于二值成功奖励,因此选择离散 5 档进度作为 RoboReward 的奖励形式(比连续值更易人工标注一致)。同时测得奖励模型准确度(MAE)与下游 RL 表现的相关系数 r = 0.83。
数据
- 数据源:(1)Open X-Embodiment(OXE):约 100 万条真机演示,跨 22 种机器人具身、数十个原始数据集;由于同一子数据集内高度重复,每个子数据集统一子采样至最多 1200 条以降低过拟合;OXE 全部为成功演示,原始奖励标为 5。(2)RoboArena(Atreya et al. 2025,DROID/Franka 平台):真实策略两两评测数据,人类评审员对每条 rollout 给出 [0,100] 进度分,映射到离散 1-5;因重复度低、天然含成功与失败,RoboArena 全量数据未做子采样。
- 负样本数据增广(“逆向 HER”):因 OXE 严重偏向成功样本,论文提出两种从同一视频生成负例的方法(不新增任何视频):
- 反事实重标注(counterfactual relabeling):固定视频,用多阶段 VLM/LLM 流水线生成新的失败/部分完成指令——(1) GPT-5-mini 对视频做详细描述;(2) GPT-5-mini 规划 4 个严格递增(1<2<3<4)的失败模式;(3) Qwen3-4B-Instruct-2507 逐档生成一条祈使句指令;(4) GPT-5-mini 做最终一致性校验,不通过则重新生成。
- 时序截断(negative clipping):把同一条成功 rollout 截断到早/中/晚等不同时间点,任务指令不变,产生”进度不足”的负例。
- 两类增广样本都要经过 VLM 校验步骤(检查指令是否与视频连贯、评分是否符合 rubric)才保留。
- 规模:总计 54,135 条样本,其中训练集 45,072、验证集 6,232、测试集 2,831。切分按原始任务描述做互斥划分(train/val/test 任务描述不重叠),避免任务级数据泄漏。
- 人工核验测试集(RoboRewardBench):测试集全部由人工标注员核验”末态奖励标签是否与视频/任务描述吻合”(标注界面同时展示 rubric 与 GPT-5-mini 的校验理由),不通过的样本被剔除,最终得到 2,831 条人工核验样本,覆盖 14 种具身类型、外视角(exocentric)与自视角(egocentric)混合视角。
- 数据来源明细(Table 4,数据源(具身/视角,train/val/test)节选,按训练集规模排序):RoboArena(DROID/Franka,Mix 视角,7337/1000/1000);RT-1 Robot Action(Google Robot,Exocentric,3988/461/100,谷歌微型厨房 17 种物体的拾取/放置/搬运);Berkeley Bridge(WidowX,Exocentric,3826/496/100,厨房/水槽/桌面场景的物体重排、扫扣、堆叠、折叠、开关抽屉);TOTO(Franka,Exocentric,2986/0/0,舀取与倾倒);DROID(Franka,Exocentric,3071/378/100,多样化家居操作);Freiburg Franka Play(Franka,Egocentric,2856/352/91,玩具积木拾放/堆叠/开抽屉/滑门/按按钮);USC Jaco Play(Jaco 2,Exocentric,2428/417/100,桌面玩具厨房拾放);Berkeley Autolab UR5(UR5,Egocentric,2388/430/100,含 6 自由度精细抓取瓶子);UCSD Pick Place(xArm,Exocentric,2384/0/100);NYU VINN(Hello Stretch,Egocentric,2369/0/0,开关多种柜门);Austin Sirius(Franka,Exocentric,1355/0/87,kcup 与齿轮插装);CMU Play Fusion(Franka,Exocentric,1269/358/92,烧烤/摆桌/洗碗多场景);Berkeley MVP(xArm,Egocentric,1218/228/71);CMU Franka PickInsert(Franka,Exocentric,1193/374/83);Berkeley RPT(Franka,Egocentric,1069/364/86);Berkeley Fanuc Manipulation(Fanuc,Exocentric,860/287/91);Roboturk(Sawyer,Exocentric,1463/0/97);Stanford HYDRA(Franka,Exocentric,507/203/91,咖啡机/烤面包机/摆放餐具);KAIST Nonprehensile Objects(Franka,Exocentric,406/162/53);UCSD Kitchen(xArm,Exocentric,393/122/95);Tokyo PR2 Tabletop Manipulation(PR2,Exocentric,293/325/73);Austin VIOLA(Franka,Exocentric,167/239/60,摆桌/煮咖啡);其余规模较小的来源(均<400 条 train)还有 Tokyo PR2 Fridge Opening、UTokyo xArm PickPlace/Bimanual、DLR Wheelchair Shared Control(DLR EDAN)、Austin BUDS、LSMO(Cobotta)、NYU ROT。全部约 29 个数据源(RoboArena + 28 个 OXE 子数据集),具身涵盖 Franka、WidowX、xArm、Sawyer、UR5、PR2、Jaco 2、Cobotta、Fanuc、Google Robot、Hello Stretch、DLR EDAN、Dual xArms 等。
训练方法
- 目标:给定(任务指令,rollout 视频)预测离散 1-5 进度分,按标准分类/回归 loss 微调(论文未指明具体 loss 形式,仅描述监督信号为离散标签)。
- 训练配置:3 个 epoch,cosine 学习率衰减,warmup ratio 0.05,weight decay 0.05,梯度裁剪 max norm 1.0,有效 batch size 32(梯度累积);学习率 4B 模型 3×10⁻⁶,8B 模型 5×10⁻⁶;按验证集 MAE 最小选最优 checkpoint。
- 数据增广流水线本身”离线且高成本”:多阶段(视频分析→rubric 规划→约束指令生成→拒绝式校验)调用大模型,速度慢、不适合直接嵌入 RL 循环;论文将其定位为”教师”,把弱但经过校准的监督蒸馏进单次前向推理的开源奖励模型,以便在 RL 循环中重复调用。
- 文本清洗:用 Qwen3-4B-Instruct-2507(纯文本)对任务指令做”语义不变”改写(修正拼写/语法,如 “palce dishes” → “place the dishes”),不改变语义。
- 真机 RL 验证实验(第 5.2 节):用 DSRL(Diffusion Steering RL,Wagenmaker et al. 2025)微调一个在 BridgeData V2 上预训练的多任务扩散策略(骨干为 Dasari et al. 2025 的 diffusion transformer),对比三种奖励来源——人类打分(oracle)、RoboReward 8B(零样本、未再微调)、Gemini Robotics-ER 1.5(零样本、未再微调)。每个任务先跑 20 次基础策略预热回放缓冲区,再训练 6000 步,每幕最多 70 步。
Infra(训练 / 推理工程)
- RoboReward 4B/8B 微调的 GPU 型号、卡数、总训练时长均未披露。
- 数据增广流水线的推理成本:反事实重标注/校验调用 GPT-5-mini(API)+ Qwen3-4B-Instruct(本地/API 均可,论文未指明部署方式)——具体 QPS/总调用次数未披露。
- RoboRewardBench 评测:所有 22 个模型均为零样本推理,视频统一按 1 FPS 抽帧输入;开源模型(Qwen 系列、Llama 4)的推理硬件/并行度未披露,闭源模型(GPT-5 系列、Gemini 系列)通过官方 API 调用。
- 真机 RL 实验硬件:WidowX 250 6-DoF 机械臂;基础扩散策略超参——batch size 2048,lr 3×10⁻⁴,训练 100,000 步,cosine 调度,warmup 2000 步,action chunk size 1,训练期 100 步去噪 / 推理期 8 步去噪,ResNet-34 图像编码器,transformer hidden size 256、1 头、3 层,前馈维度 512;DSRL 微调阶段 hidden size 1024,每次更新 30 个梯度步,discount 0.97,action magnitude 1.5。控制频率(Hz)/端到端推理延迟未披露。
评测 benchmark
RoboRewardBench 全量排名(22 模型,论文 Table 7,MAE 越低越好,以论文提交时的静态快照为准):
| 排名 | 模型 | 机构 | 参数量 | 访问方式 | MAE |
|---|---|---|---|---|---|
| 1 | RoboReward (8B) | 本文 | 8B | 开源 | 0.665 |
| 2 | GPT-5 mini (2025-08-07) | OpenAI | – | 受限 API | 0.691 |
| 3 | GPT-5 (2025-08-07) | OpenAI | – | 受限 API | 0.811 |
| 4 | RoboReward (4B) | 本文 | 4B | 开源 | 0.845 |
| 5 | Gemini 3 Pro (Preview) | Google DeepMind | – | 受限 API | 0.851 |
| 6 | GPT-5.2 (2025-12-11) | OpenAI | – | 受限 API | 0.887 |
| 7 | Qwen3-VL Instruct (8B) | Alibaba | 8B | 开源 | 0.892 |
| 8 | GPT-5.1 (2025-11-13) | OpenAI | – | 受限 API | 0.901 |
| 9 | Gemini 2.5 Pro | Google DeepMind | – | 受限 API | 0.902 |
| 10 | Qwen3-VL Instruct (30B) | Alibaba | 30B | 开源 | 0.903 |
| 11 | Gemini Robotics-ER 1.5 | Google DeepMind | – | 受限 API | 0.906 |
| 12 | Gemini 3 Flash (Preview) | Google DeepMind | – | 受限 API | 0.917 |
| 13 | Gemini 2.5 Flash | Google DeepMind | – | 受限 API | 0.943 |
| 14 | Gemini 2.5 Flash-Lite | Google DeepMind | – | 受限 API | 0.990 |
| 15 | Qwen2.5-VL Instruct (72B) | Alibaba | 72B | 开源 | 0.991 |
| 16 | Qwen3-VL Instruct (4B) | Alibaba | 4B | 开源 | 1.032 |
| 17 | Qwen2.5-VL Instruct (32B) | Alibaba | 32B | 开源 | 1.137 |
| 18 | Qwen2.5-VL Instruct (7B) | Alibaba | 7B | 开源 | 1.172 |
| 19 | Llama 4 Maverick Instruct | Meta | – | 开源 | 1.271 |
| 20 | GPT-5 nano (2025-08-07) | OpenAI | – | 受限 API | 1.295 |
| 21 | Llama 4 Scout Instruct | Meta | – | 开源 | 1.485 |
| 22 | Qwen2.5-VL Instruct (3B) | Alibaba | 3B | 开源 | 1.607 |
要点:
- RoboReward 8B 全场最优(0.665),优于所有前沿 VLM,含 GPT-5 mini(0.691)、Gemini 2.5 Pro(0.902)、Gemini 2.5 Flash(0.943)。在最大且最”天然”的子集 RoboArena(1000 条)上同样最优(0.768),优于 GPT-5 mini(0.862)、GPT-5(1.028)、Gemini Robotics-ER 1.5(1.002)。
- 同架构下监督收益显著:RoboReward 8B 相对基座 Qwen3-VL Instruct (8B) 提升 0.227 MAE(0.892→0.665,RoboArena 子集 0.847→0.768);RoboReward 4B 相对基座 Qwen3-VL Instruct (4B) 提升 0.187 MAE(1.032→0.845,RoboArena 子集 0.929→0.806)。
- 专为具身推理训练的模型未必占优:Gemini Robotics-ER 1.5 是专门在机器人数据上训练、面向具身推理/进度估计的旗舰模型,但总体 MAE 0.906,排名 11/22。
- 非均匀的泛化差距:GPT-5 在 Austin Sirius(0.310)、Austin VIOLA(0.283)子集上很强,但在 Berkeley RPT(1.174)、Tokyo PR2 Tabletop Manipulation(1.366)、RoboArena(1.028)上明显更差;Gemini 3 Pro (Preview) 在 Berkeley RPT(0.395)、UCSD Pick Place(0.37)上最优,但在 Berkeley MVP(1.394)、KAIST Nonprehensile Objects(1.491)上大幅退化;即便是总体最优的 RoboReward 8B,在 UTokyo xArm Bimanual(绝对误差 1.394)与 Stanford HYDRA(0.890,该子集排名仅 8/22,子集最优 Gemini 2.5 Pro 为 0.495)上也明显偏弱。
数据增广消融(4B 模型,Table 3):
| 数据配比 | Overall MAE↓ | RoboArena MAE↓ |
|---|---|---|
| 完整(反事实重标注 + 时序截断 + RoboArena) | 0.845 | 0.806 |
| 去掉负样本增广(仅 RoboArena + 原始成功 OXE) | 1.450 | 0.797 |
| 去掉时序截断(保留反事实重标注) | 1.075 | 0.813 |
要点:仅用 RoboArena 天然失败样本训练,在 RoboArena 子集上误差几乎不变(0.797 vs 0.806),但整体基准误差暴涨(1.450 vs 0.845)——说明单一平台的天然失败覆盖不足以支撑跨具身泛化;去掉时序截断同样明显伤害整体表现(1.075 vs 0.845)而对 RoboArena 影响很小(0.813 vs 0.806),说明截断负例主要贡献”覆盖广度”。
真机 RL 实验(WidowX,20 次试验/设置,Table 2):
| 奖励来源 | Pick-and-place monkey | Open drawer |
|---|---|---|
| Base policy(未 RL) | 5% | 10% |
| Human(oracle) | 75% (+70) | 90% (+80) |
| RoboReward 8B | 50% (+45) | 80% (+70) |
| Gemini Robotics-ER 1.5 | 10% (+5) | 45% (+35) |
RoboReward 8B 驱动的 RL 把基础策略成功率从 5%/10% 分别提升到 50%/80%,大幅优于用 Gemini Robotics-ER 1.5 做奖励(仅 10%/45%,在 pick-and-place 任务上几乎无提升),并显著缩小了与人类打分奖励(75%/90%)之间的差距(尤其在 Open drawer 上仅差 10 个百分点)。模型排序(RoboReward 8B 优于 Gemini Robotics-ER 1.5)与二者在 RoboRewardBench 上的 MAE 排序(0.665 vs 0.906)一致,印证离线奖励精度可预测下游 RL 表现。
失败模式定性分析(附录 B.3):对 Gemini Robotics-ER 1.5 的三个典型错误案例——(1)“拉开抽屉”任务实际失败(抽屉未开、机械爪滑脱)却被打 5/5(假阳性,模型描述中虚构了”手指合拢抓住把手”和”拖拽抽屉”的细节);(2)同一任务实际成功拉开抽屉却只打 2/5(假阴性,描述在”即将抓取”处戛然而止,未追踪到后续开门动作);(3)“把棕色猴子放到黄色毛巾上”任务猴子仍悬空未放下却打 5/5(幻觉出”放置”这一关键事件)。作者认为这类错误反映前沿 VLM 能正确复述场景大意,但在抓取是否牢固、抽屉是否真正打开、物体是否真正放置等细粒度时空细节上仍会出错,这正是 RoboRewardBench MAE 与真机 RL 差距的重要来源。
创新点与影响
- “逆向 HER”负样本增广:不同于 Hindsight Experience Replay 把失败重标为成功以增加正例,本文反其道而行——把成功演示重标为失败/部分成功以平衡数据,且不需要采集任何新视频,只需重新生成指令或截断已有视频。
- 首个 22-VLM 通用具身奖励模型基准:覆盖开源与闭源、跨越 3B 到 72B+ 参数规模、14 种具身、成功与失败混合的 2,831 条人工核验测试集,填补了此前工作(RoboCLIP、RL-VLM-F 等)只针对单一机器人评测单个奖励模型的空白;也比同类 OpenGVL leaderboard(仅 6 任务/14 模型/只用成功样本)更全面。
- 验证离线奖励精度是真机 RL 表现的有效代理指标:仿真(Robomimic,r=0.83)和真机(WidowX)两个尺度上都观察到”奖励模型 MAE 更低 → 下游 RL 策略提升更大”的一致趋势,为”用基准分数预测部署价值”提供依据。
- 小模型(4B/8B)在短时任务奖励打分上反超远大于自己的前沿 VLM(包括 GPT-5、Gemini 3 Pro Preview、专门做具身推理的 Gemini Robotics-ER 1.5),说明针对性的数据监督比单纯堆参数量更有效。
- 论文自陈局限:(1)即便是排名第一的 RoboReward 8B,在若干具身/场景子集上仍显著弱于其他模型(如 UTokyo xArm Bimanual、Stanford HYDRA),说明跨具身泛化仍是共性难题,并非本文方法已解决;(2)负样本标签由多阶段 VLM/LLM 流水线自动生成,不保证完全正确,依赖严格 rubric 校验与 RoboArena 天然数据兜底质量;(3)该标注流水线本身高成本、离线,无法直接嵌入 RL 训练循环,只能作为”教师”蒸馏进单次前向的奖励模型;(4)当前工作仅覆盖短时程(short-horizon)情景末态奖励,作者明确把”长时程、多阶段任务下的信度分配与进度估计”列为未来方向;(5)同期工作 Robo-Dopamine(过程奖励建模)因权重未开源而未能纳入对比评测。
原始链接
- 论文 arXiv:https://arxiv.org/abs/2601.00675(PDF:https://arxiv.org/pdf/2601.00675;提交于 2026-01-02,v2 修订于 2026-01-08)
- 项目页 / HELM 排行榜:https://crfm.stanford.edu/helm/robo-reward-bench/latest/
- 数据集(Hugging Face):https://huggingface.co/datasets/teetone/RoboReward
- 模型权重 RoboReward 8B:https://huggingface.co/teetone/RoboReward-8B
- 模型权重 RoboReward 4B:https://huggingface.co/teetone/RoboReward-4B
- 评测代码依托 Stanford CRFM HELM 框架:https://github.com/stanford-crfm/helm
一手源存档(sources/)
- robo-reward-bench—project-page.md — HELM 项目页快照(摘要、资源链接、实时排行榜 top10)
- robo-reward-bench—hf-dataset-card.md — HF 数据集卡(字段说明、切分规模)
- robo-reward-bench—hf-model-cards.md — HF 模型卡(RoboReward 4B/8B,推理 prompt)
- arXiv 原文 PDF(https://arxiv.org/pdf/2601.00675,arXiv 原文 PDF,不入 git)