一句话定位
SAM-E 把 RVT 式多视角虚拟渲染架构里的视觉编码器换成预训练 Segment Anything(SAM)ViT-B 图像编码器(LoRA 微调,rank 4),再给动作头加上时间维度通道,一次前向预测一段长度 5 的动作序列(而非逐步预测单个动作):RLBench 18 任务/249 变体上平均成功率 70.6%,比 RVT 高 7.7 个绝对点(62.9%,相对提升 12.2%),比 PerAct 高 21.2 个绝对点(49.4%,相对提升 43.0%),推理步数总和从 RVT 的 6158 步降到 1130 步(约 5.5 倍效率提升);在 6 个未见任务的少样本适配(10 倍更少示范、15 倍更少更新步)上以 63.2% 大幅超过 RVT 适配后的 37.1%(+26.1 点,相对 70.4%)。
背景与定位
2023 年前后 3D 操作策略主要分两条范式:一是以 PerAct、C2F-ARM 为代表的体素化 3D 表征路线,3D 推理能力强但体素数量随分辨率立方增长、训练极慢(PerAct 需 8×V100 训练 16 天);二是纯 2D 视角式方法,训练快但缺乏精确 3D 定位能力。RVT(Goyal et al., 2023)提出把传感器点云重渲染为围绕机器人底座的多个虚拟正交视角图像、交给多视角 Transformer 联合处理,用”渲染解耦”把训练成本从体素方法的立方级降到接近视角式方法的量级,同时刷新精度(比 PerAct 相对提升 26%、训练加速 36 倍)。
SAM-E 站在 RVT 的多视角 Transformer 架构之上做两处改动:(i)用预训练视觉基础模型 Segment Anything(SAM, Kirillov et al., 2023)替换 RVT 从零训练的视觉编码器——SAM 的 prompt-driven 架构和海量图像/掩码预训练带来更强的场景理解与跨任务泛化,通过 LoRA 参数高效微调把它适配到具身场景;(ii)针对长时序推理效率问题,提出一种”动作序列建模”:基于一个”最优动作序列具有时间平滑性”的假设(末端执行器位置在相邻关键帧间变化平滑,旋转的平滑性弱于位置),设计多通道 heatmap 让动作头一次预测长度为 h 的动作序列并顺序执行,而非 RVT/PerAct 那样逐关键帧单步预测。这一”动作分块”(action chunking)思路与 2D 操作里的 ACT/RoboAgent 一脉相承,SAM-E 把它显式建模为 3D 多通道 heatmap 的时间维度扩展。
同期相关工作里,R3M、CLIP、DINO 是三种可替换的通用/操作专用视觉表征,SAM-E 把它们全部作为消融基线对比;SAM-G(Wang et al., 2023b)是同期用 SAM 做具身表征的另一项工作,但它用点提示生成掩码图像去噪 2D 操作/移动任务的视觉输入,与 SAM-E 面向 3D 多视角提取任务相关特征的定位不同。RoboFlamingo(Li et al., 2024)用 OpenFlamingo 微调具身数据,但局限于 2D 操作、缺乏显式 3D 几何建模。
模型架构
感知骨干:SAM 的图像编码器——一个预训练自 MAE(He et al., 2022)的 ViT-B Vision Transformer,含 12 层 Transformer block,输出 C×H×W 图像嵌入。冻结原始权重,仅用 LoRA(rank r=4) 在自注意力模块的 Q、V 投影层上插入可训练低秩旁路 ΔW=BA(A 高斯初始化、B 零初始化),K 投影保持冻结不加 LoRA——消融显示只加 Q、V 优于同时加 Q、K、V(与原始 LoRA 论文观察一致)。
多视角 Transformer:视觉观测经 SAM 编码器得到图像嵌入,深度和坐标信息经 Conv2D 得到 3D 空间特征,两者在通道维度拼接成”view token”;语言指令经预训练 CLIP 文本编码器生成语言 token。先做同视角内的 view-wise attention(类 ViT,保留单视角信息),再做跨视角注意力(同时纳入语言 token),完成跨视角场景信息与语言指令的融合。
动作头(多通道 heatmap,核心创新):8 维动作 = 6-DoF 末端执行器目标位姿(3 平移+3 旋转)+ 夹爪开合二值 + 碰撞许可二值。位置预测:每个视角的 view token 生成一张 heatmap,为动作序列的时间维度额外加通道(即一次输出 h 个时间步的 heatmap),再跨视角反投影到离散 3D 点集合上打分确定 3D 位置。旋转预测:延续 PerAct/RVT 的做法,把欧拉角离散成 5° 一格的 bin 做分类;用位置 heatmap 作为权重从 view token 里加权提取视角特征,再过全连接网络输出旋转、夹爪状态、碰撞标志的序列。
动作序列长度 h:默认 h=5(消融测试 {1,3,5,7},h=5 在 18 任务平均成功率上最优)。可变长度的动作序列数据:短于 h 时 mask 掉未训练的动作头位置,长于 h 时截断。
参数规模(Table 1/4):SAM-E 总参数 122.5M,可训练参数 35.7M(LoRA 旁路 + 多视角 Transformer + 动作头,SAM 主干冻结);对照基线 RVT 可训练参数 36.3M;去掉预训练 SAM、视觉编码器从零训练的变体 SAM-E(SAM→RVT) 总参数/可训练参数均为 35.6M。仅支持单臂 Franka Panda 平行爪,论文未涉及跨本体(cross-embodiment)设计。
数据
仿真训练(RLBench):与 RVT、PerAct 完全相同的数据集——18 个任务、249 个变体(涵盖放置、颜色、尺寸、类别、计数、形状六类变化维度),每任务 100 条专家示范(共 1800 条)。4 个 RGB-D 相机(左肩/右肩/前/腕部),128×128 采集分辨率,遵循 RVT 的重渲染方式转成立方体正交投影虚拟图像后再喂给模型。
关键帧/序列切分的关键差异:RVT 和 PerAct 把示范切成关键帧转移并对”重要转移”做经验性的复制增强;SAM-E 不做这种复制,而是把每条示范无缝拆分成多个关键帧子序列(sub-episodes),以支持动作序列(长度 h)的预测目标。
少样本适配数据:6 个 RLBench 新任务(meat on grill / open jar / screw nail / toilet seat down / tv on / solve puzzle),示范量为多任务训练的 1/10(约 10 条/任务),更新步数为多任务训练的 1/15(4K vs 60K 步,对应训练轮数 1 epoch vs 15 epoch)。
真实世界数据:Franka Panda 机械臂,两个静态 RGB-D 相机(左前、右前视角,标定至机器人底座坐标系)。5 个任务 × 10 条示范 = 共 50 条:把毛巾放到柜子上、堆叠积木块、关抽屉、拿起香蕉、把橙子放进抽屉。示范采集方式为人工用控制器远程操控机械臂(非运动学示教),同步记录 RGB-D 流与机器人关节位姿。仿真与真实数据分开训练,不做联合 co-training。
训练方法
目标函数:标准模仿学习(行为克隆)最大似然目标(Eq.1),在关键帧提取(joint velocity 接近零,或夹爪状态改变)之后,把动作预测目标从”预测下一个关键帧动作”扩展为”预测未来 h 个关键帧动作序列”。
LoRA 微调:冻结 SAM ViT-B 编码器全部原始权重,仅训练插入自注意力 Q、V 投影的 LoRA 低秩旁路(rank=4)+ 多视角 Transformer + 动作头,共 35.7M 可训练参数(占总参数 122.5M 的约 29%)。消融对比:LoRA(Q,V) 优于 LoRA(Q,K,V)(69.2%)、优于冻结不微调(67.2%)、也优于全参数微调(65.8%,作者认为示范量有限时全量微调容易过拟合/失败)。
超参数(Table 8,多任务训练 / 少样本适配):batch size 10;学习率 4e-3;优化器 LAMB;学习率调度 cosine decay,warmup 2000 步;训练步数 60K / 4K;训练轮数 15 epoch / 1 epoch。多任务训练取最后一个 checkpoint(60K 步)评测,与 RVT 保持一致。
动作序列长度消融:h∈{1,3,5,7},h=5 综合最优;h=1 反而性能下降(作者归因于时间信息不足以驱动 SAM 基础模型训练,且缺少 RVT/PerAct 式重要关键帧复制增强)。
Infra(训练 / 推理工程)
- 训练硬件/GPU 数量/GPU-hours:论文正文未披露具体 GPU 型号、数量或训练总耗时(仅定性声称”SAM-E 与 RVT 训练时间相当,可训练参数更少”,Figure 5 训练曲线里 RVT 为作者复现官方代码所得,同样未标注硬件)。GitHub 训练脚本示例命令
--device 0,1,2,3使用 4 个 GPU(README 示例,非论文实际训练配置的确认数字)。 - 推理延迟(Table 5,同一设备测量):预测一次动作序列(h=5,5 个动作)耗时 152ms;RVT 逐步预测 5 个动作需 5×103ms=515ms(RVT 单步 103ms)。h=1/3/7 分别为 126ms/144ms/156ms——序列长度增加对单次推理延迟影响较小,但换算到”每个动作”的均摊延迟大幅下降。
- 执行效率(Table 2 Inference Steps Sum):18 任务评测总推理步数,RVT 6158±64 步 vs SAM-E 1130±12 步,约 5.45 倍减少;在 meat off grill / push buttons / put money in safe 等任务上 SAM-E 仅需一次前向(“一瞥”即可完成任务),RVT 平均需 5.5/3.8/6.0 步。
- 具体推理硬件型号:论文未披露。
评测 benchmark
RLBench 18 任务多任务学习(Table 2,PerAct/RVT 分数取自 Goyal et al. 2023 原文,5 次评测均值±标准差):
| 方法 | 18 任务平均成功率 | 推理步数总和 |
|---|---|---|
| PerAct | 49.4 | - |
| RVT | 62.9 | 6158±64 |
| SAM-E (SAM→RVT,无预训练编码器) | 65.3±0.6 | 1190±19 |
| SAM-E (SAM→R3M) | 66.5±1.0 | 1165±63 |
| SAM-E (SAM→CLIP) | 64.8±0.9 | 1192±17 |
| SAM-E (SAM→DINO) | 67.1±0.4 | 1143±15 |
| SAM-E(完整模型) | 70.6±0.7 | 1130±12 |
SAM-E 在 14/18 个任务上同时超过 PerAct 和 RVT,部分任务提升超过 30 个百分点(如 Screw Bulb: RVT 48.0→SAM-E 78.4,Insert Peg: RVT 11.2→SAM-E 18.4);另外 4 个任务上 SAM-E 未能同时超过两个基线:Place in Shape Sorter(RVT 36.0 vs SAM-E 34.4,小幅落后)、Stack Blocks(RVT 28.8 vs SAM-E 26.4,小幅落后)、Place Cups(RVT 4.0 vs SAM-E 0.0,落后)、Stack Cups(RVT 26.4 vs SAM-E 0.0,明显退步)。
少样本适配到 6 个新任务(Table 3):从零训练时 SAM-E 42.4±1.5 对 RVT 39.3±2.3(+3.1 点,相对+7.9%);用多任务权重初始化后适配(15 倍更少更新步、10 倍更少示范)时 SAM-E 63.2±1.5 对 RVT 37.1±1.0(+26.1 点,相对+70.4%)——RVT 适配后反而低于从零训练(37.1 vs 39.3),显示其难以跨任务迁移知识,而 SAM-E 从适配中显著受益。
LoRA/微调方式消融(Table 4,18 任务平均):SAM-E(LoRA,Q/V) 70.6±0.7(122.5M/35.7M) > LoRA(Q,K,V) 69.2±0.9(122.6M/35.8M) > 冻结不微调 67.2±1.0(122.4M/35.6M) > 全参数微调 65.8±1.0(122.4M/122.4M) > 无预训练编码器(SAM→RVT) 65.3±0.6(35.6M/35.6M)。
动作序列长度消融(Table 5):RVT 62.9/103ms;h=1 30.6±1.4/126ms;h=3 64.0±0.6/144ms;h=5 70.6±0.7/152ms(最优);h=7 66.5±1.2/156ms。
与 Hiveformer 对比(Appendix Table 9,10 个任务、每任务 100 条示范;Hiveformer 分数取自原论文,但 Hiveformer 每任务仅单一变体,比 SAM-E 训练全部变体更容易):Hiveformer 平均 83.3,SAM-E 平均 88.6±0.7。
真实世界实验:5 任务(毛巾上柜、堆积木、关抽屉、拿香蕉、放橙子入抽屉)× 10 示范,论文仅定性描述”能实时预测并有效完成任务”,未给出量化成功率数字(成功/失败案例以视频形式呈现于项目页)。
创新点与影响
贡献:(1)首次把 Segment Anything 这一图像分割基础模型引入 3D 多视角操作策略,用 LoRA 参数高效微调(仅 Q/V 投影、rank 4)把 SAM 的 promptable、object-oriented 表征迁移到具身场景,验证视觉基础模型对操作策略泛化能力的价值;(2)基于”最优动作序列时间平滑”假设,提出多通道 heatmap 的动作序列预测头,把 2D 操作里常见的 action chunking 思路显式扩展到 3D 多视角 heatmap 检测框架,一次前向预测多步动作,既提升长时序推理的连贯性也大幅降低推理步数(约 5.5 倍)。
改变了什么:在 RVT 建立的”渲染再多视角”范式基础上证明了两件事可以叠加收益——预训练视觉基础模型(相对从零训练/R3M/CLIP/DINO 编码器)和动作序列建模(相对逐步预测)分别独立带来性能提升,二者结合后在少样本适配到新任务上的优势尤其显著(RVT 适配后反而不如从零训练,SAM-E 适配后大幅超越从零训练),说明预训练基础模型表征对新任务泛化的贡献在小样本场景下被放大。
作者自陈局限(Appendix H):(1)受限于相对有限的机器人数据做参数高效微调,未探索用更大规模数据集(如 Open-X-Embodiment)进一步发挥视觉基础模型的可扩展性;(2)动作序列长度 h 是固定超参数,虽然整体有效,但对某些任务(如 Stack Cups,实验中 SAM-E 完整模型成功率降到 0)可能并不合适,作者认为让 h 可学习/自适应地权衡精度与连贯性是有意思的未来方向。
原始链接
- arXiv:https://arxiv.org/abs/2405.19586 (PDF:https://arxiv.org/pdf/2405.19586)
- 项目页:https://sam-embodied.github.io/
- 代码:https://github.com/pipixiaqishi1/SAM-E (官方仓库,含训练/评测脚本与多任务 checkpoint 下载链接)
一手源存档(sources/)
- sam-e—project-page — 项目主页快照(含作者列表、方法概览、真实世界实验说明,fetched 2026-07-16)
- sam-e—github-readme — GitHub
pipixiaqishi1/SAM-EREADME 快照(含安装/训练/评测命令,fetched 2026-07-16) - 论文全文见上述 arXiv 链接(arXiv 原文 PDF,不入 git;已读 v1 全文 HTML + PDF 抽取文本,含正文全部表格与附录 A-H)