一句话定位

RVT 的多视角 Transformer 拆成”编码器+动作解码器”两截,先在 Objaverse 20 万个 3D 物体上对编码器做掩码自编码(遮住 75% 视角 token、重建 5 个正交虚拟视角的 RGB-D 图像),再接回动作解码器去精调 RLBench/COLOSSEUM 任务——用这条”3D 感知的视觉预训练”路线把 RVT 从零训练的 62.9% 平均成功率推到 67.5%,且在 COLOSSEUM 的纹理/尺寸/光照扰动测试上比从零训练的 RVT 更稳。

背景与定位

2D 图像上的掩码自编码(MAE)预训练已经在 R3MMVP 等工作里证明能提升机器人操作策略的泛化,但这些方法预训练的是 2D 视觉编码器(ResNet/ViT),而当时最强的操作策略(RVTAct3DPerAct)都在做显式 3D 建模——2D 预训练出来的表征没有天然的搬运路径接到这些 3D 策略上。3D-MVP 要填的正是这个缺口:选 RVT 而不是 PerAct/Act3D 作为宿主架构,是因为 RVT 把点云重渲染成正交虚拟视角 RGB-D 图像再喂 Transformer,视角式的输入天然适合套用 MAE 这一套”遮块-重建”的预训练范式(PerAct 用体素、Act3D 用连续 3D 特征场采样点,都不是规整的图像网格,MAE 不好直接套用)。

论文的核心操作是把 RVT 端到端的多视角 Transformer 一分为二:编码器只管从 5 个虚拟视角图像里提特征,动作解码器只管把特征映射到 6-DoF 位姿+夹爪状态。这样编码器就可以脱离”语言指令+机器人动作”标注、单独在大规模纯 3D 物体数据集(Objaverse)上做自监督预训练,训练好之后再接回一个轻量解码器去精调具体操作任务——这条”预训练与任务标注解耦”的设计,是 3D-MVP 相对于 RVTPerAct 这些从零训练路线的关键差异。

模型架构

渲染管线:沿用 RVT 的思路,把点云重渲染为 5 个固定正交虚拟相机(上/左/右/前/后)拍到的图像;论文里每个虚拟视角图像给出 10 个通道:RGB(3)+ 深度(1)+ 世界坐标系 3D 点坐标(3)+ 相机传感器坐标系 3D 点坐标(3)。

编码器/解码器拆分:原 RVT 的多视角 Transformer f_θ 被拆成渲染器 R(点云→5 张虚拟图)、编码器 E(虚拟图→latent embedding z∈R^(5N×H))、动作解码器 D(z→动作)三段。预训练阶段只训练 E 加一个独立的轻量 MAE 解码器 D_MAE(重建用,训完即弃);精调阶段把 E 接回原本的动作解码器 D 联合训练。

配置数字:patch size 10×10 做图像 tokenize;编码器 E——8 层、8 个注意力头、隐藏维度 1024 的多视角 Transformer;MAE 解码器 D_MAE——2 层、同样 8 个注意力头(刻意保持轻量,让预训练压力集中在编码器上);掩码比例 0.75(遮住 75% 的视角 token)。虚拟视角具体分辨率、参数总量论文未披露。

动作输出:精调后仍是 RVT 原生的 6-DoF 末端执行器位姿 + 夹爪开合二值状态,语言指令作为解码器的条件输入。仅在单臂 Franka Panda 平行爪上验证,无跨本体设计。

数据

预训练数据:Objaverse,共 80 万+ 3D 物体(带真实纹理材质),从中采样 20 万个高质量模型作为训练集、1000 个作为定性验证集(不做大规模定量验证集,因为预训练阶段的验证只是定性检查重建质量,最终评估留给下游操作任务)。消融里还用了 3D-FRONT(室内场景数据集)和一个 1.8 万物体的 Objaverse 子集(“Objaverse (small)“)做对比。

精调数据(RLBench):与 PerActRVT 相同的 18 个任务,4 个无噪声 RGB-D 传感器相机(前/左肩/右肩/腕部),128×128 采集分辨率,用 CoppeliaSim 仿真。

精调数据(COLOSSEUM)20 个任务,每个任务训练时不加环境扰动、生成 100 条示范;测试时对每个任务施加 12 种环境扰动(物体/背景颜色、纹理、尺寸、光照、干扰物、相机位姿变化,可变对象包括操作物体 MO、承接物体 RO 和桌面),每种扰动生成 25 条示范,失败则最多重试 20 次;个别任务(如 empty dishwasher)因渲染报错被跳过,只报告能成功渲染的设置。

没有的东西:论文没有用真实机器人数据做预训练或精调(早期摘要版本提到的”真实机器人平台”实验在 2025-03 的 CVPR camera-ready 版(v2)里已被移除,最终版只报告 RLBench + COLOSSEUM 两个仿真基准);预训练与精调数据完全解耦,不做联合 co-training。

训练方法

预训练目标:纯自监督掩码自编码——对 5 个虚拟视角图像各自随机遮住一部分 patch token,编码器 E 从遮住后的输入提取 z,MAE 解码器 D_MAE 从 z 重建原始的 5 张完整图像,用逐像素 L2 重建损失联合训练 ED_MAE

精调目标:行为克隆(behavior cloning),把预训练好的 E 接回 RVT 原生动作解码器 D,在人类示范上端到端监督预测动作(延用 RVT/PerAct 的动作监督形式:位姿 heatmap + 离散旋转 bin + 夹爪二值)。

预训练超参:AdamW,学习率 1e-4,权重衰减 0.01,batch size 3,训练 15 epoch

精调超参:LAMB 优化器,学习率 1e-42000 步 warmup + cosine 衰减到 1e-6,batch size 3,RLBench 和 COLOSSEUM 训练集都训 15 epoch(为公平对比 2D 预训练与从零训练的基线,精调协议与 RVT、COLOSSEUM 论文保持一致)。

Infra(训练 / 推理工程)

  • 预训练硬件8× NVIDIA V100(显存规格未在预训练部分注明)。
  • 精调/评测硬件:**8× NVIDIA V100(32GB)**做精调,单张 V100 做评测。
  • GPU-hours / 训练总时长:论文未披露。
  • 并行策略、混合精度:论文未披露。
  • 推理 FPS / 控制频率 / 延迟:论文未披露(RVT 原论文报过 11.6 fps,但 3D-MVP 论文本身没有重新给出自己的推理速度数字,故不代入)。

评测 benchmark

RLBench 18 任务平均成功率(Table 1,与 PerActRVT 同协议评测):

方法平均成功率
Image-BC (CNN)1.3
Image-BC (ViT)1.3
C2F-ARM-BC20.1
PerAct49.4
RVT(从零训练)62.9
3D-MVP(本作)67.5

分任务对比(成功率 %,RVT → 3D-MVP):Close Jar 52.0→76.0、Drag Stick 99.2→100、Insert Peg 11.2→20.0、Meat off Grill 88.0→96.0、Open Drawer 71.2→84.0、Place Cups 4.0→4.0(持平,两者均接近失败)、Place Wine 91.0→100、Push Buttons 100→96.0(3D-MVP 略降)、Put in Cupboard 49.6→60.0、Put in Drawer 88.0→100.0、Put in Safe 91.2→92.0、Screw Bulb 48.0→60.0、Slide Block 81.6→48.0(3D-MVP 明显更差)、Sort Shape 36.0→28.0(3D-MVP 更差)、Stack Blocks 28.8→40.0、Stack Cups 26.4→36.0、Sweep to Dustpan 72.0→80.0、Turn Tap 93.6→96.0。论文指出提升主要来自中等难度任务(如 Insert Peg、Put in Cupboard、Stack Blocks);任务太难(PerAct/RVT 都解不出)或太简单(已 >90% 成功率)时预训练收益有限,个别任务(Slide Block、Sort Shape、Push Buttons)预训练后反而下降。

COLOSSEUM(Figure 4,雷达图形式报告 12 种环境扰动 + 无扰动下的平均成功率,论文正文未给出配套数字表):2D 预训练基线 MVPR3M 在几乎所有扰动轴上都接近 0(雷达图上贴着圆心),说明 2D 预训练表征对这套需要精确 3D 定位的操作任务基本不可用。3D-MVP 与 RVT(从零训练)相比,论文正文原话是”在承接物体(RO)的纹理和尺寸变化、操作物体(MO)尺寸变化、光照颜色(Light Color)、桌面颜色(Table Color)上尤其稳健”(原文列举的具体优势轴)。笔者对雷达图的读图观察(非论文给出的精确数字,仅供参考):3D-MVP 曲线在 12 个扰动轴的多数上包住 RVT,例外是 RO Color(承接物体颜色) 轴上 RVT 反而明显优于 3D-MVP。

创新点与影响

贡献:(1)第一次把 MAE 式的掩码视角重建预训练直接接到一个做显式 3D 建模(而非纯 2D 编码器)的操作策略上,靠”编码器/解码器拆分”绕开了 3D 场景数据集缺乏动作标注、机器人示范数据集缺乏 3D 场景多样性这两头都稀缺的矛盾;(2)系统消融了预训练数据集选择(物体级 Objaverse vs 房间级 3D-FRONT vs 直接用任务自身的 RLBench 点云)、数据规模(20 万 vs 1.8 万物体)、掩码策略(只遮 RGB vs 遮全部 10 通道)三个维度,给出的结论是:物体级、多样、大规模的 Objaverse 预训练效果最好(62.9→67.6),房间级的 3D-FRONT 只能带来温和提升(62.9→63.6),数据规模变小(20 万→1.8 万物体)也会掉点(67.6→65.3);仅在任务自身场景(RLBench)上做预训练虽然精调后数字(67.5)和 Objaverse 预训练相当,但编码器会过拟合到 RLBench 渲染风格、迁移到 COLOSSEUM 等新环境时明显变差(用重建可视化直接证明了这一点);只遮 RGB 通道比遮全部通道效果好(67.6 vs 64.4),呼应了原始 MAE 论文里”预训练任务太难反而学不好”的发现;(3)用架构消融(精调时跳过预训练、只做架构改动)确认性能提升来自预训练本身而非编码器/解码器拆分带来的架构变化——不预训练时精调结果 62.9,与原版 RVT 几乎完全一致。

改变了什么:证明”3D 感知的视觉预训练”这条路径对显式 3D 操作策略是可行且有收益的,弥补了此前 2D MAE 预训练(MVPR3M)与 3D 操作策略(RVTPerActAct3D)之间的方法论断层;后续利用大规模 3D 资产数据集给操作策略做与任务无关的表征预训练,3D-MVP 提供了一个可复现的对照组和消融结论(数据多样性优先于数据规模、掩码策略要适度)。

论文自陈局限(Conclusion 节):(1)目前只用固定的一组相机视角,不显式建模遮挡与物体间空间关系,作者认为神经辐射场等更灵活的 3D 表示是未来方向;(2)假设场景/机器人/物体处于准静态,不处理机器人与环境的动态交互,作者计划探索能预测动作对场景影响的”动作条件化”表征;(3)目前每个下游任务仍需要少量标注示范才能精调,尚不能零样本泛化到未见过的操作任务类型。此外论文声明代码与预训练权重”即将发布”,但截至本次抓取(2026-07-16)项目页仍显示 “Code (coming soon)“,GitHub 仓库 JasonQSY/3DMVP 里 README 只有一行标题、无任何代码或权重。

原始链接

一手源存档(sources/)

  • 3d-mvp—project-page — 项目主页快照(摘要、方法图、RLBench/COLOSSEUM 结果图说明,fetched 2026-07-16)
  • 3d-mvp—github-readme — GitHub JasonQSY/3DMVP README 快照(确认仓库为空占位,fetched 2026-07-16)
  • 论文全文见上述 arXiv 链接(arXiv 原文 PDF,不入 git;已读 v1 与 v2 全文 HTML 及 COLOSSEUM 结果图)