一句话定位
MV-UMI 给手持式 UMI 采集器(wrist-mounted GoPro)加了一路第三人称俯视相机,训练时用 SAM-2 把人从俯视画面里分割出来、再用静态背景帧修补掉,让第三人称视角在”人类演示”和”机器人部署”两端看起来都像”没有操作者/机器人”存在,从而在不引入训练-部署域偏移的前提下补上手腕相机看不到的场景语境;论文自报在需要”大场景理解”的子任务上相对成功率提升约 47%(3 个真实任务)。
背景与定位
模仿学习的成功高度依赖多样、高质量的演示数据,而数据采集长期卡在两个极端之间:机器人遥操作(精确但需要一台在场的机器人,昂贵费时)和互联网人类视频(海量但难以建立观测-动作的显式映射)。手持式无机器人采集器(robot-free handheld grippers)是介于两者之间的折中方案:仅靠腕部相机记录第一人称视角,让非专家也能采集演示,且因为训练/部署观测分布一致(都是腕部视角)而天然获得跨本体(cross-embodiment)能力——这正是 UMI(Chi et al., RSS 2024,“Universal Manipulation Interface”)确立的范式,也是 Dobb-E、RUM、Fast-UMI、Legato 等一系列后续工作的共同基础。但纯第一人称视角的代价是:任何移出腕部相机视野的物体都需要模型维持很长的记忆,多步骤任务里这一点尤其致命。
MV-UMI 的定位是给这套”UMI 范式”打补丁:加一路第三人称视角以获得更宽场景语境,但不能像常规遥操作数据集(如 droid)那样直接用第三人称原始画面训练——因为人类演示时摄像头看到的是操作者,机器人部署时看到的是机器人本体,两者视觉分布不同,直接训练会引入新的域偏移。论文把这一问题与两条现有的跨本体数据编辑技术并列讨论:Shadow(Lepert et al.,用目标机器人渲染的分割掩码替换源机器人像素)和 Mirage(Chen et al.,用图像修补把源机器人”画”成目标机器人)——两者都要求训练时已知目标本体;以及 Track2Act / Im2Flow2Act 一类用物体运动流(object-flow)做本体无关中间表征的路线。MV-UMI 的做法更直接:不是把观测收窄到某种任务相关信号(如物体流),而是把”不该被看见的本体特定元素”(人或机器人)整体去掉,保留其余场景语境不变。
同属”手持采集器+机器人手/夹爪作为通用接口”这一脉络的还有 dexumi(用人手本身作为灵巧手采集接口)和更早的 dexcap(手套式动捕采集系统);umi-on-legs 则是把 UMI 采集的操作策略迁移到移动本体上的后续工作。MV-UMI 与它们的差异在于:它不改变动作/末端执行器的采集方式(仍是 UMI 原装的位姿+夹爪宽度),只扩展观测的视角来源。
模型架构
策略骨干:action diffusion CNN-based 架构(沿用 Diffusion Policy diffusion-policy 一脉的思路),在每个时间步预测一小段多步 end-effector 位姿 + 夹爪宽度轨迹,而非单步动作向量。
视觉编码器:ViT(Vision Transformer)——论文在消融分析中对 ViT 的多头自注意力层挂 forward hook,取 class token 的 query-key 注意力分数,重排成空间网格做注意力可视化(Fig. 8),但正文未给出 ViT 具体规模(层数/宽度/patch size 均未披露)。
观测输入(两路):
- 第一人称/腕部视角 $o_t^{\text{ego}}$:GoPro Hero-10 挂载在手持夹爪上,本体无关(训练、部署时观测分布一致)。
- 第三人称视角:训练时为 $o_t^{\text{3rd}_H}$(俯视,含人类演示者),部署时为 $o_t^{\text{3rd}_R}$(俯视,含机器人本体);两者物理上都用 Intel RealSense D455 采集。
跨本体桥接(分割+修补)核心机制:
- 分割:对每帧俯视画面跑 SAM-2(Segment Anything v2),得到人/机器人的二值掩码;只在每段录制会话第一个 episode 的第一帧上人工选正/负点提示(正点标人、负点标夹爪),SAM-2 内部把关键点传播到整段会话的后续帧,无需逐 episode 重新提示。
- 修补:用一张静态背景参考帧 $o_{\text{ref}}^{\text{bg}}$,把掩码区域”贴”上背景,生成看起来完全没有人/机器人的第三人称帧 $o_t^{\text{3rd-masked}}$。论文的 Inpaint(·) 是”用背景参考帧混合替换掩码区域”这类合成操作,而非生成式/扩散式修补网络。
- 时间对齐:由于两路相机各自采集,存在帧间微小偏移,故每个 ego 帧 $o_t^{\text{ego}}$ 与时间上最接近的已处理俯视帧 $o_{\tau(t)}^{\text{3rd-masked}}$ 配对,构成状态 $s_t=(o_t^{\text{ego}}, o_{\tau(t)}^{\text{3rd-masked}})$。
动作提取(沿用 UMI 方案):对腕部 GoPro 的 .MP4 视频跑 ORB-SLAM3 视觉 SLAM,结合 GoPro IMU 数据,估计手持设备相对起始帧的位姿;夹爪开合宽度由夹爪两爪上各贴一枚 ArUco 标记、测量二者间距得到。动作 $a_t=(T_t, w_t)$ 为连续的末端位姿 $T$(位置+朝向)与夹爪宽度 $w$,非离散 token、非流匹配(flow)表示。
部署侧两种配置(消融对比见下):
- 带机器人分割+修补:对部署时俯视帧 $o_t^{\text{3rd}_R}$ 同样跑 SAM-2 分割出机器人掩码,再用背景参考帧修补,使输入观测分布与训练一致;论文指出 SAM-2 在 A100 上约 40 FPS,远快于动作扩散策略本身,因此该修补步骤对实时性影响很小。
- 不做机器人分割:直接把原始俯视帧喂给策略,不做任何处理。
自定义三爪夹爪硬件:原版 UMI 的两爪平行夹爪难以锁定物体的旋转自由度,MV-UMI 设计了一款三爪夹爪——两个柔性爪(TPU 95A 打印)+ 一个刚性爪;单爪外形约 189 mm × 94 mm,采用可变填充率打印(爪身多数区域 25% 填充,抓取面用 5% 填充最大化摩擦抓持力,固定件安装区用 45% 填充保证结构强度);支持手持与电机驱动(linear motor)两种构型,可负载达自重的 3 倍;据项目主页披露整爪重 0.39 kg(此数字仅见于项目页摘要,arXiv 正文未提及)。夹爪的机械设计不是本文核心贡献,schematics 另行开源(项目页面标注”Hardware Repository (coming soon!)”,抓取时尚未上线)。
数据
- 任务与场景:3 个真实世界任务——Bottles-Rack-Inserter(把玻璃瓶插入酒架上唯一的空位,空位位置随机)、Marker-Cup-Placer(把马克笔捡起并放入桌上某个杯子,杯子常在起始时就在腕部相机视野外)、Cans-Shelf-Placer(把罐子放到桌子对侧的一个置物架上,置物架在轨迹大部分时间都不在腕部相机视野内,且位置在桌面上可变)。
- 采集硬件:GoPro Hero-10(腕部/第一人称)+ Intel RealSense D455(第三人称,全程连续录制,不随 episode 启停);episode 的起止时刻由 GoPro 视频时间戳界定;每个环境开始录制前用腕部相机扫一次同步码(每环境一次,非每 episode 一次)。
- 场景多样性:论文用 Fig. 3 展示了一组”in-the-wild”环境(如户外、厨房等,具体场景名见项目页视频列表:outdoors / kitchen / c3 / b2 / bottles / cans),用于说明系统在非受控场景下的鲁棒性,但正文未给出具体环境数量或总演示条数/总时长/总帧数——这些规模数字论文未披露。
- 数据来源单一:全部为人类手持采集器现场演示,无仿真数据、无网络视频数据、无跨数据集混合训练。
- 动作标签:来自 ORB-SLAM3 + IMU 位姿估计与 ArUco 测距(见”模型架构”),非人工标注。
训练方法
- 目标:behavior cloning,用 action diffusion 策略拟合 $\pi(a_t \mid s_t)$,$s_t$ 为(ego 帧, 修补后的第三人称帧)二元组。
- 训练时数据增强(Algorithm 1,Policy Training with Random Dropout):
- 初始化参数 $\theta$、初始 dropout 率 $p_0$、衰减率 $\lambda$;
- 每次迭代:采样原始帧 ${o_t^{\text{ego}}, o_t^{\text{3rd}_H}}$ 与真值动作 $a_t$,对 $o_t^{\text{3rd}_H}$ 跑 SAM-2 得到 $o_t^{\text{3rd-masked}}$;
- 以概率 $(1-p)$ 同时输入两路视图;否则以概率 $p$ 对其中一路视图随机加噪声块(viewpoint dropout,Fig. 4),模拟修补瑕疵/遮挡场景;
- 计算损失并更新参数,dropout 率按 $p \leftarrow p_0 e^{-\lambda t}$ 指数衰减(训练早期强增强、后期弱增强)。
- 该增强机制的目的是防止策略过拟合到某一路视角或某种固定模式,提升对修补伪影和遮挡的鲁棒性。
- 无强化学习环节;未披露具体 batch size、学习率、训练步数/轮数等超参数。
Infra(训练 / 推理工程)
- 训练算力(GPU 型号/数量/训练时长):未披露。
- 推理侧:SAM-2 分割+修补模块在 A100 上运行约 40 FPS,明显快于动作扩散策略本身的推理速度,因此该步骤”产生的额外计算开销很小、维持了系统整体的实时性”——但策略本身的具体控制频率(Hz)/端到端延迟数值未披露。
- 边缘/机器人端硬件:未提及具体机器人本体型号或机载计算平台;仅说明部署时机器人搭载修改版三爪夹爪(含线性电机驱动)。
评测 benchmark
主结果(Fig. 7,UMI 单目视角 vs. MV-UMI 双视角,按子阶段拆分成功率;论文正文未给出精确数值表,以下为从柱状图读取的近似百分比):
| 任务 | 子阶段 | UMI(仅腕部视角) | MV-UMI(本文) |
|---|---|---|---|
| Cans-Shelf-Placer | 捡起罐子 | ~83% | ~92% |
| Cans-Shelf-Placer | 放上置物架 | ~17% | ~67% |
| Marker-Cup-Placer | 整体成功率 | ~40% | ~67% |
| Bottles-Rack-Placer | 捡起瓶子 | ~75% | ~70% |
| Bottles-Rack-Placer | 插入正确酒架位 | ~20% | ~65% |
可以看到 MV-UMI 在”捡起”这类腕部视角本就够用的早期阶段与基线相当(甚至 Bottles 任务的捡瓶阶段略低于基线),但在需要场景语境的后期阶段(放置/插入正确位置)大幅领先——这与论文摘要”约 47% 相对提升”的表述吻合(该数字是论文自报的整体量化结论,具体计算方式未在正文给出公式)。
消融研究(Table II,相对 MV-UMI 完整设置的成功率归一化值):
| 消融项 | 相对成功率 |
|---|---|
| Without Human Segmentation(训练用未分割的人类原始画面) | 0.10 |
| Without 3rd-Person View(退化为原版单目 UMI) | 0.60 |
| Without Robot Inpainting(分割但不做背景修补) | 0.00 |
| Without Robot Segmentation(部署时第三人称画面完全不处理) | 0.80 |
论文文字解读:训练在”人类未分割”数据上的策略”几乎无法完成任何任务”(尽管动作方向常常是合理的),归因于训练/部署观测空间的分布偏移;相反,在”分割后”数据上训练的策略即使在部署时机器人也不做分割(对应 Table II 的 0.80)依然泛化良好——说明”去人”这一步本身消除了人类动作与夹爪动作之间的虚假相关性,让策略更依赖任务相关的场景特征而非人类特有信号。
注意力图分析(Fig. 8,定性):未分割训练下的模型注意力经常落在操作者的手/机器人臂等本体特征上;MV-UMI(分割训练)模型的注意力则稳定聚焦在被操作物体上,即使推理时机器人未被分割也是如此——为上述消融结果提供了机制层面的佐证。
基线:仅对比原版单目腕部视角 UMI 设置;未与 Shadow / Mirage / Im2Flow2Act 等其他跨本体方法做定量对比(Table I 只是特性对照表,无success rate数字)。
创新点与影响
- 不需要目标本体先验知识的跨本体第三人称融合:与 Shadow、Mirage 需要在训练时预知目标机器人形态不同,MV-UMI 的分割+修补流程对训练和部署双向对称使用(人在训练时被去掉、机器人在部署时也被去掉),不依赖任何特定机器人的先验渲染或标定。
- 揭示”去人”而非仅仅”加视角”才是关键:消融显示如果不做人物分割,直接加第三人称视角反而会让策略完全失败(0.10 相对成功率),说明视角本身不是收益来源,消除本体特定信号才是。
- 给出了成本更低的”部署时可省略修补”退路:Table II 显示部署时即便不对机器人做分割修补,仍能保留 0.80 的相对性能,为实时性/工程简化提供了可选项。
- 自定义三爪夹爪:针对原版 UMI 二指平行夹爪难以约束物体旋转自由度的问题给出软硬结合方案(两柔性爪+一刚性爪),可负重 3 倍自重,兼容手持/电机驱动两种模式。
- 论文自陈局限(IV-5 Limitations,原文仅一段):训练时人类演示者造成的遮挡、或部署时机器人本体造成的遮挡,都可能导致”带分割+修补”部署配置下的分割不完整;论文指出第二种部署配置(不对机器人做分割)能缓解这一问题,但未给出量化的失败率或进一步分析。
- 论文未与其他跨本体基线做直接 success-rate 对比,也未披露训练数据总规模(episode/小时/帧数)与训练算力,这些是本文作为一篇系统性论文(system paper)而非严格量化 benchmark 论文的局限。
- 代码与硬件仓库在抓取时(2026-07-16)仍标注”coming soon”,尚未开源发布。
原始链接
- arXiv: https://arxiv.org/abs/2509.18757
- PDF: https://arxiv.org/pdf/2509.18757
- 项目主页(含视频): https://mv-umi.github.io
一手源存档(sources/)
- mv-umi—project-page — 项目主页快照(摘要、消融讨论原文、硬件仓库”coming soon”状态、三爪夹爪重量 0.39 kg 披露位置)
- arXiv 2509.18757 原文(arXiv 原文 PDF,不入 git,通过 arxiv.org/html 抓取阅读)