一句话定位
把 universal-manipulation-interface(UMI)那套免遥操作的手持式演示采集接口升级为视觉-触觉双模态版本:两个 Fin Ray 软体夹爪各自内嵌摄像头做全向、高分辨率触觉成像,配合一个专门设计的”用触觉预测未来画面”对比预训练目标,让接触密集型任务(in-hand 转向、挂钩、动态插孔等)的模仿学习数据采集完全不需要真实机器人在场。
背景与定位
- 范式定位:手持式/便携式免遥操作数据采集接口(UMI 谱系)——相对于 ALOHA/Mobile ALOHA、外骨骼、Open-TeleVision/AnyTeleop 这类”采集时必须实时遥操作物理机器人”的方案,UMI 类接口把相机+夹爪拿在手里直接示范,靠 SLAM 事后把末端位姿标成动作。ViTaMIn 直接在 universal-manipulation-interface(Chi et al., 2024)硬件基础上加装触觉传感,是该谱系里第一批把高分辨率视觉式触觉塞进手持接口的工作。
- 触觉硬件复用自同组的配套论文 AllTact Fin Ray(Liang et al., arXiv:2504.18064,“AllTact Fin Ray: A compliant robot gripper with omni-directional tactile sensing”)——一个基于弹性体浇筑、内嵌摄像头的全向触觉 Fin Ray 手指;ViTaMIn 把这根手指集成进 UMI 式手持采集装置,是它的下游应用。
- 对比最相关的 Huang et al. 2024《3D-ViTac》(CoRL 2024):同样用 Fin Ray+触觉,但(1)触觉是 16×16 分辨率的电阻式阵列而非视觉式传感,(2)数据采集仍依赖遥操作物理机器人,不是免机器人的手持接口。
- 对比 George et al. 2024《VITAL》:VITAL 把触觉与”当前”视觉图像做时间对齐的 CLIP 对比学习,且触觉表征依赖本体感知(proprioception);而 ViTaMIn 的手持采集在 SLAM 成功之前没有可靠的本体感知信号,因此改为把触觉与”被遮挡的当前图像”融合去预测”未来图像”。
- 与并行工作 dexumi(DexUMI,Columbia+Stanford,也是给 UMI 式接口加触觉,但目标是灵巧手而非平行爪)互为参照。
模型架构
ViTaMIn 本身不是一个端到端策略网络,而是”数据采集硬件接口 + 触觉表征预训练 + 下游 Diffusion Policy”的组合:
- 采集端硬件:GoPro 10 鱼眼相机(155° FOV,60 FPS,2704×2028 分辨率)做视觉观测;两个 AllTact Fin Ray 触觉手指,每指内嵌摄像头,30 FPS、640×480 分辨率,同时捕捉手指整体形变(全向接触)与接触面局部形变;一个额外的低成本同步相机(30 Hz)用于把触觉流与 GoPro 流对齐;Raspberry Pi 5 + 电池负责离线记录,整机重约 1960g,可脱离机器人在野外独立工作。夹爪宽度沿用 UMI 做法,靠贴在两指上的 ArUco 标记从视觉反推。
- 视觉编码器:预训练 CLIP ViT-B/16,冻结,与原版 UMI 一致。
- 触觉编码器:另一个独立初始化自 CLIP ViT-B/16 的网络,专门做触觉表征预训练(见”训练方法”),是本文的核心新增模块,而非直接复用视觉 CLIP。
- 策略网络:Diffusion Policy(Chi et al., 2023)+ 卷积 U-Net 噪声预测网络,DDIM 加速采样;动作空间为末端执行器相对(delta)位姿,与 UMI 一致;动作视野(action horizon)16 步/次推理,按时延补偿策略约执行其中 10 步再重新规划。
- 观测视野(v1 版 Appendix Table V,v2 定稿正文未重复列出,标注版本):图像观测视野 2 步,本体感知观测视野 2 步,观测分辨率 224×224。
- 无跨本体(cross-embodiment)设计,也不涉及离散/连续动作 token 化——延用 UMI 的连续 delta-pose 回归;论文自陈局限:仅在固定基座的单臂/双臂平行爪任务上验证,灵巧手是未来工作方向。
数据
- 采集方式:100% 真实世界、免遥操作手持采集,无仿真数据;论文认为仿真在复杂物理属性(如软体、透明物体)上保真度不足。
- 动作标注:不直接记录动作,而是靠 SLAM 事后从录像中反解末端位姿轨迹(与 UMI 相同做法),SLAM 在低纹理场景可能失败,整体成功率约 80%,失败轨迹被过滤掉。
- 各任务原始/有效(SLAM 成功)轨迹数与平均长度(v2 定稿 Table I,当前版本 5 个主任务):
| 任务 | 原始 | 有效 | 平均长度 |
|---|---|---|---|
| Orange Placement | 87 | 73 | 435 |
| Dynamic Peg Insertion | 201 | 141 | 321 |
| Test Tube Reorientation | 150 | 125 | 619 |
| Scissor Hanging | 172 | 137 | 642 |
| Knife Pulling(左臂) | 188 | 131 | 403 |
| Knife Pulling(右臂) | 180 | 134 | 254 |
- 版本差异(如实记录):初版预印本(v1, 2025-04)以 7 个任务框架呈现,Appendix E 的数据统计表额外包含 Sponge Insertion(160 原始/138 有效/605 均长)与 Articulated Object Manipulation(101 原始/83 有效/403 均长),且 Dynamic Peg Insertion 当时的计数是 146 原始/101 有效/406 均长;2025-09 定稿版(v2,即当前 arXiv 版本)把主实验收窄为 5 个任务,去掉了 Sponge Insertion 作为独立评测任务,把 Articulated Object Manipulation 降级为一个只报力矩曲线、不算成功率的定性演示,并对 Dynamic Peg Insertion 重新采集了更多数据(201/141/321)。两版里 Dynamic Peg Insertion 的成功率数字(0.8 / 0.45)保持一致,说明只是补采了数据,结论未变。
- 触觉表征预训练阶段的数据:把 5 个任务下所有采集到的”动作无关”(action-free,即打标签动作之前)视觉-触觉片段汇总使用——不要求 SLAM 成功,这是该预训练策略刻意设计的优势(不依赖 SLAM 成功率就能用满全部采集量)。
- 无跨数据集混合/协同训练(不使用 Open X-Embodiment 等外部机器人数据),是单一自采语料。
训练方法
两阶段流水线:
阶段一:视觉-触觉对比表征预训练。 冻结预训练 CLIP 图像编码器 φ_V,只微调触觉编码器 φ_T(初始化自 CLIP ViT-B/16)。给定第 k 步的被遮挡当前图像 Ĩ_V^k(掩码比例采样自 [0.5, 0.75])与完整当前触觉图像 I_T^k,分别过编码器得到 V_k、T_k,拼接后过一层全连接投影回 512 维 CLIP 空间得到融合特征 F_k;用对称 InfoNCE/CLIP 损失 L_CLIP = ½(L_f-v + L_v-f)(可学习温度 τ)把 F_k 对齐到未来完整视觉嵌入 V_{k+1}(而非当前帧),逼迫触觉编码器学到能预判接触后果的表征。这一设计的动机:不同任务图像差异大但触觉观测可能相似,用被遮挡的当前图像做融合比直接对齐当前帧更能避免触觉表征退化为”任务标签”式的平凡捷径。 预训练超参(v1 版 Appendix Table IV,标注版本——v2 定稿正文未重复列出该表):观测分辨率 224×224,掩码比例 [0.5, 0.75],优化器 AdamW(β₁=0.95, β₂=0.999),学习率 1e-4 余弦衰减,batch size 256。
阶段二:行为克隆。 用预训练好的触觉编码器(冻结)+ 原版 CLIP 视觉编码器,在 SLAM 过滤后的逐任务演示数据上训练 Diffusion Policy;动作空间为末端相对位姿;U-Net 噪声预测网络;DDIM 加速推理采样。 策略训练超参(同样出自 v1 版 Appendix Table V):图像/本体观测视野各 2 步,动作视野 16 步,观测分辨率 224×224,AdamW(β₁=0.95, β₂=0.999),学习率 3e-4(扩散网络)/ 3e-5(视觉编码器微调),余弦衰减,batch size 64,训练扩散步数 50,推理去噪步数 16;所有实验默认在收敛后的第 60 个训练 epoch 取 checkpoint 评测。 全程为模仿学习(行为克隆),未使用强化学习。
Infra(训练 / 推理工程)
- 训练算力(GPU 数量/GPU-hours):论文未披露预训练和策略训练所用的 GPU 数量或训练时长。
- 部署推理:控制回路 10Hz,基于 ROS Noetic / Ubuntu 20.04,视觉处理、触觉处理、机器人控制分线程并行以降低时延;部署机械臂为 Rokae xMate ER3Pro(7 自由度)+ PGI-140-80-W-S 平行爪(8cm 开合行程);v1 版 Appendix B-B 记载部署主机为搭载 NVIDIA RTX 2080Ti 的 PC,GoPro 画面经 Elgato HD60 X 采集卡接入(同一套物理部署方案,v2 定稿正文未重复此细节,故标注来源版本)。
- 采集端为完全离线设备:Raspberry Pi 5 + 电池板载,无需外部算力,整机 1960g,可脱离实验室独立工作。
- 传感器同步:同步相机 30Hz vs GoPro 60Hz,时间对齐误差上界为 1/60 + 1/30 = 0.05 秒。
- SLAM 姿态恢复成功率约 80%,用于筛掉不可用轨迹。
- 时延补偿:每次推理生成 16 步连续轨迹,按预测缓冲+时间戳同步策略约执行其中 10 步后重新规划(与 UMI 相同策略)。
评测 benchmark
真实机器人评测,5 个主任务(当前 v2 定稿版本;初版 v1 曾以 7 个任务呈现,见”数据”节版本差异说明),每任务 20 次随机初始条件试验,三方对比:Vision(纯视觉,即 UMI 原版复现)/ Ours w/o Pre-training(触觉+视觉简单拼接、不做专门预训练)/ Ours(完整 ViTaMIn)。成功率(Table II,v2):
| 任务 | Vision | w/o Pre-training | Ours |
|---|---|---|---|
| Orange Placement | 0.85 | 0.90 | 1.00 |
| Test Tube Reorientation | 0.40 | 0.70 | 0.90 |
| Scissor Hanging | 0.10 | 0.45 | 0.70 |
| Dynamic Peg Insertion(10mm/s 移动孔位) | 0.45 | 0.80 | 0.90 |
| Knife Pulling(双臂协作) | 0.60 | 0.80 | 0.90 |
泛化测试(Table III,v2;Orange Placement / Scissor Hanging,6 个未见小物体+3 把未见剪刀 / 改变光照):
| 任务 | 方法 | Original | Novel Objects | Different Lighting |
|---|---|---|---|---|
| Orange Placement | Vision | 0.85 | 0.70 | 0.55 |
| Orange Placement | w/o Pre-training | 0.90 | 0.80 | 0.60 |
| Orange Placement | Ours | 1.00 | 1.00 | 0.85 |
| Scissor Hanging | Vision | 0.0 | 0.0 | 0.0 |
| Scissor Hanging | w/o Pre-training | 0.45 | 0.40 | 0.40 |
| Scissor Hanging | Ours | 0.70 | 0.70 | 0.50 |
数据效率消融:在 {25%, 50%, 100%} 演示数据量下评测,预训练触觉表征让策略在 25% 数据下即可在 Test Tube Reorientation 上取得高成功率(Figure 7,论文只给曲线图,未在正文给出具体数值表)。 训练效率消融:带预训练的策略在训练 10 个 epoch 内即可学会任务第一阶段,总体成功率提升更快(Figure 8,同样只有图无数值表)。 柔顺/力控演示(V-C,定性):机械臂旋转一个连接力传感器的开关阀门,每种条件 10 次试验,触觉版本”施加的平均力显著更小”,但具体力值只画在力曲线图里,正文未给数字。 仅存在于 v1 初版、v2 定稿正文已删除的消融(标注版本,可能因会议篇幅限制被砍):触觉分辨率消融——把 640×480 触觉图像降采样到 16×16(对齐 Huang et al. 3D-ViTac 的电阻式传感器分辨率),Test Tube Reorientation 上 Vision/低分辨率触觉/高分辨率触觉 成功率为 0.40/0.60/0.70,Scissor Hanging 为 0/0.20/0.45,显示高分辨率视觉式触觉的价值。 论文未与其他已发表系统(如 3D-ViTac、DexUMI)做直接数值对比,仅做内部消融(纯视觉 vs 无预训练触觉 vs 完整方法)。
创新点与影响
- 把免遥操作的手持式 UMI 采集接口第一次接上高分辨率(640×480)全向视觉式触觉传感(AllTact Fin Ray),相对 Huang et al. 3D-ViTac(16×16 电阻式阵列 + 仍需遥操作采集)在传感分辨率和采集方式上都是明确升级。
- 提出”用被遮挡当前图像+触觉去预测未来完整图像”的对比预训练目标,专门规避手持采集场景下”无本体感知信号可用(SLAM 成功前)“以及”不同任务图像差异大但触觉相似导致平凡对齐”两个问题;预训练数据来自全部动作无关片段,不受 SLAM 成功率(约 80%)拖累。
- 论文自陈局限:目前只验证了固定基座单臂/双臂、平行爪任务;灵巧手场景和长程多阶段移动操作留给未来工作。
- 从 v1(2025-04)到 v2(2025-09 定稿)论文自身做了收缩:任务从 7 个精简为 5 个(去掉 Sponge Insertion,把 Articulated Object Manipulation 降级为定性演示),并删去了触觉分辨率消融——这是作者自己的版本修订,不是本页整理时的遗漏。
- 截至抓取时(2026-07-16),项目页代码栏标注”Code (coming soon)“,尚无公开 GitHub 仓库;硬件清单/组装教程/传感器教程链接均为占位符,未发布可复现的完整 BOM。
原始链接
- arXiv 摘要页:https://arxiv.org/abs/2504.06156
- arXiv PDF:https://arxiv.org/pdf/2504.06156
- 项目主页:https://chuanyune.github.io/ViTaMIn_page
- 配套触觉手指硬件论文(AllTact Fin Ray):https://arxiv.org/abs/2504.18064
一手源存档(sources/)
- 项目主页快照
- arXiv 原文 PDF,不入 git(见上方原始链接)