一句话定位
ManiWAV 把 UMI 那把手持采集夹爪的指尖装上一颗压电接触麦克风(“ear-in-hand”),让人在野外徒手采集视觉+音频同步演示;策略侧用 Transformer 音频编码器(AST)与 CLIP 视觉特征融合后条件化 Diffusion Policy 的扩散动作头,靠训练时叠加 ESC-50 环境噪声与机器人电机噪声做数据增强来跨越”人手采集 vs 机器人部署”的音频域差;在擦白板、翻贝果、倒骰子、贴魔术贴四个需要感知接触事件/材质/物体状态的任务上,音频显著提升成功率与泛化(如擦白板从 40% 提到 85%),是视觉之外用声音做接触感知的一个具体、低成本落地。
背景与定位
论文的出发点是:视觉主导的机器人操作系统很难感知”接触”本身——是否碰到了、碰的方式是什么、碰的表面材质是什么、物体内部状态如何。触觉传感器(六轴力/力矩传感器、GelSight 类视觉触觉传感器、触觉皮肤)能补上这块,但普遍偏贵、易损、需要专门知识才能用。作者提出用一个被长期忽视但廉价可靠的模态——音频——来做同样的事:压电接触麦克风便宜、耐用、买得到,且音频信号有标准编码格式(可直接塞进 MP4),因此可以像 UMI 一样脱离真机、用手持设备在野外采集。
此前把音频用进机器人操作学习的工作,要么是主动声学感知(发射振动波再接收,装在物体/机械臂/夹爪/软手指上测材质形状),要么是被动声学感知(采集交互产生的声音喂进端到端模型),但被动声学的数据采集都要求受控环境——麦克风装在机器人或物体上、靠遥操作收集,无法脱离真机。ManiWAV 的定位就是把被动声学感知从”必须有真机在场”解放出来,直接沿用 UMI 的”ear-in-hand”手持采集范式(复用其 3D 打印平行夹爪、GoPro 腕装相机、视觉惯性 SLAM 恢复动作标签),只是在指尖加一颗接触麦克风;策略学习延续同一批作者提出的 Diffusion Policy 做动作头。与多传感融合的策略学习工作(如 Lee et al. 2019 的视触融合、Li et al. 2022 的 MLP 音频融合、Mejia et al. 2023 的 AVID 音频预训练)相比,ManiWAV 的区别在于给出了”训练时噪声增强桥接域差 + Transformer 音频编码器 + 手持在野采集”这一整套针对在野音频数据的具体解法。发表于 CoRL 2024。
模型架构
策略骨干:端到端闭环感知运动学习模型,输入 RGB 图像 + 音频,输出 10-DoF 机器人动作(末端位置 3 + 6D 旋转表示 6 + 1D 夹爪开合)。
- 视觉编码器:CLIP 预训练 ViT-B/16,图像 resize 到 224×224、随机裁剪 + 颜色抖动增强;20Hz 采样,取过去 2 个时间步,每帧用 CLS token 特征单独编码。
- 音频编码器:Audio Spectrogram Transformer(AST),类 ViT 的注意力机制学音频频谱图 patch 表征。作者的直觉是 CNN 依赖的”平移不变性”不适合音频频谱图(时间/频率上的平移会显著改变信息含义),实验也证明从零训练的 Transformer 优于 CNN(ResNet18、AVID 预训练 CNN)编码器。音频处理链路:任务相关的最近 2-3 秒音频 → 48kHz 重采样到 16kHz → log-mel 频谱图(FFT/窗长 400、hop 160、64 个 mel 滤波器组)→ 线性归一化到 [-1,1] → 取 AST 最后隐层的 CLS token 特征。
- 感官融合:一层 Transformer 编码器(8 头注意力,前馈维度 2048,dropout 0.0)融合视觉与音频特征(做法参考 Li et al.),让模型在任务不同阶段自适应加权两个模态(如靠近物体时视觉重要、接触时音频重要);融合后拼接特征线性降维到 768 维,再拼接过去 2 个时间步的末端位姿(20Hz)作为条件观测。
- 动作头:以观测表征为条件,用 Diffusion Policy 提出的 UNet 扩散模型逐去噪步预测未来 16 步的动作轨迹(噪声预测 MSE 损失,端到端训练)。
- 音频延迟匹配:数据采集时视觉/音频由 GoPro 同步录制天然对齐;机器人部署时校准得到总音频延迟 0.23s(图像延迟 0.17s + 麦克风到显示的额外 0.06s),采用与 UMI 相同的推理期延迟补偿方法处理。
- 硬件:在 UMI 3D 打印平行夹爪的基础上改造,把压电接触麦克风嵌入高摩擦抓握胶带下方,麦克风接到 GoPro Media Mod 的 3.5mm 外接麦克风口;音频 48000Hz 采样、图像 60Hz,同步存为 MP4。部署时同一夹爪装到 UR5 机械臂上,图像与音频经 Elgato HD60 X 采集卡实时流到 Ubuntu 22.04.3 桌面机。
数据
四个接触密集任务,全部真人手持采集、无仿真:
- 翻贝果(Flipping):115 条”实验室内”演示 + 274 条”野外”演示(6 个不同环境、4 种不同煎锅),共 389 条;野外数据具体分布为会议室 52 条、两个厨房各 37/44 条、办公室 46 条、休息室桌面 76 条、咖啡馆 19 条。每条采集约 4-6 秒。
- 擦白板(Wiping):120 条演示,每条约 10-15 秒。
- 倒骰子(Pouring):100 条演示,每条约 10-15 秒;手持夹爪可直观演示”摇晃”动作以产生杯内物体的振动声。
- 贴魔术贴(Taping):200 条演示,用夹爪指尖沿胶带”滑动”的原语动作。
噪声增强数据:训练时从 ESC-50 环境音数据集随机采样背景噪声(归一化到与采集声音同尺度);另录制 10 条 UR5 随机轨迹下的机器人电机噪声(麦克风位置与部署时相同);背景噪声与机器人噪声分别以 0.5 概率叠加到原始音频上。动作标注沿用 UMI 的视觉惯性 SLAM 从手持轨迹恢复 6DoF 末端位姿,无需额外标注。数据集与策略 checkpoint(翻贝果任务的野外数据 + zarr 格式回放缓冲区 + 原始 MP4 演示视频)已开源在 real.stanford.edu/maniwav。
训练方法
- 目标函数:扩散模型噪声预测 MSE 损失,纯模仿学习(行为克隆),不涉及 RL。
- 多阶段/消融设计:每个任务独立训练;核心方法论创新是”训练时噪声增强”而非”测试时降噪”——测试时降噪算法(非平稳噪声抑制,基于逐频段估计噪声阈值再做平滑掩码)会削弱原始信号、反而扩大训练/测试域差,效果不如训练时叠加 ESC-50 + 机器人噪声。
- 图像增强:训练回放缓冲区中每帧随机裁剪 95% 比例后 resize 回原分辨率,并叠加 ColorJitter(亮度 0.3、对比度 0.4、饱和度 0.5、色调 0.08),目的是让模型对部署时不同光照条件更鲁棒。
- 超参:AdamW 优化器,lr=1e-4,betas=[0.95, 0.999],eps=1e-8,weight_decay=1e-6,权重上应用 EMA(指数滑动平均);60 epoch,batch size 64。
Infra(训练 / 推理工程)
- 训练算力:每个任务在 2× NVIDIA GeForce RTX 3090 上端到端训练 60 epoch,batch size 64(论文原文披露到此,GPU-hours 未披露)。
- 推理硬件:UR5 机械臂 + 同款嵌入麦克风的平行夹爪;图像/音频经 Elgato HD60 X 采集卡实时流入 Ubuntu 22.04.3 桌面机做在线推理;音频总延迟通过打点标定为 0.23s(图像延迟 0.17s + 麦克风额外延迟 0.06s)并在推理期做延迟补偿。控制频率 / 推理 FPS 未披露具体数值。
评测 benchmark
四个任务均采用相同初始配置的成对 rollout 做基线对比(成功率为该论文一手实测数据):
- 翻贝果(20 次 rollout,Table 4):OURS 90%;Vision only(仅视觉扩散策略)25%;MLP policy(用 MLP 替代扩散头)60%;ResNet(ResNet18 音频编码器 + CoordConv)35%;AVID(AudioSet 预训练 9 层 CNN 音频编码器)55%。失败模式:Vision only 常见”poke”(未插入锅底而戳到贝果侧面)或”lose”(提前脱离接触);ResNet 常见”displace”(铲子在末端执行器中位移)。测试场景覆盖 T1 初始配置随机化、T2 音频扰动(背景噪声)、T3 未见桌高、T4 两个未见野外环境(黑色炉灶台、白色台面)。
- 擦白板(20 次 rollout,Table 3):OURS 85%;Vision only 40%;MLP fusion(MLP 替代 Transformer 融合)35%;Noise masking(掩掉 500Hz 以下频段替代噪声增强)50%;No noise aug(不做噪声增强)35%。文中明确指出音频将整体成功率从 40% 提到 85%。
- 倒骰子(12 次 rollout,Table 1,子步骤拆解):OURS 抓取 90% / 倒出 100% / 放置 90%;Vision only 抓取 100% / 倒出 0% / 放置 8.3%;1s audio(仅 1 秒音频历史)抓取 91.7% / 倒出 30% / 放置 0%;10s audio(10 秒音频历史)抓取 100% / 倒出 60% / 放置 16.7%。Vision only 因无法判断杯内是否有物体,几乎从不执行倒出动作。
- 贴魔术贴(10 次 rollout,Table 2,子步骤拆解):OURS 触碰 90% / 判材质(Sense)90% / 拾取 80% / 放置 80%;Vision only 判材质仅 30%(随机猜测,整体成功率约 20%);Env Mic(用 Rode VideoMic GO II 指向性麦克风替代接触麦克风)判材质同样仅 30%;Noise Reduction(测试时降噪替代训练时增强)判材质 40%。
- 消融结论总结:(1) 扩散动作头优于 MLP,但即便 MLP 配合音频也显著优于纯视觉扩散策略;(2) 从零训练的 Transformer 音频编码器优于 CNN(ResNet/AVID);(3) 野外数据使策略泛化到未见环境(黑色炉灶台、白色台面)显著优于仅用实验室内数据;(4) 训练时噪声增强优于测试时降噪与频段掩码;(5) 音频历史窗口长度存在最优区间(1 秒太短、10 秒过长均伤性能);(6) 接触麦克风对材质差异的灵敏度显著优于环境(非接触)麦克风。
创新点与影响
- 贡献:提出”ear-in-hand”手持采集设备(在 UMI 夹爪指尖嵌入压电接触麦克风)+ 对应策略学习接口,是首个把被动声学感知的数据采集从”必须在受控环境用遥操作、麦克风装在机器人/物体上”解放为”可在野外用手持设备采集”的工作;提出的训练时噪声增强策略(ESC-50 环境音 + 机器人电机噪声叠加)具体解决了人手采集数据与机器人部署数据之间的音频域差问题。
- 改变了什么:证明了廉价接触麦克风信号可以在多个具体接触密集任务(区分接触/非接触、区分接触模式、区分表面材质、感知遮挡物体状态)上给纯视觉策略带来大幅成功率提升,而且这些提升来自一个比视觉触觉传感器便宜得多、鲁棒得多的传感器;注意力可视化显示音频协同训练还让视觉编码器本身学到更任务相关的注意力(不再走”背景结构走捷径”的路子)。开源了代码、翻贝果野外数据集与策略 checkpoint。
- 作者自陈局限:(1) 接触麦克风并非在所有场景都有用——对形变物体(如布料)或某些准静态任务,交互本身可能不产生显著声音信号,且在机器人部署时容易被电机噪声掩盖到不可感知;(2) 当前策略网络架构没有利用”音频采样频率高于图像”这一特点来学习更具反应性的行为,未来可考虑分层网络架构从音频输入推断更高频动作。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2406.19464
- 论文 PDF:https://arxiv.org/pdf/2406.19464
- 项目主页:https://mani-wav.github.io/
- 代码库(GitHub,MIT):https://github.com/real-stanford/maniwav
- 数据集与 checkpoint:https://real.stanford.edu/maniwav
- 技术总结视频(YouTube):https://youtu.be/SzHENLZ7_tc
- 发表:Conference on Robot Learning (CoRL) 2024
一手源存档(sources/)
- maniwav—github-readme — GitHub README 快照(软硬件安装、数据集下载、训练/部署命令)
- maniwav—project-page — 项目主页快照(摘要、四任务关键发现、注意力可视化说明)
- arXiv 原文 PDF(arXiv 原文 PDF,不入 git):https://arxiv.org/pdf/2406.19464