一句话定位

Neural Volumetric Memory(NVM,CVPR 2023 Highlight)提出一个显式建模 3D 几何、对相机位姿 SE(3) 变换等变(equivariant)的体素特征记忆模块:把前视深度相机在近期几帧拍到的深度图各自编码成 3D 特征体素,用位姿网络估计出的相对变换把它们对齐回机器人当前的自身坐标系再融合,取代传统”沿通道堆叠历史帧”(frame-stacking)的做法,使四足机器人具备对遮挡地形的持久几何记忆。

背景与定位

四足机器人视觉运动控制此前的主流做法是”帧堆叠”:把近期几帧图像沿通道维拼接后喂给 2D CNN(如 LocoTransformer、Yang et al. 的 cross-modal transformer 等),让网络自己隐式学会处理相机因机身晃动/位移带来的视角变化。作者指出这种做法有两个问题:一是帧堆叠忽略了 3D 世界的等变结构,策略需要额外学会消解由相机位姿变化带来的”伪变化”(spurious change),这本身就增加了学习难度;二是生物系统也不会逐像素保存详细视觉观测,这提示应该有一个中间层的、功能性聚合观测流的短期记忆机制,而不是直接堆叠原始像素。NVM 的定位是把计算机视觉中”显式建模场景 3D 几何”的范式引入运动控制:与 rma-rapid-motor-adaptation(RMA,只用本体感受做隐式环境适应)、dreamwaq(同样是纯本体感受的隐式地形想象)不同,NVM 依赖前视深度相机的显式视觉输入;与同样使用深度相机但仍是”隐式记忆”(帧堆叠/RNN/Transformer 拼接)的 LocoTransformer、NaiveCNN 系方法不同,NVM 显式建模了相机的 SE(3) 变换并用其对齐历史特征体素。训练流程沿用 learning-robust-perceptive-locomotion-wild(Miki et al., Science Robotics 2022)与 learning-quadrupedal-locomotion-challenging-terrain(Lee et al. 2020)确立的 teacher-student 两阶段蒸馏范式:先用特权信息(高程图 + 真值速度)训练状态策略,再把训练好的策略蒸馏进只用视觉+本体感受的学生策略。稍晚的 extreme-parkour-legged-robotsrobot-parkour-learning 同样沿用”本体+视觉 teacher-student”范式挑战跑酷级地形,但沿用帧堆叠式感知,未采用 NVM 这类显式 3D 体素记忆。

模型架构

(视觉运动 RL 策略,非 VLA/世界模型,无 VLM;NVM 模块本身可视为一个专用的几何记忆编码器)

  • 3D 编码器 Enc3D:输入单帧深度图,先用 2D 卷积生成形状 (C, H, W) 的 2D 特征图,再沿通道维 reshape 成体素张量 (C/D, D, H, W),随后接 3D 卷积层进一步精炼特征,得到该帧的 3D 特征体素 Vᵢ = Enc3D(Oᵢ)。默认体素分辨率 D=12, H=6, W=6(深度×高×宽)。
  • 位姿编码器 Encpose:输入两帧深度图,用一组 2D 卷积输出一个 6D 向量(旋转+平移),参数化为 SE(3) 群元素 Tᵢⱼ = Encpose(Oᵢ, Oⱼ) ∈ SE(3),用于估计过去帧到当前帧的相对相机位姿变换。
  • SE(3) 对齐与融合:对每个体素位置 p=(i,j,k)ᵀ 应用估计出的旋转 R、平移 t 做 p̂=Rp+t 完成体素坐标变换,之后再接两层额外的 3D 卷积精炼变换后的特征(因为直接在离散体素空间做坐标变换会因体素粗糙度产生错位);对齐到当前帧的历史特征体素 V̂ₜ..V̂ₜ₋ₙ₊₁ 通过取平均(mean,V̂ᵗₘ = (1/n)Σ V̂ᵢ)聚合成融合特征体素,作为该时刻的 Neural Volumetric Memory。
  • 动作头:视觉策略把 NVM 输出的 (C, D, H, W) 体素展平成 (C×D, H, W) 的 2D 特征图,经一组 2D 卷积 + 单层线性层得到 1D 视觉特征;本体感受用单独的编码器网络得到本体特征;两者拼接后输入最终网络输出 12 维关节动作,属于标准连续动作头(非离散 token / diffusion / flow)。
  • 自监督解码器 Dec(仅用于训练期的辅助自监督任务,图 4):取历史中最久远一帧的特征体素 Vₜ₋ₙ₊₁,用估计出的相对位姿变换到其它各帧的坐标系,再用解码器 Dec(先把 (C,D,H,W) reshape 成 (C×D, H, W),接 2D 卷积)预测出对应帧的深度图像,与真实观测算 L1 像素重建损失。
  • 教师策略网络:4 层 ReLU MLP,隐层维度 [256, 128, 128, 64],用 PPO 训练,仅在仿真里训练(依赖特权信息,不部署到真机)。
  • 跨机体/多环境:单一策略(single policy)覆盖论文中全部四类仿真地形(Stages/Stairs/Stones/Obstacles)及全部真实场景,未做多机体(cross-embodiment)泛化,实验平台统一为 Unitree A1

数据

纯仿真训练 + 零样本 sim-to-real 迁移,训练阶段无真实世界采集数据:

  • 视觉观测:真机与仿真统一用头部前向安装的单目深度相机,视觉历史窗口默认 n=5 帧、每帧分辨率 64×64;训练时对深度图随机采样 1% 像素并置为最大读数以模拟真实深度传感器噪声。
  • 教师策略观测空间(Table 1,特权信息):本体状态 R⁶³(关节角 12D×2 步 + 关节速度 12D + 上一动作 12D×2 步 + 投影重力 3D);特权信息 R¹⁴(线速度 3D + 角速度 3D + 环境随机化参数 8D);密集高程图 R^{21×26}(5cm 网格间距,覆盖机身附近区域);稀疏高程图 R^{10×19}(10cm 网格间距,覆盖更大范围)。
  • 仿真环境:四类地形——Stages(多段离散平台,段间不同宽度间隙)、Stairs(不同高度/宽度台阶)、Stones(形状各异的小石块)、Obstacles(多个高方块障碍物);仿真评测每种地形跑 640 个 episode
  • 真实世界场景(用于评测而非训练):Stages 搭建 4 级离散台阶,间距 15cm/20cm/30cm;Stairs 搭建 3 级台阶,高度 3cm/6cm/10cm;Obstacles 在狭窄走廊放置多个方块障碍;每个方法/场景重复 5 次试验。
  • 数据/动作标注:全部动作来自仿真内 PPO 教师策略 rollout 的行为克隆监督(非人类示教/遥操作采集);无跨模拟器数据混配比例(论文未披露具体仿真器名称)。

训练方法

  • 两阶段 teacher-student 流程:第一阶段用 PPO 在仿真中训练依赖特权信息(高程图 + 真值速度)的状态策略 π̂;因图像观测把训练吞吐拖慢约 40 倍(仅用高程图可达 4万 fps,换成 64×64 图像观测降到约 1千 fps),第二阶段才引入视觉的蒸馏训练。
  • 视觉策略蒸馏(第二阶段):把 NVM 模块(Enc3D + Encpose 两个网络组件)与视觉策略端到端联合训练,用行为克隆损失 L_BC = |π̂(p) − π(o)| 让视觉策略 π 模仿教师策略 π̂ 的动作,其中 p 是特权观测(含高程图),o 是视觉+本体观测。
  • 自监督辅助目标:利用 SE(3) 等变假设,额外引入基于新视角一致性(novel-view consistency)的自监督重建损失 L_rec(图 4 所示解码器预测其它帧视觉观测的 L1 像素误差),联合训练总损失 L = λ_BC·L_BC + λ_rec·L_rec,实验中取 λ_BC=1, λ_rec=0.01
  • 教师策略奖励函数:R = α_forward·R_forward + α_energy·R_energy + α_height·R_height + α_amp·R_amp,权重为 α_forward=1, α_energy=−0.005, α_height=−2.0, α_amp=1.0;四项分别对应目标前进速度跟踪(目标速度 0.4 m/s)、能耗惩罚(关节力矩×角速度之和)、机身高度跟踪(目标相对地面高度 0.265 m)、以及 AMP 判别器打分([49] Peng et al. 风格化步态先验,鼓励更自然的步态)。
  • 消融覆盖的超参数:体素分辨率 D(默认 12,对比 D=3、D=6)与 H×W(默认 6×6,对比 4×4、8×8);视觉历史长度 n(默认 5,对比 n=3、n=9)。

Infra(训练 / 推理工程)

  • 训练硬件(GPU 型号/数量)、仿真器名称、GPU-hours 均未披露
  • 训练吞吐仅给出相对量级:仅用特权高程图观测训练可达约 40,000 fps;换成 64×64 深度图像观测后降至约 1,000 fps(约 40 倍减速),这是论文采用两阶段而非端到端单阶段训练视觉策略的主要动机。
  • 真机推理的控制频率(Hz)、板载计算硬件(如 Jetson/NUC 等)、端到端延迟均未披露;仅说明真机平台为 Unitree A1,机身头部安装单目前视深度相机。
  • 无相机跨模态融合以外的额外传感器(无 LiDAR/IMU 融合细节披露)。

评测 benchmark

仿真评测(Table 2,640 episode/环境,指标为 Traversing Rate 与 Success Rate,百分比,均值±标准差;Teacher 为特权高程图策略,视为性能上界):

方法Traversing/StagesTraversing/StairsTraversing/StonesTraversing/ObstaclesSuccess/StagesSuccess/StairsSuccess/StonesSuccess/Obstacles
Teacher97.9±2.094.5±1.889.6±3.192.8±1.895.6±2.386.6±2.770.6±5.287.8±2.7
NaiveCNN76.4±26.981.5±28.629.4±10.663.3±22.553.9±19.771.3±25.40.5±0.845.2±16.4
NaiveCNN-MS72.1±25.484.5±29.726.4±9.363.7±22.748.9±18.973.1±26.20.0±0.048.1±18.3
NaiveCNN-RNN68.3±24.182.4±29.726.3±9.367.9±23.948.9±18.079.1±28.92.2±1.549.8±17.9
LocoTransformer74.0±26.585.5±29.925.2±8.965.2±22.953.3±19.375.8±26.80.9±1.146.7±16.9
NVM79.9±28.185.5±30.047.4±16.774.1±26.065.0±23.279.8±28.214.4±6.061.6±21.9

NVM 在全部四类地形上超过所有基线,Stones(需要精确 3D 结构推断以确定落脚点)上优势最大(Success Rate 14.4% vs 次高 2.2%,约 6.5 倍)。作者观察到 NVM 在 Obstacles 上也领先,尽管该场景理论上仅凭最新一帧视觉观测就足以避障——推测是 3D 理解帮助策略更贴近教师策略会选择的最优路径。对照发现 NaiveCNN-MS(逐帧分别编码再融合,而非堆叠后统一编码)相比 NaiveCNN 并无提升,NaiveCNN-RNN(额外接 2 层 GRU 做记忆)同样无提升,说明改进确实来自显式 3D 变换建模而非额外算力/记忆机制本身。

分辨率与历史长度消融(Table 3):D 越大(体素越精细)整体表现越好;H=W=6 相比 4×4、8×8 综合最优;历史长度从 n=3 增至 n=5 性能提升,但从 n=5 增至 n=9 性能反而下降(作者推测历史过长时位姿编码器难以准确估计最旧帧与当前帧间的位姿变换,冗余视觉信息反而干扰决策)。

真实世界评测(Table 4,5 次重复试验的平均移动距离,米;对比对象为 LocoTransformer,因其在其余基线中最鲁棒):

场景NVMLocoTransformer
Stages5.4±0.33.4±0.1
Stairs4.0±0.02.1±0.8
Obstacles7.3±0.16.7±0.4

NVM 在 Stages、Stairs 上显著领先,Obstacles 上小幅领先(与该场景对 3D 结构理解需求较低一致);作者观察到 LocoTransformer 训练出的策略在真机上会出现前腿能跨过台阶/梯级而后腿踩空的问题,暴露其对周围 3D 结构理解不足,即便该策略在仿真中的表现尚可。

自监督重建可视化(Fig. 5,定性):在多类真实地形上,从最久远帧特征体素解码出的合成视图能较好保留场景整体结构(如障碍物位置、临近阶梯轮廓、临近石块),验证了 NVM 存储的体素特征确实捕获了足够的几何信息用于场景重建。

创新点与影响

  • 贡献:(1) 提出显式对相机 SE(3) 位姿变化等变的体素记忆架构 NVM,用可学习的位姿网络把多帧历史特征体素对齐回当前自身坐标系再融合,替代帧堆叠这一”隐式”处理相机运动的主流做法;(2) 把该体素记忆与 teacher-student 视觉运动蒸馏结合,在仅用行为克隆的前提下于全部四类地形上超过帧堆叠/RNN/Transformer 系基线;(3) 额外提出基于新视角一致性的自监督重建目标,证明该记忆空间本身携带足够的场景几何信息可用于视图合成,为记忆表征的可解释性提供佐证;(4) 全部策略在真实 Unitree A1 上完成零微调(zero-shot)sim-to-real 部署验证。
  • 改变了什么:把计算机视觉中”显式 3D 场景表示 + 等变性建模”的范式引入四足视觉运动控制,指出”帧堆叠隐式处理相机运动”是此前视觉运动策略的一个共性弱点,为后续显式几何记忆类工作提供了一个具体、可复现的架构范式(3D 编码器 + 位姿网络 + SE(3) 对齐融合)。
  • 论文自陈局限:图像观测相比纯状态观测使仿真训练吞吐降低约 40 倍(4万 fps → 1千 fps),因此必须依赖两阶段 teacher-student 蒸馏而非端到端单阶段训练;论文本身未讨论该架构在动态障碍物、非静态场景(自监督目标假设场景在观测窗口内静止)下的适用边界,也未给出真机推理延迟/控制频率等部署工程数据。

原始链接

一手源存档(sources/)