一句话定位
General Flow 把「场景中任意查询点的未来 3D 轨迹(general flow)」定义为一种与具体本体(human / robot)无关的基础 affordance,直接从大规模 RGBD 人类操作视频(HOI4D 等)中学习一个语言条件的 3D flow 预测模型 ScaleFlow,无需任何机器人数据或额外训练,即可零样本迁移到 Franka-Emika 机械臂,在 6 个场景 18 个任务上达到 81% 平均成功率。
背景与定位
论文的出发点与 LLM scaling 的类比一致:要复现 LLM 式的规模化泛化,需要 (1) 一个能吸纳海量、inference-domain-gap 小的数据源,(2) 一个恰当的、可监督的预测目标。真实机器人数据采集昂贵且难以规模化,作者转向人类操作视频这一更廉价、更贴近真实物理的跨本体数据源,并选择「flow」——查询点在未来 T 个时间步的 3D 轨迹——作为预测目标,类比 LLM 里的 text-token 预测。
该工作是 3D flow/keypoint 类 affordance 谱系(FlowBot3D、ToolFlowNet 等 [II-A 关联工作] 中”关键点与流”一脉)与「从人类视频学 affordance / policy prior」谱系(如 Bahl et al. Affordances-from-Human-Video、any-point-trajectory-model-atm)的交汇点:相比前者局限于仿真环境或单一本体、存在明显 sim-to-real gap,相比后者(2D 轨迹/仅粗糙运动趋势)guidance 信息不够 actionable,General Flow 主张直接在真实 RGBD 人类视频上学 3D 点级 flow,从而同时获得可规模化的数据源与足够几何/物理信息的监督信号,实现无训练的零样本人到机器人技能迁移。相较同期把 affordance 建立在关键点约束优化上的 rekep(依赖 GPT-4o/DINOv2 做在线推理、无预训练 flow 模型),General Flow 走的是”预训练通用 flow 预测器 + 简单启发式策略”路线。
模型架构
Affordance 定义:给定感知观测 S(任意本体的 RGBD 点云)与任务指令 I,以及 N_q 个 3D 查询点 Q∈R^(N_q×3),General Flow F∈R^(N_q×T×3) 表示这些点未来 T 个时间步的轨迹(论文取 T=3,对应 1.5 秒片段、0.15 秒间隔)。
ScaleFlow 网络(PointNeXt 骨干 + 条件 VAE 头):
- 文本编码:CLIP 文本编码器提取指令语义,经 MLP 降维到 d_I(对齐宽度设为 6,与点云 XYZ+RGB 维度一致),做 early-fusion——在点云特征层面就与文本特征拼接(消融显示 early-fusion 优于晚融合,w/o Text EarlyFusion 使 Test-ADE 从 0.0358 恶化到 0.0370)。
- 点云输入:场景点 P_s∈R^(N_s×6)(XYZ+RGB),查询点 P_q 用可学习 embedding E∈R^3 替代 RGB 作为”query identifier”;场景点与查询点特征拼接后过 PointNeXt backbone + 分割头提取几何特征。
- 预测头:查询点特征作为条件变量输入 条件 VAE (CVAE),输出归一化位移 Δn̂_t 与轨迹总长度 L̂;ScaleFlow-B 用 2 层 MLP 编解码器(隐藏维 512),ScaleFlow-L 把 PointNeXt backbone 宽度从 32 增至 64,ScaleFlow-S 用 PointNeXt-S + 1 层 CVAE(隐藏维 384);latent 维度统一为 16。
- Total Length Normalization (TLN):核心设计——直接回归绝对位移 Δp_t^i 会因不同查询点轨迹长度差异悬殊(如”开保险柜”任务中门上的点位移远大于柜体上的静止点)而产生 scale 不平衡,因此把每条轨迹按其总长度 L^i=Len(F^i) 归一化为 Δn_t^i=Δp_t^i/L^i,再单独回归标量 L̂ 恢复真实尺度;消融显示 TLN 优于相对位移不归一化(0.0358 vs 0.0376/0.0381)以及 TDN/SDN 等其他归一化变体。
- 参数量:ScaleFlow-S 0.906M,ScaleFlow-B 5.622M,ScaleFlow-L 17.088M(对比基线 ResNet18 13.160M、VIT-B-224 86.614M、PointNeXt-B/L 4.134M/15.583M)——ScaleFlow 用更少参数取得更优精度。
训练目标(Loss with Scale Rebalance):总损失 L = L_recon + β₁L_scale + β₂L_KL + β₃L_acc,其中 L_recon 是归一化位移的 MSE,L_scale 是尺度回归 MSE,L_KL 是 VAE KL 散度,L_acc 是累计位移误差;β₁=25(重点加权 scale 项),β₂=β₃=1。此外用 K-Means(4 簇)按轨迹尺度聚类 + softmax 重采样(温度 τ=1)做 scale rebalance,缓解”静止点占多数”导致模型偏向预测零位移的问题。
零样本执行的鲁棒性增广(专为解决人类手/机器人臂遮挡不一致、下游查询点采样方式多变而设计):
- Hand Mask (HM) 增广:以 p=0.5/0.2/0.3 的概率分别 (1) 删除所有手部点、(2) 保留所有手部点、(3) 随机选一个手部锚点、只保留距锚点 >12cm 的点。
- Query Points Sampling (QPS) 增广:以 p=0.7/0.3 概率做 (1) 完全随机采样查询点、(2) 随机选锚点+采样其邻近点。
数据
- HOI4D(3D 标注数据集,刚体/铰接物体主力数据源):16 类物体、800 个实例,共 44.4 小时 RGBD 录制,提供 RGBD 图像、相机参数、物体位姿、场景分割掩码、动作标签等完整 3D 标注。Flow 标签直接用 ground-truth 位姿+相机参数反投影得到,并做相邻帧掩码交叠过滤、相机抖动去噪(<0.02cm 位移视为相机抖动并从全体轨迹中扣除)。
- 自采 RGBD 视频(软体,“叠衣服”任务):RealSense D455 相机,6 种衣物、30 段 rollout,提取 605 个片段。Flow 标签流程:先做 HOI 分割(用 100DoH 检测框输入 FastSAM 得到手/主动物体掩码,仅保留置信度 >0.5 的掩码),在主动物体上随机采样 1024 点,用 Co-Tracker (TAP) 在 2D 像素空间跟踪未来轨迹,剔除被遮挡/消失/深度值中断的轨迹后反投影回 3D。
- 切片与划分:所有片段统一 1.5 秒时长、0.15 秒间隔、3 个时间步;对含非接触前缀动作(如手伸向物体)的片段额外生成 4 个扩展子片段。数据集按 80%/10%/10% 划分训练/验证/测试,得到 51693/6950/6835 个片段,不同集合间无重复物体实例。
- 训练时每样本裁剪以 flow 起点为中心的 80×80×80 cm³ 立方体空间,用最远点采样 (FPS) 得 2048 个场景点;训练随机采 128 条查询轨迹,验证采 512 条(测试时按物体部件均匀分配 512 条以提升评测有效性,但训练/真实部署不使用部件标签)。
- 无 sim-to-real 问题:训练与部署均直接用真实 RGBD 点云,无仿真环节。
训练方法
- 优化器 AdamW,学习率 0.001,weight decay 0.0001,10 epoch warmup + 余弦调度,共训练 200 epoch,batch size 128(验证/测试 batch size 256)。
- 标准点云增广:随机旋转、平移、缩放、坐标归一化、颜色抖动、特征 dropout。
- 零样本执行策略是训练无关的启发式策略(非模仿学习/RL):把靠近夹爪的场景点簇视为一个刚体微团,用预测的 general flow 对该点簇做加权 SVD 刚体配准,得到 SE(3) 变换后交给阻抗控制器执行,闭环重复直到任务完成或失败(Algorithm 1)。加权 SVD 中每个点的回归权重与其到夹爪距离成反比:w_i=(1/(d_i+β))/Σ(1/(d_j+β)),β=1。
- 对短距离轨迹(<5cm)做特殊处理:因 Deoxys 的 6DoF 阻抗控制器在小距离下精度不足,将该轨迹整段合并为一步并放大到 5cm 执行,约 25% 的预测触发此策略。
- 部署时用 FastSAM(以机器人静止底座为 prompt 点)分割机器人本体,反投影得到场景点云后选取夹爪 10cm 半径内的点作为查询点。
Infra(训练 / 推理工程)
- 训练:ScaleFlow-B(5.62M 参数)在单张 NVIDIA GeForce RTX 3090 GPU(配 Intel Xeon Gold 5220R CPU)上训练 10 小时完成 200 epoch;论文未披露具体的 GPU 小时统计口径之外的更大集群资源(即未使用多卡/多机)。
- 推理延迟分解(表 V,基于”打开(抓握)冰箱”任务 10 次测量均值):数据采集 3.2ms,FastSAM 分割 347.6ms,点云生成 30.8ms,查询点采样 0.3ms,Flow 预测(ScaleFlow-B)22.1ms,启发式策略生成 1.7ms;含分割总延迟 405.7ms(2.5Hz),不含分割总延迟 58.1ms(17.5Hz)。FastSAM 分割占总延迟 85.7%,是主要瓶颈。
- 相机:RealSense D455,部署时用 1280×720 分辨率(低于 HOI4D 训练用的 1920×1080),故部署时体素下采样粒度改为 0.01cm(训练用 0.02cm)。ROS 系统闭环频率设为 20Hz。相机-机器人标定:方向四元数 (qw=0.911, qx=-0.015, qy=0.410, qz=-0.032),位置 (x=-0.265, y=0.260, z=1.095),模拟人类第一视角操作视角。
评测 benchmark
Flow 预测精度(HOI4D 测试集,3D ADE/FDE,单位米;ADE-H/FDE-H 为含手部点的鲁棒性测试):
| 模型 | ADE↓ | FDE↓ | ADE-H↓ | FDE-H↓ | 参数量(M) |
|---|---|---|---|---|---|
| ResNet18 | 0.0754 | 0.1071 | / | / | 13.160 |
| R3M(frozen) | 0.0755 | 0.1056 | / | / | 11.861 |
| R3M(finetune) | 0.0754 | 0.1069 | / | / | 11.861 |
| VAT-MART | 0.0716 | 0.1220 | 0.0717 | 0.1220 | 1.577 |
| VIT-B-224 | 0.0681 | 0.0948 | / | / | 86.614 |
| PointNeXt-B | 0.0396 | 0.0537 | 0.0392 | 0.0529 | 4.134 |
| PointNeXt-L | 0.0383 | 0.0516 | 0.0380 | 0.0512 | 15.583 |
| ScaleFlow-S | 0.0374 | 0.0501 | 0.0372 | 0.0498 | 0.906 |
| ScaleFlow-B | 0.0358 | 0.0477 | 0.0356 | 0.0474 | 5.622 |
| ScaleFlow-L | 0.0355 | 0.0470 | 0.0352 | 0.0467 | 17.088 |
3D 模型全面优于 2D 模型(ResNet/VIT/R3M),说明 3D 几何信息的重要性;ScaleFlow 系列以更少参数超越同规模 PointNeXt 基线。
真实世界零样本人到机器人技能迁移(Franka-Emika 机械臂,单一 ScaleFlow-B 模型覆盖全部任务,每任务 10 次试验):
| 物体 | 动作 | 成功率 |
|---|---|---|
| Mug | pickup / putdown | 10/10 / 9/10 |
| Toy Car | pickup / putdown / push | 10/10 / 10/10 / 5/10 |
| Clothes | fold | 8/10 |
| Safe | open / close | 9/10 / 10/10 |
| Box | open / close | 10/10 / 10/10 |
| Drawer | open(pull) / open(grasp) / close | 4/10 / 3/10 / 10/10 |
| Refrigerator | open(pull) / open(grasp) / close | 7/10 / 9/10 / 10/10 |
| Laptop | open / close | 5/10 / 7/10 |
| 平均成功率 | 81% (146/180) |
对比基线:Bahl et al. (Affordances from Human Videos) 是唯一开源的、与本文设置相近(直接从真实人类视频学低层 affordance)的工作;作者部署其模型后发现该基线 (1) 运动方向泛化不足,(2) 只给 2D 指导、无深度信息,(3) 受本体遮挡干扰显著,预测轨迹不足以支撑闭环执行,因此未进行进一步机器人实测对比。
真实世界消融(open Safe / close Drawer 两个代表性任务,成功率):full 95%(9/10, 10/10);w/o Scale Rebalance 75%(7/10, 8/10);w/o HM Augmentation 70%(8/10, 6/10);w/o QPS Augmentation 45%(5/10, 4/10)——QPS 增广对零样本鲁棒性影响最大。
离线消融(Test-ADE/FDE w/o hand,表 IV):full 0.0358/0.0477;w/o Text EarlyFusion 0.0370/0.0495;w/o Scale Normalization(relative) 0.0376/0.0504;w/o Scale Normalization(absolute) 0.0381/0.0512;w TDN 0.0374/0.0500;w SDN 0.0377/0.0510;w β₁=1 0.0368/0.0493;w/o central crop 0.0399/0.0538(不做立方体裁剪、场景 2m 操作空间内主动物体点仅占约 2%);w/o Scale Rebalance 0.0359/0.0478;w/o HM Augmentation 0.0366/0.0488;w/o QPS Augmentation 0.0358/0.0477——三种鲁棒性增广不损害域内精度(HM 增广甚至显著提升域内预测精度)。
创新点与影响
- 贡献:(1) 首次提出并验证”general flow as foundation affordance”框架,把 3D 点级未来轨迹预测作为可规模化、跨本体的机器人学习基础任务;(2) 提出 scale-aware 的 ScaleFlow 架构(TLN 归一化 + scale rebalance + 尺度回归损失),系统解决真实世界 flow 预测中轨迹尺度差异巨大的问题,以更少参数超过 FlowBot3D/ToolFlowNet 等现有方法;(3) 首次证明单一 flow 预测模型 + 简单启发式闭环策略即可实现稳定的零样本人到机器人技能迁移(81% 成功率,18 任务/6 场景/3 类物体),且对分割误差、新类别、抓取方式、初始位姿等具有一定鲁棒性。
- 观察到的涌现能力:语言可控的语义分化(同一输入点云因指令不同预测出不同 flow)、对标签噪声的鲁棒性(label 有明显偏差或近乎静止时仍预测出正确趋势)、空间常识(根据物体空间关系自适应调整预测尺度)。
- 论文自陈的局限:(1) 依赖 FastSAM 做开放世界分割,是推理延迟的主要瓶颈(占 85.7%),且分割质量制约整体鲁棒性;(2) 当前数据缺乏细粒度语言控制(如”Storage Furniture”笼统概括了旋转式与平移式两种结构,导致 open Drawer 抓取式成功率仅 30%,因训练数据里旋转结构的比例带来预测偏置);(3) 启发式策略过于简单,在夹爪周围无点时会失效,未来可结合少样本模仿学习或强化学习做更优策略;(4) 薄物体(如笔记本电脑盖)因单视角 RGBD 点云生成质量差导致成功率下降(50%);(5) Toy Car 推动方向的语义理解要求较高,成功率仅 50%。作者提出未来方向:用更大规模、语义更丰富的人类视频数据集(如同期发布的 Ego4D 后续/Ego-Exo4D 类数据)、结合深度估计技术使用纯 RGB 数据集、多视角/腕部相机缓解遮挡、更精细的下游策略学习。
- 项目页面标注该论文投稿/发表于 RSS 2024。
原始链接
- arXiv: https://arxiv.org/abs/2401.11439
- PDF: https://arxiv.org/pdf/2401.11439
- 项目页: https://general-flow.github.io/
- GitHub: https://github.com/michaelyuancb/general_flow
一手源存档(sources/)
- general-flow—project-page — 项目主页(含摘要、视频演示说明、涌现特性图解、BibTeX)
- general-flow—github-readme — GitHub README(安装、模型库权重下载、HOI4D/RGBD 视频标签提取流程、训练/推理命令)
- arXiv 原文 PDF(2401.11439),不入 git