一句话定位
Track2Act(CMU/UW/Meta,ECCV 2024;arXiv 预印本标题为 “…Diverse Zero-shot Robot Manipulation”)用一个只在约 40 万段网络人类/机器人视频上训练的点跟踪扩散模型预测「初始帧→目标帧」之间任意一组像素点的未来轨迹,把这份 2D 轨迹解算成物体的 3D 刚体变换序列得到开环机械臂动作计划,再用约 400 条本体专属遥操作数据训练的小型残差策略逐步修正,使 Spot 机器人在 5 类泛化难度、25 项未见任务上实现零样本(无需测试时训练)操作。
背景与定位
零样本操作的主流路径是在大规模机器人交互数据集(RT-1、Bridge 等)上做行为克隆,但真实机器人数据采集成本高、任务多样性受限;另一条路径是测试时训练(先看一段人类演示视频再在线练习),无法做到真正的开箱即用。Track2Act 延续 Bharadhwaj 等人此前用手-物体掩码作为跨本体交互计划的思路,但认为掩码丢失了精确的物体状态变化信息,转而用**点轨迹(point tracks)**作为本体无关的中间表征——它比 RGB 帧更容易预测(不需要建模纹理、光照等外观细节),又比手-物体掩码或稀疏光流更能捕捉大幅非线性状态变化下的点对应关系。
同期工作中,general-flow(Yuan et al., Tsinghua)用 3D flow + 手工挑选抓取点的启发式策略,im2flow2act(Wang et al., Stanford/Columbia, CoRL 2024)用物体中心 flow 生成网络 + 完全学习的仿真 play-data 策略——三者共享「用运动轨迹作为本体无关中间层,连接网络视频与机器人执行」这一范式,但 Track2Act 的路径是「预测轨迹→PnP 解算刚体变换→残差策略修正」的最短闭环,不需要仿真环境或额外的抓取点检测模块。
模型架构
系统分三阶段,均围绕同一份预测的点轨迹 τ 展开:
1. 轨迹预测模型 𝒱_θ(唯一在网络视频上训练的模块):基于 DiT(Diffusion Transformer)的去噪扩散模型,输入初始帧 I₀、目标帧 𝒢(视为该视频片段的末帧)、初始帧上待跟踪的 p 个随机点 P₀,输出这些点在未来 H 步的 2D 位置 [P_t]。与原始 DiT 不同之处:每个 DiT block 通过 adaLN(自适应层归一化)额外注入初始帧嵌入 z₀、目标帧嵌入 z_g(均为 ResNet18 编码,维度 512)与扩散步嵌入 z_k 的加和;Transformer 每个 batch 的输入是 p 个 token(对应待跟踪点数),P₀ 本身不加噪。配置:24 个 DiT block,隐藏维度 1024,16 个注意力头;训练时 p 在 200–400 间随机变化,测试时可指定任意点集;不对训练视频做任何目标筛选或相机运动假设。
2. 粗粒度机械臂轨迹推断(Algorithm 1,无需任何机器人数据的几何优化):给定深度图得到初始点的 3D 坐标 P₀^3D 与相机内参 K,对预测轨迹中判定为「物体上」的点子集 τ_obj(通过运动幅度筛选,RANSAC 剔除离群点),在每个时间步求解 PnP 型优化 argmin_T Σ‖投影(K·T_t·P₀) − 预测2D轨迹‖,得到刚体变换序列 [T_t];末端执行器先移动到预测点集中心并完成抓取,再按 T_t 变换末端位姿得到开环动作 ā_t = T_t·e₁。
3. 残差策略 π_res(Fig. 4,唯一在本体数据上训练的模块):同样是 DiT 架构 Transformer,12 个 block,隐藏维度 512,8 个头;输入是密集网格上 p=400 个点(对应 256×256×3 图像分辨率)的预测轨迹加上未来 h 步的开环计划 [ā_t],共 p+h 个 token,读出末尾 h 个 token 经 MLP 得到 h 步残差动作 Δa_{t:t+h};实际执行 Δa_t + ā_t 的第一步,采用多步预测-单步执行以缓解行为克隆的复合误差。两个模型均用 Adam(β=0.9/0.999)、恒定学习率 1e-4 训练;adaLN 层与末层 MLP 零初始化,其余 Xavier 均匀初始化。
数据
轨迹预测训练数据:约 400,000 段网络视频片段(4–5 秒/段),来自四个来源——Something-Something-v2(人类日常操作 YouTube 短视频,直接取首末帧为初始/目标图)、Epic-Kitchens(厨房第一人称长视频,切成 4–5 秒片段并筛选有手部可见的片段)、RT-1 数据、BridgeData(两种不同机器人的遥操作数据,取每条 rollout 首末帧)。所有片段用 Co-Tracker 在首帧密集网格 400 个点上生成伪真值轨迹作为监督信号——不使用任何人工标注的动作标签。RT-1/Bridge 所用机器人本体与实验中的 Spot 完全不同,验证了本体无关的可迁移性。
残差策略训练数据:仅 约 400 条遥操作轨迹,覆盖 10 个任务、3 个物理场地,用摇杆遥操作 Spot 采集,每条轨迹 H=50 步 (I_t, a_t) 观测-动作对,采集频率 5 Hz(与部署频率一致)。论文强调这比 RT-1/RoboAgent 等同类工作所需的机器人数据量少 3–4 个数量级。评测场景中,与采集数据同任务的部分对应「轻度泛化 MG」,其余泛化轴(未见物体实例/组合/类型)均超出这 10 个任务/3 场地范围。
训练方法
两阶段解耦训练,无联合优化、无强化学习:(1) 轨迹预测模型仅用网络视频 + Co-Tracker 伪标签做去噪扩散训练(DDPM 目标);(2) 残差策略仅用本体遥操作数据做行为克隆,条件输入包含冻结的轨迹预测结果与几何解算出的开环计划,因此只需学习相对该计划的小幅修正,不需要重新学习完整动作分布。部署时(Algorithm 2):先跑一次轨迹预测与刚体变换解算得到全程开环计划,再逐步用残差策略预测未来 h=4 步修正、执行首步、以闭环方式重复直至完成或到达时限 H=50,末尾开爪并复位。消融对比「预测残差」vs「直接预测完整动作(不依赖开环计划)」验证了残差范式的必要性。
Infra(训练 / 推理工程)
- 训练:GitHub 训练脚本为
torchrun --nnodes=1 --nproc_per_node=8,全局 batch size 480(1 节点 8 GPU);GPU 型号、单次训练总 GPU-小时未披露。 - 推理/部署:Spot 机器人前置 Intel RealSense RGBD 相机,末端二指夹爪,通过 Boston Dynamics 官方 IK 控制器把预测的末端位姿转换为关节动作;控制频率 5 Hz,rollout 视界 H=50 步,残差策略每步预测 h=4 步后仅执行首步;轨迹预测扩散模型的采样延迟未披露。
评测 benchmark
轨迹预测(Table 1,Δ 指标:δ_t^x 在 x∈[1,10] 像素阈值、H 步上的曲线下面积均值,0–1 越高越好;对比 flow 插值基线与「先生成 RGB 视频再用 Co-Tracker 打点」的 video 基线):
| 数据集 | Flow 基线 | Video 基线 | Track2Act | 静止基线(不预测运动) |
|---|---|---|---|---|
| EpicKitchens | 0.21 | 0.30 | 0.67 | 0.03 |
| SmthSmthv2 | 0.27 | 0.17 | 0.70 | 0.05 |
| BridgeData | 0.42 | – | 0.77 | 0.36 |
| RT1 Data | 0.38 | – | 0.75 | 0.28 |
机器人操作成功率(Table 2,每个泛化档位 20 次 rollout,覆盖 5 个物理场地共 25 项任务;MG=轻度/G=标准/CG=组合/TG=类型泛化):
| 方法 | MG | G | CG | TG |
|---|---|---|---|---|
| Behavior Cloning (BC) | 60% | 20% | 0% | 0% |
| Affordance-Conditioned BC | 65% | 30% | 10% | 5% |
| Video-Conditioned BC | 60% | 25% | 0% | 0% |
| Hand-Object Mask-Conditioned BC | 70% | 40% | 25% | 20% |
| Track2Act(仅开环,无残差策略) | 35% | 25% | 30% | 25% |
| Track2Act(消融:直接预测动作而非残差) | 70% | 45% | 30% | 30% |
| Track2Act(完整) | 70% | 60% | 55% | 40% |
完整方法在标准/组合/类型泛化三档上显著超过所有基线,尤其在 CG/TG 上比第二名(Hand-Object Mask-Conditioned BC)分别高 30 / 20 个百分点;仅开环执行的成功率明显低于加入残差策略后,说明残差策略主要纠正抓取误差与轨迹中断等失败模式。
创新点与影响
- 提出用点轨迹(而非手-物体掩码、静态可供性图或生成式 RGB 视频)作为本体无关的交互计划表征,在同等设定下的定量对比中一致优于这三类基线。
- 证明了「大规模网络视频学交互计划 + 极少量本体数据学残差修正」的两段式分工:约 40 万段无动作标签的网络视频负责跨场景/跨物体泛化能力,仅 400 条本体轨迹(约为同类工作所需机器人数据的千分之一到万分之一量级)负责让计划变得可执行。
- 论文自陈局限:任务仍是短时程、单物体操作;作者指出把该框架扩展到涉及多物体连续操作的长时程任务是未来方向。此外失败分析显示 CG/TG 档位成功率仍然有限(40–55%),主要败因是错误抓取、执行卡死、以及生成轨迹与目标图不完全吻合。
原始链接
- arXiv: https://arxiv.org/abs/2405.01527
- PDF: https://arxiv.org/pdf/2405.01527
- GitHub: https://github.com/homangab/Track-2-Act
- 项目主页: https://homangab.github.io/track2act/
一手源存档(sources/)
- track2act—github-readme.md
- track2act—project-page.md
- arXiv 原文 HTML(https://arxiv.org/html/2405.01527v1,含 Appendix 6.2–6.8 全部架构/数据细节),不入 git