一句话定位
CogRobot(中国电信人工智能研究院 TeleAI + 西北工业大学 + 港科大)不直接训练异构动作空间的 VLA,而是把双臂操作重新表述为”视频预测”问题:微调 CogVideoX 得到 text-to-flow(预测光流序列,把语言意图具体化为运动线索)→ flow-to-video(用光流引导生成细粒度机械臂轨迹视频)两级模型,再用一个轻量 goal-conditioned Diffusion Policy 从预测视频的目标帧里解出可执行关节动作,从而用有限的双臂数据获得一个可泛化的双臂基座策略。
背景与定位
双臂操作的 VLA 路线(如 rdt-1b 的统一物理动作空间、GR00T/GO-1 的隐动作码本,参见 groot-n1)需要在异构机器人数据上从头训练统一动作空间的大模型,计算开销大,且双臂动作本身多模态性强,需要海量数据覆盖各种动作模式。CogRobot 反过来问:能不能不直接建模异构动作,而是利用现成的文本到视频(T2V)生成模型——它们已经从网络视频里学到了物体交互与运动语义——把”预测机器人轨迹”变成”预测未来观测视频”,再用一个轻量控制器把视频目标帧转成动作。
但直接把 T2V 模型(作者选用 cogvideox)在双臂数据上微调效果很差:论文用 CogVideoX-2B/5B 在 rdt-1b 和 robomind 数据集上直接微调(记为 CogVideoX-*B-SFT)做诊断,发现三类失败模式——(i) 物理幻觉(生成的机械臂运动违反物理规律,甚至把机械臂又换回人手);(ii) 任务混淆(长程指令下相似初始画面时选错子任务分支);(iii) 指令模糊(“place it”这类高层语言缺乏执行细节,导致动作过激、不可行)。CogRobot 的解法是引入光流作为中间表征,把”语言→视频”拆成”语言→光流→视频”两级,缓解语言歧义、降低对大规模数据的依赖。同期用视频预测做双臂操作的工作还有 vidar(视频扩散 + 逆动力学 + 测试时扩展)。
模型架构
两级模型均以 CogVideoX-2B 为基座(论文强调官方 2B 版本不支持初始观测图像条件输入,故实际使用社区变体 alibaba-pai/CogVideoX-Fun-V1.1-2b-InP,支持图像条件与多分辨率;直接微调消融的 5B 版本同样来自 VideoX-Fun 的 CogVideoX-Fun-V1.1-5b-InP)。
- Text-to-Flow:把光流序列 F_{0:N}=(f_{0→1},…,f_{0→N}) 按幅值+方向(HSV 色轮,幅值→饱和度、方向→色相)栅格化为”光流视频”,从而复用预训练 3D VAE 编码、避免为 2 通道光流单独训一个 VAE(不同于此前工作 Motion-I2V 需要额外训练 flow VAE)。冻结 VAE,只微调扩散 Transformer 预测加噪光流视频的噪声(标准 ε-prediction 扩散损失)。
- Flow-to-Video:光流视频与真实双臂轨迹视频各自过同一个冻结的预训练 3D VAE 得到 latent z_f、z_v;对 z_v 加噪后与 z_f 沿 channel 维拼接,与文本 embedding 一起送入扩散 Transformer,训练目标同样是预测加到视频 latent 上的噪声。
- 动作头:不做 token 化或直接动作回归,而是用预测视频的目标帧 o_n 作为”目标观测”,训练一个 goal-conditioned Diffusion Policy(骨干为 Diffusion Policy,[22])π(a_{0:n}|o_0,o_n):新增一个 ResNet-18 编码目标图像,特征与另一个 ResNet-18 编码的历史观测特征拼接,再走标准扩散策略头生成动作序列。训练时随机采样目标步长 n~U(1,n_max) 并对动作序列加噪去噪。
- 光流提取:训练阶段用 FlowFormer++ 离线抽取真值光流(帧 0 与帧 1…16 两两配对),推理阶段光流由 text-to-flow 模型自身生成,不依赖外部光流模型。
- 视频统一分辨率 256×256、定长 17 帧。
数据
预训练混合两个公开双臂数据集:
- RDT 数据集(ALOHA 平台采集,300+ 任务):经采样步长 4、跳帧间隔 2 切片后得到 157,912 条训练片段;另留出 5% 情节作验证集,得到 1,757 条验证片段(步长 16)。
- RoboMIND(跨本体基准中的 AgileX 双臂子集):同样步长/跳帧设置下得到 198,789 条训练片段;用官方验证集切出 5,346 条验证片段。
下游微调集(自采):
- RoboTwin(仿真数字孪生环境):用官方脚本每任务采集 100 条成功轨迹,切片(步长 1、跳帧间隔 4)后得到 106,771 条训练片段。
- Realman 真机(自建双臂平台):Vision Pro 遥操作每任务采集 100 条人类演示,切片后得到 12,866 条训练片段。
预处理:统一 resize 到 256×256、切成定长 17 帧片段;因双臂精细操作帧间变化小,用跳帧下采样减少静止帧占比;光流视频在光流序列前额外拼接一张纯白图像对齐总长度为 17 帧;并过滤掉光流幅值过低(画面基本静止)的片段。
下游任务设计(真机,两类各 100 条演示、20 次试验评估):柔性物体操作(Pull box:双臂各抓绳一端、绕到箱后再合力拉近)、双臂协同搬运(Lift bag:双臂各抓一侧提手同时抬起)——均为单臂无法独立完成的协同任务。
训练方法
两阶段微调流程(text-to-flow 与 flow-to-video 各自独立训练,不共享参数):
- 第一阶段:在 RDT+RoboMIND 合并数据集上微调 CogVideoX-2B,text-to-flow 训 20k steps、flow-to-video 训 30k steps;
- 第二阶段:以第一阶段权重为基座,在下游具体数据集(RoboTwin 或 Realman)上继续微调,两个模型均训 RoboTwin 15k steps / Realman 5k steps。
优化器:AdamW,学习率 2×10⁻⁵,前 100 步线性 warmup。低层策略另用 Diffusion Policy 的标准扩散训练目标(对目标步长 n 与噪声同时采样)。
关键设计取舍:光流不直接建模为 2 通道张量,而是转成 3 通道”光流视频”复用预训练 VAE 与生成先验——用作者的说法,这是为了在双臂数据稀缺的前提下最大化利用 T2V 预训练权重、避免像此前工作那样需要网络级数据规模去单独训练 flow VAE。
Infra(训练 / 推理工程)
训练硬件:全部微调(含两阶段、两个模型)均使用 4×H100 80GB,batch size 128/GPU(论文原文表述,未进一步说明是否梯度累积或全局有效批大小)。精度、并行策略(是否用 ZeRO/FSDP)论文未披露。
推理/部署:真机部署为闭环迭代——把当前观测输入 text-to-flow→flow-to-video 生成新的目标观测,再喂给 goal-conditioned Diffusion Policy 出动作;论文未披露端到端推理延迟或控制频率(Hz)。数据采集阶段的遥操作控制频率为 60 Hz(VR 遥操作到机械臂逆运动学求解的更新频率,非模型推理频率)。
评测 benchmark
RoboTwin 仿真(10 个随机种子×10 次评估,报告成功率均值±标准差;基线含单视角 Diffusion Policy/DP、3D 点云 DP3、多视角 RDT-1B,CogRobot 仅用单视角 RGB):
| 任务 | DP3(点云) | DP3(点云+色彩) | RDT(多视角) | DP(单视角) | CogRobot(单视角) |
|---|---|---|---|---|---|
| Put Apple Cabinet | 74.7±42.2 | 97.0±2.6 | 22.0±0.10 | 82.0±0.09 | 100.0±0.0 |
| Block Handover | 67.3±7.0 | 86.0±15.1 | 70.0±0.08 | 2.0±0.04 | 36.0±0.11 |
| Pick Apple Messy | 11.7±5.5 | 68.7±6.8 | 31.2±0.08 | 3.0±0.07 | 15.0±0.07 |
| Container Place | 89.0±7.5 | 73.3±6.5 | 34.4±0.09 | 51.0±0.14 | 55.0±0.07 |
可见 CogRobot 在部分任务上以单视角输入超过依赖 3D 点云/多视角的强基线(Put Apple Cabinet、Container Place),但在 Pick Apple Messy 上明显落后于带色彩的 DP3(15.0 vs 68.7)。
真机双臂(20 次试验平均成功率,基线仅 DP 单视角):
| 任务 | DP | CogRobot |
|---|---|---|
| Lift Bag | 0.50 | 0.70 |
| Pull Box | 0.05 | 0.75 |
在需要多阶段协调的 Pull Box 上优势最明显(0.05→0.75),验证视频预测模型作为高层规划器对复杂协同任务的帮助更大。
视频生成质量消融(RoboMIND 官方验证集 5,346 样本 + RDT 自建验证集 1,757 样本;PSNR↑/SSIM↑/LPIPS↓/FVD↓,对比直接在 RDT+RoboMIND 上 SFT 的 CogVideoX-2B/5B):
| 数据集 | 方法 | PSNR | SSIM | LPIPS | FVD |
|---|---|---|---|---|---|
| RDT | CogVideoX-2B-SFT | 19.677 | 0.784 | 0.151 | 1222 |
| RDT | CogVideoX-5B-SFT | 20.502 | 0.806 | 0.132 | 1064 |
| RDT | CogVideoX-2B-Flow(本文) | 22.663 | 0.836 | 0.097 | 760 |
| RoboMIND | CogVideoX-2B-SFT | 18.928 | 0.821 | 0.136 | 848 |
| RoboMIND | CogVideoX-5B-SFT | 19.418 | 0.837 | 0.123 | 740 |
| RoboMIND | CogVideoX-2B-Flow(本文) | 21.977 | 0.864 | 0.085 | 576 |
用 2B 参数量的光流引导模型在四个视频质量指标上全面超过直接 SFT 的 2B 与 5B 模型,说明光流中间表征对小数据场景下的视频预测质量提升比单纯堆参数量更有效。
创新点与影响
- 贡献:(1) 提出把双臂基座策略问题转化为”视频预测 + 目标条件低层策略”,绕开异构动作空间统一建模与从头大规模预训练;(2) 提出 text-to-flow → flow-to-video 两级范式,用光流视频(复用预训练 VAE,无需额外训练模态转换网络)作为中间表征缓解语言指令歧义、降低双臂微调数据需求;(3) 用交叉注意力图可视化证明光流引导确实提升了模型对动作词/物体词的视觉 grounding;(4) 自建 Vision Pro 遥操作双臂平台与两类协同任务真机数据。
- 影响:为”用现成 T2V 模型做机器人基座策略”这一路线提供了一种数据高效的方案,将光流作为语言-视频之间的桥接表征这一思路可迁移到其他视频预测式世界模型/策略工作(如同期的 vidar)。
- 作者自述局限:每个下游任务仍需单独训练一个 goal-conditioned 低层策略来从预测视频中提取动作,尚未做到统一动作模型;论文未公开代码/权重/项目页。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2505.24156
- 论文 PDF:https://arxiv.org/pdf/2505.24156
- 论文全文 HTML:https://arxiv.org/html/2505.24156v1
一手源存档(sources/)
- 未发现官方博客 / GitHub / HuggingFace 模型卡 / 项目页(论文正文与 arXiv 摘要页均未提供代码或项目链接,Bing 检索亦未找到公开发布)。
- arXiv 2505.24156 全文(arXiv 原文 PDF,不入 git;见上方链接)