一句话定位

SeedPolicy 给 Diffusion Policy 加装一个循环式的门控注意力时序模块(SEGA),用固定大小的循环隐状态取代堆叠观测帧窗口,把”观测窗口越长、DP 性能反而越差”这一反直觉现象直接反转——在 RoboTwin 2.0 的 50 个操作任务上平均比 DP 提升 36.8%(干净场景)/ 169%(强随机化场景),且能外推到超过训练窗口 5 倍以上的分钟级长程任务,并可移植进 VLA 架构(SeedVLA)。

背景与定位

Diffusion Policy 用固定长度的堆叠观测帧作为扩散动作专家的条件;其原论文附录曾提到一个反直觉现象——观测窗口越长,性能反而下降,但未深入分析原因。SeedPolicy 系统性拆解这个瓶颈:先证明”加一层朴素时序自注意力”能修复这一趋势(验证问题出在”简单堆叠帧无法捕捉复杂时序依赖”,而非扩散建模本身),但时序注意力的计算量随窗口二次方增长,扩展到更长窗口时收益迅速递减。为此,作者提出循环式更新机制——用一个固定大小的隐状态 S_t 取代不断增长的窗口来累积历史上下文,再用一个不引入额外可学习参数的门(直接复用交叉注意力自身的 logits 作为相关性信号)过滤视觉噪声,两者合称 Self-Evolving Gated Attention(SEGA)。

命名对照:ACT/ACT 靠动作分块稳定轨迹;RDT、π0.5 等 VLA 走”大模型 + 少样本微调”路线;SeedPolicy 走的是”给 DP 配一个轻量循环记忆模块”,不改变 DP 本身的扩散动作专家。论文把 SEGA 与两种已有记忆机制做了受控对比——ARMT 式循环 transformer 记忆、MemoryVLA 式外部记忆库,SEGA 在原文 10 个代表性任务上全部胜出;并在附录里把 SEGA 的循环隐状态机制替换进 MemoryVLA 的记忆模块得到 SeedVLA,验证该机制不锁定在扩散策略骨干上。

基准是 RoboTwin 2.0(ALOHA-AgileX 双臂平台,50 个任务)+ 真机 Dexmal DOS-W1 平台(5 个长程状态歧义任务),另外用 RMBench 分钟级任务和 MimicGen(单臂 Franka,MuJoCo)做跨基准泛化验证。

模型架构

Backbone:ResNet 视觉编码器把当前 RGB 图像 I_t 与关节位姿 P_t 编码为观测特征 O_t∈R^(No×D);观测经 SEGA 时序模块增强后,送入 Transformer(或 CNN)骨干的扩散动作专家(Diffusion Action Expert)。默认用 Transformer 骨干做真机实验与全部消融(参数效率更高),另有 CNN 骨干变体做架构无关性验证。

SEGA(Self-Evolving Gated Attention)

  • 维护固定大小的循环隐状态 S_(t−1)∈R^(Ns×D),消融确定 Ns=60、D=256 为最优(Ns=30 信息不足,Ns=90 出现轻微性能回退,如 Grab Roller 从 89%→80%)。
  • 双流并行 Transformer 设计:State Update 流——S_(t−1)、O_t 各自过 MSA 提取内部特征后,S’_(t−1) 作 Query 对 O’_t 做交叉注意力,得到中间状态 Inter·S_t 与 L 层×H 头的注意力 logits A;State Retrieval 流——角色互换,O’t 作 Query 对 S’(t−1) 做交叉注意力,得到增强观测特征 EObs_t,送入动作专家。
  • Self-Evolving Gate (SEG):不训练额外门控网络,而是把 State Update 流里的 pre-softmax 交叉注意力 logits 在 L·H·No 维度上取平均得全局相关性分数 R,过 sigmoid 得门 G_t∈R^(Ns×1),门控融合:S_t = G_t⊙Inter·S_t + (1−G_t)⊙S_(t−1)。
  • 交互块深度消融:L 从 2 增到 6 持续提升(Put Bottles Dustbin 36%→48%),L=8 出现过拟合回退(Move Can Pot 71%→52%),最终取 L=6。
  • 推理无额外串行瓶颈:观测逐步到达,S_(t−1) 已缓存,每步只需用新观测更新。
  • ACTION 头:连续扩散(非离散 token 化),DDPM,100 训练/推理时间步,Squared Cosine Cap v2 beta schedule(β_start=1e-4→β_end=0.02),ε-prediction;每步预测未来若干个 14-DoF 动作(ALOHA-AgileX 双臂+夹爪,DOS-W1 亦为 14 维状态:双臂各 6-DoF 关节+1-DoF 夹爪)。
  • 观测窗口:T_obs=3(3 帧 320×240 RGB + 14-DoF 关节位姿);窗口本身不扩大,长时依赖靠 SEGA 的循环隐状态而非更大堆叠窗口获得。
  • 跨骨干通用性:SEGA 同时验证于 Transformer 与 CNN 两种 DP 骨干,均带来一致增益。
  • VLA 兼容性(SeedVLA):把 SEGA 的循环隐状态机制替换进 MemoryVLA 的记忆模块(其余训练设置不变),验证机制不局限于扩散策略骨干。
  • 参数量:DP-Transformer 20.61M → SeedPolicy-Transformer 33.36M;DP-CNN 96.80M → SeedPolicy-CNN 147.26M(对比 RDT 1.2B,SeedPolicy 参数量少 1–2 个数量级,约省 8×–36×)。

数据

仿真(RoboTwin 2.0):50 个操作任务,每任务 50 条专家示范,训练 600 epoch,测试 100 次 rollout/任务,clean(demo_clean)与 randomized(demo_randomized)两种场景各测 3 个独立 trial 取均值。数据规模消融:示范数从 50→100→200,Place Empty Cup 32%→67%→87%,Stack Bowls Two 73%→91%→94%;短程任务 Turn Switch 提升有限(54%→55%→57%,已接近饱和)。

真机(Dexmal DOS-W1):Intel RealSense D435 前视固定 RGB 相机;5 个专为长程状态歧义设计的任务——Looping_Place-Retrieval(红/蓝方块依次放入托盘再取回,制造重复视觉状态)、Sequential_Picking(红/黄/蓝方块按固定顺序拾取放置)、Bottle_Handover(瓶子跨工作区转移)、Food_Replacement(移除原食物、抓取替换食物再放置)、Cover_and_Reveal(先用盖子遮住方块再揭开,制造物体临时消失的强状态歧义);每任务 50 条专家示范,600 epoch,评测 2 trial×50 rollout。

数据采集与处理流水线:采集期引入系统性空间随机化(物体初始位置与摆放朝向),迫使策略学习相对空间几何而非绝对坐标;用最近邻匹配把高频本体感知日志对齐到视频帧时间戳;运动式过滤——若 14 维状态向量(双臂 6-DoF 关节角+1-DoF 夹爪)相对上一有效帧静止(容差 ε<1e-4)则丢弃该帧;最终用 Zarr 归档 + Blosc-Zstd (level 3) 压缩存储,图像转 NCHW 格式,动作标签构造为”下一状态预测”(A_t 对应 t+1 时刻的状态向量)。

跨基准验证:RMBench 提供 3 个分钟级长程任务(Swap Blocks / Cover Blocks / Battery Try,单次成功执行需持续超过 1 分钟);MimicGen(MuJoCo 单臂 Franka)提供 Coffee D2 / Kitchen D1 / Mug Cleanup D1 三个任务,同时测图像观测与体素观测两种模态。

sim-vs-real / co-training:仿真与真机各自独立采集示范,论文未做仿真到真机的迁移实验,也未引入第三方数据联合训练。

训练方法

优化器 AdamW,batch size 128,学习率 1e-4,余弦衰减 + 500 步 warmup,训练 600 epoch;Transformer 骨干权重衰减 1e-3(注意力层)/1e-6(编码器)、β=(0.9, 0.95),CNN 骨干权重衰减 1e-6、β=(0.95, 0.999);EMA decay 0.75,梯度累积步数 1。扩散动作专家用 DDPM,100 训练/推理时间步,Squared Cosine Cap v2 beta schedule(1e-4→0.02),ε-prediction,训练目标是标准的去噪扩散损失(模仿学习,无 RL 阶段)。

隐状态初始化与重置:S_0 一次性从标准差 0.02 的零均值高斯分布采样(固定随机种子),随策略其余参数联合优化;训练时用 episode-reset 指示符在每个 episode 起始把状态替换为该学习到的初始隐状态 S_0,否则跨连续步递归传播;推理时同样从 S_0 起步,再由 SEGA 在线更新。

训练窗口与外推:训练期最大累积循环上下文对应约 120 帧观测(截断值而非模型容量上限);在分钟级长程任务测试中,实际成功 rollout 可达约 640 帧(约 64 秒,Battery Try 任务),证明隐状态机制可以外推到远超训练窗口的执行长度。

统计显著性:对 RoboTwin 2.0 clean 场景全部 50 个任务做配对双侧精确符号检验(sign test,剔除平局),Transformer 骨干 38 胜/5 负/7 平,p=2.5×10⁻⁷;CNN 骨干 41 胜/6 负/3 平,p=1.8×10⁻⁷,说明增益是系统性的而非少数任务的偶然结果。

Infra(训练 / 推理工程)

论文原文明确写明”All experiments are conducted on a single NVIDIA RTX 4090D GPU”——即每个策略在单张 RTX 4090D 上训练完成。GPU-hours、是否使用分布式/数据并行、混合精度训练细节均未披露。真机/边缘部署的控制频率(control-Hz)或端到端推理延迟(FPS)未披露。代码开源,基于 Diffusion Policy 官方实现与 RoboTwin 2.0 平台代码构建,循环隐状态更新的实现参考了 CUT3R 与 TTT3R 的思路;论文三个代表任务的预训练 checkpoint 发布在 Hugging Face(guiyouqiang/SeedPolicy),HF 页面内容因网络原因未能成功抓取核验,具体权重规格未在本页收录。

评测 benchmark

主表(RoboTwin 2.0,50 任务平均,原文 Table 1)

方法RDTACTDP-TransformerDP-CNNSeedPolicy-TransformerSeedPolicy-CNN
Easy 平均成功率34.50%29.74%33.10%28.04%40.08%42.76%
Hard 平均成功率13.72%1.74%1.44%0.64%4.28%1.54%
参数量1.2B80M20.61M96.80M33.36M147.26M
  • SeedPolicy 在 45/50(Transformer)、44/50(CNN)任务上打平或超过 DP。
  • Easy 场景绝对/相对提升:Transformer +7.0pt / +21.10%;CNN +14.72pt / +52.50%。
  • Hard 场景:Transformer 1.44%→4.28%(+197.22% 相对);CNN 0.64%→1.54%(+140.63% 相对)。
  • 按任务长度分组(Short/Medium/Long),SeedPolicy 相对 DP 的优势随任务变长而扩大:Short 阶段 Transformer +2.9pt / CNN +13.6pt;Medium 阶段 +6.4pt / +12.9pt;Long 阶段扩大到 +16.0pt / +21.9pt。
  • 与 RDT(1.2B 参数,单任务微调)对比:Easy 场景 SeedPolicy-CNN 42.76% 超过 RDT 8 个百分点以上;Hard 场景 RDT 反而更强(13.72% vs SeedPolicy 最高 4.28%),作者归因于 RDT 有大规模预训练视觉语言先验支撑开放式泛化。

与已有记忆机制对比(原文 Table 3,10 个代表任务,DP+ARMT-style / DP+MemoryVLA-style / SeedPolicy):Move Playingcard Away 56/64/68,Turn Switch 50/52/54,Place Object Stand 20/26/28,Dump Bin Bigbin 47/50/52,Place Container Plate 38/51/60,Place Empty Cup 15/30/32,Put Object Cabinet 15/29/41,Stack Blocks Two 33/38/47,Stack Bowls Two 56/60/73,Put Bottles Dustbin 21/26/48——SEGA 在全部 10 个任务上最优,长程任务优势最大。

组件消融(原文 Table 4,以 Short/Medium/Long 各一个代表任务):DP → +时序注意力 → +循环状态(无门控)→ +SEG 门控(Cross-Attention 版,即 SeedPolicy)→ FFN 版门控对照。Turn Switch(短)51/51/51/54/53;Place Empty Cup(中)24/26/28/32/21;Stack Bowls Two(长)33/48/65/73/70。长程任务上循环状态机制本身贡献最大(33%→65%),SEG 门控在此基础上进一步提升(65%→73%),且一致优于 FFN 版门控(73% vs 70%)。

Hard 场景训练+测试均随机化(附录 Table 11):SeedPolicy 全面优于 DP 与 FFN 门控变体,长程任务优势尤其明显。

分钟级长程任务(附录 Table 13,RMBench + RoboTwin 2.0,DP/ACT/π0.5/SeedPolicy):Swap Blocks 11/2/24/26,Cover Blocks 0/0/0/15,Battery Try 9/19/16/33——SeedPolicy 全部领先,且 rollout 可外推到约 640 帧(远超训练期 120 帧上限)。

MimicGen 跨基准(附录 Table 14,图像 vs 体素观测,DP/ACT/Ours-Img/Ours-Voxel):Coffee D2 26/33/80/79,Kitchen D1 50/61/83/89,Mug Cleanup D1 23/31/76/77,全面超过 DP 和 ACT。

SeedVLA 兼容性(附录 Table 15,RoboTwin 2.0 5 任务,RDT/MemoryVLA/π0.5/SeedVLA):Turn Switch 35/40/42/50,Handover Mic 90/69/58/91,Put Object Cabinet 33/38/54/60,Stack Bowls Two 76/81/93/94,Blocks Ranking Size 0/27/36/45——SeedVLA 全面最优。

真机结果(Fig. 6,5 任务):SeedPolicy 全面优于 DP 基线;正文给出的具体数字仅 Bottle_Handover(16%→54%),其余 4 个任务只以柱状图呈现,原文未列出精确数值。

统计显著性:符号检验 p=2.5×10⁻⁷(Transformer)/ 1.8×10⁻⁷(CNN),见”训练方法”节。

创新点与影响

贡献:(1) 第一次系统解释并解决 Diffusion Policy 里”观测窗口越长、性能反而下降”的反直觉现象,定位到堆叠帧无法捕捉复杂时序依赖这一根本原因;(2) 提出 Self-Evolving Gate——直接复用交叉注意力自身的 logits 作相关性信号,不引入额外可学习门控网络,在长程任务上一致优于 FFN 式门控,也优于 ARMT 式循环记忆、MemoryVLA 式外部记忆两种既有记忆机制;(3) 证明该循环隐状态机制不锁定在 DP 架构上——移植进 MemoryVLA 得到 SeedVLA,在 RoboTwin 2.0 上同样跑赢 RDT/MemoryVLA/π0.5;(4) 以远小于基础模型的参数量(33.36M/147.26M vs RDT 1.2B)在 clean 场景取得更强的成功率。

改变了什么:把”扩大观测窗口”这个此前被认为对 DP 无效甚至有害的方向,重新变成可扩展的长程建模手段;50 任务上的符号检验(p<1e-6)说明这不是个别任务的偶然收益,而是系统性改进;分钟级任务上隐状态外推到约训练窗口 5 倍长度(640 帧 vs 120 帧上限)说明该机制具备真正的长程泛化能力,而非死记硬背固定训练窗口。

作者自陈局限:Hard(强随机化)场景下泛化能力仍不如大规模预训练的基础模型(如 RDT);纯 RGB、无深度传感器输入,历史窗口下的 3D 位置估计仍是病态问题,透明/半透明容器等场景仍会出现空抓/碰撞;论文未披露具体训练算力规模(GPU-hours、并行策略)与真机推理延迟数字。

原始链接

一手源存档(sources/)

  • seedpolicy—github-readme — GitHub README 快照(sources/embodied/2026/seedpolicy—github-readme.md)
  • 论文全文(arXiv 2603.05117,arXiv 原文 PDF,不入 git;正文数字取自 v3 版本 PDF 全文)