一句话定位
清华 TSAIL 组的 RDT-1B:把 Diffusion Transformer(DiT)当骨干、以扩散建模连续动作分布的 1.2B 参数 VLA,先在 46 个数据集、100 万+ 条多机器人轨迹上预训练(当时最大的扩散式机器人基座),再在自采 6K+ 条双臂数据上微调,零样本泛化到未见物体/场景、少样本学新技能并完成灵巧双臂操作。
背景与定位
双臂操作的两大痛点:(1) 双臂动作空间维度翻倍,可行动作的多模态更强,确定性回归会学到”多模态的平均”,产生不可行动作;(2) 特定双臂机器人的数据极度稀缺(<10K 条轨迹)。RDT 的对策是把 openvla/rt-1/rt-2 走的”大规模多机器人预训练 + 目标机器人微调”范式引入双臂场景,把数据规模抬高三个数量级,从其他机器人数据中学可迁移的物理知识。
方法路线上它站在两条线的交汇点:一是扩散策略(diffusion-policy、dp3-3d-diffusion-policy)用扩散模型表达多模态连续动作,避开离散化量化误差与 VAE 的表达力不足;二是异构多机器人预训练(octo 的扩散 Transformer 93M、hpt-heterogeneous-pretrained-transformers 的异构对齐)。RDT 相对 Octo 的差异是把参数量拉到 1.2B 并对 DiT 做机器人专用改造,相对 OpenVLA(7B,离散 token)的差异是走连续扩散而非自回归离散。目标机器人是 mobile-aloha / aloha-act 体系的 ALOHA 双臂平台。论文明确强调:用多机器人数据是为了增强目标双臂机器人的泛化,而非做一个通用 cross-embodiment 模型。
模型架构
骨干:Diffusion Transformer(DiT with Cross-Attention)。RDT-1B 配置 28 层、hidden size 2048、32 个 attention head、约 1.2B 参数(Table 9)。消融里的小模型 RDT (small) 为 166M(发布为 RDT-170M)。
多模态编码器(均冻结以省显存):
- 视觉:SigLIP(
siglip-so400m-patch14-384),图像 token 维度 1152;3 路相机(外部 + 左右腕),图像历史 T_img=2;用多维网格位置编码 (T_img, N_cam, N_patch, D) 区分视角与时间。 - 语言:T5-XXL(
t5-v1_1-xxl),token 维度 4096;带 attention mask 屏蔽 pad token。 - 低维物理量(本体感知 z_t、含噪动作块 ã、控制频率 c、扩散步 k):用带 Fourier features 的 MLP 编码,以捕捉低维空间里的高频变化;动作用 3 层 MLP、语言/图像 adaptor 用 2 层 MLP(均 GeLU),统一对齐到 2048 维。
对 DiT 的三处机器人专用改造(Fig. 4 消融证明缺一不可):
- QKNorm + RMSNorm:机器人物理量数值范围不稳定,原始 DiT 的 LayerNorm 会导致大规模预训练时 loss 不稳定甚至爆炸;QKNorm 稳注意力数值,RMSNorm 去掉 centering 以免破坏时序对称性(token shift / attention shift)。
- MLP Decoder:把最后的线性解码头换成非线性 MLP,从 latent 投回物理动作空间,提升对非线性动作的逼近能力(去掉后无法完成灵巧任务)。
- Alternating Condition Injection (ACI):图像/语言作为条件、长度可变且信息量不对等,无法压成单 token 走 adaLN;改用 cross-attention 注入,且在相邻层之间交替注入图像与语言 token(而非每层同时注入),避免图像 token 数量远多于文本时压过文本、损伤指令跟随能力。
动作表征——Physically Interpretable Unified Action Space:128 维统一动作向量(Table 4),每一维有明确物理意义——右/左臂关节位置(各10)、夹爪关节位置(各5)、关节速度、末端执行器位置/6D 姿态/速度/角速度、底盘线/角速度等。特定机器人把原动作按物理意义填入对应槽位、其余 padding;单臂机器人填入”右臂”部分;EEF 旋转用 6D 表示。为区分”0=静止”还是”0=填充”,动作与本体感知拼接一个 0-1 mask 指示向量,得到 256 维。除夹爪宽度做 min-max 归一化到 [0,1] 外,其余物理量一律不归一化(用 SI 单位使多数值落在 [-1,1]),以保留物理含义、促进跨机器人泛化。
动作块(action chunking):一次预测 T_a=64 步动作块,减少决策次数、缓解误差累积并提升时序一致性。训练时对每路模态以 10% 概率独立随机 mask,防止过度依赖单一输入(如只看外部相机忽略腕部相机而丧失深度感知)。
数据
预训练集合:46 个数据集,合计 100 万+ 条轨迹、21 TB(论文称当时最大的机器人预训练集合)。采样权重按 √N_j 初始化(相对线性加权,抑制大数据集过采样、保证小数据集被充分采样),再依多样性/质量以及训练中间 loss 调整(收敛慢的数据集加权)。主要来源:
- RT-1 Dataset:13 万条轨迹,13 种本体,单外部 RGB,3 Hz。
- DROID:7.6 万条轨迹、564 个场景,Franka Panda 7-DoF,腕部+外部 RGB-D,15 Hz。
- RH20T:11 万条轨迹、140 任务,4 种本体、3 视角,10 Hz。
- Mobile ALOHA Dataset:1K+ 条双臂轨迹,14 维双臂关节位置 + 底盘。
- 其余来自 RoboSet、BridgeData V2、Open X-Embodiment 子集。
数据清洗:剔除重复片段与失败片段、去空白图像、剔除错误记录的速度、过滤过短轨迹、过长轨迹下采样。
微调集(自采,mobile-aloha 机器人):300+ 任务、6K+ 条轨迹、3M+ 帧,是当时最大的开源多任务双臂数据集之一。100+ 物体(刚体/非刚体、不同尺寸材质)、15+ 房间/光照。含灵巧任务(拧瓶盖)、理解任务(字母块拼 “love”)、灵巧+理解结合(白板解数学题)、双臂协同(插充电线)。其中借用开源 Songling 数据集 3 个任务共 140 条。用 GPT-4-Turbo 为每个任务改写生成 100 条扩展指令 + 1 条简化指令,增强文本多样性;训练时按 1/3 概率从原标注/扩展/简化指令中采样。
训练方法
目标:扩散去噪的 MSE。网络 f_θ 从含噪动作块预测干净动作块 a_t^0(x0-prediction),对整段 action chunk 建模 p(a_{t:t+T_a} | ℓ, o_t)。训练用 DDPM scheduler + glide cosine(squaredcos_cap_v2),1000 步噪声表。
两阶段流程:
- 预训练:多机器人统一动作空间上 1M 步。
- 微调:目标 ALOHA 双臂数据上 130K 步。因排期原因并非从 1M checkpoint 微调,而是选了 500K checkpoint。微调时进一步过滤长度 <32 的片段、把 >2048 的下采样到 2048,去掉每段开头操作者未反应的静止段。
关键超参(Table 10,预训练与微调共用):AdamW,constant LR = 1e-4,batch = 32×48 = 1536,bf16 混合精度,warmup 500 步,β1=0.9 / β2=0.999,weight decay 1e-2,ε=1e-8。
数据增强:图像 color jittering + image corruption;本体感知加 SNR=40 dB 的高斯噪声;GPT-4-Turbo 指令扩展。未使用 CFG(发现不提升反而带来机械臂不稳定行为)。训练监控:周期性扩散采样,比对采样动作与真值的 MSE(与实机部署表现正相关),MSE 收敛即可停,过低则可能过拟合。
Infra(训练 / 推理工程)
训练硬件:48 张 H100 80GB。预训练约 1 个月跑满 1M 步;微调用同一批 GPU 约 3 天跑 130K 步。框架 PyTorch + DeepSpeed(微调默认 ZeRO-2)。数据管线:把 OXE 等 TFRecord 全量转存,用 producer-consumer 框架——producer 进程从 TFRecord 解压写入硬盘 buffer,consumer 进程乱序读取喂给训练,既解耦 TF/PyTorch 环境又缓解内存 shuffle buffer 过小的性能损失;微调阶段数据小,额外用 HDF5 存储管线。buffer 需求 ≥400GB。
推理/边端:用 DPM-Solver++ 把采样扩散步从 100 步降到 5 步;在目标机器人板载 RTX 4090 24GB 上达到 6 Hz 动作块推理频率(action chunks/sec)+ 平均 381 Hz 动作推理频率(actions/sec),项目页称该频率足以支持机械臂达到接近人类操作者的速度(实验中为安全/减少磨损故意限速)。部署封装为 RoboticDiffusionTransformerModel.step();图像输入顺序须为 [ext, right_wrist, left_wrist] 的 t-1 与 t 两帧。VRAM 友好方案:预计算语言 embedding 免加载 T5-XXL、8-bit Adam、量化、XFormers、gradient checkpointing,或改用 RDT-170M。
评测 benchmark
真机(ALOHA / Cobot Mobile ALOHA,agilex.ai 制造,14 DoF = 7×2;仅用于场景间搬运,训练/推理均为静态双臂),成功率为主指标。7 个挑战任务覆盖五个维度:未见物体(Wash Cup)、未见场景(Pour Water)、指令跟随(Pour Water-L-1/3、R-2/3,“1/3""2/3”训练未见)、少样本(Handover 5-shot、Fold Shorts 1-shot)、灵巧(Robot Dog 推摇杆走直线)。基线:ACT、OpenVLA(7B,离散化)、Octo(93M,扩散)。
摘要口径:RDT 在广谱任务上比基线成功率提升 56%。多数任务中 OpenVLA / Octo / ACT 几乎全 0,RDT (ours) 显著领先(Table 3 节选,总成功率):Fold Shorts(1-shot) RDT 68 vs scratch 40 / Octo 4 / ACT 0;Handover(5-shot) RDT 40 vs scratch 16,其余基线 0;Robot Dog 走直线 RDT 48 vs scratch 32 / ACT 32 / OpenVLA 0。
消融(Table 2,未见物体/未见场景/指令跟随 成功率%):RDT (ours) 50 / 62.5 / 100;RDT (regress,去扩散) 12.5 / 50 / 12.5;RDT (small,166M) 37.5 / 62.5 / 25;RDT (scratch,无预训练) 0 / 25 / 62.5 —— 说明扩散建模、大模型、大数据缺一显著掉点,其中无预训练在未见物体/场景上崩塌,印证预训练知识对泛化至关重要。
仿真(GitHub 补充,非论文正文):ManiSkill 5 任务、每法 250 试(10 seed×25),RDT 均值 53.6%,OpenVLA 4.8%、Octo 0%、Diffusion-Policy 30.2%;单任务如 PushCube RDT 100%、PickCube 77.2%。RoboTwin 2.0 官方排行榜上 RDT 排在 pi0 之后第二(排除用真值点云的 DP3)。
创新点与影响
- 贡献:(1) 首个 1.2B 级、扩散式双臂操作基座,把扩散策略从小模型推到基座规模;(2) 对 DiT 的三处机器人化改造(QKNorm+RMSNorm 稳训练、MLP decoder 表非线性、ACI 平衡图文条件);(3) 128 维物理可解释统一动作空间 + 0/1 mask 填充,让几乎所有带夹爪机器人(单/双臂、关节/EEF、位置/速度、含轮式)的异构数据能一起预训练;(4) 开源 6K+ 双臂微调数据集与全部代码/权重(MIT)。
- 影响:成为开源 VLA 与双臂操作的常用强基线与微调起点(RoboTwin、ManiSkill 生态均以其为对照),后续 π0 等流匹配 VLA 常与之对比。
- 作者自述局限:因 embodiment gap,RDT 尚不能零样本泛化到预训练未见的新机器人平台,需采少量目标机器人数据微调;实验限于静态双臂 ALOHA,未用移动底盘自主移动能力;未用 CFG。
原始链接
- 论文(arXiv abs):https://arxiv.org/abs/2410.07864
- 论文 PDF:https://arxiv.org/pdf/2410.07864
- 项目页(demo 视频):https://rdt-robotics.github.io/rdt-robotics/
- GitHub(代码/权重/微调指南):https://github.com/thu-ml/RoboticsDiffusionTransformer
- HuggingFace 模型(1M-step checkpoint):https://huggingface.co/robotics-diffusion-transformer/rdt-1b
- HuggingFace RDT-170M(小模型):https://huggingface.co/robotics-diffusion-transformer/rdt-170m
- HuggingFace 微调数据集:https://huggingface.co/datasets/robotics-diffusion-transformer/rdt-ft-data
一手源存档(sources/)
- rdt-1b—github-readme — GitHub README(安装/微调/部署/ManiSkill+RoboTwin 结果,fetched 2026-07-16)
- rdt-1b—hf-card — HuggingFace 模型卡(编码器/数据集/用法,fetched 2026-07-16)
- rdt-1b—project-page — 项目页文本抽取(概览/推理频率/消融,fetched 2026-07-16)
- arXiv 2410.07864 全文(arXiv 原文 PDF,不入 git;见上方链接)