一句话定位
Vidar(Tsinghua + ShengShu Technology)把一个互联网规模预训练的文生视频基座模型(Vidu 2.0,也验证了 Wan 2.2 / HunyuanVideo)继续预训练成”具身视频世界模型”:视频扩散模型 G 只学习不含动作的世界演化先验,再用一个轻量的掩码逆动力学模型(MIDM)把生成视频翻译成具体机器人动作;仅用约 20 分钟(232 段演示、覆盖 81 个任务)的新机器人平台数据做微调(约为同类方法所需数据的 1%),即在真实双臂操作上大幅超过 VPP 和 UniPi 两个视频先验基线,并泛化到未见任务、未见背景和未见摄像机布局。
背景与定位
Vidar 延续 UniPi 式”用视频生成模型作机器人控制的可迁移先验”这条路线,把策略 π 显式分解为 π = I∘G:G 是一个视频生成(世界)模型,只建模”世界如何演化”,不含动作变量;I 是一个逆动力学模型,把生成的视频窗口翻译成机器人本体的具体动作。这与主流 VLA 路线(rt-1、rt-2、octo、openvla、pi0、pi0-5、rdt-1b)形成对照——VLA 把感知、语言、动作端到端耦合进同一个模型,论文指出现有人类演示语料通常只有几十到几百小时的规模(远小于互联网规模视频语料),换新机器人平台仍需相当规模的同质演示数据。Vidar 的论点是:视频比动作标签丰富且便宜得多,把大部分表征负担甩给可在互联网视频上预训练的 G,只留一个轻量的 I 用少量目标域数据训练。
同期把视频生成与动作耦合训练的工作(VPP、UVA、VidMan)需要端到端联合训练生成器和动作头,灵活性受限;Vidar 走的是解耦两阶段路线。另一条相关脉络是用视频生成做具身规划但局限于单臂单摄像头(UniPi、RoboDreamer、Gen2Act、CLOVER、SuSIE、GR-1),以及交互式 3D 世界生成的 Genie 2(自回归隐扩散生成可交互环境,不针对具体机器人本体)。Vidar 的定位差异是:双臂 + 多视角 + 跨具身(三个真实机器人平台)统一观测空间预训练,以及一个无需分割标注、可泛化到未见背景的掩码逆动力学模型。
模型架构
范式:G(视频生成/世界模型)+ I(逆动力学模型)两阶段解耦,I 具体实现为掩码逆动力学模型(MIDM)。
视频生成模型 G
- 骨干为**修正流(rectified flow)**视频扩散模型,学习速度场 v(x_t, t, c),从高斯噪声流向目标视频;训练目标为流匹配损失 L_G = E[‖(x₁-x₀) - v(tx₁+(1-t)x₀, t, c)‖²];推理时用无分类器引导(CFG)合成条件与无条件流。
- 三个骨干互换验证:Vidu 2.0(ShengShu 自研,主实验用于真实世界测试,参数规模未披露)、开源 Wan 2.2(5B 参数,仿真实验 + 补充真实世界实验)、开源 HunyuanVideo(13B 参数,补充真实世界实验,见附录 E)。
- 统一观测空间:定义 U = {⟨o,l⟩ | o = aggregate(I⁽¹⁾,…,I⁽ⱽ⁾), l = concatenate(l_r, l_c, l_t)},其中 o 是多视角图像沿空间/通道聚合(各视角经独立缩放函数 φ_rk 处理,允许缺视角),l 由机器人身份、摄像机布局、任务指令三段文本拼接(每个预训练数据集提供一段模板化的”机器人+摄像机布局”描述文本,如”industrial art style, fixed front camera + movable left/right arm camera, the aloha robot is performing: …“)。该观测空间本身不含动作——视频扩散模型只学习世界演化,这是它能跨不同本体(形态/视角差异巨大)高效泛化的关键设计。
- 训练视频统一降采样到 8 fps;真实世界推理生成 **60 帧(8fps 下 7.5 秒)**视频。
- 测试时扩展(TTS):给定观测前缀,用不同随机种子并行生成 K 个候选视频,用预训练评估器(GPT-4o)对候选视频做”拒绝采样”式重排序,选最高分的一条,以降低扩散采样的方差、提升物理合理性和指令对齐度。真实世界实验 K=3;仿真实验为可复现性关闭 TTS(K=1)。
逆动力学模型 I:Masked Inverse Dynamics Model (MIDM)
- 两个子网络:mask 预测网络 U(U-Net,5 层下采样/上采样)输出空间掩码 m∈[0,1]^{H×W};动作回归网络 R(ResNet-50)从 round(m)⊙x 的掩码帧回归动作 â。
- 损失 L_I = E[Huber(â-a) + λ‖m‖₁],λ=3×10⁻³(λ 越小掩码越松散、越大越稀疏,论文附录做了 5 档消融);用直通估计器(straight-through estimator)训练离散化的 round(m)。
- 无需任何像素级分割标注即可学出聚焦手臂/工具/接触区域的稀疏掩码,在未见背景(含反光表面)下依然能生成合理掩码(图 3)。
- 逐帧独立映射(单帧图像 → 单步动作),不对动作历史做条件建模;MIDM 参数量 92M。
- 目标机器人为 Aloha 双臂平台,动作即每臂的关节 + 夹爪目标位置。
数据
预训练(G 的具身域继续预训练):整合 AgiBot-World、RoboMind(含 Franka、Aloha 两种本体)、RDT(rdt-1b 论文所用的 Aloha 演示采集)三个来源,真实世界实验最终预训练集为 746,533 段(≈750K)多视角双臂 episode,覆盖三个真实机器人平台,均配三视角摄像头;采样比例按各数据集规模成比例设置。仿真实验额外加入 EgoDex(单视角人类第一视角操作视频)。AgiBot-World 的 episode 用其帧级标注切成更短片段,过滤视角数<3 或时长<4 秒的样本;用 GPT-4o 为 Vidar 自采数据集增强任务文本标注。
目标域微调(新平台适配):
- 真实世界:采集 20 分钟人类演示视频,覆盖 81 个任务、232 段 episode(平均每任务约 3 段演示)——论文强调这是同类方法典型数据需求的约 1%。目标 Aloha 平台把中央摄像机调整到能完整拍到双臂的新位置,与所有预训练数据集的视角配置都不同,是检验跨具身泛化能力的理想测试床。
- 仿真(RoboTwin 2.0):低数据设定每任务 20 段演示(调整摄像机视角以完整捕捉双臂,clean 场景);标准数据设定每任务 50 段演示(原始视角,手臂遮挡更常见)。
- 微调阶段对可变长度视频做随机起点裁剪增强,充分利用有限的目标域数据。
训练方法
- 两阶段预训练/微调:第一阶段在跨具身机器人数据上做具身域继续预训练(10,000 步,三个骨干共用此设置);第二阶段在目标平台演示上做全参数监督微调(Vidu 2.0 为 13,000 步,Wan 2.2 为 12,000 步,HunyuanVideo 为 2,000 步)。
- 优化器:全部用 AdamW,batch size 128(三个骨干共用此设置)。Wan 2.2:预训练/微调 lr 均 2×10⁻⁵,warmup 200 步,AdamW(β=0.9/0.999, ε=10⁻⁸, wd=0.1);HunyuanVideo:预训练 lr 1×10⁻⁴、微调 lr 5×10⁻⁵,warmup 500 步,AdamW(β=0.9/0.999, ε=10⁻⁸, wd=0)。
- MIDM 训练:只在目标域微调数据集上从头训练,lr 5×10⁻⁴,warmup 6000 步,AdamW(β=0.9/0.999, ε=10⁻⁸, wd=10⁻²)。
- 基线复现:UniPi 直接在演示数据上微调 Vidu 2.0 并训练 ResNet 逆动力学模型;VPP 复用与 Vidar 相同的视频生成 checkpoint,额外训练一个扩散模型从单步去噪的潜特征 + CLIP 任务文本嵌入生成短动作序列,并采用闭环控制(Vidar 用开环控制);Pi0.5 使用官方 checkpoint(已在 >10k 小时机器人数据上预训练),按官方框架多任务微调(2B 参数,lr 2.5×10⁻⁵,batch 32,warmup 1000 步,AdamW(β=0.9/0.95, ε=10⁻⁸, wd=10⁻¹⁰),55,000 迭代,action horizon 16)。
Infra(训练 / 推理工程)
- 预训练/微调硬件:Vidu 2.0 用 64×NVIDIA Ampere 系列 80GB GPU,23,000 步(10K 预训练 + 13K 微调)总耗时约 64 小时;MIDM 用 8×NVIDIA Hopper 系列 80GB GPU,60,000 步训练约 5 小时;HunyuanVideo(13B)用 64×NVIDIA Hopper 系列 80GB GPU,训练约 54 小时。并行策略细节未披露。
- 精度:未披露(论文未说明 fp16/bf16 设置)。
- 推理:开环控制——单次批量生成后不再重新规划(VPP 对照组为闭环,每次执行后重新生成);用 8×NVIDIA Ampere 系列 80GB GPU 生成一段 60 帧(8fps 下 7.5 秒)视频约耗时 25 秒;论文明确指出可用蒸馏或量化进一步降低延迟,但这超出本文范围(未实现)。TTS(K=3)由 GPT-4o 做三路候选重排序,每次两两比较约 $0.003,在 K=3 时约占总延迟的 25%。
- 部署形态:视频扩散模型部署在云端,只有轻量的 MIDM 在本地执行——这是论文明确交代的云-端分离推理架构。
- 边缘硬件:未涉及。
评测 benchmark
RoboTwin 2.0 仿真基准(多任务设定,50 个任务、100 episode 均值,Table 1):
| 数据规模 | 场景 | Pi0* (官方逐任务单独训练/评测,不直接可比) | Pi0.5 (Vidar 同设定基线) | Vidar |
|---|---|---|---|---|
| Low (20 episode/任务) | Clean | — | 25.0% | 60.0% |
| Low | Randomized | — | 9.2% | 15.7% |
| Standard (50 episode/任务) | Clean | 46.42% | 44.8% | 65.8% |
| Standard | Randomized | 16.34% | 14.2% | 17.5% |
真实世界(6 seen + 5 unseen-task + 6 unseen-background 任务,Table 2):
| 方法 | Seen 任务&背景 | Unseen 任务 | Unseen 背景 |
|---|---|---|---|
| UniPi | 36.4% | 6.7% | 22.2% |
| VPP | 4.5% | 13.3% | 0.0% |
| Vidar | 68.2% | 66.7% | 55.6% |
三场景平均,Vidar 比 VPP 高约 58 个百分点、比 UniPi 高约 40 个百分点(论文摘要用语)。
消融(Table 5,同一批真实世界任务):
| 配置 | Seen | Unseen 任务 | Unseen 背景 |
|---|---|---|---|
| w/o TTS | 45.5% | 33.3% | 44.4% |
| w/o MIDM(换 ResNet 基线) | 59.1% | 26.7% | 22.2% |
| Vidar(完整) | 68.2% | 66.7% | 55.6% |
VBench 视频质量(Table 3,未见目标域,衡量具身预训练对生成质量的影响):Subject Consistency 0.565→0.855;Background Consistency 0.800→0.909;Imaging Quality 0.345→0.667(Vidu 2.0 原始 checkpoint → +具身预训练)。
MIDM vs. ResNet 逆动力学模型(Table 4,成功判定:双臂关节误差 <0.06、夹爪误差 <0.6,L∞ 范数):训练准确率均 99.9%;测试准确率 ResNet 24.3% vs MIDM 49.0%;测试 L1 误差 ResNet 0.0430 vs MIDM 0.0308——训练集拟合相当但 MIDM 泛化明显更好。
λ 超参消融(Table 12):λ=3×10⁻³ 时测试准确率最高(49.0%,L1=0.0308);λ=10⁻¹ 时掩码过粗,测试准确率骤降至 7.1%。
补充真实世界实验(附录 D):用 Wan 2.2 复现、扩大微调集到 2,307 episode 后,Vidar 在 7 个 seen 任务均值 69.3% vs Pi0.5 34.3%(+35pp);7 个 unseen 任务均值 67.1% vs Pi0.5 12.9%(+54pp)。用 HunyuanVideo 复现(6 个任务,3 seen + 3 unseen)平均成功率 58.3%。
创新点与影响
- 首个大规模双臂操作视频世界模型:把互联网规模预训练的文生视频基座(Vidu 2.0)继续预训练成”动作无关”的具身世界模型,用统一观测空间吸收三个真实机器人平台、约 75 万段跨本体演示,验证了骨干可替换(Wan 2.2、HunyuanVideo 均复现出类似结论)。
- 掩码逆动力学模型(MIDM):无需任何分割标注即可学出聚焦手臂/接触区域的稀疏掩码,比朴素 ResNet 逆动力学模型有明显更好的未见背景泛化(测试准确率 49.0% vs 24.3%)。
- 数据效率:仅 20 分钟 / 232 段目标域演示(论文摘要称约为同类方法典型数据需求的 1%)即可让预训练视频先验对齐到全新的摄像机布局/机器人平台,在 seen、unseen-task、unseen-background 三种场景均大幅超过同样使用视频先验的 VPP、UniPi 基线。
- 提出”one prior, many embodiments”的可扩展配方:强先验(便宜、可复用的互联网规模视频模型)+ 极少量本体对齐数据,是论文自陈的核心贡献与可推广叙事。
- 论文自陈局限:① 采用开环控制(单次批量生成后不重规划),单次 60 帧视频推理约 25 秒延迟,论文明确表示蒸馏/量化加速”超出本文范围”、留待未来工作;② TTS 依赖 GPT-4o 打分,带来额外 API 成本与约 25% 的延迟开销;③ 仅在 Aloha 双臂平台上做真实世界主实验(Wan 2.2/HunyuanVideo 复现规模更小);④ Ethics Statement 中承认通用双臂机器人部署会带来隐私、安全、可问责性方面的新议题,尤其在近距离人机交互场景下。
原始链接
- arXiv abs(当前版本 v4,2025-12-20 修订):https://arxiv.org/abs/2507.12898
- arXiv PDF:https://arxiv.org/pdf/2507.12898
- 项目页
https://embodiedfoundation.github.io/vidar_anypos/:核实时返回 GitHub Pages 404(2026-07-16 抓取),未找到可用的项目主页 - GitHub / HuggingFace / ModelScope:未找到官方代码仓库或模型卡(论文 Reproducibility Statement 提及计划开源 HunyuanVideo 版本实现与 MIDM 代码,但截至核实时未见对应仓库上线)
一手源存档(sources/)
- 未归档补充快照:官方博客、GitHub README、HuggingFace/ModelScope 模型卡均不存在(project_url 404,且未检索到独立代码仓库);本页全部数据核实自 arXiv 2507.12898 v4 全文(PDF,通过
arxiv.org/pdf/2507.12898抓取转文本核对,未入 git,见上方链接)。