一句话定位
RoboScape(清华大学 + Manifold AI,arXiv 2506.23135)是一个基于自回归 Transformer 的具身世界模型,在标准 RGB 视频预测目标之外联合训练时序深度预测与自适应关键点动态学习两个物理先验辅助任务,用单一框架同时提升生成视频的视觉保真度、几何一致性与动作可控性,无需外接物理仿真器或材质场建模。
背景与定位
具身世界模型的主流做法(如 iVideoGPT、IRASim、Genie)几乎只优化 RGB 像素重建目标,对 3D 几何与运动动力学缺乏显式约束,在接触密集的操作场景(如可形变物体的抓取、装袋)里经常出现物体形变失真、运动不连续等违反物理规律的伪影。已有的”物理感知”改进路线可分三类:基于物理先验的正则化(如对高斯溅射/点云施加局部刚性或旋转相似性约束,但局限于人体运动或刚体动力学等窄域)、基于物理仿真器的知识蒸馏(引入运动信号或语义图作为条件,但级联管线计算开销大)、材质场建模(局限于物体级建模,难以扩展到场景级生成)。同期的 Aether 等工作也探索了联合 RGB-深度预测,但论文指出其学习停留在整帧(whole-image)级别,无法捕捉操作场景中细粒度的运动动态与物体形变细节,且存在”3D 感知提升以 RGB 保真度下降为代价”的性能权衡。
RoboScape 的定位是:把物理知识作为辅助监督任务直接嵌入世界模型自身的多任务学习框架,既不引入外部物理仿真器级联,也不需要显式材质建模——通过时序深度预测捕捉全局空间几何先验,通过关键点动态学习隐式编码局部物体的刚性/柔性材质特性,二者互补。下游用途上,RoboScape 定位为(1)视频生成质量对比对象、(2)为 Diffusion Policy 与 pi0 等策略模型提供合成训练数据的数据引擎、(3)策略评估器(world model as simulator)。
模型架构
范式:自回归 Transformer 世界模型(AR-transformer),逐帧预测:给定历史观测 o₁:t 与机器人动作 a₁:t,预测下一帧 o_{t+1};动作 a ∈ ℝᵏ 为连续 k 维控制向量(论文中拼接末端位置 + 末端朝向 + 末端执行器位置构成)。
视频/深度分词(tokenizer):用 MAGVIT-2 把原始 RGB 帧 o₁:T ∈ ℝ^{T×H×W×3} 压缩为离散潜在 token s₁:T ∈ ℝ^{T×H′×W′×D}(H′=H/α, W′=W/α,α 为下采样因子);对时序深度图 d₁:T ∈ ℝ^{T×H×W×1} 采用同样的方式 tokenize 为潜在深度 token z₁:T(形状与 RGB token 对齐,均为 D 维通道)——论文未进一步说明深度分支是否复用同一套 MAGVIT-2 权重还是独立训练的分词器。
双分支协同自回归 Transformer(Dual-branch Co-autoregressive Transformer, DCT):
- RGB 分支 F_RGB 与深度分支 F_Depth 并行运行,各由堆叠的 ST-Transformer(Spatial-Temporal Transformer)块组成:时间注意力用因果掩码保证生成因果性,空间注意力用双向注意力做全上下文建模。
- 两分支均以学习到的动作嵌入 c₁:t-1 = E_a(a₁:t-1)(E_a 为机器人动作编码器)与位置编码 e₁:t-1 做逐元素相加(broadcast)条件注入:ŝ_t = F_RGB(s₁:t-1 ⊕ c₁:t-1 ⊕ e₁:t-1),ẑ_t = F_Depth(z₁:t-1 ⊕ c₁:t-1 ⊕ e₁:t-1)。论文指出简单加性融合在保持效率的同时已能提供有效的动作控制。
- 跨分支交互(单向:深度→RGB):在每个 ST-Transformer block l,深度分支中间特征 h_depth^l 经可学习线性投影 𝒲^l 后加性注入 RGB 分支:h_RGB^l = h_RGB^l + 𝒲^l(h_depth^l),使 RGB 分支在生成照片级真实画面的同时保持精确几何结构。
- 两分支均用 token 级交叉熵损失优化:L_RGB = -Σ s_t log p(ŝ_t),L_Depth = -Σ z_t log p(ẑ_t)。
关键点动态学习(隐式材质理解):用 SpatialTracker 在初始帧密集采样 N₀ 个关键点并跟踪其 T 帧轨迹 𝒯_dense;按运动幅度 ℳ_i = Σ‖p_i^{t+1}-p_i^t‖₂ 自适应选出运动最活跃的 top-K 个关键点 𝒯_sample(无需分割掩码定位接触区域)。对这 K 个关键点强制”各帧 token 对齐第 1 帧”的时序一致性损失: L_Keypoint = 1/((T-1)K) · Σ_{i=1}^{K} Σ_{t=2}^{T} ‖ŝ_t(p_i^t) - ŝ_1(p_i^1)‖₂² 并额外构造关键点引导的空间-时间注意力图 A(关键点位置权重 γ,其余位置权重 1),对 RGB 交叉熵损失加权:L_Attention = -Σ A_t ⊙ s_t log p(ŝ_t),因为关键点区域运动复杂、误差通常更大,需要额外强化学习。
联合训练目标:L = L_RGB + λ₁L_Depth + λ₂L_Keypoint + λ₃L_Attention,其中 λ₁=1, λ₂=0.01, λ₃=1, γ=5(超参数取值见”训练方法”)。
模型规模变体(附录 C 缩放实验):RoboScape-S(34M)、RoboScape-M(131M)、RoboScape-L(544M),六项评测指标随模型容量增大而一致提升,呈现清晰的模型缩放规律。主实验用的默认规模论文未单独标出(应为三者之一或另行配置,未明确披露)。
数据
基础数据源:AgiBotWorld-Beta 数据集,抽取 50,000 段视频片段,覆盖 147 个任务、72 项技能。
物理先验自动标注管线(论文提出的具身数据处理管线,非本文核心创新点但为训练前提):
- 物理属性标注:用 Video Depth Anything 生成深度图序列;用 SpatialTracker 采样并跟踪关键点轨迹。
- 视频切分:用 TransNetV2 做镜头边界检测,用 InternVL 生成片段的动作语义标签,将原始长视频切成属性归一化(无镜头跳变、单一动作语义)的短片段。
- 片段过滤:用 FlowNet 过滤运动模糊/杂乱的片段;用 InternVL 标注关键帧并过滤与关键帧无明确关联的帧。
- 片段分类:按动作难度与场景重新组织数据,支持从易到难的课程学习(curriculum learning)训练策略。
预处理与规模:将视频切成 16 帧片段、采样率 2Hz,最终得到约 650 万(6.5M)条训练片段。数据规模消融(附录 C):用 RoboScape-S 分别在 1,000K / 3,000K / 6,000K 片段上训练,发现数据量增加能持续提升视觉质量与动作可控性,但几何精度提升边际甚至轻微下降——作者分析这是因为小数据集上模型更容易过拟合到条件输入的最后一帧,人为抬高了几何指标却未学到有意义的时序动态。
动作标注:直接复用 AgiBot-World 平台采集的真实机器人末端位置、末端朝向、末端执行器位置序列拼接为连续动作向量,无需额外的动作标注环节。
仿真 vs 真实:预训练数据全部来自真实机器人平台(AgiBot World),不含仿真数据;下游策略学习/评估实验则在 Robomimic(仿真)与 LIBERO(仿真)环境中验证合成数据效用,属于”真实数据预训练世界模型 → 仿真环境验证下游合成数据价值”的组合。
训练方法
目标函数:见”模型架构”节的联合损失 L = L_RGB + λ₁L_Depth + λ₂L_Keypoint + λ₃L_Attention。
主训练配置:训练 5 个 epoch,超参数 λ₁=1, λ₂=0.01, λ₃=1, γ=5,在 32 张 NVIDIA A800-SXM4-80GB GPU 集群上约 24 小时训练完成。
推理方式:以首帧为条件输入,自回归预测后续 15 帧(即完整 16 帧片段)。
下游训练/评估用法(非世界模型本身的训练,而是验证其合成数据/评估效用):
- 策略训练数据增强:用 RoboScape 生成合成视频数据,逐步追加训练 Diffusion Policy(Robomimic Lift 任务,10k 步训练)与 π0(LIBERO 任务套件,先用 200 条真实轨迹热启动再叠加合成数据)。
- 策略评估:把世界模型当作环境,接收策略生成的动作序列做 rollout 预测后续观测,靠人工判断生成视频中的成功/失败信号;在 Robomimic Lift 任务上用 200 条真实轨迹训练 Diffusion Policy,每 250 epoch 存一个 checkpoint 直至收敛,分别在真实仿真器与世界模型中各跑 100 次,计算 Pearson 相关系数与 R² 衡量世界模型评估结果与真实仿真器的一致性。
Infra(训练 / 推理工程)
- 训练硬件:32 × NVIDIA A800-SXM4-80GB,主模型训练约 24 小时、5 epoch。
- 并行策略 / 混合精度:论文未披露具体的数据/模型并行方案与 fp16/bf16 精度设置。
- 推理速度:论文未披露具体的 FPS / 延迟数字;只说明推理时以首帧为条件自回归生成后续 15 帧。
- 边缘部署:未涉及,论文定位为研究原型,无边缘硬件部署报告。
评测 benchmark
视频生成质量对比(Table 1,四个基线:IRASim、iVideoGPT、复现版 Genie(用 1x-technologies/1xgpt 开源实现)、CogVideoX;六项指标:LPIPS↓/PSNR↑ 外观保真度,AbsRel↓/δ₁↑/δ₂↑ 几何一致性,ΔPSNR↑ 动作可控性):
| 方法 | LPIPS↓ | PSNR↑ | AbsRel↓ | δ₁↑ | δ₂↑ | ΔPSNR↑ |
|---|---|---|---|---|---|---|
| IRASim | 0.6674 | 11.5698 | 0.6252 | 0.5013 | 0.7020 | 0.0269 |
| iVideoGPT | 0.4963 | 16.1236 | 0.7586 | 0.3480 | 0.5795 | 0.1144 |
| Genie(复现) | 0.1683 | 19.7571 | 0.4425 | 0.5435 | 0.7736 | 1.9871 |
| CogVideoX | 0.2180 | 17.5222 | 0.5243 | 0.6046 | 0.7599 | — |
| RoboScape | 0.1259 | 21.8533 | 0.3600 | 0.6214 | 0.8307 | 3.3435 |
RoboScape 在全部六项指标上均超过四个基线;论文分析 CogVideoX 视频质量尚可但无法跟随动作指令,两个专门的具身世界模型(IRASim、iVideoGPT)在长程生成时运动建模能力不足。
消融实验(Table 2,去掉深度分支 / 去掉关键点分支 / 两者都去掉):
| 配置 | LPIPS↓ | PSNR↑ | AbsRel↓ | δ₁↑ | δ₂↑ | ΔPSNR↑ |
|---|---|---|---|---|---|---|
| 完整模型 | 0.1259 | 21.8533 | 0.3600 | 0.6214 | 0.8307 | 3.3435 |
| w/o depth | 0.1249 | 21.9465 | 0.3921 | 0.5788 | 0.8277 | 3.4863 |
| w/o keypoint | 0.1264 | 21.7087 | 0.3417 | 0.6497 | 0.8673 | 2.9462 |
| w/o depth & keypoint | 0.1299 | 21.4873 | 0.3565 | 0.6248 | 0.8129 | 1.9871 |
深度学习主要维护运动物体的几何一致性(去掉后 AbsRel/δ₁ 明显变差:0.36→0.3921,0.6214→0.5788);关键点学习对视觉保真度与动作可控性更关键(去掉后 PSNR 21.8533→21.7087,ΔPSNR 3.3435→2.9462,尽管去掉关键点后 AbsRel/δ 反而略有提升);两者叠加去掉时 ΔPSNR 跌至 1.9871(与未加物理先验的 Genie 基线相当)。
下游策略训练(Table 3,用合成数据增强):
Diffusion Policy 在 Robomimic Lift 任务(10k 训练步,成功率):合成数据 50 条→40%,100 条→77%,150 条→84%,200 条→91%,对照组真实数据 200 条→92%(即约 200 条合成数据即可逼近同量级真实数据的效果)。
π0 在 LIBERO 任务套件(先用 200 条真实轨迹热启动,Spatial/Object/Goal/Long(10)/平均 成功率%):
| 合成数据量 | Spatial | Object | Goal | Long(10) | 平均 |
|---|---|---|---|---|---|
| 200 | 77.6 | 81.8 | 71.0 | 36.0 | 66.6 |
| 400 | 79.4 | 85.2 | 74.6 | 46.2 | 71.4 |
| 600 | 81.6 | 86.0 | 78.0 | 51.8 | 74.4 |
| 800 | 84.6 | 89.0 | 82.8 | 60.0 | 79.1 |
| 真实数据(200,热启动基线) | 77.2 | 79.8 | 68.8 | 34.8 | 65.2 |
随合成数据量从 200 增至 800,平均成功率从 66.6% 稳步升至 79.1%,持续超过仅用 200 条真实数据热启动的基线(65.2%)。
策略评估:世界模型作为评估器时,与真实仿真器结果的 Pearson 相关系数为 0.953(论文指出 IRASim、iVideoGPT 作为评估器时相关性”明显更低”,但具体数值未在正文文字中给出,仅见于图示)。
模型/数据缩放实验(附录 C):RoboScape-S(34M)/ RoboScape-M(131M)/ RoboScape-L(544M)随模型容量增大六项指标一致改善;数据量从 1,000K→3,000K→6,000K 片段,视觉质量与动作可控性持续提升,几何指标提升边际或轻微下降(原因见”数据”节)。
创新点与影响
- 提出在世界模型自身内部嵌入物理先验的多任务学习框架:用时序深度预测捕捉全局几何一致性、用自适应关键点动态学习隐式编码局部材质/形变特性,二者互补,避免了物理仿真器级联或显式材质场建模带来的计算开销。
- 关键点自适应采样策略:不依赖分割掩码定位接触区域,仅按运动幅度排序选 top-K 活跃关键点即可捕捉刚性/柔性材质差异(如机器人往塑料袋装苹果时袋子形变的关键点轨迹)。
- 提出基于 AgiBot-World 的自动化物理先验标注数据管线(深度生成 + 关键点跟踪 + 镜头切分 + 语义标注 + 质量过滤 + 难度分类),产出 50,000 段片段 / 650 万训练片段的多模态具身数据集。
- 系统性验证世界模型的下游实用性:既能作为策略训练的合成数据源(Diffusion Policy 在 Robomimic 上、π0 在 LIBERO 上均随合成数据量增加而持续提升),也能作为策略评估的低成本替代仿真器(与真实仿真器 Pearson 相关系数 0.953)。
- 作者自述局限:论文”未来工作”部分仅提出计划将该生成式世界模型与真实机器人结合做进一步性能测试(当前验证局限于合成数据下游任务 + 仿真环境策略评估,尚未在真实机器人闭环中验证);“广泛影响”部分也提出需要在合成数据多样性与安全关键场景部署治理上做更多工作。
- 代码开源现状:论文声明代码开源于 github.com/tsinghua-fib-lab/RoboScape,但截至存档时(2026-07-16)该仓库仅有一次”Initial commit”,README 只有标题一行,尚无训练代码、模型权重或使用说明发布。
原始链接
- arXiv abs:https://arxiv.org/abs/2506.23135
- arXiv PDF:https://arxiv.org/pdf/2506.23135
- GitHub:https://github.com/tsinghua-fib-lab/RoboScape(仅占位仓库,尚未发布代码)
一手源存档(sources/)
- roboscape—github-readme — GitHub 仓库快照(README 仅标题、无代码,fetched 2026-07-16)
- arXiv 2506.23135 全文(arXiv 原文 HTML/PDF,不入 git,见上方链接)