一句话定位

港大(Xihui Liu 组)与 Sreal AI 提出的 MultiWorld:把单智能体动作条件视频世界模型扩展到”多智能体 + 多视角”场景,用 Multi-Agent Condition Module(智能体身份嵌入 + 自适应动作加权)解决多智能体可控性、用冻结的 VGGT 3D 重建骨干做 Global State Encoder 解决多视角一致性,两个模块都不假设固定的智能体数或相机数,从而在双人游戏协作与 2–4 机械臂协同操作两个领域上同时验证了可扩展性。

背景与定位

现有交互式视频世界模型(如 genie-3、Oasis、GameFactory 等)普遍假设仿真环境里只有单一智能体,忽视了协作机器人、多人游戏这类真实场景中多个智能体同时行动产生的相互依赖;同时,每个智能体从各自视角观察共享环境,也要求模型生成的多个视角必须彼此几何一致——这是单视角世界模型完全没有处理过的维度。论文指出扩展到多智能体多视角引入三个此前工作未解决的挑战:(1) 多智能体可控性——需要把具体动作和对应智能体正确关联并同步执行;(2) 多视角一致性——不同智能体的局部观测必须在几何上彼此吻合;(3) 框架可扩展性——真实环境的智能体数与视角数是可变的,模型不能假设固定配置。

论文将自己定位在两条已有研究线的交叉点上:一是交互式视频世界模型(genie-3、Oasis、GameFactory、MineWorld 等,多聚焦相机控制或单一动作条件的信号注入);二是多智能体规划与仿真(RoboFactory、SeqWM-MARL、TeamCraft、CausalMACE 等,依赖物理仿真器或游戏引擎,需要复杂的人工环境设计)。论文认为视频世界模型可以作为后者更通用的替代方案,但此前多智能体视频世界模型探索很少:COMBO 把多个单智能体世界模型拼接组合成多智能体框架,但完全忽略智能体间的交互;论文自称的”同期工作”(cited as solaris2026)在 Minecraft 里构建了双人视频世界模型,但假设固定的智能体数与视角数,且把两个视角沿序列维度交织后共享自注意力处理,无法扩展到更多视角(计算和显存瓶颈)。MultiWorld 用 Global State Encoder 把跨视角信息压缩进一个紧凑的隐表示,从而在视角数上具备可扩展性,是论文强调的核心区别。

模型骨干基于 wan-2-2-5B 的 Flow Matching 视频扩散 Transformer,全景状态编码器复用预训练 VGGT(3D 重建基础模型)的冻结骨干。

模型架构

整体建模:把 C 个相机视角的多智能体多视角世界仿真形式化为 C 个共享全局环境状态的图像-动作条件视频生成问题。设 K 个智能体,第 i 帧的联合动作 a_i=(a_i¹,…,a_i^K);模型基于 Flow Matching 训练速度场网络 v_θ(x_c^t, t, a, o),其中 x_c 是相机 c 记录的视频、o 是各视角的初始帧观测(作为全局场景上下文,随环境演化更新)。为保证时序因果性,对动作交叉注意力施加逐帧因果掩码,使第 i 帧视频 token 只能关注 {0,…,i} 帧的动作,避免未来信息泄漏、支持稳定的长时程自回归生成。

Multi-Agent Condition Module(MACM)——解决多智能体可控性,两个子组件:

  • Agent Identity Embedding(AIE):直接堆叠多个智能体的动作编码会产生”身份模糊”(模型难以区分”智能体1左移+智能体2右移” vs 反过来的镜像动作)。AIE 借鉴 RoPE 思路,对每个智能体 i∈{1,…,K} 的动作嵌入 a_i∈R^D 施加旋转矩阵 R_{Θ,i}(基于预计算频率 θ_j=b^(−2j/D)),再对智能体动作 token 做自注意力显式建模智能体间交互;RoPE 的相对位置特性使 (R_m a_m)ᵀ(R_n a_n)=a_mᵀ R_{n−m} a_n,天然编码相对身份关系,可自然外推到任意数量的智能体而无需改架构。
  • Adaptive Action Weighting(AAW):智能体的”影响力”随时间变化(有的在动、有的静止),AAW 用一个 MLP 为每个动作 token 预测自适应权重,加权求和聚合为每帧统一的动作 token,让模型更关注驱动环境变化的活跃智能体,而非平等对待所有智能体。

聚合后的动作 token 通过因果交叉注意力注入 DiT 主干。

Global State Encoder(GSE)——解决多视角一致性:用预训练且冻结的 VGGT(端到端 3D 重建基础模型)作为骨干,从任意数量的多视角观测 O={O_c}_{c=1}^C(每张 O_c∈R^{3×H×W})中提取隐特征 H_vggt=VGGT(O)∈R^{C×n×d}(n 为每图 token 数,d 为隐维度),再经 MLP 对齐维度得到 H=MLP(H_vggt),通过交叉注意力注入 DiT 主干条件化生成。论文强调不显式重建 3D 点云,而是直接利用 VGGT 隐特征中天然蕴含的 3D 空间信息;该设计同时带来三重收益:多视角空间一致性、支持任意数量视角(把多视角信息压缩进统一的 3D-aware 全局状态)、以及多视角并行生成的效率。

可扩展框架:智能体可扩展性由 AIE 的相对身份嵌入提供——相对嵌入可外推,框架能容纳任意数量智能体而不需重新设计架构;视角可扩展性由 GSE 提供——把多视角拆解为一组共享全局状态的单视角生成任务,推理延迟在计算资源同比例扩展时几乎与视角数无关。论文实测双视角并行生成相对顺序生成约有 1.5× 加速。长时程仿真通过自回归分块生成 + 定期用最新观测更新全局状态实现:生成首个 chunk 的所有视角后,用末帧更新 GSE 的全局状态供下一 chunk 使用,可稳定生成超过 2× 训练上下文长度的序列且性能下降轻微,扩展到 4× 训练长度仍保持较小的质量损失。

数据

多人游戏数据集(It Takes Two):录制 500 小时真实玩家数据,60 fps;经预处理(剔除非交互过场动画、只保留左右分屏对称帧、去除大幅相机运动导致的运动模糊/眩晕片段、去除长时间静止的片段)后保留 100 小时清晰动作 + 稳定相机运动的数据,共 2100 万+帧,原始分辨率 2560×1440,训练时下采样到 640×320(对应每个玩家分屏视角 320×320)。两名玩家使用不同控制器(键鼠 vs 手柄),动作空间异构;为避免为每个智能体单独设计动作编码器,论文将两类动作拼接为单一向量,为每个玩家把对方的动作维度置零,实现单一编码器同时服务两个智能体。

多机器人操作数据集(基于 RoboFactory 仿真):涵盖 4 个任务——击打(strike)、双臂堆叠、三臂堆叠、四臂传递,智能体数从 2 到 4 不等。每个任务采集 1,000 条成功轨迹 + 2,000 条失败轨迹(避免只有成功案例的偏差);失败轨迹并非纯随机生成,而是在正确任务计划(如”移动到位置→张爪→合爪→移到目标位置→再次张爪”)基础上引入受控随机扰动模拟真实执行错误——论文提到早期用完全随机动作生成失败案例导致轨迹无意义并损害训练效果,因此改为”接近成功但引入受控偏差”的策略。每条轨迹从多个视角以 256×320 分辨率记录。

开源计划:论文承诺发布多人游戏数据集中一个章节的子集用于复现(完整游戏数据因外部授权限制无法发布),机器人协作数据集则计划完全公开发布。

训练方法

目标函数:标准 Flow Matching(FM),对每个视角 c 采样 tU(0,1)、噪声 εN(0,I),定义 x_c^t=(1−t)x_c+tε,目标速度 u=ε−x_c;训练损失 L_FM=E_{t,ε}[‖v_θ(x^t,t,a)−u‖₂²]。推理时用标准 Euler 求解器对概率流 ODE dx=v_θ(x^t,t,a)·dt 迭代求解,从噪声采样出视频。

骨干与超参数:基于 wan-2-2-5B 模型,训练序列长度 81 帧;分辨率游戏场景每视角 320×320、机器人场景每视角 320×256;训练 40,000 次迭代,学习率 5e-5,余弦学习率调度器,全局 batch size 64,8×NVIDIA A800 GPU,全程训练耗时约 4 天

动作评测模型(IDM):为评估动作跟随能力,另训练一个双向 Inverse Dynamics Model(沿用 VPT 方案),ResNet-50 骨干 + 时序处理层,分别预测离散/连续动作;在与世界模型相同的训练集上训练 20 epoch,学习率 1e-4。游戏任务报告离散动作准确率;机器人任务报告归一化指标 100×(1−MSE(a_pred, a_gt))。

Infra(训练 / 推理工程)

  • 训练硬件:8× NVIDIA A800 GPU,全局 batch size 64,训练耗时约 4 天(约 40,000 迭代);训练精度、并行策略(是否用 FSDP/ZeRO 等)未披露
  • 推理:多视角并行生成相对顺序生成约 1.5× 加速(双视角场景实测);自回归长时程生成可稳定扩展到 2× 训练上下文长度、4× 时质量损失依然较小;具体推理 FPS / 控制频率(control-Hz)/ 端到端延迟未披露

评测 benchmark

主实验(Table 1,对比 Standard / Concat-View / COMBO 三个基线)

多人游戏(视角固定为双视角):

方法FVD↓LPIPS↓SSIM↑PSNR↑Action↑RPE↓
Standard2450.360.5017.4888.40.75
Concat-View2150.360.4917.5489.10.74
COMBO2070.340.5117.8289.30.72
MultiWorld (Ours)1790.350.5117.7289.80.67

多机器人操作(Concat-View 加 * 号,因其只能在固定双视角上训练,与其余方法不完全可比):

方法FVD↓LPIPS↓SSIM↑PSNR↑Action↑RPE↓
Standard1000.070.9026.3988.21.60
Concat-View*1060.060.9027.4492.00.82
COMBO990.080.9026.4988.51.54
MultiWorld (Ours)960.070.9026.6088.71.52

消融——主架构组件(Table 2,游戏场景,逐步加模块):Standard → +MACM → Both(+MACM+GSE):FVD 245→228→179;LPIPS 0.36→0.36→0.35;SSIM 0.50→0.51→0.51;PSNR 17.48→17.56→17.72;Action 88.4→89.7→89.8;RPE 仅 +MACM(0.76)与 Both(0.67)两行给出数值,Standard 行该表未列(对照 Table 1 中同一 Standard 基线的 RPE=0.75)——即单加 MACM 时 RPE 基本持平甚至略升,加入 GSE 后才从约 0.75 降到 0.67。结论:MACM 主要提升动作跟随能力,GSE 主要提升多视角一致性,二者共同改善视觉质量。

消融——AIE 基频(Table 3):base=10000(LLM 标准值):FVD 234 / PSNR 17.53 / Action 89.2;base=20(匹配智能体数量的更快频率衰减):FVD 228 / PSNR 17.56 / Action 89.7——基频 10000 下相邻智能体嵌入角度间隔过小、几乎无法区分,降到 20 后表现更好。

消融——AAW(Table 4):w/o AAW:FVD 245 / PSNR 17.48 / Action 88.4;w/ AAW:FVD 236 / PSNR 17.52 / Action 88.6

消融——GSE 骨干选择(Table 5,对比 w/o Global State / Wan VAE / DINOv2 / VGGT)

Global State EncoderFVD↓LPIPS↓SSIM↑PSNR↑RPE↓
w/o Global State2280.360.5117.560.75
Wan VAE2560.360.5017.380.71
DINOv22320.360.5017.480.72
VGGT (Ours)1790.350.5117.720.67

VGGT 在所有指标上全面领先,验证了显式建模跨视角共享 3D 环境状态的必要性(Wan VAE 独立编码各视角、DINOv2 只有图像级语义特征,都不携带跨视角几何关系)。

定性结果:与三个基线对比(Fig. 3),竞品呈现三类典型失败模式——动作跟随不准确、智能体在生成过程中消失、多视角结果不一致;MultiWorld 显著缓解上述问题。此外论文展示了失败轨迹仿真(多机器人碰撞/竞速等失败模式的物理合理再现)、长时程一致性(三机械臂堆叠彩色方块,超出训练上下文窗口仍保持连贯)、动作可控性(零动作输入时生成静止视频,不像其他动作条件模型存在”动作偏置”导致无意义运动)、以及跨视角物理一致性(阴影、雪地脚印在对向视角间保持一致)。失败案例分析指出:智能体在画面中占据较小区域(远处/小物体)时形状常常模糊不清,归因于空间分辨率有限。

创新点与影响

  • 首次系统性地把动作条件视频世界模型扩展到多智能体 + 多视角联合场景,并同时在智能体数与视角数两个维度上验证了架构级可扩展性(不假设固定配置),区别于假设固定智能体/视角数的同期工作与仅拼接单智能体模型、忽视智能体交互的 COMBO。
  • MACM(AIE + AAW)用 RoPE 风格的相对身份嵌入解决多智能体”镜像动作”身份混淆问题,且验证了 LLM 常用的 RoPE 基频(10000)在小规模智能体场景下并非最优,需要按智能体数调小基频(20)。
  • GSE 用冻结的 3D 重建基础模型(VGGT)而非 VAE 或自监督视觉特征来提供跨视角一致性条件,是消融实验中收益最大的单一设计选择(FVD 从 228 降到 179)。
  • 构建并计划开源两个互补的多智能体多视角数据集:真实双人游戏协作(It Takes Two)与可扩展多机械臂操作仿真(基于 RoboFactory,含受控失败轨迹)。
  • 论文自陈局限:当前训练规模仍然有限,受计算资源约束未探索大规模训练;未来工作方向包括探索实时多智能体生成,以及为超长时程多智能体仿真设计专门的记忆机制(当前方案的时空显存开销随时程增长)。

原始链接

一手源存档(sources/)

  • arXiv 2604.18564 全文(arXiv 原文 PDF,不入 git,见上方链接)
  • 未发现官方博客 / GitHub / HuggingFace / 项目主页(截至 2026-07-16 检索,论文正文明确”开源计划”为未来时态,尚未发布代码或数据)