一句话定位

WISA 是 360 AI Research 联合中山大学深圳校区、鹏城实验室 2025 年 3 月提出的物理感知文生视频(T2V)方法:把物理原理拆解为文本描述、定性类别、定量属性三层,通过 Mixture-of-Physical-Experts Attention(MoPA)和 Physical Classifier 注入到 CogVideoX-5B(后续代码库扩展至 Wan2.1-14B),配套发布专门收集”物理现象显著呈现”视频的数据集 WISA-32K(论文版本,后扩展为 WISA-80K),在 VideoPhy 基准上把 CogVideoX-5B 的 PC(物理一致性)从 0.33 提升到 0.38、SA(语义对齐)从 0.60 提升到 0.67,仅新增 187M 参数(约 3.5%)和约 5% 推理耗时。

背景与定位

Sora、Kling、Cosmos 等 T2V 模型被寄望成为”世界模拟器”,但普遍无法遵守物理定律——videophyphygenbench 等已量化过这个差距(如 phygenbench 中最强模型 Gen-3 平均 PCA 也仅 0.51)。此前的两类解法各有局限:一类是 DANO、MotionCraft、PhysGen 用可微分物理仿真估计刚体动力学再驱动图像转视频,但只覆盖刚体、静态场景,泛化性差;另一类是 PhyT2V,用 LLM/VLM 多轮迭代分析生成视频的物理错误并改写 prompt,虽通用但推理开销巨大(约为基线 9 倍)且不提升生成模型本身编码物理知识的能力。WISA 走第三条路:不改变底层扩散采样流程,而是把结构化物理知识作为一种新的 conditioning 嵌入现成的 cogvideox / Wan2.1 骨架,思路上呼应 MoE / MoH(Mixture-of-Head Attention)。与 cosmos-predict 这类押注”海量数据 scale 出物理理解”的路线相反,WISA 押注”显式结构化物理标注 + 轻量专家模块”,训练成本低(仅 187M 可训练参数、8 张 A100 训练),但覆盖的物理现象也更窄(17 类)。

模型架构

Backbone:论文实验用 CogVideoX-5B;GitHub 代码库后续(2025-05-15)基于 finetrainers 框架重构并扩展支持 Wan2.1-14B(Diffusers 版本)。两者均通过 LoRA + 附加模块方式适配,不改动主干权重本身。

WISA 在主干最后一个 Diffusion Transformer block 之后(而非每层都插入,以控制参数/计算开销)插入两个新组件:

  • Physical Module:核心是 Mixture-of-Physical-Experts Attention(MoPA)。定性物理类别编码为向量 P_c ∈ ℝ^C(C=29,见”数据”节类别定义),多头自注意力的每个头对应一个物理类别专家(头数 h=C=29),只有被激活类别对应的头参与后续融合。为抗标注噪声,训练时对 P_c 做随机扰动——激活位置以 0.2 概率被压到 0.1、未激活位置以 0.2 概率被拉到 1.0,得到扰动后的 P̂_c;最终 F_o = Linear(Reshape(MHSA(F) ⊙ P̂_c))。定量物理属性(密度、时间、温度)先用科学计数法拆成系数+指数、经线性层编码,再与 timestep embedding 拼接后通过 AdaLN 注入。
  • Physical Classifier:接在 Physical Module 之后,用多标签二元交叉熵(BCE)损失 L_pc 监督预测 29 个定性物理类别,辅助模型理解抽象物理类别;总损失 L = L_diffusion + λ·L_pc/(1+L_pc.detach())(用 detach 归一化避免分类损失量级压制扩散损失,λ 具体取值未披露)。
  • 文本物理描述(textual physical description)不走专门模块,而是直接与视频 caption 拼接后送入文本编码器,依赖生成模型自身的语义理解能力生成对应视觉现象。

参数量:Physical Module + Physical Classifier + LoRA 三部分合计新增可训练参数 187M(相对 CogVideoX-5B 主干冻结),对应约 3.5% 的参数量增幅和约 5% 的推理时间增幅(论文自述)。LoRA 配置:rank=128,alpha=16。

数据

  • WISA-32K(arXiv v1 论文版本):人工采集 32,000 条视频片段,覆盖 3 大物理域下的 17 类物理现象(按视频条数占比:力学 Dynamics 47%、光学 Optics 29%、热学 Thermodynamics 24%):力学 6 类(碰撞 Collision、刚体运动 Rigid Body Motion、弹性运动 Elastic Motion、液体运动 Liquid Motion、气体运动 Gas Motion、形变 Deformation);热学 6 类(熔化 Melting、凝固 Solidification、汽化 Vaporization、液化 Liquefaction、爆炸 Explosion、燃烧 Combustion);光学 5 类(反射 Reflection、折射 Refraction、散射 Scattering、干涉与衍射 Interference and Diffraction、非自然光源 Unnatural Light Sources)。采集时主动排除含文字的视频,且因采集难度未覆盖升华/凝华等更罕见现象。
  • WISA-80K(2025-03-28 GitHub/HF 发布的扩展版):项目主页与 HF 数据集卡片给出的后续版本,规模扩展到80,000 条人工筛选视频,物理域/类别定义与 WISA-32K 一致(同样 17 类现象、3 大域);但论文正文的定量实验(Table 1/2)全部基于 WISA-32K,WISA-80K 本身的训练效果数字未在 arXiv v1 中单独给出。
  • 标注流程:PySceneDetect 做分镜检测 → 美学分过滤 → Qwen2-VL 生成视频 caption(限长 256 token)→ GPT-4o mini 基于 caption 做 5 轮定性类别标注 + 3 轮定量属性标注。定性标注共 29 个类别(17 个物理现象类 + 3 个”无明显现象”类 + 2 个镜头运动类 + 7 个物体状态变化类,详见 Appendix B);定量属性标注 3 项(密度、时间范围、温度范围,用科学计数法表示)。
  • 标注方案成本对比(100 个样本人工评估):基于 caption 的标注方案准确率 76%,仅略低于直接多模态输入的标注方案(78%),但 token 成本从约 10K/样本降到约 2K/样本,因此论文最终采用 caption-based 方案规模化标注全量数据。
  • 标注准确率(Appendix C,按类别人工核验的类别标注准确率):力学 84%、光学 71%、热学 64%,总体 75%。
  • 消融用对照数据集:作者额外从 Koala-36M(通用场景视频数据集)采样 32,000 条并同样打上物理标签训练 WISA,作为”是否需要专门收集物理现象显著的视频”的对照组(结果见”训练方法”消融部分)。
  • 评测 prompt:VideoPhy 344 条 + PhyGenBench 160 条,均为已有基准提供的 prompt,非本文自建。

训练方法

  • 基座:CogVideoX-5B(论文实验);Wan2.1-14B 支持见 GitHub 后续更新(非 arXiv 论文内容)。
  • 训练配置(Appendix A):在 WISA-32K 上训练 8,000 步,学习率 2e-5,batch size 8,视频分辨率 480×72049 帧;LoRA rank 128、alpha 16;训练时只更新 Physical Module + Physical Classifier + LoRA 参数,主干冻结,合计新增可训练参数 187M
  • 损失函数:扩散损失与物理分类损失的加权和(见”模型架构”节公式),λ 的具体取值论文未披露。
  • 组件消融(Table 2,VideoPhy 上用 VideoCon-Physics 评分):Baseline(CogVideoX-5B)SA=0.60/PC=0.33 → only LoRA SA=0.64/PC=0.34 → w/o Physical Module SA=0.64/PC=0.33 → w/o Physical Classifier SA=0.66/PC=0.36 → 完整 WISA SA=0.67/PC=0.38。
  • 数据消融(同表):从 Koala-36M 采样等量(32K)通用场景视频、打物理标签后训练,得到 SA=0.62/PC=0.33,明显不如用专门收集的 WISA-32K(SA=0.67/PC=0.38)——证明”视频本身是否显著呈现物理现象”比”是否有物理标签”更关键。
  • 后续扩展(GitHub,非 arXiv 论文内容):2025-05-15 代码库基于 finetrainers 框架开源,支持 Wan2.1-14B 训练;因 Wan2.1-14B 显存需求大,训练脚本提供”预计算并缓存 latent/text embedding”的可选流程以避免 OOM,README 建议单批预计算样本数不超过 12,000 条以防 CPU 缓存溢出;验证(validation)阶段因存在导致生成质量异常的 bug 已在代码库中被禁用。

Infra(训练 / 推理工程)

  • 训练硬件:论文实验在 **8 张 A100 GPU(每张 80GB 显存)**上完成(Appendix A);训练总 GPU-hours、并行策略(数据/模型并行)与训练精度(fp16/bf16/fp32)均未披露。
  • 推理延迟:WISA 端到端推理耗时 220 秒(Table 1,VideoPhy prompt 测得),对比基线 CogVideoX-5B 的 210 秒(增幅约 5%,与论文”5% inference time”自述吻合);对照方法 Cosmos-Diffusion-7B 耗时 600 秒,PhyT2V (Round 4) 耗时 1800 秒(约为 CogVideoX-5B 基线的 9 倍)。
  • Wan2.1-14B 训练 infra(GitHub,非论文内容):具体 GPU 型号/数量未披露,仅说明需通过预计算 latent/text embedding 缓存规避大模型训练时的 OOM 问题。
  • Physical Module 的插入位置(仅主干最后一个 transformer block 之后,而非每层都插入)是论文为控制参数/计算爆炸和避免拖慢收敛而做的显式工程取舍(4.2 节自述)。

评测 benchmark

主结果(Table 1,VideoCon-Physics 评分体系,VideoPhy 344 prompt + PhyGenBench 160 prompt;*为作者复现分数)

MethodInference Time (s)VideoPhy SA↑VideoPhy PC↑PhyGenBench SA↑PhyGenBench PC↑
VideoCrafter2-0.470.36--
HunyuanVideo-0.460.28--
CogVideoX-5B*2100.600.330.390.41
Cosmos*6000.570.180.430.14
PhyT2V (Round 4)18000.590.420.380.42
PhyT2V* (Round 4)18000.610.37--
WISA2200.670.380.400.43
  • VideoPhy:WISA 相对基线 CogVideoX-5B 提升 SA +0.07、PC +0.05,同时推理耗时仅增加约 5%(220s vs 210s)。PhyT2V 在 PC 上略高于 WISA 原始报告值(0.42 vs 0.38),但需 9 倍推理时间(1800s vs 210s),且作者复现的 PhyT2V PC 分(0.37)反而低于 PhyT2V 论文自报值。Cosmos 表现最差,作者归因于”物理过程紊乱、时序不一致”。
  • PhyGenBench:WISA 在该测试集上取得 SA=0.40、PC=0.43(PC 为表中最高),验证跨基准的泛化性。
  • 人工评估(Figure 7,语义一致性 + 物理对齐两维度排名打分,第一 3 分/第二 2 分/末位 0 分):三个代表性模型对比中 WISA 在物理对齐维度显著领先,同时保持较强的语义一致性表现;论文未给出具体分值,仅为图示化排名结果。
  • 注意力图分析(Figure 8/9):可视化显示”刚体运动”专家头精准聚焦在秋千摆动区域,“无明显动力学现象”专家头聚焦在静止背景,定性验证 MoPA 学到了类别特异性的空间聚焦。
  • 评估指标局限性讨论(Appendix G,作者自述):VideoCon-Physics 对”先落水后飞溅”这类符合物理规律的正确时序视频误判打出 0.08 低分;作者用 Qwen2.5-VL 复测,发现该模型同样难以判断物理事件的正确时序,说明现有视频物理评估指标本身仍不可靠。

创新点与影响

  • 提出三层物理知识分解(文本描述 / 定性类别 / 定量属性)及对应的三种条件注入方式,把”物理先验”转化为可训练模型直接消费的结构化条件,而非依赖 LLM/VLM 迭代改写 prompt(对比 PhyT2V)或可微分刚体仿真(对比 DANO/PhysGen,仅限刚体静态场景)。
  • Mixture-of-Physical-Experts Attention(MoPA)把 MoE/MoH 思想用于”物理类别路由”:不同物理现象激活不同注意力头,注意力图可视化证实了这种路由确实学到了对应物理区域的空间聚焦。
  • 首个专门为”物理现象显著呈现”(而非作为次要元素混杂在通用场景视频中)精心人工采集的视频数据集(WISA-32K→WISA-80K),并用消融证明同规模的普通场景视频(Koala-36M 子集)即便打上物理标签也达不到同等效果(SA 0.62 vs 0.67,PC 0.33 vs 0.38)——即数据源头的现象显著性比标签本身更重要。
  • 工程开销极低:仅新增 187M 参数(约 3.5% 增量)、约 5% 推理时间增量,即可在 CogVideoX-5B 上带来 VideoPhy PC +0.05 / SA +0.07 的提升;后续代码库进一步把方法迁移到 Wan2.1-14B,验证了架构无关的可迁移性。
  • 论文自述局限(Section 6):① 物理类别覆盖有限,WISA-32K 仅涵盖 17 种日常物理现象,未覆盖如腐蚀、真空环境等更罕见现象;② 物理信息引导层级偏高层语义,缺乏能量守恒、牛顿定律等物理机制层面的精确约束,而更精细的约束目前只能靠基于图像/3D 信息建模物体运动实现,泛化性差;③ 受限于数据和参数规模,WISA 无法在所有场景下完美遵循物理原理。

原始链接

一手源存档(sources/)

  • wisa—project-page — 项目主页快照(含摘要、作者单位、Cosmos/CogVideoX/PhyT2V/Wan2.1 定性对比视频描述),fetched 2026-07-16
  • wisa—github-readme — GitHub README 快照(含 WISA-80K/Wan2.1 支持发布时间线、环境搭建、训练/推理脚本说明),fetched 2026-07-16
  • wisa—hf-model-card — HuggingFace 模型权重卡片快照,fetched 2026-07-16
  • wisa—hf-dataset-card — HuggingFace WISA-80K 数据集卡片快照,fetched 2026-07-16
  • arXiv 原文全文(HTML v1,2503.08153)已通读,正文与附录 A-G 数字均取自此;arXiv 原文 PDF,不入 git,见上方 arXiv 链接。