一句话定位
腾讯混元的开源”文/图生 3D 世界”框架:先用扩散模型生成一张 360° 全景图作为”世界代理”,再用 VLM 驱动的智能体把场景自动分层(天空 / 背景 / 多个前景物体层),逐层估计对齐深度并通过 sheet warping 重建为可导出的分层 3D 网格——同时保留物体级可交互性、可无缝对接 Unity/UE 等图形管线,并集成 Voyager 视频扩散模型做超出全景视野范围的长程漫游扩展。号称首个开源、可仿真、沉浸式的 3D 世界生成模型。
背景与定位
论文把 2025 年之前的”世界生成”分成两条路线,并指出各自的根本局限:视频类方法(Hunyuan-Video、CogVideo-X、Wan-2.1 等)继承视频扩散模型的丰富先验和多样性,但缺乏真正的 3D 一致性——长程生成会累积漂移;逐帧渲染成本高;帧格式无法直接接入现有图形管线(游戏引擎、VR)。3D 类方法(LucidDreamer、WonderJourney、LayerPano3D、Director3D 等)具备几何一致性和实时渲染效率,但受限于稀缺的 3D 场景训练数据,且已有 3D 表征要么非结构化要么内存效率低,此外通常把场景生成为不可拆分的整体网格,难以支持物体级交互。
HunyuanWorld 1.0 的立场是不把 2D 与 3D 生成当作互斥范式,而是用全景图像作为两者之间的桥梁:借助 2D 扩散模型的数据丰富度生成全景”世界代理”,再用语义分层 + 深度对齐把代理提升为结构化的分层 3D 网格。这一范式与同期自动驾驶/机器人向的可控视频世界模型(如 Cosmos)、以及自回归交互式视频世界模型(genie-3、tencent-hunyuan-gamecraft)分属不同技术路线——后两者生成的是”边走边生成”的视频流,而 HunyuanWorld 1.0 生成的是一次性、持久存在、可导出为标准 mesh 的静态 3D 资产(这与同年 11 月发布的 World Labs Marble 定位相近,但 HunyuanWorld 1.0 更早开源、且强调物体级解耦而非纯粹的高斯泼溅场景)。长程漫游部分复用了同团队随后独立发布的 Voyager(RGB-D 视频扩散模型,arXiv 2506.04225),二者共同构成腾讯混元”世界模型”产品线的第一代(后续团队又发布了 HunyuanWorld-1.0-lite 量化版、1.1/WorldMirror、1.5/WorldPlay 与 2.0,均由 GitHub README 的更新日志披露,超出本文讨论范围)。
模型架构
分阶段生成式框架,核心是”全景生成 → 智能体分层 → 分层重建 → 长程扩展”四段流水线:
- Panorama-DiT(全景生成骨干):基于 Diffusion Transformer(DiT)框架的扩散模型,输出等距柱状投影(equirectangular projection, ERP)全景图。GitHub README 披露开源版本以 Flux 为基座(论文正文未明确点名基座,仅在架构描述中称”DiT 框架”),并称该方法可迁移到 Hunyuan Image、Kontext、Stable Diffusion 等其它图像生成模型。
- 文生全景:先用 LLM 把用户输入的中文/自然语言 prompt 翻译并”增强细节”,对齐训练数据的 caption 分布,再输入扩散模型。
- 图生全景:先用预训练 3D 重建模型(MoGe 或 UniK3D)估计相机内参,把输入的针孔图像反投影到全景空间,再用 VAE 编码进潜空间,与噪声潜变量拼接送入扩散模型;同时用 2.2 节的”场景感知 prompt 生成”策略产出辅助文本条件。
- 边界伪影处理:训练时对 ground-truth 全景做随机竖直位移增强(概率 p、位移比例 r,未disclosed 具体数值)以提升对视角变化的鲁棒性;推理时用 circular denoising(环形 padding + 渐进式混合去噪)保证全景左右边界的结构/语义连续。
- 智能体世界分层(Agentic World Layering):把场景拆解为天空层(室外场景)、背景层、多个前景物体层,分三步全自动完成:
- 实例识别:用 VLM 识别场景中需要单独建模的物体,并按语义/空间关系归入不同子层(如把附近车辆与远处建筑分开)。
- 层分解:先对全景图做 circular padding 再送入 Grounding DINO 做目标检测(避免物体被 ERP 左右边界切断),检测框映射回原全景坐标后用 ZIM 分割模型生成像素级掩码,并用基于面积的 NMS 合并被边界切断的同一物体碎片。
- 层补全:以”洋葱剥皮”式自回归流程逐层移除已识别物体并 inpaint 遮挡区域;作者构造了(物体掩码, 含物体全景, 去物体全景)三元组数据集,微调 Panorama-DiT 学习该条件补全任务;天空层单独用 HDRI 天空数据集微调一个补全模型。
- 分层世界重建(Layer-Wise World Reconstruction):
- 深度对齐:先用深度估计模型(MoGe/UniK3D)在原始全景上得到 base 深度图,最前景层深度直接取自 base 图;后续各层(更靠后的前景层、去前景后的背景层)单独估计深度,再用深度匹配(最小化重叠区域距离)与 base 深度对齐;天空层深度设为略大于所有已存在层最大深度的常数。
- 分层重建为网格:基于 WorldSheet 的 sheet warping 把带对齐深度的分层图像转换为网格。前景层提供两种重建策略:直接投影(按深度和语义掩码 warp 出网格,含极区平滑与边界抗锯齿特殊处理)或 3D 生成(用 Hunyuan3D 系列 image-to-3D 模型把前景物体实例生成为完整 3D 资产,再用自动物体放置算法按空间布局摆入场景);背景层做自适应深度压缩后 warp 为网格;天空层除传统 mesh 外还支持 HDRI 环境贴图表征,也支持用分层 3DGS(3D Gaussian Splatting)作为 mesh 的替代表征。跨层边界统一用 circular padding 处理。
- 长程世界扩展:集成 Voyager(世界一致视频扩散模型),用”世界缓存机制”——把已生成 3D 场景构建成初始点云缓存,投影到目标相机视角为扩散模型提供部分引导;新生成帧持续更新/扩展缓存,形成闭环,支持沿任意相机轨迹的自回归长程漫游(含点云剔除以控制显存占用、平滑采样策略保证片段间无缝衔接)。
- 模型规格(HuggingFace 发布的四个 checkpoint):HunyuanWorld-PanoDiT-Text(478MB,文生全景)、HunyuanWorld-PanoDiT-Image(478MB,图生全景)、HunyuanWorld-PanoInpaint-Scene(478MB,场景层补全)、HunyuanWorld-PanoInpaint-Sky(120MB,天空层补全)。参数量、latent 维度、attention 层数等内部细节论文与 HF 卡均未披露。
数据
- 全景训练数据来源:商业采购、开放数据下载、Unreal Engine(UE)自建渲染三类来源混合;论文未披露具体的图像/场景总数或各来源占比。
- 数据质检:自动质量评估框架(水印、美学分数、清晰度、分辨率、畸变等指标)先过滤不达标样本;再由专业标注员人工复检,剔除几何伪影(明显畸变、可见拼接缝)、场景不规范(过窄/不具代表性的空间)、内容不一致(异常物体重复、人体/物体幻觉)三类问题样本。
- 训练 caption 三阶段流水线:(1) 用 re-captioning 技术为全景生成规范化、细节丰富的描述;(2) 用 LLM 把描述蒸馏为从高层场景概括到细粒度物体标注不同长度的一组 caption;(3) 专业标注员人工核验,消除图文不匹配与幻觉。
- 层补全训练数据:专门构造的”全景物体移除”数据集,每条为(物体掩码, 含物体原图, 去物体目标图)三元组;天空补全模型单独在 HDRI 天空数据集上微调。
- 论文全文未披露具体的图像张数 / 小时数 / 场景数等规模数字(此点在 arXiv 全文与 GitHub/HF 卡片中均未给出,标记为未披露)。
训练方法
- 多阶段/多模型流水线而非单一端到端模型:Panorama-DiT(文生全景 + 图生全景两个变体)→ 场景层补全模型(PanoInpaint-Scene)→ 天空层补全模型(PanoInpaint-Sky),均基于同一 DiT 架构微调得到,分别针对不同子任务用对应数据集训练。
- 全景生成训练:标准扩散训练范式(DiT 框架),文生分支只用文本条件,图生分支拼接条件图像潜变量 + 辅助文本条件;训练时施加”elevation-aware augmentation”(随机竖直位移,提升对视角旋转的鲁棒性)。
- 层补全训练:把 Panorama-DiT 在”物体移除”三元组数据集上微调为条件补全模型,本质是图像 inpainting 任务的扩散式实现;天空层补全单独微调。
- 深度对齐不是学习式训练,而是推理期的几何优化(深度匹配,最小化重叠区域深度差)。
- 前景物体的完整 3D 化复用现成的 Hunyuan3D 系列 image-to-3D 生成模型(非本文训练),本文只负责把生成的物体资产按空间布局放置进场景(自动物体放置算法)。
- 长程扩展直接复用团队此前发布的 Voyager 模型(已在其自身论文中训练完成),HunyuanWorld 1.0 只做流水线集成,不在本文范围内重新训练。
- 具体超参数(学习率、batch size、优化器、训练步数/epoch 数)论文全文未披露。
Infra(训练 / 推理工程)
- 训练侧:GPU 型号、GPU 数量、并行策略、精度(fp16/bf16/fp32)、总训练 GPU-hours 均未披露。
- 推理侧优化(论文 2.6 节,仅描述工程手段,无绝对速度/延迟数字):
- 网格存储压缩:面向离线内容制作的多阶段流水线(网格抽稀 + 纹理烘焙 + 基于 XAtlas 的 UV 参数化),压缩率达 80%;面向 Web 在线部署采用 Draco 压缩,压缩率达 90%,原生 WebAssembly 支持。
- 模型推理加速:基于 TensorRT 把扩散 Transformer 转换为优化引擎,支持”有缓存/无缓存”两种推理模式并共享显存分配以降低 GPU 开销;对非关键去噪步用缓存推理、对影响生成质量的关键步用完整计算;classifier-free guidance 场景下用多线程在不同 GPU 上并行计算正/负 prompt 条件并同步聚合结果。
- 具体的 FPS、端到端延迟、单次生成耗时等定量数字均未披露。
- GitHub 后续披露(不在 arXiv 论文内):2025-08-15 发布了量化版 HunyuanWorld-1.0-lite(fp8 GEMM/attention 量化 + 缓存推理),可在 RTX 4090 等消费级 GPU 上运行,用于降低推理门槛,但未给出该量化版的具体速度/显存数字。
评测 benchmark
评测基于 CLIP-T/CLIP-I(生成结果与文本/输入图像的语义对齐)及三个无参考图像质量指标 BRISQUE↓、NIQE↓、Q-Align↑(视觉质量),在自建的图/文 prompt benchmark 上进行(图像条件取自 World Labs、Tanks and Temples 及真实用户图片;文本条件为众包采集的多风格/多场景 prompt)。所有渲染视角统一用 90° FOV、960×960 分辨率。
文生全景(Text-to-Panorama),对比 Diffusion360 / MVDiffusion / PanFusion / LayerPano3D:
| 方法 | BRISQUE↓ | NIQE↓ | Q-Align↑ | CLIP-T↑ |
|---|---|---|---|---|
| Diffusion360 | 69.5 | 7.5 | 1.8 | 20.9 |
| MVDiffusion | 47.9 | 7.1 | 2.4 | 21.5 |
| PanFusion | 56.6 | 7.6 | 2.2 | 21.0 |
| LayerPano3D | 49.6 | 6.5 | 3.7 | 21.5 |
| HunyuanWorld 1.0 | 40.8 | 5.8 | 4.4 | 24.3 |
图生全景(Image-to-Panorama),对比 Diffusion360 / MVDiffusion:
| 方法 | BRISQUE↓ | NIQE↓ | Q-Align↑ | CLIP-I↑ |
|---|---|---|---|---|
| Diffusion360 | 71.4 | 7.8 | 1.9 | 73.9 |
| MVDiffusion | 47.7 | 7.0 | 2.7 | 80.8 |
| HunyuanWorld 1.0 | 45.2 | 5.8 | 4.3 | 85.1 |
文生 3D 世界(Text-to-World),对比 Director3D / LayerPano3D(渲染 6 视角,方位角 {0°,60°,120°,180°,240°,300°}):
| 方法 | BRISQUE↓ | NIQE↓ | Q-Align↑ | CLIP-T↑ |
|---|---|---|---|---|
| Director3D | 49.8 | 7.5 | 2.7 | 23.5 |
| LayerPano3D | 35.3 | 4.8 | 3.9 | 22.0 |
| HunyuanWorld 1.0 | 34.6 | 4.3 | 4.2 | 24.0 |
图生 3D 世界(Image-to-World),对比 WonderJourney / DimensionX(渲染 7 视角,方位角 0°–90° 每 15° 一次):
| 方法 | BRISQUE↓ | NIQE↓ | Q-Align↑ | CLIP-I↑ |
|---|---|---|---|---|
| WonderJourney | 51.8 | 7.3 | 3.2 | 81.5 |
| DimensionX | 45.2 | 6.3 | 3.5 | 83.3 |
| HunyuanWorld 1.0 | 36.2 | 4.6 | 3.9 | 84.5 |
四组对比中 HunyuanWorld 1.0 均在全部指标上超过所有基线。论文指出 Director3D 在多数测试用例上生成长程相机轨迹能力有限,限制了其跨输入条件的泛化性;定性对比(论文 Fig.6-9, 12-13)显示基线方法常出现不连续伪影与几何畸变,而本方法视觉连贯性与美学质量更高。
创新点与影响
- 提出”全景图作为 2D-3D 桥梁”的世界生成范式:不把视频类和 3D 类世界生成对立,而是用全景代理连接二者,兼顾 2D 扩散模型的数据丰富度与 3D 表征的几何一致性/渲染效率。
- 语义分层 3D 网格表征:首次把”天空盒 + 地形网格 + 多个物体资产”这一游戏美术领域的传统建模惯例自动化为一条智能体驱动的分层重建流水线,使生成结果天然具备物体级解耦——这是它与同期大多数”整体网格/整体 3DGS”式 3D 世界生成方法(LayerPano3D、Director3D 等)的核心差异,支持下游的 3D 变换(平移/旋转/缩放)单物体操作。
- 网格导出优先:相比纯 3DGS 表征,本文坚持网格导出兼容性,配合 Draco(90% 压缩)与 XAtlas 离线管线(80% 压缩),目标直接对接 Unity/Unreal Engine 等工业图形管线,服务 VR、物理仿真、游戏开发等下游场景。
- 首个开源、可仿真的沉浸式 3D 世界生成模型(GitHub 明确定位),开源了 4 个 checkpoint 与完整推理代码,并在发布后一个月内追加了消费级 GPU 量化版(HunyuanWorld-1.0-lite),降低了社区复现与二次开发门槛;后续团队据此衍生出 Voyager、WorldMirror(1.1)、WorldPlay(1.5)、2.0 等一系列产品,构成了腾讯混元世界模型技术栈的起点。
- 作者自述局限:论文本身未设专门的”Limitations”章节,但从方法描述可见:(1) 全景图本身只支持视点旋转式的完整 360° 覆盖,遮挡区域(视点平移后可见的新区域)依赖层补全的 inpainting 猜测,超出该范围的探索则要依赖额外集成的 Voyager 视频扩散模型,而非本文核心的分层重建流程本身;(2) 3D 场景数据稀缺问题被论文列为该方向的根本性挑战之一,但本文并未直接给出解决 3D 数据稀缺的新数据集(training caption pipeline、图像质检流程都是针对全景图像而非 3D 场景标注);(3) 论文全文未披露训练数据规模、GPU 资源与端到端推理速度等定量工程数字,限制了外部对训练成本和实际交互延迟的复现验证。
原始链接
- arXiv abs:https://arxiv.org/abs/2507.21809
- arXiv PDF:https://arxiv.org/pdf/2507.21809
- GitHub:https://github.com/Tencent-Hunyuan/HunyuanWorld-1.0
- HuggingFace 模型:https://huggingface.co/tencent/HunyuanWorld-1
- 官方项目页(现已更新为 2.0 版本内容,1.0 时期页面内容不再可见):https://3d-models.hunyuan.tencent.com/world/
一手源存档(sources/)
- hunyuanworld-1—github-readme — GitHub README 快照(fetched 2026-07-16)
- hunyuanworld-1—hf-card — HuggingFace 模型卡快照(fetched 2026-07-16)
- arXiv 2507.21809 全文(arXiv 原文 HTML,不入 git,见上方链接)