一句话定位
高德地图(AMAP)CV Lab 出品的通用多模态 3D 世界模型:把文本、单图、多视图照片或随手视频统一”提升”为一个紧凑的 Spatial Generative Primitive(全景图 + 空间点云),再用 14B 参数的全景视频扩散模型沿规划轨迹生成 3D 一致的探索视频,最终经 ABot-3DGS 迭代修复重建出可漫游的照片级 3D Gaussian Splatting 世界,并原生锚定到地图 POI,作为消费级地图产品的空间探索引擎。
背景与定位
论文把”AI 3D 内容生成”的演进路径描述为从物体级(Tripo、Meshy、腾讯 Hunyuan3D 等,text/单图→单个 3D 资产)走向场景级(scene-level),后者带来两个核心技术挑战:如何高效表示一个完整空间(物体一圈环拍即可覆盖,而场景从单间到街区、城市不等,需要同时编码几何结构与视觉外观的紧凑表示);以及如何高效探索这个空间(透视图像视野窄,覆盖完整环境需要大量帧,生成与渲染成本随场景规模急剧上升)。
论文将自己定位为对标 world-labs-marble(World Labs, Marble)与 HY-World 2.0(腾讯混元,arXiv 2604.14268,论文原文称遵循其 end-to-end 评测协议)这两个”完整 3D 场景生成”系统的第三个同类工作,并指出二者共同的三个技术瓶颈:(i) 多模态输入(多视图、视频)常被级联式生成式转换处理,丢弃原始几何证据、放大幻觉;(ii) 视频生成器多采用透视视频作为探索载体,视野窄、覆盖效率低,且用 2D loss 训练缺乏跨视图几何感知;(iii) 训练数据若只有 2D 监督而无对齐 3D 真值,3D 保真度存在天花板。ABot-3DWorld 0 的方案是用同一 Spatial Generative Primitive(SGP)统一所有输入模态、用全景视频取代透视视频作为探索载体、并自建”重建-渲染”数据引擎产出几何对齐的训练监督。技术路线上,其全景视频生成器直接基于阿里自研的 vace(Ali-Vilab,all-in-one 视频创作/编辑框架)14B 权重初始化的可控视频扩散模型;轨迹规划与 3DRL 后训练思路呼应了同期 OmniRoam、PanoWan、360Anything 等全景世界模型工作,以及 CamPVG 的全景 Plücker 相机编码、AnyRecon 的点云可见性掩码设计。
与竞品 HY-World 2.0(面向游戏资产与具身智能场景)、Marble(闭源,室内场景强但城市级覆盖有限)不同,ABot-3DWorld 0 强调”室内 / 地面级室外 / 航拍”全谱系覆盖、地图 POI 绑定,以及独有的 Portal 时空穿越消费级产品形态——论文将这些定位为高德地图生态原生的差异化能力,而非单纯的生成质量竞赛。
模型架构
整体流水线(四阶段):多模态输入 → Spatial Generative Primitive(SGP)→ 探索轨迹 → 3D 一致全景视频 → 3DGS 世界。
SGP 定义:S ≜ (P, G),P 为高质量全景图,G 为编码场景度量几何的空间点云;每个 SGP 关联一个相机位姿 T 作为空间锚点(不属于生成式原语本身),多个 SGP 可通过共享度量坐标系拼接组合成更大的世界 W = {S₁,…,S_K}(单房间到多房间室内、单街段到整个街区)。
输入→SGP 两条路径:
- 极简输入(文本/单图):先用 ABot-Pano(基于 Diffusion Transformer 的多模态全景生成器)合成 360° 全景 P,再用 MoGe-2 风格的单目几何估计器(transformer 深度预测器,cube-map 投影逐面预测深度再拼回统一全景点图)估计点图 G;该几何估计器在 ABot-3DGS 重建场景生成的合成单全景深度语料上微调。
- 富输入(多视图照片/短视频):先做关键帧采样与联合位姿配准,得到稀疏点云;再用 ABot-3DGS 做稀疏到稠密的快速 3DGS 重建;从重建结果在多个代表性视角(POI)渲染全景图,未覆盖区域用引导式 inpainting 补全;每个渲染全景图+对应点图构成一个 SGP,多个 SGP 共享统一度量坐标系并组合成多房间世界。
ABot-Pano(全景图生成):基于 DiT 架构,支持文本/透视图像/二者组合的统一条件生成。关键设计:(1) Zero-Convolution 残差注入的 Control 分支——透视图先投影为 ERP 格式并经 VAE 编码,Control 分支产生逐层残差信号通过可缩放加性融合注入主干,条件为空图像时优雅退化为纯文本生成模式;(2) 双模态独立解耦训练策略——Caption Dropout(纯视觉外推)、Image Dropout(保留纯文本生成能力)、联合保留(跨模态语义对齐与空间约束的协同);(3) 全景几何正则——水平循环填充 + Distortion-aware Cube Loss + Rotation-consistent Yaw Loss,处理 ERP 边界连续性、极区畸变与全局旋转等变性。
轨迹规划(几何驱动的智能体式规划):用 MoGe-2 估计全景的度量深度场与逐像素法向,反投影为统一全局点云与三角网格;经 RecastNavigation 转为可行走导航网格并稠密采样为空间图 G;用 Qwen3-VL-8B 识别全景中的语义显著物体,经 Grounding DINO → SAM3 → 深度反投影的检测-分割流水线在 3D 中定位并注册为导航图上的目标点。三类轨迹通过农点采样、扇区划分、KD-tree 碰撞安全过滤、余弦去重多样性过滤联合生成:空间覆盖(绿色,farthest-point sampling + 方位扇区划分)、语义参与(紫色,逼近发现的目标物体)、自主漫游(橙色,提供密集视差与视图重叠的重建质量监督)。离散位姿序列经三次 B-spline 平滑并重采样为 21 个等距关键帧。
全景视频生成器(探索视频合成核心):基于 VACE 系列可控隐空间视频扩散模型的 14B 参数基座(Ali-Vilab VACE,扩展其 control-branch 架构);生成等距柱状投影(ERP)视频 V̂ ∈ R^{T×H×W×3}。轨迹对齐控制信号四类:点云 RGB 渲染(沿 ViewCrafter/GEN3C/Uni3C 思路)、深度视频、点云可见性掩码(沿 AnyRecon 思路,标记 ERP 像素是否有点云证据支持)、相机位姿 Plücker 射线图(沿 CamPVG 思路,逐像素编码 6 维 Plücker 坐标);此外维护最多 4 个带位姿的参考全景作为”场景记忆”(scene memory),依相机中心邻近度检索。RGB/深度经 VAE 编码为隐空间控制特征,掩码与相机射线嵌入下采样为紧凑联合嵌入,控制分支从 VACE 权重初始化并微调。
无缝环绕拼接(Wrap-around)处理:在 VAE 编码、隐空间去噪、VAE 解码三个阶段同时施加循环连续性约束——编码前对宽度方向做循环填充(右侧 W/8 列拼到左边界、左侧 W/8 列拼到右边界)编码后裁掉填充区;去噪期间在每步把隐张量及其条件沿宽度方向整体滚动 ⌊W_ℓ/N⌋ 列(N 为总去噪步数),累计位移在去噪结束后撤销;解码前对隐空间再做一次循环填充再裁剪。三级机制联合消除 θ=±180° 处的接缝伪影。
推理加速:采用 LightX2V 风格一致性蒸馏,将全景视频采样器从 50 步压缩到 4 步,配合适度的空间/时间 patch 缩减;在 4×4090 节点上模型常驻显存以降低加载开销,单场景推理约 12 分钟。
数据
数据引擎理念:采用”重建-渲染”式流水线而非直接使用采集的全景素材,规避真实全景采集的三大缺陷(操作者/设备入镜破坏几何、轨迹不可控且有相机抖动、无 3D 几何真值)。核心是先用 ABot-3DGS 把多源资产重建为稳定的 3DGS “虚拟世界” 资产库,再用虚拟全景相机沿规划轨迹渲染出 (RGB, 点图, 相机位姿) 三元组,天然无遮挡、位姿完全可控、几何完美对齐。
3DGS 资产库四类来源(论文未披露各来源具体场景数/小时数的汇总统计):
- 自建室内外 3DGS 场景:用消费级设备(智能手机、Insta360 X5 等全景相机)低成本采集,经 ABot-3DGS 重建;据论文两处一致表述,单个项目可稳定重建覆盖 “over 105 m2” 的连续室内外空间——PDF 文本抽取存在歧义,很可能是 “10⁵ m²”(约 10 万平方米)的上标被展平为 “105”,但也可直译为 105 m²;两种读法均未在原文中消歧,此处如实标注存疑,不作确定性换算。
- 航拍/城市级 3DGS 资产:AMAP 自有的大规模航拍摄影 3DGS 资产(同样经 ABot-3DGS 重建),并引入卫星影像重建的城市模型作为粗粒度城市几何补充。
- 公开数据集:Matterport3D、ScanNet(全景/室内数据集)以及 InteriorGS(3DGS 室内数据集),主要补充室内布局与外观多样性;所有资产统一坐标归一化、尺度对齐、元数据清洗。
- 自举式风格化 3DGS 场景:爬取许可宽松的互联网全景图、无人机片段、街景序列,去重过滤后先用 ABot-3DWorld 0 自身流水线提升为 3DGS 场景,再经同一数据流水线挑选高质量输出回灌训练集,扩展奇幻/卡通/历史重建等风格长尾。
训练样本渲染:从 3DGS 资产库沿规划轨迹渲染 81 帧全景视频;平移专用轨迹(全景相机朝向在片段内固定,靠相机平移产生视差/遮挡/去遮挡变化);遍历速率从 {1×, 2×, 3×, 4×} 采样以覆盖不同运动幅度,深度全局重缩放保持轨迹与场景尺度一致;每个训练样本包含目标视频、相机位姿、点云 RGB 渲染、深度图、点云可见性掩码,以及最多 4 张同场景邻近视角的带位姿参考全景(场景记忆训练信号)。
质量控制:两级过滤——(i) 几何覆盖过滤,剔除有效深度不足或轨迹穿越重建几何的样本;(ii) VLM 感知打分,对候选片段评估纹理清晰度、无伪影程度与美学质量,低于阈值的样本调整轨迹参数后重新渲染;最终语料按场景类别(室内/室外街景/航拍/风景/风格化)做数据集平衡,避免单一场景类型主导生成先验。
一套数据引擎供给多模块:同一套 (RGB, 点图, 轨迹) 三元组同时监督 DiT 全景生成器(ABot-Pano)、14B 全景视频扩散模型(点云渲染条件与 RGB 目标像素级对齐)、以及 3DRL 后训练阶段(用同一渲染语料结合重建无关的几何一致性奖励微调)。
训练方法
全景视频生成器:以 VACE 14B 权重为基座初始化,微调 control 分支使其接受轨迹对齐控制信号(点云 RGB/深度/可见性掩码/相机 Plücker 射线图)与场景记忆条件;训练损失、学习率、batch size、优化步数等具体超参数未披露。
3D Reinforcement Learning(3DRL)后训练:标准 flow-matching 训练只提升逐帧真实感,不显式约束时序/几何一致性;论文提出一个”重建无关”的几何一致性奖励,避免昂贵的显式 3D 重建评估。采用 DiffusionNFT 风格的策略优化,复合奖励由两项组成:
- 循环一致性奖励:将生成的全景视频均匀采样为 K 个透视视频(规避 ERP 投影畸变与横向环绕对光流估计的干扰),对每个透视视频采样 N 组间隔 s 的帧对,用 RAFT 估计双向光流并计算前向-后向循环误差 e(x)=‖F_{t→t+s}(x) + W(F_{t+s→t}, F_{t→t+s})(x)‖²(W 为双线性采样算子),在所有有效像素/帧对/视图上求平均得 ē,再归一化为 r_cycle = clip(1 − ē/τ_cycle, 0, 1)。
- 保真度奖励:为防止”近乎静止视频光流误差也小”的奖励作弊、并保持预训练分布,用 LPIPS 比较 RL 生成视频与冻结的 RL 前参考视频:r_fid = 1 − LPIPS(V̂, V̂_ref)。 两项奖励联合鼓励时序/几何一致同时不偏移预训练生成分布。
ABot-3DGS 重建训练/优化流程:(i) 用 structure-from-motion 从全景视频恢复相机轨迹与稀疏种子点云(借助规划轨迹 τ 作为强先验加速收敛),初始化 vanilla 3DGS 做粗重建;(ii) 受 Difix3D+ 启发的迭代 FLUX 修复-重拟合循环——FLUX 微调后的修复器以确定性单步扩散(从低质量隐变量出发而非随机噪声)把当前 3DGS 渲染视图修复为高分辨率参考,修复训练中引入随机 patch dropout 以提升遮挡/弱纹理区域鲁棒性;修复后的视图作为额外监督重新优化 3DGS,共执行 2 轮修复-重拟合(第一轮去除严重伪影并提升有效分辨率,第二轮用改进后的中间 3DGS 作为更稳定画布进一步压制残余漂移)。(iii) 野外场景鲁棒性模块:天空建模(用 Depth Anything 3 掩码分离天空/前景,显式天空高斯约束为球壳分布,训练中逐渐推向透明并剪枝);外观校准(3D 级 GLO 模块学习逐帧外观码并预测逐高斯颜色偏移,末层 MLP 零初始化;2D 级亮度引导双边网格做像素级仿射校正,配合全变分正则);MCMC 式稠密化(用不透明度加权的概率采样替代基于屏幕空间梯度阈值的确定性稠密化,解耦密度控制与梯度触发,提升反光地面/玻璃幕墙等场景的稳定性);瞬态抑制(2D 语义/inpainting 掩码降权动态区域,配合每个高斯上的可学习 3D 掩码标量,周期性剔除多视图不一致的图元)。加速手段包括仅对 farthest-point sampling 挑选出的子集视图做 FLUX 修复、3DGS 训练用 SH degree 0、改进的并行 FasterGS 后端,以及跨修复轮次复用权重。
Infra(训练 / 推理工程)
训练侧:全景视频扩散基座训练、3DRL 后训练、ABot-Pano 与几何估计器微调所用 GPU 型号、GPU 数量、总训练 GPU-hours、训练精度均未披露。
推理侧(论文正文披露的实测数字,均在 4×4090 节点上测得):
- 全景视频生成:4 步采样(LightX2V 蒸馏后),模型常驻显存以降低加载开销,约 12 分钟/场景。
- ABot-3DGS 重建:FLUX 修复约 3 分钟/场景,每轮 3DGS 训练约 1 分钟/场景;含 3 轮 3DGS 训练 + 2 轮 FLUX 修复的完整重建流程,连同开销约 10 分钟/场景完成。
- 端到端(视频生成 + 3DGS 重建)单场景总耗时约 22 分钟(论文分别披露两段耗时,未给出显式相加总数)。
- 重建资产支持通过 continuous LOD 导出多级细节,用于带宽自适应流式传输与异构客户端设备的实时渲染;具体 FPS / 控制频率(control-Hz)未披露。
评测 benchmark
Table 1:3DRL 消融(100 个 held-out 室内外场景,同一全景初始化/条件视频/随机种子对比 w/o 3DRL vs w/ 3DRL):
| 指标 | w/o 3DRL | w/ 3DRL |
|---|---|---|
| PSNR ↑ (3D一致性,拟合3DGS后渲染) | 34.11 | 35.30 |
| SSIM ↑ | 0.942 | 0.951 |
| LPIPS ↓ | 0.089 | 0.082 |
| DA3 深度 Confidence ↑ | 0.396 | 0.412 |
| VBench Aesthetic Quality ↑ | 46.74 | 47.85 |
| VBench Imaging Quality ↑ | 43.34 | 44.12 |
| VBench Motion Smoothness ↑ | 99.17 | 99.21 |
| VBench Subject Consistency ↑ | 89.42 | 89.94 |
| VBench Background Consistency ↑ | 94.60 | 94.61 |
Table 2:ABot-3DGS FLUX 修复 vs Difix3D+(真实场景稀疏前向视图重建,held-out 侧视角测试,同一参考视图条件下公平对比):
| 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|
| Difix3D+ | 20.2968 | 0.7184 | 0.2667 |
| Ours | 21.6118(+1.31dB) | 0.7926(+0.074) | 0.2314(−0.035) |
Table 3:端到端生成质量 vs HY-World 2.0(遵循 HY-World 2.0 §8.1.5 评测协议;同一测试 prompt 各系统独立生成 3DGS 世界,采样固定新视角评估):
| Val Set | 方法 | Q-Align ↑ | CLIP-IQA+ ↑ | Laion-Aes ↑ | CLIP-I ↑ |
|---|---|---|---|---|---|
| Indoor | HY-World 2.0 | 4.1578 | 0.5412 | 5.3277 | 0.9129 |
| Indoor | Ours | 4.1503 | 0.5573 | 5.5049 | 0.9191 |
| Outdoor | HY-World 2.0 | 3.7592 | 0.5220 | 5.1887 | 0.8970 |
| Outdoor | Ours | 3.6962 | 0.5198 | 5.3670 | 0.9063 |
| All | HY-World 2.0 | 4.0755 | 0.5348 | 5.3137 | 0.9105 |
| All | Ours | 4.0426 | 0.5469 | 5.4903 | 0.9174 |
Laion-Aes 全线领先(Indoor +0.1772、Outdoor +0.1783、All +0.1766),归因于 14B VACE 骨干相对典型全景基线的 1.3B 骨干在高有效分辨率下保留更丰富纹理细节;CLIP-I 同样全线领先(Indoor +0.0062、Outdoor +0.0093、All +0.0069),Outdoor 增益最大,归因于 AMAP 航拍训练分布偏向街景/风景/航拍内容。Q-Align 上 HY-World 2.0 略胜;CLIP-IQA+ 上 Outdoor split HY-World 2.0 领先、Indoor 与 All 本方法领先——两系统在低层感知质量上大致持平。
定性对比:与 Marble、HY-World 2.0 在室内/街景/风景/航拍四类场景的定性对比(Fig. 15)显示后两者存在反光水面、场景文字/招牌、大视差视角、纹理密集区域的重建盲区/模糊/几何畸变;与 Marble 在富多模态输入(多视图照片集/随手视频)下的对比(Fig. 17)显示 Marble 会丢弃原始几何/光度证据并放大幻觉,本方法通过统一 SGP 提取对输入观测保真度更高——论文摘要将此列为核心结论:“ABot-3DWorld 0 sets the state of the art among open-source methods and demonstrates stronger scene fidelity than Marble under rich multimodal inputs.”(无量化指标,仅定性图示对比。)
未提供的:预训练/RL 阶段的 loss 曲线、消融各分项对最终指标的贡献拆解表(仅 3DRL 与 FLUX 修复两个组件有独立消融表)、与 Marble 的端到端量化指标对比(仅有定性图示,量化对比仅针对 HY-World 2.0)。
创新点与影响
- Spatial Generative Primitive(SGP):用”全景图 + 空间点云”这一紧凑元组统一文本/单图/多视图/视频四种输入模态,消除按场景类型或输入模态设计专用分支的需要;多个 SGP 可在共享度量坐标系下拼接组合,兼容单房间到城市街区的不同规模。
- 全景视频作为探索载体:相比透视视频,360° 全景每帧观测完整环绕视野,覆盖同等空间所需帧数更少,并原生具备时空连续性、消除视角盲区;论文将其固有短板(无原生 3D 感知、单帧分辨率有限)分别用 3DRL 后训练与迭代 FLUX 修复补上。
- 3D Reinforcement Learning(3DRL):用光流前向-后向循环一致性构造”重建无关”的几何一致性奖励,避免显式拟合 3D 表示带来的高昂计算与”偏爱模糊/静止视频”的奖励作弊风险,配合保真度奖励维持生成分布。
- 全渲染式数据引擎:把训练监督全部通过 ABot-3DGS 重建资产的虚拟相机渲染获得,天然占用-无关、位姿完全可控、几何完美对齐,规避真实全景采集的三大固有缺陷(设备入镜、轨迹不可控、无几何真值)。
- 系统级差异化(论文自述):室内/地面级室外/航拍全谱系覆盖(对比 Marble 室内强但城市覆盖有限、HY-World 2.0 偏向游戏资产与具身智能);生成世界原生锚定地图 POI;Portal 时空穿越消费级产品形态(利用共享度量坐标系的两个配对高斯世界间做屏幕空间掩码切换,视觉无缝且计算低廉)。
- 论文自述的局限与未来方向(Conclusion 小节):(1) 单图路径下 ABot-Pano 相对 HY-Pano 2.0 在极区纹理质量与开放场景扩展多样性上略有下降,论文将其归因于可控性与生成灵活性之间的权衡;(2) Q-Align 与部分 split 上的 CLIP-IQA+ 未能全面超越 HY-World 2.0;(3) 尚未验证 SGP 组合扩展到城市尺度环境时如何保持跨图元几何一致性;(4) 尚未与行星尺度 3D 地图服务做更深度集成(当前 globe-to-room 连续探索未实现);(5) 物理层仍限于占用碰撞网格与 Portal 传送,尚未支持重打光、动态元素、智能体交互等更丰富的物理可交互性。
原始链接
- arXiv abs:https://arxiv.org/abs/2607.11673
- arXiv PDF:https://arxiv.org/pdf/2607.11673
- 官方产品页(ABot World Studio / 世界广场):https://abot-world.amap.com/plaza
- 关联产品页(星球生成):https://abot-earth.amap.com/
一手源存档(sources/)
- abot-3dworld-0—project-page — 官方产品页(世界广场)快照(fetched 2026-07-16)
- arXiv 2607.11673 全文(arXiv 原文 PDF,不入 git,见上方链接)