一句话定位

SenseNova-Vision 是商汤把”整个经典计算机视觉”(检测、OCR、关键点、分割、深度、法向、点云、相机位姿)重新表述为统一多模态生成的工作:不加任何任务专用预测头,直接用一个 UMM(Bagel-7B-MoT)在同一套”文本生成 + 图像生成”空间里,把上述异构任务全部当成”读指令 → 生成可解码的文本/图像/图文混合答案”。整篇论文没有新架构、没有 RL,核心是一套数据协议 + 一份 50M 语料(SN-VC-50M)+ 一次混合任务 SFT,结论是单个统一模型能在四大感知族上追平各自的专用系统。作者含 Ziwei Liu、Dahua Lin、Lei Yang、Quan Wang 等,arXiv 2607.06560,2026-07-07 提交、07-08 开源。

背景与定位

UMM 这条线(TransfusionShow-o2Janus-ProBagelEmu3.5 等)已经把”文本 + 图像生成”统一进一个模型。GPT 用”prompt + 生成”把 NLP 的异构任务收敛成一个生成接口;这篇论文问的是:能不能对视觉做同样的事——把从检测到多视几何的全谱系 CV 任务,都表达成一个 UMM 的原生生成,不再一个任务配一套架构、损失、解码规则和评测协议。

论文把已有路线归纳为几类,并指出各自的”半统一”缺陷:序列化统一(Pix2Seq、Unified-IO 2、Florence-2)把标注塞进共享序列格式,但仍需各任务专属的序列化/解析约定;表征中心的视觉基座(SAM、SegGPT、Depth Anything、VGGT 之类)在视觉相近的任务族里泛化强,却没有统一输出空间、语言控制有限;图像生成式稠密感知(Marigold、Lotus、DICEPTION、Vision Banana)能出深度/法向这类稠密图,但天生覆盖不了符号化记录(类别、坐标、相机参数);MLLM 路线(LISA、VisionLLM v2、X-SAM)加了语言和推理,但稠密输出仍然走任务专用 decoder。作者的观察是:符号记录、稠密空间目标、图文混合输出,至今没有被塞进同一个原生多模态生成框架。SenseNova-Vision 就是要补这个缺口——把三类输出都对齐到 UMM 原生的文本与图像输入输出空间,变成可训练、可解码的目标。定位上它跟商汤自家 SenseNova-SI(空间智能监督)互补:后者研究怎么 scale 空间推理,本文关注怎么把异构 CV 标注转成可解码的原生生成目标。

模型架构

关键点是:不改架构、不加头。整个方法直接复用现成的开源 UMM Bagel-7B-MoT(MoT = Mixture-of-Transformers,理解侧走 VAE + SigLIP2 双编码、生成侧继承 rectified-flow),发布的模型就叫 SenseNova-Vision-7B-MoT。异构 CV 任务如何落到这套原生空间,靠的是一套”输出表示协议”,按四大任务族分工:

  • 结构化视觉理解(→ 文本生成):检测、referring、pointing、关键点、OCR、版面分析、GUI grounding,全部写成文本记录——类别/文字/属性是普通文本,空间字段写成归一化图像坐标,用 <p><bbox><point> 这类轻量 marker 分隔短语和坐标域,生成的文本再解析回各 benchmark 的结构化记录。所有这些任务共享同一个文本生成空间,靠语言指令和文本 schema 区分。
  • 稠密几何预测(→ 图像生成):深度、表面法向这类与输入像素对齐的目标,天然适合条件图像生成。深度把有效度量值转成 inverse depth 再渲成归一化灰度图;法向渲成 RGB 图(三通道编码法向分量);生成的图再确定性地解码回度量兼容的深度/法向图。
  • 分割(→ 图像 or 图文混合):沿用 X-SAM 的任务分类。单目标(referring/reasoning/interactive)输出固定前景背景色的二值 mask 图,交互式分割额外接收点/框/涂鸦/mask 等视觉 prompt;多区域(generic/panoptic/semantic)用图文混合——文本部分用 <color> marker 列出各区域的 RGB 调色板,图像部分渲染对应的 color-coded mask。GCG(grounded conversation generation)分割进一步:先生成区域描述和配色,再按生成的 legend 渲 mask。
  • 多视几何(→ 图像 + 结构化 token):有序图集作输入,指令给出视图顺序、参考坐标系和输出类型。稠密场景几何表示成 per-view 稠密 XYZ 点云图(RGB 三通道存对齐归一化的 3D 坐标);相机位姿表示成结构化序列,每个目标视图相对参考帧编码为四元数旋转 + 平移方向 + 尺度,用 <frame>/<quat>/<offset>/<scale> 这类保留 token 界定。点云重建留在图像空间,离散几何元数据留在文本空间。

一个工程细节:相机位姿用了专用词表——把基座模型词表的最后 2009 个 entry 征用为专用 token,其中 2001 个编码量化后的位姿参数(四元数旋转、单位平移向量、尺度),剩下 8 个作结构占位符。这些 token 只用于相机位姿,其余结构化输出仍用普通文本 token 序列化。

数据

数据是这篇论文真正的重头。核心产物是 SenseNova-Vision Corpus(SN-VC):把公开 CV 数据集按上面的协议转成”一或多张视觉输入 + 自然语言指令 + 可解码目标响应”的指令-响应样本。SN-VC 定位为完整可复现语料——图像取自公开源,能直接匹配可解码格式的标注就直接转换;监督不完整/缺失/多样性不够时,作者自己生成或策展补目标。公开发布的子集叫 SN-VC-50M,含 5000 万条这些生成+策展的样本;SN-VC 的其余部分则通过发布的源清单、prompt 模板、转换规则和示例从公开数据集重建。凡与评测 benchmark 重叠的数据,保留官方 split 并把评测图像/标注排除出训练。

四大源族与补目标手段:

  • 结构化视觉理解源覆盖以检测为中心的标注 + GUI、OCR、版面、关键点。检测和 OCR 数据部分借 Rex-Omni 的数据构造 pipeline。附录 Table 6 列出的检测源里,Objects365(174.2 万框)、SA-1B(311.9 万框)、V3Det、NuImages、BDD100K 等是主力;点标注很多是”B2PC”——从 bbox 转来的点;部分标注来自作者自建的 grounding data engine(GDE)。
  • 稠密几何预测源提供深度和法向监督,用 MoGe-2 对不完整监督做稠密化、扩多样性(生成额外深度/法向目标),再做有效性和场景内容过滤。
  • 分割源覆盖 mask 类任务(referring、generic、interactive、GCG、reasoning),重点策展 GCG 这类图文混合目标——区域描述和配色 legend 必须和 mask 图对齐。
  • 多视几何源贡献重建目标和相机位姿标注,用 LingBot-Depth 补稀疏深度,并过滤掉深度无效、缺相机信息或视图元数据不一致的样本。

指令-响应转换用任务模板确定性生成:文本类任务用归一化 schema,图像类任务渲 mask/几何图,混合类任务按固定顺序摆放文本和图像分量;每个任务实例化多个指令变体以提升 prompt 鲁棒性。同一源图出现在多个任务里时,各任务的转换样本作为独立样本保留。训练实际配比见论文 Fig. 5(b)(图示,未给逐族百分比数字)。SN-VC 的总样本量、各族绝对配比数字未在正文披露(只发布了 50M 子集与源清单)。

训练方法

一次混合任务 SFT,没有多阶段、没有 RL、没有蒸馏。从 Bagel-7B-MoT 的 checkpoint 出发,在 SN-VC 语料 + 通用多模态数据(VQA、文生图、图生图)的加权混合上做监督微调。加通用数据是为了”能力保持”——避免基座 UMM 的开放式图像理解、指令跟随、图像生成能力在专门化训练中退化。

训练机制上,一个 mini-batch 里可能混着来自多个任务类别的样本,因此同时产出文本和视觉两类监督目标,二者在同一优化过程中交错:

  • 文本类输出(检测框、OCR 串、关键点、相机参数)token 化后用标准交叉熵(next-token prediction)优化;
  • 视觉类输出(mask、深度图、法向图、点云图)编码进 VAE latent 空间,用继承自 Bagel 的 rectified-flow 目标优化。

于是异构 CV 目标全部通过基座模型原生的文本/图像 decoder 学习,不引入任何任务专用头。作者认为这种跨交错任务格式共享参数的联合训练,是模型能零样本泛化到”训练语料里没显式枚举”的任务变体的原因。

高分辨率和多视设置:SigLIP2 提供比 VAE 通路更强的语义条件,对语言引导和区域级感知有利,因此对需要精细空间条件的图像输入任务(尤其分割)把 SigLIP2 输入分辨率保到 980 像素(理解和图像条件生成两侧都是),比 Bagel 生成侧更低的 SigLIP2 条件上限更高。多视场景因显存约束,每个训练样本最多随机取 10 个视图;点云重建时选中视图对齐到第一帧、中心归一化、无效像素映射到远处 sky box。

超参(论文唯一给全的训练细节):VAE 视觉编码器冻结,其余所有模块和 connector 可更新;AdamW,学习率 2.5×10⁻⁵,无 weight decay;沿用 Bagel 的 batch packing,每 rank 32K–36K token、单样本最大上下文 32K;text/ViT/VAE 输入 token 的 dropout 分别 0.05/0.1/0.1;训 50K step(含 500 warm-up),EMA ratio 0.995,评测用 EMA checkpoint;其余配置与 Bagel 的 SFT 阶段相同。

Infra(训练 / 推理工程)

训练算力这块基本是空白。 论文和 model card 都没有披露 GPU 数量、GPU·时、并行策略、混合精度或吞吐,能查到的只有上面的 SFT 超参(50K step、32K token/rank、AdamW 2.5e-5)。这是本工作的主要工程缺口——它本质是”在开源 Bagel 上做一次大 SFT”,规模应可观(50M 语料 + 32K 上下文),但作者没给数字。

推理侧只有部署门槛的定性说明(来自 GitHub / model card):完整 web demo 推荐 1×80GB GPU;跑全套 benchmark 推荐至少一台 8×80GB GPU 机器(脚本默认 --num_gpus 8 --tasks_per_gpu 2)。仓库给了统一入口脚本(example / 单图推理 / 交互推理 / benchmark 推理)和 Gradio demo,evaluation 指南在 docs/EVAL.md。没有蒸馏/量化/加速 kernel 的披露。

评测 benchmark

论文用四大任务族的标准 benchmark 逐一对比专用系统,全部是一手数值(下列取 SenseNova-Vision 与关键对手,↑越高越好、↓越低越好)。

结构化视觉理解(Table 1,F1@mIoU / F1@Point / click acc / F1@mOKS):SenseNova-Vision 在多数格上领先,尤其密集、长尾、小目标、referring、OCR:

COCO-Com.RefCOCOg V/TLVISDense200VisDrone(pt)HierTextICDAR15ScreenSpot-V2COCO-Kpt
Bagel(基座)50.276.4 / 77.846.842.436.97.115.881.1
Qwen3-VL-8B46.672.3 / 72.643.213.535.722.425.490.5
Rex-Omni52.973.6 / 74.346.958.358.928.028.188.432.6
SenseNova-Vision56.679.6 / 80.554.866.862.931.249.585.934.6

相对基座 Bagel,OCR(ICDAR15 15.8→49.5、HierText 7.1→31.2)和密集检测(Dense200 42.4→66.8)提升巨大;只有 GUI grounding(ScreenSpot-V2 85.9)不敌 Qwen3-VL/Qwen3.5 的 90+。

稠密几何预测(Table 2,深度 abs rel↓/δ1↑,法向 mean err↓/δ11.25↑):追平乃至超过生成式基线(Marigold/DICEPTION/FE2E/Lotus-2),与几何专用模型(MoGe-2、Depth Anything V2)竞争。NYUv2 深度 4.0/98.1、ScanNet 3.9/98.0、DIODE abs rel 20.6(最低);法向 ScanNet 12.8/68.9、NYUv2 14.4/62.7 多项领先生成式对手。

分割(Table 3):整体有竞争力,reasoning 和 GCG 强,但 generic/referring 输给带 SAM/Mask2Former mask 先验的专用模型。Rea. Seg. Val/Test 63.2/60.7(最高);Inter. Seg. Box 73.9(最高);但 Gen. Seg. Pan/Sem 48.8/64.0 低于 X-SAM 54.7/66.5,RefCOCO cIoU 81.3/76.0/80.3 略逊 X-SAM 的 85.1/78.0/83.8。

多视几何(Table 4,重建 Acc↓/Comp↓/F1↑;位姿 RRA/RTA/AUC@30↑):在通用几何方法里强,尤其 ETH3D 重建和相机位姿,但与前馈几何专用模型(VGGT、Depth Anything 3)仍有差距。ETH3D 0.301/0.175/72.2,CO3Dv2 位姿 97.4/95.4/80.1,明显好于同为”UMM 派”的 G2VLM(96.3/92.0/55.2),但 VGGT ETH3D F1 80.9、DA3 AUC 91.8 仍更高。

与通用视觉模型对比(Table 5):对 Youtu-VL(VL 理解路线)在检测 mAP 53.7 vs 47.1、深度 δ1 98.1 vs 90.4 上更强;对 Vision Banana(图像生成路线)在语义分割、referring 分割、法向上占优,深度因评测协议不同(本文用 affine-invariant,Vision Banana 报 absolute-depth)仅作参考对比。

通用能力保持:SFT 后 MMVP 多模态理解 79.0(基座 Bagel 83.3,略降),文生图 GenEval 0.85(基座 Bagel 0.82,略升)。即专门化训练基本保住了基座的开放能力。

收敛分析(Fig. 6):深度/法向收敛最快(目标与输入空间对齐、接近预训练见过的图像生成/编辑模式);相机位姿最慢(要跨视对齐 + 新引入位姿 token + 更深几何理解);密集检测最慢之一(拥挤小目标要精确跨模态判别 + 长序列化)。作者据此认为视觉能力是”分阶段”习得,越需要细粒度视觉证据/语言意图/空间结构对齐的任务越晚收敛。

创新点与影响

核心贡献是一个 formulation 而非一个新模型:把整个经典 CV 表述成 UMM 的原生统一多模态生成,作者类比”GPT 之于 NLP”——把异构专用监督收敛成单一生成接口。三条具体产出:(1) 统一多模态生成的表示协议,把检测/OCR/关键点/分割/深度/法向/点云/相机位姿全部映射到文本、图像、图文混合三种可解码目标;(2) SenseNova-Vision Corpus,及其 5000 万条的公开子集 SN-VC-50M;(3) 一次混合任务 SFT 得到的 SenseNova-Vision-7B-MoT,四大族追平专用系统,且能零样本做训练里没枚举的语言定义任务变体

最有意思的是”能力重组”这组定性探针(Sec. 5.6):referring-style 交互分割(把点 cue 写成文本坐标 <p><point>[0.x,0.x]</point></p> 而非图像 prompt,模型要把数值坐标转成图像位置再生成 mask,这个组合 prompt 训练里没有)、VGD 分割(用文本坐标指一个参考实例,分割同类其他实例)、free-form 配色 mask(用自然语言而非固定 RGB 描述配色)、文本分割(没训过文本 mask,却能把 OCR 定位重组成”coke”整词或逐字母的文本形 mask)。这些行为说明:即便监督来自分离的任务域,本文的统一训练强化了跨模态对应,让同一份信息能在文本/图像/空间之间灵活表示和复用——检测的坐标知识能插值进 mask 生成,OCR 定位能重组成文本分割。这是”统一”相对”多任务拼盘”的真正价值所在。

开源:GitHub(OpenSenseNova/SenseNova-Vision,代码 Apache-2.0)、HF/ModelScope 模型(权重 CC BY-NC 4.0,仅非商用——与代码 license 不同,需注意)、HF demo space,2026-07-08 同步放出报告 + 权重 + 推理代码 + 50M 数据集。

已知局限(作者 + model card 明示):并非每个任务都最优,专用模型在若干专门 benchmark 仍更强(generic/referring 分割、VGGT/DA3 级几何);输出解析依赖任务专属 parser 和解码规则;深度/法向/点云/位姿的度量精度不保证,下游需独立验证;对 prompt 措辞和输出 schema 敏感;行为反映训练语料的分布和标注约定偏差。工程侧最大缺口是训练算力/规模完全未披露。作者展望的方向:更强 in-context learning 进一步消解任务边界、从图像扩到视频引入时序和网络级视频监督、以及 scale 语料/模型并与最强 LLM 深度融合走向世界模型。

原始链接

一手源存档(sources/)