一句话定位

MM1.5:在 MM1 基础上以数据为中心,系统研究全训练周期的数据混合,提升文字密集图像理解、视觉指代/定位、多图推理,并出 Video 与 UI 专用变体。

摘要

MM1.5 是新的多模态大模型家族,旨在增强文字丰富图像理解、视觉指代与定位、多图推理。基于 MM1 架构,MM1.5 采用以数据为中心的方法,系统探索全训练周期内不同数据混合的影响:包括用于持续预训练的高质量 OCR 数据与合成 caption,以及为 SFT 优化的视觉指令微调数据混合。模型规模 1B-30B(含稠密与 MoE 变体),证明精心的数据 curation 与训练策略即便在 1B/3B 小规模也能取得强性能。还推出两个专用变体:MM1.5-Video(视频理解)与 MM1.5-UI(移动 UI 理解)。

关键技术细节

  • 规模:1B、3B、7B、30B;稠密 + MoE。
  • 三阶段数据:大规模图文预训练 → 高质量 OCR + 合成 caption 持续预训练 → 优化的视觉指令微调 SFT。
  • 关键发现:数据 curation/混合让小模型(1B/3B)也能强。
  • 专用变体:MM1.5-Video、MM1.5-UI(移动界面理解)。
  • 与 MM1 互补:MM1 关注预训练,MM1.5 关注微调阶段的数据。

原始链接

一手源存档(sources/)