一句话定位

百川的首个开源 7B 全模态(image+video+audio+text)大模型,支持四模态并发处理与实时交互。

摘要

Baichuan-Omni 是首个开源 7B 全模态 MLLM,能并发处理图像、视频、音频、文本四种模态,提供先进多模态交互体验与强性能。训练采用从 7B 模型出发、经”多模态对齐 + 多任务微调”两阶段的有效训练方案,覆盖音频/图像/视频/文本模态,使模型具备跨模态理解与交互能力。

关键技术细节(带数字)

  • 规模:7B(全模态 MLLM)。
  • 模态:image + video + audio + text 四模态并发处理。
  • 训练方案:两阶段——(1) 多模态对齐(multimodal alignment);(2) 多任务微调(multitask fine-tuning)。
  • 定位:首个开源 7B 全模态模型;在图像/视频/音频多个基准上与 Qwen2-VL、VITA 等比较。

原始链接

一手源存档(sources/)

  • baichuan-omni.pdf (PDF 不入 git,走 HF bucket)