一句话定位
2026-06-30 Google DeepMind 一篇博客同时官宣两件事:一是新增 Nano Banana 2 Lite(gemini-3.1-flash-lite-image,即 Gemini 3.1 Flash Lite Image),Nano Banana 家族里最快、最便宜的一档图像模型,主打高吞吐/低延迟/低成本(文生图约 4 秒出图、1K 图约 $0.034/张),定位为老 Nano Banana(Gemini 2.5 Flash Image) 的推荐替代;二是把 I/O(约 2026-05)就发布的统一 any-to-any 视频模型 Gemini Omni Flash(gemini-omni-flash-preview) 首次开放给开发者 API(公开预览),支持从文本+图像+视频输入做对话式多轮视频生成与编辑,输出带音频的 720p 视频,$0.10/秒(与 Veo 3.1 Fast 同价)。两个模型都不开源,无论文;硬指标来自发布博客、模型页、模型卡、API 文档与定价页。注意区分:本页两个模型都属”Flash/Lite”效率档,不要与已单独收录的 Nano Banana Pro(Gemini 3 Pro Image) 专业档混淆。
背景与定位
这条产品线要放到 Google 2025–2026 的原生多模态生成谱系里看。图像侧的 Nano Banana 家族此刻共四档,官方 API 文档给了清晰分层:
- Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image,
gemini-3.1-flash-lite-image):本页新模型,速度/成本专家,近实时高并发场景。官方明说”不适合处理多个参考输入或多轮连续编辑”。 - Nano Banana 2(Gemini 3.1 Flash Image,
gemini-3.1-flash-image):通用主力,均衡质量与成本,支持 4K、Google 搜索接地、多参考图一致性。 - Nano Banana Pro(Gemini 3 Pro Image,
gemini-3-pro-image):见 gemini-3-pro-image-nano-banana-pro,专业档,最强世界知识/本地化/品牌一致性/创意控制。 - Nano Banana(Gemini 2.5 Flash Image,
gemini-2.5-flash-image):老一代,官方直接建议升级到 2 Lite(更好质量、更快、更便宜)。
视频侧的 Gemini Omni Flash 是 Omni 家族的第一个模型,官方口径是”把 Gemini 的多模态推理能力接到视频生成与编辑上”,对标定位是把它类比成”视频版的 Nano Banana”——每一次编辑都建立在上一次之上,维持连贯一致的场景。它对位的是纯视频生成线 Veo(Omni Flash 用同价 $0.10/秒去卡 Veo 3.1 Fast),以及同期各家的统一/视频模型;与闭源图像最前沿 gpt-image-2、seedream-5-0-pro、imagen-4 处在同一波”统一/原生多模态生成”竞争里。
时间线要分清什么是 6-30 真正新的:
- Gemini Omni Flash 模型本身在 Google I/O(模型卡标注 Published: May 2026)就发布了,当时是面向消费端——通过 Gemini app(AI Plus/Pro/Ultra 订阅者)、Google Flow、以及 YouTube Shorts / YouTube Create App 铺开;I/O 博客明确写”未来几周会通过 API 向开发者和企业客户开放”。
- 6-30 真正新的两件事:(a) Nano Banana 2 Lite 这个图像新档首发 GA;(b) Gemini Omni Flash 首次通过 Gemini API + Google AI Studio + Gemini Enterprise Agent Platform 开放给开发者(公开预览)。所以 Omni Flash 的方法/架构不是 6-30 的新东西,6-30 是它的”开发者可用性 + API 能力边界 + 定价”落地。
模型架构
两个模型都没有论文,架构披露程度差别很大。
Gemini Omni Flash(模型卡确认):是一个 transformer-based 模型(引 Vaswani et al., 2017),原生支持文本、视觉、视频、音频输入(native multimodal support for text, vision, video and audio inputs);输出是”带音频的高质量高分辨率视频”。这是它跟以往视频模型的关键差异——不是”文/图 → 视频”的单向管线,而是把文本/图像/音频/视频统一进一个多模态模型里,官方称之为”native multimodality”,从而在多输入组合下保持更强的一致性与可控性。backbone 规模、tokenizer、扩散/自回归、潜空间、解码器结构等全部未披露。API 的 REST 响应结构里出现 "type": "thought" 步骤,且定价把 thinking token 计入输出,说明 Omni Flash 生视频前也走”思考”过程,但思考细节未披露。
Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image):官方未单独披露架构,只给能力边界。它和 Nano Banana 2 / Pro 同属”Gemini 3 图像”思考型模型族,但 Lite 档做了明显裁剪:
- 只支持 1K 分辨率(1024×1024,输出 1120 token/张);不支持 2K/4K,也没有 Flash Image 才有的 512px(0.5K)。
- 不支持 Google 搜索接地(Flash Image / Pro 才有)。
- 官方定位”不适合多参考输入或多轮连续编辑”——不过”最多 14 张参考图”能力表里,Flash Lite 一行标注”最多 14 张高保真对象图片用于合成最终图”,但”角色一致性参考”和”风格参考”两栏对 Lite 都标”不适用”。即它能吃多张对象参考图,但不做角色/风格一致性这类高级参考。
- 新增一批宽高比:
1:1 / 3:2 / 2:3 / 3:4 / 4:3 / 4:5 / 5:4 / 9:16 / 16:9 / 21:9。 - 官方称即便优先速度,仍保留可靠的指令遵循、较强的角色一致性、可读的图内文字渲染。
- 调用统一走 Interactions API(
client.interactions.create),而非老的 generateContent。
数据
Nano Banana 2 Lite 的训练数据完全未披露(图像文档只讲用法与计费,无数据章节)。
Gemini Omni Flash(模型卡确认,粗粒度):在 音频、视频、图像、文本 数据上训练;音频与视频数据集”用不同细节层级的文本 caption 做标注(annotated with text captions at different levels of detail)“。训练视频”按合规、安全、质量等多项指标过滤,并做了语义去重(deduplicated semantically)“。安全侧的预训练缓解手段是”用多样化的合成 caption 提升模型准确表征各类概念的能力”。数据规模、来源、配比、版权处理均未披露。
训练方法
- Omni Flash 后训练(模型卡):post-training 侧的披露集中在安全——部署了”advanced production filters”并用 SynthID 水印标注 AI 生成内容以维持信息完整性。训练目标(扩散/flow/next-token)、SFT/偏好对齐、reward model、蒸馏/加速均未披露。模型具备”改变人物语音(speech editing)“的能力,但官方主动限制了这项能力,理由是还在研究如何安全负责地放开。
- RL:两个模型均未提及任何 RL / RLHF / 偏好优化细节,无从确认。
- 思考/推理:Omni Flash 生视频含 thought 步骤(见架构);Nano Banana 2(Flash Image)文档提到可用
thinking_level(minimal/high)在质量与延迟间取舍、并会生成”想法图”,但这段能力挂在 Flash Image 上,Flash Lite 档是否可调思考等级官方未明说(Lite 定位就是极致低延迟,倾向于不重推理)。
Infra(训练 / 推理工程)
训练 infra(仅 Omni Flash 模型卡披露,无数字):训练用 Google 自研 TPU(TPU Pods 大规模集群),软件栈是 JAX + ML Pathways。具体 TPU 代次、卡数、算力、并行策略、精度、吞吐均未披露。Nano Banana 2 Lite 的训练 infra 完全未提。
推理/部署与 API 工程(图像文档 + Omni 文档,较具体):
- 统一 Interactions API:两个模型都通过
interactions.create调用,该 API 已 GA。多轮编辑靠previous_interaction_id携带会话与视频状态,无需重传上一条视频;模型记住上下文、只改你提到的部分、保留其余。主博客说多轮体验可”堆叠最多 3 次连续编辑”。 - Omni Flash 输出与投递:默认生成带音频的视频;>4MB(约 >720p)建议用
delivery="uri"避开 payload 大小限制;想要更快的同步一元生成可设background=false, store=false, stream=false(但store=false后该视频不能再用previous_interaction_id编辑)。生成含 SynthID 隐形水印。 - Omni Flash 当前能力边界(6-30 API 预览版限制,Omni 文档):目前只能生成 10 秒 视频(更长”即将支持”);不支持上传音频参考;API schema 接受 ≤3 秒的视频参考但”模型目前无法正确处理”;不支持视频扩展与插帧;不支持跨多视频引用/推理;不支持语音编辑;不支持 system instruction / temperature / top_p / stop / 负面提示(负面提示只能写进正文,如”不要出现 X”);不支持把 YouTube 视频当素材源;仅完整支持英语。EEA/瑞士/英国有额外的人物图片编辑限制。
- Nano Banana 2 Lite 延迟:文生图约 4 秒 出结果(主博客);第三方 Astrocade/合作方证言称在 1K 图上比 Gemini 3.1 Flash Image(Nano Banana 2)快约 2.7× 且延迟方差很小。
- 批量:图像生成支持 Batch API(更高速率上限、最长 24 小时),Lite 批量价腰斩(见下)。
评测 benchmark
Nano Banana 2 Lite:官方未给任何量化基准(无 GenEval/DPG/Elo 数字)。发布博客有一张”生成/编辑质量(Elo) vs 延迟 vs 每 1K 图成本”的对比图,但未给可抄的具体数值,只做定性宣称:在保持速度的同时保留指令遵循、角色一致性、图内文字可读。
Gemini Omni Flash:全部是人评 side-by-side 胜负口径(deepmind.google/models/gemini-omni),无公开 Elo/胜率数字,只给”领先/持平”的定性结论与评测规模:
- 视频编辑(Video Editing,“Editing 3P 10s”):504 个样本人评,Omni 在”总体偏好(Overall Preference)“和”指令遵循(Instruction Following)“上取得领先。
- 文生视频(Text to Video):在 Meta 发布的 MovieGenBench 上评 1,003 条 prompt,Omni 在”总体偏好”和”指令遵循”上表现最好。
- 文生视频·快动作(Fast Motion):500 条体育/竞技/高动态动作 prompt 的评测集。
- 图生视频(Image to Video):VBench I2V 的 355 组图文对,Omni Flash 与 Grok-Imagine-Video、Kling 三家持平并领先于其他模型。
- 参考生视频(Reference to Video,“I+AR2V Image & Audio”):468 个混合图像/音频/文本参考的样本,Omni 在”总体偏好”和”语音贴合(Speech Adherence)“上领先;另有 Movie Bench Audio 的 T2VA 公开基准。
- 能力被官方标为 T2VA / I2VA / R2VA / 视频编辑 / 图像生成(VA = 带音频的视频)。模型卡在 I/O 时说”评测会在开发者/企业 API 开放时公布”,这批人评结果就是随开发者开放一起放出的。
创新点与影响
- Nano Banana 2 Lite = 把图像生成做成”能进实时/高并发管线”的一档。核心不是画质突破,而是速度/成本工程:4 秒出图、$0.0336/1K 图(批量 $0.0168),只留 1K、砍掉搜索接地和高级多轮编辑,换极致吞吐。它对应的产品形态是 agent/应用里”边生成边用”的图(Manus 用它给自主工作流实时生图、Figma Weave 节点画布快速迭代、消费端 AI Mode/Photos/Ads 批量出图)。
- Gemini Omni Flash 的开发者开放 = 把”对话式多轮视频编辑 + any-to-any”接进 API。相对传统”文/图生视频”的一次性采样,它的范式增量是:原生多模态输入(文/图/音/视频混合参考)、带音频输出、以及靠 Interactions API 的状态化多轮编辑(改你说的、留你没说的)。定价用 $0.10/秒直接对标 Veo 3.1 Fast,是”便宜且可对话编辑”这个位置的卡位。
- 两个模型的组合叙事:官方主推”Lite 快速出图 → 把图当参考喂给 Omni Flash 生成视频”的链路,配 Interactions API 维持会话,做端到端的图→视频创作流(官方给了 Anywhere/Space Lift/Omni Product Studio 三个可 remix 的 demo app)。
- 溯源与安全:两模型均带 SynthID 隐形水印;Omni 内容还带 C2PA Content Credentials;Omni 的语音编辑能力被主动限制。
- 已知局限:① 两者都零技术披露(Lite 连架构/数据/训练全无,Omni 只到”transformer + TPU + JAX/Pathways + 粗粒度数据”级别),外界无法核验方法与真实 SOTA 位置;② 评测全是内部人评的”领先/持平”定性口径,无可复现数字;③ Omni Flash 预览期硬限制多(仅 10 秒、无音频参考、视频参考不生效、无多视频推理、仅英语、无 system instruction/采样控制);④ Lite 砍掉了 2K/4K、搜索接地和高级多轮编辑,画质/一致性对复杂任务不如 Nano Banana 2/Pro。
原始链接
- blog(2026-06-30 发布公告,两模型合并官宣): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/
- Gemini Omni 模型页(能力 + 人评基准): https://deepmind.google/models/gemini-omni/
- Gemini Omni Flash 模型卡(HTML): https://deepmind.google/models/model-cards/gemini-omni-flash/
- Gemini Omni Flash 模型卡(PDF): https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-Omni-Flash-Model-Card.pdf
- Nano Banana 2 Lite / Flash Lite Image 模型页: https://deepmind.google/models/gemini-image/flash-lite/
- 图像生成 API 文档(分辨率/参考图/宽高比/思考): https://ai.google.dev/gemini-api/docs/image-generation
- Gemini Omni 视频 API 文档(生成/编辑/限制): https://ai.google.dev/gemini-api/docs/omni
- 定价页(Lite 与 Omni Flash 逐项单价): https://ai.google.dev/gemini-api/docs/pricing
- I/O 首发博客(Introducing Gemini Omni,消费端 May 2026): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/