一句话定位

SIMA 2 是 Google DeepMind 的通用具身智能体(generalist embodied agent):以一个 Gemini Flash-Lite 为核心,经 SFT + 在线 RLVR 微调后,能在十余款商业 3D 电子游戏里像人一样「看屏幕像素 + 敲键盘鼠标」完成语言 / 图像目标,同时在同一 token 流里输出内部推理、对话与动作。相比只会短指令跟随的 sima-scalable-instructable-multiworld-agent(SIMA 1),SIMA 2 把训练环境平均成功率翻倍(人类评测口径约 33%→65%)、逼近人类;能零样本泛化到完全没训过的游戏(ASKA、MineDojo、The Gunk)乃至 genie-3 实时生成的照片级世界;并首次演示开放式自改进——用 Gemini 当「出题者 + 通用奖励模型」,纯靠自生成经验在新环境里从零学新技能。是「智能体 + 世界模型」栈(SIMA 2 × Genie 3)的一半。2025-11-13 以「有限研究预览」发布,随附 12-05 版技术报告 PDF(未上 arXiv,无开源权重 / 代码)。

背景与定位

论文把自己放在「基础模型 → 具身智能体」这条线的最新节点上,援引 Moravec 悖论:高层认知(下棋、总结法律)比低层感觉-运动技能(收拾餐桌、穿过杂乱房间)更容易被 AI 攻克。纯 LLM/VLM 是被动、离身(disembodied)的——在 OpenEQA、EmbodiedBench 等基准上具身表现有明显缺陷——因为它们从未被训练去「执行动作并理解动作后果」。SIMA 2 的定位就是把 Gemini 这样的通才推理引擎,转成能在 3D 世界里有能动性地追目标的 VLA(vision-language-action)模型。

技术谱系上,它同时接三条线:

  • 游戏驱动的通才智能体:承接自家 sima-scalable-instructable-multiworld-agent,以及 Gato、Multi-game DT,与同期 ByteDance Lumine、Game-TARS 对标;用商业游戏当「复杂、视觉丰富、无环境奖励」的安全练兵场。
  • 世界模型(world model):论文明确引 Ha & Schmidhuber、Dreamer 系、以及自家 Genie 1/2/3。援引 Clune (2019) 的观点——开放式学习需要一个「Darwin-complete」环境搜索空间,而一个通用世界模型(给定动作产生下一状态的转移函数)恰好能提供它。SIMA 2 × Genie 3 被称作「首个在通用世界模型里学习的智能体的初步工作实例」,指向「越强的世界模型 ↔ 越强的智能体」的良性循环。
  • 具身基础模型 / VLA:与 RT-2、PaLM-E、OpenVLA、π0、Gemini Robotics 1.5 同族——都是把互联网预训练的推理能力灌进具身控制。SIMA 2 的差异是用虚拟世界 + 键鼠通用接口当测试床,主打泛化(新环境、照片级环境)与自改进

范式命名:这是一篇**「把 Gemini 微调成 VLA + 用基础模型做开放式自改进」**的具身智能体技术报告,不是世界模型本身(世界模型那半是 Genie 3),本页归 rl-wm(RL × world-model)。

模型架构

SIMA 2 是 EMB 意义上的 VLA:policy backbone 就是 Gemini 本体,动作以「结构化文本」形式和推理 / 对话共享同一 token 流。

智能体-环境接口(Agent-Environment Interface, Fig.3)

  • 输入:环境 RGB 视频帧,分辨率 720p(1280×720),游戏以 30 fps 运行,但智能体每 10 帧才看到一帧(≈3 fps 的观测节律)。历史里还拼接了此前的自然语言输入 + 智能体自己产生的内部推理与回复。
  • 无特权信息:不读取任何底层游戏状态(对比 Claude Plays Pokemon 那类拿内存状态的做法),只看像素、只敲键鼠——和人类玩家同模态。
  • 动作空间:模拟标准人机接口——96 个标准键盘按键 + 鼠标点击 + 离散化的鼠标相对位移(Δx, Δy)。
  • 动作头 = 文本生成,不是离散动作 token:不从预定义集合里预测离散 action token,而是经 SFT 学会输出一段特定格式的结构化文本,可被确定性地解析成底层键鼠命令;同一输出里也可含对话 / 内部推理的自然语言。智能体输出的是动作 chunk(一批动作一次性给环境),并可在每一步自行指定要生成哪些输出模态(推理 / 对话 / 动作)。
  • 单一 token 流统一 V-L-A:因为视觉、语言、动作都成了一条 token 序列,才得以解除 SIMA 1 的输入 / 输出限制(SIMA 1 无法输出文本、无法接受草图等多模态提示),进而支持对话、多模态提示(图片 / 草图)、以及以内部推理改写自身行为。

backbone 选型

  • 主体 = Gemini Flash-Lite:因为具身动作有低延迟约束,选了比 Gemini Pro 弱但快的 Flash-Lite 当核心,从其预训练 checkpoint 起做微调。报告只写「Gemini Flash-Lite」未钉死版本号,参考文献引到 Gemini 2.5(arXiv:2507.06261)。
  • 分层组合(可选,Sec.4.4):把 SIMA 2 与一个独立的 Gemini Pro 组合成 hierarchical 结构——Gemini Pro 以更慢的节律(每 $k$ 步)读近期视频历史,向 SIMA 2 下发自然语言指令;同时产出一段文本摘要在下一次调用时回喂,充当递归记忆,把长程上下文维持在即时上下文窗之外。Gemini 一升级,这套组合就能立刻吃到更强推理(复杂图示跟随、抽象推理「反着做」、玩 21 questions 等)。

数据

报告给了详尽的数据构成与流程,但没有披露总时长 / 总帧数 / 总 token 数等绝对规模数字(这是本页最大的未披露项)。SFT 训练集是 gameplay 数据 + Gemini 预训练(非 gameplay)数据的混合——作者强调这个混合对保住基座能力(视觉理解、对话、推理、可提示性)至关重要。gameplay 部分分两类:

1) Human data(按体量占训练数据大头) —— 教低层动作 / 运动控制

  • 内容:RGB gameplay 视频帧 + 对应键鼠动作 + 多种语言标注;主要由持牌协议下的人类参与者游玩产生(知情同意 + 有偿),再用 Gemini 合成标注扩量。
  • 两种采集法:
    • 单人事后标注:一人自由游玩,事后由玩家用自然语言对齐到具体帧描述其动作。行为多样自然,但语言与意图非因果对齐(事后补的)。
    • 双人「Setter-Solver」:一人 Setter 看画面实时下指令,另一人 Solver 操控 avatar。指令总是先于动作,因果对齐更强;Setter 只能通过 Solver 间接操控。
  • 任务 / 评测数据:
    • 「Game-Tasks」:从预定义游戏状态出发给定具体指令(如”Craft a stone axe”),到时限或玩家判定完成为止。
    • 人类评分 / 对比:对已采轨迹收集人类判断(二值成功评分 + 两条轨迹的 side-by-side 对比),用于评测与校准奖励模型
  • 预处理 / 过滤:教程统一控制与标注规范;离线 reshape/resize 帧到模型输入尺寸;启发式 + 打分指标过滤低质数据;跨环境重混与加权以优化技能学习;把轨迹切成**「spans」**——每个 span = 一条任务指令 + 对应帧序列 + 动作序列;再用 Gemini 离线补充合成语言 / 推理文本。

2) Bridge data(少量高质量) —— 桥接「动作」与「语言」两种模态

  • 人类 gameplay 本身不含推理 / 对话,故需要一份把推理 + 对话 + 视觉 + 动作交织的数据。做法:选少量高质量样本(覆盖各训练环境的多种游戏内行为,每例=单任务指令 + 成功完成该任务的动作 / 视觉帧序列),用 Gemini Pro 从智能体自我中心视角、以与画面 / 行为因果一致的方式,标注内部推理与对话;并变动训练 prompt 增强鲁棒性。产物涵盖纠错、显式指令跟随、指令串接、视觉问答、依赖记忆、长程行为,还包含 no-op(任务完成后保持不动)。

环境清单

  • 训练:研究环境 Construction Lab、Playhouse、WorldLab;商业游戏 Goat Simulator 3、Hydroneer、No Man’s Sky、Satisfactory、Space Engineers(SIMA 1 之后新增)、Valheim、Wobbly Life。
  • 完全 held-out(训练未见)ASKA(维京生存,2024-06 抢先体验的新游戏)、MineDojo(Minecraft 上的语言条件基准,取 50 个程序化任务,涵盖 Combat/Harvest/Tech-Tree,每任务 15 个随机种子)、The Gunk(叙事向动作冒险,仅定性)、Genie 3 生成的照片级自然 / 城市场景(仅定性 + 自改进)。

RL / 自改进阶段的数据

  • RLVR 任务:三元组(初始游戏状态, 文本指令, 验证函数),主体由 Google 承包参与者从随机游戏状态出发提议可完成任务;再对所有人类轨迹套验证器找到目标完成点并配近邻状态扩量;过滤掉人类在时限内做不完的过难任务;另用人类问答对造 dialogue 任务。RL 仅限训练环境,排除 held-out。
  • 自改进:Gemini task setter 动态生成语言任务;Gemini reward model 给每条轨迹(视频)按 rubric 打 0–100 分(≥50 记「成功」),rubric 由「校准到人类偏好对」得到,含任务完成度 + directedness(不做多余动作);据此攒自生成经验数据训下一代智能体。

训练方法

标准的**「SFT → 在线 RL → 自改进」三段式**,每段都由 Gemini 支撑。

  1. SFT(监督微调):从预训练 Gemini Flash-Lite checkpoint 起,在「gameplay + 非 gameplay」混合集上微调,学会「给定图像帧 + 指令 → 输出结构化键鼠动作(+ 可选推理 / 对话文本)」。混入非 gameplay 数据是防灾难性遗忘的关键设计。
  2. 在线 RLVR(Reinforcement Learning from Verifiable Rewards):SFT 后在线 RL。对 curated 可验证任务生成智能体轨迹以改进策略;奖励来自完成具身任务对环境 grounded 问题给出正确答案;部分任务加 shaped reward 提升指令跟随与可控性。限训练环境
  3. 开放式自改进(self-improvement):Gemini 同时扮演
    • Task Setter:读当前状态出「从此状态大概率可完成」的语言任务,可按下游评测反馈把智能体推向弱项技能,甚至据 within-episode 表现挑「学习进展最大」的任务;
    • Universal Reward Model:不靠 ground-truth 状态,直接从像素 + 语言目标出 0–100 评分。
    在 held-out 的 ASKA:先用固定任务集隔离「改进」环节,多轮迭代后平均分超过人类参考轨迹、成功任务从「不足 1/4」升到「全部任务」;再上完整 setter+reward 循环练 tech-tree 相关技能(ASKA 的合成菜单与训练环境差异大、初始很吃力,经 setter 定向后学会),自改进 agent 在 1 小时窗口内建出 shelter、tech-tree 进度显著超 SIMA 1 / SIMA 2。在 Genie 3:把环境切成 urban(train)/ natural(test),只在 train 任务上自改进,train 任务普遍涨 25 分以上,且迁移到完全不同的 natural held-out 环境多数任务也超初始 agent——首个「在通用世界模型里学习并跨生成环境泛化」的工作实例。

保住基座能力(防遗忘,Table 1):相对未训 SIMA 数据的基座 Gemini,SFT 与 SFT+RL 后在三个通用基准上的相对分数变化——

基准SFTSFT+RL
LiveCodeBench(代码生成)−4.0%−8.4%
AIME(数学)−25.5%−15.4%
GPQA Diamond(STEM)−16.3%−19.5%

结论:只在动作数据上训会「彻底摧毁对话能力」(引 Hancock 2025 等),而 SIMA 2 的动作微调只带来温和回退,RL 相比纯 SFT 没有显著额外损伤——证明「高具身能力」不必以「牺牲通用智能」为代价。

Infra(训练 / 推理工程)

  • 训练算力 / GPU 数 / GPU-hours / 并行 / 精度:全部未披露。报告未给任何加速器型号、卡数、训练时长、显存或并行策略。
  • 推理 / 部署工程
    • 观测节律显式给出——游戏 30 fps,智能体每 10 帧看一帧;输出动作 chunk 施加到环境。
    • Flash-Lite 而非 Pro,明说是为满足具身控制的低延迟要求;为低延迟只能用有限上下文窗,导致「记忆较短」成为已知局限。
    • 分层版把 Gemini Pro 放在更慢节律(每 $k$ 步)跑,用文本摘要当递归记忆缓解上下文窗限制。
    • 具体 control-Hz / 端到端 latency / 边缘硬件:未披露

评测 benchmark

全部数字取自技术报告(图表读数,均为成功率 %)。

训练环境平均成功率(Fig.6)

人类评测(Human Eval)自动评测(Automatic Eval)
SIMA 133%30%
SIMA 265%66%
Human(同时限)76%78%
Human(无时限,上界)86%86%

SIMA 2 约翻倍 SIMA 1 的成功率、逼近人类;人类在有时限下也常做不完(有的任务仅 3 秒),无时限值给近似上界。注:这里 SIMA 1 的分数是在全新、扩大、更难的评测套件(SIMA Evaluation Suite 2.0)上测的,故比 SIMA 1 原报告低。

分技能类别(Fig.7,8 类):interaction / navigation / menu use / tool use / construction / object management / resource gathering / combat。SIMA 2 在 interaction、object management 几乎补齐到人类;resource gathering、combat 仍有差距(如 Valheim 猎鹿需下风向潜行 + 瞬时攻击 + 追逐,运动难度高)。

分环境提升(读数为 SIMA 2 相对 SIMA 1 的增量)

  • 人类评测(Fig.8):Goat Simulator 3 +46%、Hydroneer +39%、No Man’s Sky +23%、Satisfactory +18%、Valheim +35%、Wobbly Life +27%。
  • 自动评测(Fig.9,10 环境):增量分布约 +5%~+57%(Goat Simulator 3 / Satisfactory +57%、Space Engineers +52%、No Man’s Sky +44% 等)。

基座 Gemini(未微调)直接玩游戏:跨 10 个训练域,Gemini Flash-Lite 仅 3.2%、Gemini Pro 仅 7.0% 成功率(已做了相当的 prompt engineering)——证明「具身交互能力不是大规模预训练的涌现属性,必须显式训练获得」。

Held-out 环境(Fig.10,自动评测):SIMA 2 每个环境都超 SIMA 1 >10%——ASKA +12%、MineDojo +13%。MineDojo 上 SIMA 2 在 50 个任务类别里完成 26 个,而 SIMA 1 只能完成 2 类(harvest dirt、combat spider)。

  • 新手人类基线(首次接触、只给书面控制说明):MineDojo ≈19%(16 任务)、ASKA 32%(25 任务)——说明 held-out 任务对新手人类也很难,SIMA 2 的初始泛化已接近「人类首次进入复杂新环境」的水平。作者提醒别过度直读人机对比(人类多因时限失败、智能体多因探索次优失败)。

定性泛化:The Gunk 手动指令下走通开局 15–20 分钟到「Campsite」检查点(扫描、攀爬、跳跃、清 gunk,靠屏幕提示 ABSORB/HOLD 推断按住左键);Genie 3 多种照片级自然 / 城市场景导航到指定目标。

创新点与影响

  • 把 Gemini 直接变成 VLA:V/L/A 同处一条 token 流,一举解锁具身对话、具身问答(走过去看再回答)、多模态提示(草图 / 图示)、多语言 + emoji 指令、以内部推理改写行为——这些 SIMA 1 全做不到,且基座 Gemini 直接玩只有 3–7% 成功率。
  • 证伪「微调 VLA 必毁通用能力」:动作微调只带来温和的代码 / 数学 / STEM 回退,RL 无显著额外损伤,混入非 gameplay 数据是关键。
  • 开放式自改进闭环:Gemini 一身三任(task setter / agent / reward model)+ 通用世界模型,纯自生成经验就能在新环境从零学新技能,并跨代自举——朝「永续学习的开放式智能体」迈出实证一步。
  • 智能体 × 世界模型的良性循环:SIMA 2 在 Genie 3 生成的照片级世界里既能零样本行动、又能自改进并跨生成环境泛化——被称作「首个在通用世界模型里学习的智能体实例」,也是 SIMA×Genie 栈的价值证明,并为「虚拟技能迁移到真实机器人(键鼠控真机)」提供 proof-of-concept。
  • 作者自陈局限:① 很长程、需多步推理 + 目标校验的复杂任务仍吃力;② 记忆短(受限上下文窗以保低延迟);③ 键鼠精细低层动作 + 复杂 3D 场景的鲁棒视觉理解仍是开放难题;④ combat / resource gathering 等运动密集技能与人类仍有差距。以「有限研究预览」发布,只向少量学者与游戏开发者早期开放,无开源权重 / 代码

原始链接

注:技术报告的 BibTeX 误填 arXiv:2404.10179,该 id 实为 SIMA 1(Scaling Instructable Agents Across Many Simulated Worlds);SIMA 2 本身并无 arXiv 版本,正式一手源为上述 googleapis 托管的报告 PDF + 官方博客。

一手源存档(sources/)

  • deepmind-sima2—blog — 官方博客正文快照(sources/world-model/2025/deepmind-sima2--blog.md
  • 技术报告 PDF 未入 git(33 MB 图重);正文数字均取自该 PDF,引用见上「原始链接」。