一句话定位
SIMA(Scalable, Instructable, Multiworld Agent)是 Google DeepMind 2024 年 3 月发布的通用具身智能体:只给它屏幕像素和一句自然语言指令,它就用和人类一样的键盘鼠标操作,在十余款商业 3D 游戏与自建研究环境里完成短时程任务——不依赖游戏源码、privileged 状态或专用 API。它不是一个生成世界的模型,而是”住在”世界模型里、消费世界模型的那一端,后来在 DeepMind 的叙事里与 deepmind-genie2、Genie 3 这类生成式世界模型直接配对(用 SIMA 去测试生成世界是否一致、可操作),并在 2025 年演化为 deepmind-sima2。
背景与定位
论文开篇提出的问题是:大语言模型在语言能力上很强,但把语言和具身的感知、动作连接起来仍然很难——这是 Moravec 悖论的一个例子。SIMA 想做的事是:用一个通用的、人类兼容的接口(图像输入、键鼠输出),训练一个能在任意 3D 虚拟环境里跟随任意语言指令的智能体。
它明确把自己和几条脉络区分开:
- 和 DeepMind 自己更早的 Playhouse / Interactive Agents 工作(Abramson et al. 2020, 2022)一脉相承,但把范围从单一程序化房间环境扩大到多款视觉复杂、机制迥异的商业游戏。
- 和 OpenAI VPT(Baker et al. 2022)、AlphaStar、OpenAI Five 等”单游戏”或”无语言”的游戏智能体不同——SIMA 全程以语言指令为训练信号,而不是以游戏得分/胜率为目标。
- 和机器人 VLA(Vision-Language-Action)模型路线(如 RT-2 一类工作,论文正文点名引用)共享”用语言驱动、跨任务/跨形态的策略”这一哲学,但 SIMA 用虚拟游戏世界替代昂贵的真实机器人数据采集与评测,赌的是”游戏里学到的经验和方法未来能迁移回机器人”。
- 和同期”用学到的环境模型做训练场”的世界模型工作(如 Ha & Schmidhuber 世界模型、Dreamer 系列)也不同——SIMA 只把视频预测模型 Phenaki 的内部状态表示当作感知组件用,并不用它生成的 rollout 来训练策略。
范式命名:论文与后续 DeepMind 材料称其为 generalist instructable embodied agent(通用可指令化具身智能体),是”智能体 + 世界模型”这一 DeepMind 技术栈里”智能体”的那一半——世界模型(Genie 系列)负责生成/模拟环境,SIMA 负责在环境里听指令行动。
模型架构
SIMA 本身是一个策略(policy)智能体,不是生成式世界模型,但融合了预训练的视觉/视频组件:
-
输入:图像观测(屏幕像素)+ 自然语言指令。输出:未来 8 步的键盘鼠标动作序列。
-
视觉/视频预训练组件(在 SIMA 数据上进一步微调):
- SPARC(Bica et al. 2024)——一个做细粒度图文对齐(fine-grained image-text alignment)的预训练模型,以行为克隆(behavioral cloning)方式微调。
- Phenaki(Villegas et al. 2022)——一个视频预测模型,以视频预测目标微调;但 SIMA 只取其内部状态表示,不使用它生成的显式视频 rollout(这一点论文特别强调,呼应 Gregor et al. 2019、Zolna et al. 2024 一类”用生成建模当状态表示学习目标函数”的做法)。
-
策略骨干:一个从零训练的 transformer,交叉注意(cross-attend)上述预训练视觉编码、编码后的语言指令,以及一个 Transformer-XL(Dai et al. 2019)记忆模块(attend 过去的记忆状态),构造出状态表示,再送入策略网络输出动作。
-
训练目标:行为克隆(behavioral cloning)+ 一个预测”目标是否完成”的辅助目标(auxiliary goal-completion objective)。
-
推理时可控性——Classifier-Free Guidance(CFG):借用扩散模型/语言模型里的 CFG 技巧(Ho & Salimans 2022;Lifshitz et al. 2023 已在游戏智能体上验证过)增强语言条件性:
π_CFG = π(image, language) + λ · (π(image, language) − π(image, ·))
即把”有语言条件”和”无语言条件”两次策略输出的差值,按系数 λ 放大后叠加回去。消融实验(见评测章节)证实 CFG 对语言可控性有实质帮助。
-
任务时程:主要训练在约 10 秒内可完成的短指令上,长任务需要用户拆成指令序列依次下达(论文承认这是尚未解决的长时程规划问题)。
-
参数量、隐藏维度、Transformer 层数等具体配置数字:未披露。
数据
- 采集方式(behavioral cloning,即从人类专家数据里学观测到动作的映射):
- 单人自由游玩,事后由人工为轨迹标注对应的语言指令;
- 双人 setter-solver 采集(Abramson et al. 2020 方式的延续)——一名玩家观察屏幕并对另一名玩家下达指令,共享同一视角,模拟单人场景。
- 所有采集均通过 Google 签约的参与者完成,数据采集协议(含报酬标准)经独立的人类行为研究委员会(Human Behavioral Research Committee)审核,参与者知情同意并获得报酬。
- 预处理:统一 resize 供智能体输入;用多种启发式规则过滤低质量数据;跨环境/跨采集批次做 remix 与加权,优先突出有效学习经验。
- 环境组合(portfolio > 10 个,论文 + 博客合并列出):
- 商业游戏(共 9 款,来自 8 家开发商,论文原文详细描述其中 7 款):Goat Simulator 3(Coffee Stain)、Hydroneer(Foulball Hangover)、No Man’s Sky(Hello Games)、Satisfactory(Coffee Stain)、Teardown(Tuxedo Labs / Saber Interactive)、Valheim(Coffee Stain)、Wobbly Life(Rubberband Games);另有 Space Engineers(Keen Software House)、Eco(Strange Loop Games)仅在博客致谢与合作方名单中出现,论文正文未展开描述。
- 研究环境(4 个):新建的 Construction Lab(用可拼接积木搭建结构,考核物体操作与直觉物理理解)、Playhouse(沿用自 Abramson 2020/2022 的程序化房屋环境,补充了烹饪、绘画等交互)、ProcTHOR(程序化生成房间,主要用于数据采集而非评测)、WorldLab(简化物理机制环境)。
- 训练集划分:主 SIMA 智能体在除 Hydroneer、Wobbly Life 之外的全部环境上训练,这两款专门留作零样本(zero-shot)定性评测。
- 定量评测子集:> 10 个环境中,仅 7 个有完整定量评测(脚注明确说明是因数据/评测量有限)。
- 指令覆盖:数据中的文本指令经层次聚类后覆盖导航、物体操作等大量通用任务簇(论文图 3),具体到评测层面共整理出 1,485 条独立任务,分属 9 个技能类别(相比之下,同期 MineDojo 用于 Minecraft 的评测集是 1,581 条任务、4 个技能类别:survival、harvest、tech-free、combat)。
- 原始规模数字(小时数/帧数/episode 数/token 数)、跨环境具体配比、动作标注是否依赖逆动力学模型等:未披露。
训练方法
- 主范式:行为克隆(supervised behavioral cloning),不是强化学习——论文强调游戏是异步实时环境,且每个商业游戏实例都要占一整块 GPU,因此无法像典型异步 RL(IMPALA 等)那样跑成百上千个并行 actor。
- 辅助目标:预测”目标是否完成”的分类头,与 BC 主损失联合训练。
- 预训练组件微调:SPARC 用行为克隆微调、Phenaki 用视频预测目标微调,再与从零训练的策略 transformer 联合工作(预实验发现,若把 SPARC/Phenaki 编码器直接放进策略训练一起端到端更新,效果反而变差,因此消融基线里”无预训练”版本改用从零训练的 ResNet 视觉编码器)。
- 对比的智能体/消融组(均为同一训练框架下的变体):
- SIMA:跨全部训练环境(除 Hydroneer、Wobbly Life)联合训练的主智能体,3 个随机种子。
- Zero-shot:每次留一个环境不训练(N−1 个环境训练),在留出环境上零样本评测迁移能力。
- No pretraining ablation:去掉 SPARC/Phenaki,换成从零训练的 ResNet 视觉编码器(沿用 Abramson 2022a 做法)。
- No language ablation:训练和评测阶段都不给语言输入。
- Environment-specialized:每个环境单独训一个专家智能体,作为归一化基准(100%)。
- 除主 SIMA 智能体外,其余对比智能体均只跑 1 个随机种子(而非 3 个),并在训练 1.2M 步后评测;Goat Simulator 3 的 environment-specialized 基线因数据量小、容易过拟合,改为每 200k 步评一次、挑最优,最终选定 400k 步。
- 推理时干预:上文提到的 Classifier-Free Guidance,用于放大语言条件性,不改变训练目标本身。
- 学习率、batch size、优化器、模型总训练 token/样本数等具体超参:未披露。
Infra(训练 / 推理工程)
- 环境部署:每款游戏实例运行在 Google Cloud 的安全环境里,用 GPU 做硬件加速渲染到虚拟显示器;人类采集数据时该画面被流式传输到浏览器,智能体评测时则流式传输给远端 agent client 进程。论文明确指出”每个商业游戏实例都需要占用一块 GPU”,这是其无法采用大规模并行 actor 式异步 RL 的直接原因。
- 训练算力(GPU/TPU 型号与数量、GPU-hours、并行策略、精度):未披露。
- 推理延迟工程:智能体在与之异步、实时运行的环境中评测,网络传输与计算本身都会引入延迟。论文的应对方式:
- 行为克隆阶段就训练智能体预测”相对视觉输入有时间偏移”的动作,评测时用观测/动作缓冲(buffering)镜像同样的偏移;
- 把动作计算调度到 TPU 加速器上(仅提及硬件类型,未给具体型号/数量);
- 跨时间步在设备上缓存(cache)神经网络状态,并仔细选择 batch size 等实现细节以压低延迟。
- 具体 FPS / 控制频率(control-Hz)/ 端到端延迟数字:未披露。
- 边缘/机器人硬件部署:不适用(纯虚拟游戏环境,无真实机器人本体)。
评测 benchmark
论文的评测体系本身就是贡献之一,因为商业游戏没有现成的”语言任务是否完成”的 ground truth:
- 评测方法组合:动作对数似然(离线评测,发现与在线表现只有弱相关,基本弃用作为主要信号)、静态视觉输入(单帧+指令判断单步动作是否合理,便宜但预测力有限)、ground-truth(仅限自建的 3 个研究环境 Construction Lab / Playhouse / WorldLab,可判定复杂交互如”用刀切胡萝卜”是否达成)、OCR(专门用在 No Man’s Sky 与 Valheim 这两款屏显文字丰富的游戏,识别任务/资源采集完成提示,例如”mine carbon/salt/ferrite”“use the analysis visor”“collect wood/stone/raspberries”“cook food”)、人工评测(游戏专家评委,至少 16 小时游玩经验,每段视频取 5 份独立评分;判定标准严格——即使智能体最终完成了指令,只要先做了无关动作也判失败)。
- 规模:7 个有定量评测的环境上共 1,485 条独立任务、9 个技能类别(对照 MineDojo 的 1,581 任务 / 4 类别)。官方博客另给出一个口径不同的数字——“SIMA 在 600 项基础技能上评测,涵盖导航(如”turn left”)、物体交互(如”climb the ladder”)、菜单使用(如”open the map”)“,与论文的 1,485 条任务集之间的具体对应关系,两个一手源都未说明,这里如实并列。
- 主结果(图 8/9,以 environment-specialized 基线=100% 做归一化):
- SIMA(跨环境联合训练)相对 environment-specialized 基线平均提升 67%(即约 167% 相对表现,与博客图表约 165% 一致),在全部 7 个环境上均显著优于专精基线(置换检验 p 值分别为 0.001、0.002、0.036、0.0002、0.008、0.004、0.0002)。
- 相对 no-pretraining 消融:整体显著更优(p<0.001),但按环境拆开后优势幅度不一(各环境 p 值分别为 0.0002、0.14、0.041、0.0002、0.244、0.052、0.032,并非每个环境都显著),说明”互联网规模预训练支持具身学习”这一结论总体成立但强度随环境而异。
- 相对 no-language 消融:no-language 表现很差,全部环境 p<0.001;博客配图显示其聚合相对表现仅略高于 30%,反过来证明 SIMA 的表现确实来自语言理解而非仅靠环境可供性(affordance)瞎猜。
- Zero-shot(留一环境不训练、评测该环境):聚合相对表现约 90%(博客图表数字),部分环境(尤其 WorldLab)零样本表现逼近甚至超过专精基线;论文特别指出即使在完全没做过视觉微调的 Goat Simulator 3 上,zero-shot 智能体表现也和专精基线相当,说明迁移不只是靠视觉编码器的共享。
- CFG 消融(仅在 Construction Lab / Playhouse / WorldLab 三个环境测试):去掉 CFG(λ=0)后表现明显下降,但仍显著优于 no-language 基线——CFG 有实质帮助,但不是语言条件性的唯一来源。
- 人类对比(No Man’s Sky 子集,用同一套严格人工评委标准):人类专家玩家成功率仅 60%(体现任务本身的难度与评测标准的严格);SIMA 智能体成功率 34%;no-language 基线成功率 11%。论文指出,由于评委间对模糊任务存在分歧,100% 成功率本身可能都不可达。
创新点与影响
- 贡献:首次证明单一智能体可以用统一的、人类兼容的键鼠接口(不依赖游戏源码、privileged 状态或专用 API),跨越 10 余个视觉与机制都截然不同的第一/第三人称 3D 商业游戏与研究环境,跟随开放式自然语言指令完成任务;并用严谨的消融(预训练组件、语言输入、CFG)与统计检验(置换检验)证明性能确实来自语言理解与互联网规模预训练迁移,而不是环境可供性或运气。同时贡献了一套应对”商业游戏没有现成任务成功信号”的混合评测方法论(ground-truth + OCR + 人工评测)。
- 改变了什么:确立了”通用可指令化具身智能体跨多世界”这一研究范式,以及后续 DeepMind 材料里反复出现的”智能体 + 世界模型”配对叙事——Genie 2 博客明确用 SIMA 去检验其生成世界的一致性与可操作性;SIMA 本身也在 2025 年演化为 deepmind-sima2(把 V-L-A 统一进单一 Gemini token 流,成功率相对 SIMA 1 大致翻倍)。
- 论文自陈的局限:
- 主要局限在约 10 秒内可完成的短时程指令,长时程多步任务需要用户手动拆解成指令序列,尚未解决;
- 整体表现”远非完美”(“far from perfect”),尤其 Construction Lab 与多数商业游戏上仍有”substantial room for improvement”;
- 即便按论文自己的严格标准,人类专家在 No Man’s Sky 子集上也只有 60% 成功率,说明评测本身足够难、也说明智能体与人类水平之间仍有明显差距;
- 论文承认”开发更具可扩展性、通用性、可靠性的评测方法”本身仍是进行中的工作;
- 责任/伦理层面:训练数据来自可能含暴力、刻板印象等内容的商业游戏,团队通过内容筛选、伦理红线、持续安全评测来缓解,但明确说明 SIMA 目前仅在”受控、封闭”的环境中使用,未公开部署、未开源代码或权重。
原始链接
- arXiv 技术报告:https://arxiv.org/abs/2404.10179 (PDF: https://arxiv.org/pdf/2404.10179 ;提交历史含 v1 2024-03-13、v2 2024-04-17、v3 2024-10-11,三版本 PDF 体积一致,属小幅更新)
- 官方博客:https://deepmind.google/blog/sima-generalist-ai-agent-for-3d-virtual-environments/ (常见引用地址
deepmind.google/discover/blog/...现 301 重定向到上述地址) - 无 GitHub、无 HuggingFace、无 ModelScope、无公开权重或代码 —— SIMA 是封闭环境内的研究项目,未开源。
一手源存档(sources/)
- sima-scalable-instructable-multiworld-agent—blog — DeepMind 官方博客全文快照(
sources/world-model/2024/sima-scalable-instructable-multiworld-agent--blog.md,fetched 2026-07-16) - arXiv 原文 PDF 未下载本地文件(不入 git);全文经
arxiv.org/html/2404.10179v1读取用于本页撰写,见上方原始链接。