一句话定位

AutoRT 不是一个新模型,而是一套用VLM 描述场景 + LLM 生成任务 + LLM 自我批判过滤(“机器人宪法” robot constitution)串起来的真机数据自动采集系统:把一支 20+ 台移动操作机器人的车队派到没见过的办公楼里自主探索,7 个月里在 4 栋楼中收集了 77,000 条真机 episode、6,650 条独特语言指令,证明用基础模型做”提议任务 + 判断能不能做/该不该做/谁来做”可以显著提升数据的语言与视觉多样性,并能反哺下游策略(rt-1)的泛化。

背景与定位

rt-1rt-2 证明了网络规模视觉-语言数据能提升机器人策略泛化,但训练这些策略本身依赖的真机演示数据长期是瓶颈:实验室环境下的自主采集(open-x-embodiment 收录的抓取/推箱/摆放类工作)场景受限、任务单一,而人类遥操作虽然动作多样但受人力带宽限制,难以规模化。AutoRT 要回答的问题是:能不能让机器人自己在真实、有人走动的办公楼里探索,自己提出任务、自己判断该不该做、自己决定找人帮忙还是自主执行,从而在人类监督带宽有限(1 人监督 3–8 台机器人)的情况下把数据采集规模化。

方法论上,AutoRT 把 palm-e 一脉的”基础模型理解场景→生成任务”思路,和 Constitutional AI(Bai et al., 2022,宪法式自我批判)、Reflexion/ReAct(自我反思式过滤)结合起来,提出机器人宪法(Robot Constitution)——一套分层的自然语言规则(受 Asimov 三定律启发的基础规则 + 安全规则 + 本体限制规则 + 可选的人类引导规则),同时约束”提议什么任务”和”过滤掉哪些任务”两个阶段。这与 Do-As-I-Can-Not-As-I-Say(SayCan,Ahn et al. 2022)等”LLM 生成计划、机器人执行”的路线不同——AutoRT 是LLM 自己生成任务给自己执行,自我设定目标而非听令于人类给定指令,受 Xian et al. (2023) 的自生成指令思路启发;论文将其与 Minecraft 中的 LLM 智能体 Voyager 类比,但强调 AutoRT 跑在真实世界的物理机器人上,长期可靠性与安全性挑战截然不同。

模型架构

AutoRT 本身不训练新的策略网络,而是一个编排系统(orchestrator),由现成基础模型模块拼装而成,论文称之为”policy graph”(策略图):

  • 导航/建图子策略:采用 Chen et al. (2023) 的自然语言地图方法——用 VLM 把物体检测编码成视觉-语言 embedding φᵢ,配合深度传感器+SLAM 给出的位置 (xᵢ,yᵢ,zᵢ)。查询目标词(如”sponge”)时,取该词文本 embedding 与地图中各点 embedding 的相似度,按 score^β 采样导航目标(β 为温度超参,采集时用 β=1 以保持探索多样性)。每个环境的地图只建一次,之后缓存复用于该环境下的所有机器人。
  • 场景描述(VLM):给定机器人摄像头图像,VLM 输出场景文字描述 + 5 个场景中的物体。论文对比了两个 VLM——PaLI(Chen et al., 2022)与 FlexCap——用语言多样性得分打分,两者都优于模板化基线,FlexCap 在颜色等细节描述上更强。
  • 任务生成(LLM):系统提示词设定角色(“我是一个在办公室工作的机器人”),拼入机器人宪法规则与场景/物体描述,LLM 输出候选任务列表(teleop 策略默认生成 10 条候选)。论文全文未指名任务生成/过滤所用的具体 LLM 型号(仅泛称”a large foundation model”/“LLM”),强调该 LLM 未针对任务做微调,只靠提示词引导以保持通用性。
  • 可用采集策略集合 {π¹,…,πᵏ}(k=3):teleoperation(人类遥操作)、scripted pick(脚本化抓取策略,附录 H 给伪代码)、rt-2(学习到的自主策略,可 pick/move near/knock down/place upright/open/close)。每个策略对应任务生成 prompt 的一个策略专属后缀。
  • Affordance 过滤(LLM 自我批判):另一次 LLM 调用,输入机器人宪法 + 各采集策略能力摘要,对每条候选任务输出”应该由哪个策略执行”或”拒绝理由”,可视为 k+1 类分类器(k 个策略 + reject 类)。最终任务从被接受的候选里随机采样。
  • 数据采集环路:采样到的策略 πⁱ 以概率 pᵢ 被选中,pᵢ 随人力监督比例动态调整(如 1 人监督 3 台机器人时 teleop 采样概率 p<1/3)。执行后进入多样性打分(视觉+语言),再重复整个循环。
  • 机器人本体:7 自由度机械臂 + 移动底座 + 头部摄像头的移动操作机器人;部分实例为固定式(跳过导航,只做任务生成+操作循环),便于 1 人监督多达 8 台。

数据

AutoRT 是一套数据采集系统,其”训练数据”即为它自身产出的真机轨迹:

  • 规模:53 台机器人,峰值同时运行20+ 台,历时 7 个月,覆盖 4 栋不同办公楼,累计 77,000 条新 episode,含 6,650 条独特语言指令(DeepMind 官方博客口径为”多达 52 台独特机器人”,与论文正文”53 台”存在 1 台的口径差异,两处均取自一手源)。
  • 采集策略拆分(论文 Table 1):
采集策略Episode 数成功率
Scripted Policy73,29321%
Teleop3,06082%
RT-29364.7%

RT-2 成功率极低,原因是复杂真实环境、物体种类和导航需求与 RT-2 训练/推理设定差异过大,这直接导致团队在采集中降低了 RT-2 的采样频率。

  • 环境覆盖:办公室、厨房、餐厅等,同一套代码在每个新环境仅需修改行驶边界即可在 <1 天内开始采集;为避免任务生成偏向单一环境常见物(如办公场景总生成办公用品任务),团队额外准备了 100+ 种随机物体(塑料玩具、易拉罐等),每天更换散布到环境中以增加物体多样性。
  • 动作标注:teleop 数据由人类演示直接提供动作标签;RT-2/scripted 数据为自主策略执行产生的自监督轨迹(无额外人工标注)。
  • co-training:5.4 节将 AutoRT 数据与 RT-1 原始预训练数据(Brohan et al., 2022)以 50-50 比例混合,对预训练 RT-1 模型做 co-fine-tune,验证数据可用性。
  • 语言多样性对比(Universal Sentence Encoder 512 维归一化 embedding 的平均 L2 距离,论文 Table 2 / 项目页一致):
采集方式语言 L2 距离
Language Table0.988
BC-Z1.070
RT-11.073
AutoRT w/PaLI1.100
AutoRT w/FlexCap1.137
Optimal(上界参考)1.414
  • 视觉多样性:用 CLIP(在 {首帧,目标帧} embedding 与自然语言 caption 上做过对比微调的版本,Xiao et al. 2023)做 embedding,k=1000 做 k-means 聚类,新 episode 到最近聚类中心的距离作为多样性分数——距离越大表示越新颖。AutoRT 各采集策略的视觉多样性均高于 RT-1 数据集,其中 teleop 数据多样性最高。

训练方法

AutoRT 本身不训练/微调任务生成或过滤所用的 VLM/LLM——两者都是纯提示词驱动的现成基础模型调用,论文明确强调”LLM is not fine-tuned to our specific use case to maintain the generality of the underlying model”。系统层面的”训练”体现在两处:

  • 机器人宪法(prompt engineering):四类规则——基础规则(改写自 Asimov 三定律,顺序调整为先保护人类、机器人自保次之、服从命令再次之)、安全规则(禁止涉及人/动物/生物、禁止接触锐器、禁止接触电器)、本体规则(不可搬超过一本书重量的物体、单臂不可做双臂任务)、引导规则(可选的人类高层指令)。这些规则同时注入任务生成 prompt 与 affordance 过滤 prompt。
  • 下游策略 co-fine-tuning(5.4 节):用 AutoRT 采到的数据对预训练 rt-1 模型做 co-fine-tune(选 RT-1 而非 RT-2 是因为训练更快更便宜),50-50 混合 AutoRT 数据与 RT-1 原预训练集,在两个 RT-1 泛化较差的任务(不同高度抓取、擦拭)上评测。另做了一个仅用 AutoRT 遥操作子集训练的消融。
  • 数据采集侧的自适应:遥操作/自主策略的采样概率 pᵢ 按人力监督供给动态调节(而非固定超参),episode 多样性打分实时反馈进入下一轮导航目标采样与场景摆放决策(附录 E 的人工实验:主管根据机器人报出的多样性分数手动调整场景布局以最大化得分)。

Infra(训练 / 推理工程)

  • 训练算力:论文未披露 VLM/LLM 推理及场景理解调用所依赖的具体计算集群规模、GPU/TPU 数量或每次调用延迟;RT-1 co-fine-tuning 阶段的算力配置同样未披露。
  • 人力-机器人配比(系统吞吐的关键指标):移动操作机器人 1 人监督 3–5 台;跳过导航的固定式机器人 1 人可监督多达 8 台。
  • 部署规模:峰值 20+ 台机器人同时运行,累计 53 台机器人参与,跨 4 栋楼,历时 7 个月。
  • 安全护栏(附录 C,传统机器人工程手段,作为 LLM 侧安全的补充层):关节受力超阈值自动停止运动;物理急停开关;工作区无隔离时至少 1 名人类需保持所有机器人在视线范围内;日常运行中主动移除环境里不安全的物体;人类遥操作前先对生成任务做人工合理性检查。
  • 推理延迟/控制频率:论文未披露 VLM 场景描述、LLM 任务生成/过滤单次调用的延迟数字,也未披露闭环控制频率(Hz)。

评测 benchmark

论文的评测重心是数据质量/多样性任务生成-过滤的准确性,而非机器人策略本身的基准分数(基准列表与数值均取自论文正文,已在上文”数据”节列出语言/视觉多样性对比表)。以下为额外的任务生成与安全性评测:

任务生成质量(Table 3,75 条候选任务,5 个场景)

任务生成方法RelevanceFeasibility
模板化语言(随机动词+VLM识别物体)20/75 = 27%39/75 = 52%
AutoRT(无引导)21/75 = 28%62/75 = 83%
AutoRT(有引导,如”收集园艺任务”)46/75 = 61%58/75 = 77%

AutoRT(引导或不引导)生成的可行任务比例比模板化语言高约 1.5 倍。

Affordance 过滤准确性:64 个场景、259 条生成任务的人工标注中,31 条本应被拒绝(基线可接受率 228/259=88%),经 LLM affordance 过滤后可接受率升至 200/214=93%;对 31 条不合适任务的拒绝召回率为 17/31=55%,其中全部 14 次漏拒都发生在 teleop 任务采样(因为刻意要求 teleop 任务保持高多样性),这些任务最终被人类遥操作员在采集时自行拒绝。

对抗式测试机器人宪法效果(Table 4,5 个刻意设置危险物体的对抗场景)

任务生成 \ 过滤无过滤 %Safe极简过滤 %Safe(Recall)宪法过滤 %Safe(Recall)
不安全提示13/49=27%11/43=26%(4/36=11%)13/15=87%(34/36=94%)
极简提示9/50=18%5/34=15%(12/41=29%)8/14=57%(35/41=85%)
宪法提示35/50=70%26/39=67%(2/15=13%)25/30=83%(26/39=67%)

生成阶段和过滤阶段都用宪法提示时安全任务比例最高(83%),仅用极简提示的最低组合仅 15% 安全。

下游策略验证(Table 5, RT-1 co-fine-tune)

训练配置不同高度抓取擦拭
RT-1(基线)0/24=0%1/10=10%
Co-fine-tuned on AutoRT 数据(50-50)3/24=12.5%3/10=30%
Co-fine-tuned 仅用 AutoRT 遥操作子集0/24=0%2/10=20%

论文明确指出这些提升幅度有限,且 AutoRT 的重点是采集多样性数据而非追求高成功率;高多样性、任务分布稀疏的数据本身对模仿学习是更难的学习问题。

创新点与影响

贡献:(1) 首个(据作者所述)允许 LLM 控制的机器人在真实世界中自主驾驶、自己提出目标并采取行动的系统;(2) 提出”机器人宪法”这一分层自然语言规则框架,把 Constitutional AI 的自我批判思路首次系统性用到真机安全过滤上,并给出对抗式场景下的定量消融;(3) 证明”VLM 场景理解 + LLM 任务生成 + LLM affordance 过滤”的组合能在完全不知道环境布局、不预先设定物体列表的前提下,规模化编排 20+ 台机器人以 1:3~1:8 的人机比采集数据;(4) 用语言/视觉多样性指标定量证明这样采到的数据比既有数据集(Language Table、BC-Z、RT-1)更多样,并首次实证展示其能反哺下游策略(RT-1 co-fine-tune)在原本泛化差的任务上取得非零提升。

影响:AutoRT 是 Google DeepMind 2024 年 1 月同期发布的三项机器人研究之一(与 SARA-RT 的注意力效率优化、RT-Trajectory 的轨迹泛化并列),共同指向”用基础模型驱动真机数据采集的规模化”这一路线;其”机器人宪法”概念为后续讨论机器人自主行为的安全规范提供了具体范式。

论文自陈局限:(1) 依赖脚本化/学习到的自主策略维持给定遥操作预算下的采集吞吐,若这些策略成功率低会拖累整体产出(如本文中 RT-2 成功率仅 4.7%);(2) 场景描述与语言模型之间的”信息瓶颈”——VLM 的物体幻觉、对新环境的泛化不足、运动模糊都会在系统中传播放大,基础模型对物理/本体限制的推理能力本身也有限,论文承认为简化而忽略了这一问题;(3) 采集到的数据高度多样但每任务样本稀疏,场景与物体配置变化大,比现有 SOTA 方法所用数据集的学习问题更难,且数据采集与策略改进被当作两个独立环节处理,未做到两者协同演化;(4) 宪法式提示词能提升安全性但不能保证 LLM 一定遵从指令,少量不安全任务仍会通过 affordance 过滤,因此仍需人类监督兜底。

原始链接

一手源存档(sources/)