一句话定位
Skild AI(CMU 教授 Deepak Pathak / Abhinav Gupta 2023 年创办)用一系列产品博客陆续披露的 “Skild Brain”:一个高层低频导航/操作策略驱动低层高频关节控制策略的分层机器人基础模型,核心卖点是在 10 万个仿真机器人形态上训练出的单一低层策略能零样本适应训练时从未见过的躯体突变(断腿、锁膝、卡轮、垫高义肢),并展现出类似 LLM 的 in-context learning——把失败的上一轮轨迹当 prompt 现场纠错;全系列均为纯博客/产品发布,无论文、无代码、无权重、无量化 benchmark 表格。
背景与定位
Skild Brain 属于跨具身 / 通用机器人基础模型这一 2025 年创业实验室扎堆的赛道,同期对照有 Physical Intelligence 的 pi0-5、NVIDIA 的 groot-n1、Figure AI 的 figure-helix,都在做”一套权重控多种机器人/多种任务”。Skild 的差异化定位有两处:
- 反对”VLM 套壳”路线:博客明确点名批评”拿现成 VLM、掺不到 1% 真实机器人数据就叫机器人基础模型”的做法(暗指 RT-2/OpenVLA 一系微调路线),认为这类模型像”波将金村”——有语义、无真正的动作 grounding,只在 pick-and-place 类任务上展示语义泛化,却缺乏物理常识。Skild 的应对是用大规模仿真 + 互联网视频做预训练,再用定向真实数据做后训练/蒸馏落地部署。
- 把”任意机体的鲁棒性”而非”操作灵巧度”作为头条能力:对比 Helix、GR00T、pi0 系以操作/抓取展示为主,Skild 目前公开的两篇技术博客里,分量最重的演示是类人形/四足在受损/突变躯体下的运动鲁棒性,应用场景锚定在安防巡检、仓储移动操作这类工业场景,而非家庭操作。
创始人 Deepak Pathak 与 Abhinav Gupta 是自监督学习、好奇心驱动探索、人类视频模仿等方向的长期研究者(团队自引的历史工作包括 Pinto & Gupta 2016 的自监督抓取、Pathak et al. 2017 的好奇心驱动探索、Bahl et al. 2022/2023 的”从人类视频学习”、Agarwal et al. 2022/2023 的仿生四足 egocentric-vision 运动与灵巧抓取),Skild Brain 的”仿真 + 视频学习”路线是这条学术脉络在公司产品化后的延续。
公司 2023 年成立,2024-07 以 3 亿美元 A 轮(估值 15 亿美元,Lightspeed/Coatue/SoftBank/Bezos Expeditions 领投)公开亮相;据官方博客列表页披露,2026-01 完成 SoftBank 领投的 14 亿美元 C 轮(估值超 140 亿美元)。GitHub 组织 skild-ai 存在但公开仓库数为 0,HuggingFace 无对应组织页,即该项目没有任何代码/模型开源。
模型架构
分层结构(《Building the general-purpose robotic brain》博客,2025-07-29 首次披露):
- (1) 高层策略:低频运行,输出操作与导航层面的高层指令(manipulation and navigation action policy)。具体骨干架构、是否基于 VLM、参数量、运行频率均未披露。
- (2) 低层策略:高频运行,把高层指令翻译成精确的关节角度与电机扭矩,直接驱动机器人本体。参数量、具体运行频率(Hz)未披露(对照同类系统,如 Helix 的 S1/S2 为 80M@200Hz / 7B@7-9Hz、Being-0 的移动/操作技能为 50Hz/10Hz,Skild 未给出对应数字)。
低层策略的视觉-运动细节(《One Model, Any Scenario》博客,2025-08-06):低层策略是单个神经网络,直接吃原始图像(在线视觉)+ 关节反馈(本体感知),端到端输出低层电机指令,做到人形机器人在平地行走、上楼梯、跨障碍物之间无需规划、建图或手动切换模式的连续控制——博客强调”没有’楼梯模式’或’跨越模式’的切换”,步态转换是连续、本能式的,类比人类走路”看见即反应”而非依赖预先建好的地形地图。
Omni-bodied 训练与形态泛化(《The case for an omni-bodied robot brain》博客,2025-09-24):Skild 用同一个低层策略同时训练控制”一个由 10 万个(100,000)不同机体构成的宇宙”,覆盖四足、类人形、轮式四足、轮腿混合体等多种形态,训练时长描述为”经过millenia(千年量级)的仿真时间”(原文用词,非精确数字)。关键在于策略不能记住任何单一机体的解,必须学到跨形态通用的控制策略——博客将其类比”设计一个 AI 无法作弊的测试”。文中所有形态泛化演示均为零样本(zero-shot):测试用机体在训练集中被显式排除。
In-context learning(测试时适应,无梯度更新):当机体失败(如刚唤醒的机体把自己误判成小型人形而摔倒),再次唤醒时把上一次失败轨迹当 prompt 前置喂给模型,模型据此在下一次尝试中改进行为,通常第三次尝试即可成功——博客明确将此现象类比大语言模型的 in-context learning。这一能力被描述为训练在极端多样形体上而涌现的性质,而非一个专门设计的训练目标;具体是何种架构(是否基于 transformer 式的长上下文条件化)使其具备接受轨迹历史作为条件输入的能力,未披露。
动作空间:连续控制,关节角度 + 电机扭矩,覆盖四足、类人形、轮式等多种机体;未披露具体自由度数、传感器配置(除”图像”与”关节反馈”外无更多细节)、参数规模。
数据
- 预训练数据来源(2025-07-29 博客明确表述):大规模仿真 + 互联网视频数据。原文论证:“scale 不是百万/十亿级样本,真正的 scale 需要万亿级样本——即使集合全地球人口去采数据也要数年才能凑够 1000 亿(10^11)条轨迹”,因此纯真实数据无法在近期达到这一规模,故转向仿真与互联网视频。
- 仿真规模:10 万(100,000)个不同机器人形态的多样化仿真宇宙,训练时长以”千年量级仿真时间”描述(定性表述,非精确数字)。
- 视频数据:互联网视频数据参与预训练,具体来源(egocentric 头戴相机 vs YouTube 教学视频)、数量(小时数/视频条数)未披露——2026-01-12《Learning by watching human videos》博客里进一步阐述视频学习的动机(教学视频、egocentric 数据”已经是互联网规模但不是’机器人原生’”),但同样未给出实际摄入训练的视频小时数/条数。
- 真实世界数据:(1)July 博客提及用”定向真实数据”做后训练(post-train)以满足部署需求,规模未披露;(2)Jan 2026 博客披露一个具体的数据效率数字——针对新技能的微调只需要视频演示 + 不到 1 小时(<1 hr)的真实机器人数据,用于把视频中的动作意图跨具身映射(bridging embodiment)到机器人本体的执行。
- 未披露:仿真引擎名称、具体轨迹/episode 数、sim:video:real 数据配比、动作标注方式细节。
训练方法
- 多阶段管线(综合三篇博客):① 大规模仿真(10 万机体)+ 互联网视频预训练,获得跨形态的低层控制鲁棒性与语义/动作先验;② 用定向真实数据做后训练(post-training)、微调(fine-tuning)与蒸馏(distillation),以满足具体客户部署需求;③ 针对新技能,可仅用视频演示 + <1 小时真实机器人数据做定向微调,实现”看视频学新技能”。
- 仿真训练目标:未披露具体算法(是否为 RL、模仿学习、两者结合)、损失函数、优化器、学习率、batch size、训练步数——均未披露。
- In-context 适应机制:训练阶段未见描述专门针对”轨迹历史条件化”的显式训练目标;博客将该能力归因为”在极端多样形体上训练”这一事实本身带来的涌现属性,而非独立设计的训练阶段。
- 视频到动作的跨具身映射(bridging embodiment):据 Jan 2026 博客,这是模型的一项”核心能力”,通过微调让模型仅凭视频示范(无需力/扭矩/触觉信号)加very少量真实机器人数据(<1hr)学会新技能,具体训练算法(是否需要额外的动作检测/姿态估计前处理步骤)未披露。
Infra(训练 / 推理工程)
- 训练算力:GPU 型号、数量、总 GPU-hours、并行策略、混合精度均未披露——三篇技术博客都没有给出任何算力/工程数字。
- 仿真环境:仿真引擎名称、并行环境数未披露。
- 推理侧:博客通过真实世界视频演示间接说明系统具备实时部署能力——例如人形机器人在城市公园/街道/消防梯/自建障碍场地上无预先建图/规划地直接行走、上楼梯,处理未见过的地形;但没有给出任何具体的控制频率(Hz)、推理延迟(ms)、板载硬件型号(对照 Being-0 披露的 NVIDIA Jetson AGX、Helix 披露的”双低功耗嵌入式 GPU”,Skild 未给出对应硬件信息)。
- 结论:算力与推理工程细节全面未披露,仅有”可在非结构化真实环境中免建图/规划实时部署”的定性描述。
评测 benchmark
三篇技术博客均没有量化 benchmark 表格、没有数值成功率、没有与任何命名基线或竞品(GR00T / pi0 / Helix 等)的对照。所有结果性主张均以视频演示 + 少量定性/半定量描述呈现:
运动能力(《One Model, Any Scenario》):
- 真实世界测试场地包括城市公园、街道、消防逃生梯、自建障碍场(不稳定托盘、缝隙、不平整台阶、杂物),全部为机器人此前从未见过的环境,且全程无预先建图或规划。
- 耐久性:能连续走完”无穷尽的一段段楼梯”而不摔倒(定性表述)。
- 抗扰动:楼梯上受到明显推拉外力后能迅速调整脚步并保持平衡。
- 精度:楼梯台阶深度仅比机器人脚掌深 3cm 时,模型仍能精确落脚、无需犹豫或减速。
- 负载:能背负箱子上下楼梯。
形态鲁棒性(《The case for an omni-bodied robot brain》),全部为零样本(测试机体在训练集中被排除):
- 失去下肢(切除小腿至大腿,减少 4 自由度):初期无法有效移动,7-8 秒后学会大幅摆动大腿关节完成移动;对照的单机体专用控制器在同等损伤下”灾难性失败并翻倒”(无双方数值成功率,仅定性对比)。
- 断膝/锁膝(软件锁死膝关节,四足变三足):初期前倾,2-3 秒后学会向后转移重心用三条腿行走;轮式四足在 1-2 条腿被锁时同样能重新分配负载维持平衡。
- 卡轮:轮子被卡死后瞬间从轮式切换为腿式步态,轮子解锁后又切回更高效的滚动方式。
- 垫高义肢(增加腿/身比例):初始几步不稳,随后快速调整步频与落脚点,恢复稳定行走。
- 首次唤醒失败后,把失败轨迹作为 prompt 前置,第三次尝试即可成功(in-context learning 演示的具体轮次数)。
结论:全部结果为公司自制视频演示,无第三方复现、无开源代码/权重/benchmark 可供外部核验;唯一出现的具体数字集中在适应时长(7-8s / 2-3s)、楼梯精度(3cm)、仿真规模(10 万机体)和微调数据量(<1hr)这几处,其余(参数量、控制频率、算力、成功率百分比)均未披露。
创新点与影响
- 把”跨具身基础模型”的头条能力从操作灵巧度换成运动鲁棒性:同期同类系统(Helix、GR00T、pi0)大多以桌面/家庭操作抓取展示为主,Skild 选择用”10 万机体宇宙 + 躯体损伤零样本适应”作为核心叙事,呼应工业安防/巡检的目标场景。
- 公开提出并演示机器人策略的”in-context learning”:把失败轨迹当 prompt 前置以现场纠错、无需权重更新,是把 LLM 式 ICL 显式类比到机器人控制策略上的少数公开案例之一,尽管其内部机制(架构如何支持轨迹条件化)未披露。
- 明确反对”VLM + 少量机器人数据”路线,主张用大规模仿真 + 互联网视频构建真正动作 grounded 的基础模型,再用定向真实数据做部署级后训练/蒸馏——这一”仿真规模化 + 视频学习 + 少量真实数据微调”的路线与创始团队此前十年的学术工作(自监督抓取、好奇心探索、人类视频模仿)一脉相承。
- 提出”看视频学新技能 + <1 小时真实数据”的数据效率主张,呼应机器人基础模型领域对”teleoperation 数据无法达到互联网规模”这一数据瓶颈的共同焦虑,但方案本身(如何解决”embodiment gap”、如何在无力/触觉信号的视频中提取可执行的动作信息)只有定性描述,无技术细节。
- 自身局限(未在博客中明说,但从披露内容可推断):(1) 全系列均为公司博客,无论文、无代码、无权重、无第三方评测,所有数字(参数量、控制频率、训练算力、成功率)基本未披露或不可核验;(2) 第一篇博客明确说本次只放出”2024 年的早期结果”,定位为”scalability and robustness 的早期里程碑”,承诺”下个月”继续披露——即 Skild 自己的公开材料也只是一个演进中系统的阶段性切片,并非最终形态的完整评测;(3) 全文无一处与任何命名竞品(GR00T / pi0 / Helix / 其他)的正面数值对照,“omni-bodied”的鲁棒性优势缺乏第三方或同行评审验证。
原始链接
- 官网 / 产品页:https://www.skild.ai/
- 官方博客首页:https://www.skild.ai/blogs
- Building the general-purpose robotic brain(2025-07-29):https://www.skild.ai/blogs/building-the-general-purpose-robotic-brain
- One Model, Any Scenario: End-to-end Locomotion from Vision(2025-08-06):https://www.skild.ai/blogs/one-policy-all-scenarios
- The case for an omni-bodied robot brain(2025-09-24):https://www.skild.ai/blogs/omni-bodied
- Learning by watching human videos(2026-01-12):https://www.skild.ai/blogs/learning-by-watching
- Announcing our $300M Series A Funding(2024-07-09):https://www.skild.ai/blogs/announcing-our-300m-series-a
- GitHub 组织(公开仓库数为 0,无开源代码):https://github.com/skild-ai
一手源存档(sources/)
- skild-brain—project-page — 官网首页快照(sources/embodied/2025/skild-brain—project-page.md)
- skild-brain—blog-index — 博客列表页快照,含 Series C 等后续动态(sources/embodied/2025/skild-brain—blog-index.md)
- skild-brain—blog-building-general-purpose-robotic-brain — 首篇技术博客全文快照(sources/embodied/2025/skild-brain—blog-building-general-purpose-robotic-brain.md)
- skild-brain—blog-one-policy-all-scenarios — 视觉运动博客全文快照(sources/embodied/2025/skild-brain—blog-one-policy-all-scenarios.md)
- skild-brain—blog-omni-bodied — 形态泛化博客全文快照(sources/embodied/2025/skild-brain—blog-omni-bodied.md)
- skild-brain—blog-learning-by-watching — 视频学习博客全文快照(sources/embodied/2025/skild-brain—blog-learning-by-watching.md)
- skild-brain—blog-series-a — A 轮融资博客全文快照,含公司背景(sources/embodied/2025/skild-brain—blog-series-a.md)