主流 Agent Harness 源码级调研 — 总览

这份调研做了什么

这是一份对 61 个主流 agent harness 的源码级横向调研。覆盖开源 coding agent CLI/IDE、通用 agent 框架/SDK、浏览器·GUI·computer-use agent、deep-research agent、中国厂商的编码/桌面 agent、闭源海外产品的官方设计披露,以及少数关键设计博客。每个对象一份独立 dossier(research/harness/<slug>.md),统一按 12 个维度拆解:agent loop、记忆、工具、提示词设计、路由/编排、skill 系统、自进化、可观测性、安全/权限、沙箱、模型协同演化、轨迹利用。

其中 19 个(browser-use、open-interpreter、claude-flow、openmanus、agno、ui-tars-desktop、continue-dev、gpt-pilot、gpt-researcher、agentscope、openai-agents-sdk、kilo-code、letta、google-adk、pydantic-ai、agent-zero、camel、plandex、deerflow)是在初版 42 个之后、经一轮查漏补缺补上的主流开源 harness——把浏览器/GUI computer-use、deep-research、记忆型有状态 server、类型化框架等此前的空白补齐。

证据可复现、不杜撰是这份调研的第一原则:

  • 开源项目全部 pin 了精确 commit SHA(frontmatter 的 commit 字段),任何架构论断都能回到某一行代码去核对,而不是抄 HF/README 摘要。
  • 闭源产品锚定版本号或抓取日期(npm tarball shasum、VSIX 版本、API info.version、文档站 Last modified、博客发布日),并在正文里逐条标注结论是”源码读出”还是”文档/博客披露”级别——两种证据强度不混用。
  • 少数介于其间的样本(客户端开源、服务端闭源;或二进制未混淆字符串可 grep)都在 dossier 开头显式声明边界。

原始摘录与抓取笔记落在 sources/harness/<slug>/(含各页的 NOTES.md)。


名单总览(61 个,按来源类型分组)

kind 图例:code = 开源代码/可源码级核实 · framework = 通用 agent 框架 · design = 闭源,仅官方设计披露 · blog = 设计博客 · design+leak = 逆向/泄露还原源码

① 开源 coding agent CLI/IDE(可 pin commit)

Harness一句话定位kindcommit 锚点dossier
OpenHands组织改名后本体搬家,真正 harness 在 software-agent-sdkOpenHands/OpenHands 仅剩 Agent Canvas 控制面code2ca3b77OpenHands
SWE-agent以 Agent-Computer Interface(ACI) 定制文件工具取代通用 shell 的 SWE harness(1.0,重心已转 mini-swe-agent)code0363b9eSWE-agent
Aider刻意不用 function-calling,让模型在 markdown 里写文本编辑格式 + 上限 3 次 lint/test 反射循环code5dc9490Aider
Cline分层 SDK + hub-spoke 架构:本地 daemon 协调、spoke 进程跑 agent 循环、多客户端 WebSocket 挂接code8b6f2cfCline
Roo CodeCline 分支,Task.ts 栈式任务循环 + Orchestrator/Boomerang 委派;2026-05 已关停归档codeb867ec9Roo Code
GooseMCP-native Rust harness,以 toolshim(弱模型本地翻译层)与 summon 递归子代理编排见长code8694a8dGoose
opencodeEffect-TS 驱动的多前端编码 agent,V1 shipped + V2 rewrite 并存codeeb6ff0copencode
Codex CLIOpenAI 官方 harness,Rust 单体仓库极细粒度 crate 拆分 + 官方设计文档站双源code8268cbfCodex CLI
Gemini CLInext-speaker LLM 判官续跑 + ConSeca 动态 ACL + 实验性本地 Gemma 路由code892b35fGemini CLI
Zed Agent开源编辑器内原生 coding agent + 自建 ACP,把外部 agent 作对等体接入同套 UI/权限/沙箱codeeeff979Zed Agent
Hermes Agent模型训练团队(Nous)自建自用的重型生产 harness,内置 skill 自维护 + ShareGPT 轨迹训练管道code5431bf2Hermes Agent
Continue (cn CLI)模型无关、以权限为核心设计的开源单主 agent coding harnesscoded0a3c0bContinue
Kilo Code从 Roo/Cline 换骨为 OpenCode fork 的多端 agent 引擎(@kilocode/clicode2031f94Kilo Code
Plandex服务端集中式、纯文本操作协议驱动的终端编码 agentcodee2d7720Plandex
Open InterpreterOpenAI Codex(Rust) 的 fork,加一层”多 CLI harness 仿真”给低成本模型选最优 harnessframework764a96eOpen Interpreter
GPT-PilotPythagora,确定性 FSM 多智能体全栈应用生成器framework9b763fdGPT-Pilot

② 通用 agent 框架 / SDK(编排/运行时,非单一产品)

Harness一句话定位kindcommit 锚点dossier
smolagentsHF 出品极简单循环 ReAct + 双动作范式(code-blob / JSON tool-call),其余维度刻意留白给生态framework526069csmolagents
AutoGPT一个仓库三种 harness:ReAct 单体 CLI(classic) / 图编排引擎 / Claude Agent SDK 之上的 Copilotframeworke2711b1AutoGPT
LangGraph通用图编排/持久化执行引擎(Pregel/BSP),ReAct agent 只是其上一层 prebuiltframeworkbe999adLangGraph
CrewAI多智能体编排框架,从 ReAct 执行器演进到 Flow 状态机化的 Plan-and-Executeframework2b90117CrewAI
DeepAgentsLangChain 官方在 create_agent()+LangGraph 之上叠加的中间件式 harness SDKframework0199007DeepAgents
MetaGPT多智能体 SOP 框架,RoleZero+TeamLeader 为默认路径,mgx.dev 商业化底座framework11cdf46MetaGPT
OpenManusMetaGPT 团队出品,教科书式极简 ReAct + OpenAI function-calling 通用 agentframework52a13f2OpenManus
Microsoft AutoGenactor 消息运行时之上的多 agent 编排框架,Magentic-One(双账本自纠偏) 为旗舰应用framework027ecf0Microsoft AutoGen
Semantic KernelKernel+Plugins 中间件 SDK,Planner 子系统已废除,编排让位给 Magentic/Handoff/Process Frameworkframeworkf6391adSemantic Kernel
OpenAI Agents SDKOpenAI 官方 Responses-API 原生的多 agent 编排框架(handoff + guardrail)framework0354f48OpenAI Agents SDK
Google ADK并存 flow 与 2.0 图编排两套范式、深绑 Gemini/Vertex 又经 LiteLLM 保持模型无关的平台级框架framework61ba59aGoogle ADK
Pydantic AI类型化状态机驱动 agent loop + capability/hook 中间件的轻量 Python 框架framework8432869Pydantic AI
AgentScope阿里出品,库 + 运行时两层的统一 ReAct agent 框架(QwenPaw 的底座)framework1aeb03dAgentScope
Agno原 Phidata,model-agnostic 生产级 multi-agent 框架,agent loop 藏在 model 层framework805b823Agno
Letta原 MemGPT,把分层记忆(core/archival/recall)做成一等公民的有状态 agent serverframeworkb76da90Letta
CAMEL学术出身(NeurIPS)的多 agent 角色扮演/数据生成研究框架framework147d926CAMEL
Agent Zero薄内核 + prompt/plugin/skill 全可编辑的通用个人 agent 框架framework3bb4057Agent Zero
Claude-Flow / Rufloruvnet 出品,跑在 Claude Code/Codex 之上的 meta-harness(prompt 生成器 + MCP server + 生命周期 hook)framework7ef4d4eClaude-Flow

③ 浏览器 · GUI · computer-use agent

Harness一句话定位kindcommit 锚点dossier
browser-useCDP 驱动、把 DOM 元素索引化后交给 LLM 选择的自主浏览器操作 agentframeworkf785855browser-use
UI-TARS Desktop / Agent TARSByteDance,截屏→VLM→动作 DSL 的 GUI/computer-use 栈:一代纯 VLM 桌面 loop + 二代事件流 Tarko 内核frameworkc2ad42eUI-TARS Desktop

④ deep-research agent

Harness一句话定位kindcommit 锚点dossier
GPT Researcher检索增强的自主 deep-research 报告生成流水线(plan→并发检索→压缩→撰写)framework18d4051GPT Researcher
DeerFlowByteDance,从 LangGraph 研究图重写为 Claude-Code 式 lead-agent + subagent 的开源 super agentframeworkbe63716DeerFlow

⑤ 中国厂商(编码 / 桌面 agent 产品,开源与闭源并存)

Harness一句话定位kindcommit / 版本锚点dossier
Qwen Code从 gemini-cli fork、大量显式对标 Claude Code 设计的编码 harness(自建四动词长期记忆 + Agent Teams)code57326e5Qwen Code
QwenPaw阿里 AgentScope 2.0 之上的多模式 Agent OS(Goal/Mission 模式 + Gate 停机 + Scroll 记忆)code085d6b2QwenPaw
MiMo Code小米 MiMo 团队基于 opencode fork 的长程编码 harness(computation/memory/evolution 三主题)code7f9060cMiMo Code
Kimi Code月之暗面 CLI harness:无沙箱、19 策略链权限、handoff-note 压缩、多 provider TS 内核code4aeb336Kimi Code
ByteDance Trae Agent单 agent 线性循环开源 CLI;配套论文另有未开源的离线 ensemble 编排(SWE-bench 75.20%)codee839e55Trae Agent
阿里 Qoder闭源 CLI(@qoder-ai/qodercli),权限/hook/子agent 文档极详但核心 loop 不可读源码code(闭源)qodercli@0.1.18Qoder
百度文心快码 Comate闭源 SaaS 编码 agent,Zulu 主智能体 + Architect 纯编排的官方多智能体体系code(闭源)插件 v3.23.0Comate
智谱 CodeGeeX闭源 VS Code/JetBrains 插件,本地 FastAPI + 真 MCP 协议驱动;核心 loop 因 Pyarmor 加密不可读code(闭源)VSIX v2.27.6CodeGeeX
智谱 AutoClaw(澳龙)闭源本地桌面 Agent 客户端(基于 OpenClaw 框架),仅博客/changelog 层面披露行为code(闭源)v1.10.0AutoClaw

⑥ 闭源海外产品 / 设计披露(无完整公开源码)

Harness一句话定位kind版本 / commit 锚点dossier
Claude CodeAnthropic 官方 harness,经 sourcemap 泄露还原源码:单一 tool_use 信号判停机、四层压缩、硬编码对抗式验证契约、OS 级沙箱design+leaknpm v2.1.88Claude Code
CursorAnysphere 闭源商用编码 harness,证据全来自官方 docs/blog,非源码读出designdocs 抓取 2026-07-07Cursor
Devin (Cognition)完全闭源云端编码 agent,证据来自官方博客/文档 + OpenAPI schemadesignAPI v3.0.0Devin
Factory.ai Droids闭源企业级 harness,但文档披露到内部函数名/hook schema/LoRA 流水线级别designfdf8712 (docs mirror)Factory.ai
Replit Agent无源码托管式云端编码 agent,靠工程博客一手披露还原design博客 2026-06-23Replit Agent
Sourcegraph Amp闭源商用 CLI,“不为模型缺陷打补丁的极简 harness”,靠官方 essay/manual/security 披露design抓取 2026-07-07Amp
v0 (Vercel)闭源托管产品,从 SDK 消息协议 + 官方博客复原”组合式模型(Composite Model)“架构designv0-sdk 001fae4v0
Warp Agent / Oz终端客户端已开源(AGPL/MIT),云端编排大脑 warp-server 仍闭源;逐条标注 client/server 边界designa612c95 (仅客户端)Warp Agent
Amazon Q Developer品牌伞下两套实现:闭源 IDE /dev agent + 一手可查的开源 Rust CLI(已 fork 为闭源 Kiro CLI)design15cc8f3Amazon Q
GitHub Copilot Agent Mode闭源 CLI 运行时 + 公开 MIT SDK(github/copilot-sdk),JSON-RPC 线协议文档级证据design0dc4de8Copilot Agent Mode
JetBrains Junie闭源 IDE/CLI coding agent,“one engine, many surfaces” + 显式 LLM-agnosticdesign文档 2026-07-04Junie
Kiro (AWS)闭源 spec-driven agentic IDE,仅 Powers 集成包开源;博客罕见公开 token/延迟/错误率基准design滚动发布Kiro
Augment Code (Auggie)闭源 npm 包,核心逻辑靠 12MB 未混淆 JS bundle 逆向 + docs/blog(Prism 缓存感知路由)design@augmentcode/auggie@0.32.0Augment Code

⑦ 设计博客(公开的设计模式,非可运行产品)

Harness一句话定位kindcommit 锚点dossier
Anthropic 多智能体编排官方 4 篇工程博客披露的 Orchestrator-Worker 研究系统设计模式 + claude-cookbooks 参考实现blog3393bdaAnthropic Multi-Agent

12 个跨维度对比 section

12 篇跨维度对比章节均已成稿(research/harness/sections/<slug>.md)。每条附一句该维度最有意思的发现。

  • ① Agent Loop 主循环 — Claude Code 显式声明 stop_reason==='tool_use' 不可信、只用”是否流出 tool_use block”作唯一停机信号;Gemini CLI 用一次独立 LLM 判官(next-speaker)决定续跑;Pydantic AI 则把整个 loop 写成类型化状态机、gpt-pilot 干脆用确定性 FSM 编排多角色。
  • ② 记忆与上下文 — 光谱一端是 Letta(原 MemGPT)把 core/archival/recall 分层记忆做成一等公民、由 agent 自己调工具改写记忆;另一端从 Claude Code 四层级联压缩、Qwen Code 的 Extract/Dream/Recall/Forget 四动词长期记忆到 Kimi 的 handoff-note 压缩——压缩/记忆策略是各家分野最大的维度。
  • ③ 工具体系 — 四条路线:Aider/Codex 的文本编辑格式(不走 function-calling)、SWE-agent 的 ACI 定制文件工具、Goose 的 MCP-native + toolshim 给弱模型补 tool-calling,以及 browser-use 的 DOM 元素索引化 / UI-TARS 的截屏→动作 DSL 这类 computer-use “工具即坐标/元素”路线。
  • ④ 提示词设计 — 最反常规的是 Claude Code 在系统提示里硬编码一条强制对抗式验证契约:非平凡改动必须派生 verification-agent 子 agent 审核,实现者不能自评通过。
  • ⑤ 路由与编排 — 形态众多:服务端缓存感知路由(Augment Prism)、本地小模型路由(Gemini 实验性 Gemma)、把多个 harness 当可互换后端的云端控制面(Warp Oz)、OpenAI Agents SDK 的 handoff 交接、DeerFlow 复刻 Claude-Code 式 lead-agent + subagent 层级编排。
  • ⑥ Skill 系统 — Claude-Code 风格 Skills 已成事实标准,被 Roo/Kimi/Warp 等广泛复刻;Hermes 更进一步让 agent 自我维护 skill 库,Agent Zero 则把 prompt/plugin/skill 全部做成用户可现场编辑的文件。
  • ⑦ 自进化 — 大多停留在”跨会话经验沉淀”(MiMo evolution 主题),Hermes 的 skill 自维护是少数真正闭环的样本,多数闭源产品此维度只有营销话术。
  • ⑧ 可观测性 — 开源框架普遍外包给 OpenTelemetry(smolagents/Agno/AgentScope),产品级 harness 更看重 trace/eval 打分(Warp server 侧)与 token/延迟/错误率基准(Kiro 博客罕见公开数字)。
  • ⑨ 安全与权限 — 光谱两端:Gemini ConSeca 每次请求让 LLM 现生成逐工具最小权限 ACL、Kimi 19 条策略链、Continue 以权限为核心的设计,对比 Amp 默认 --dangerously-allow-all 的极简放权。
  • ⑩ 沙箱隔离 — OS 级(Claude Code 的 bubblewrap/Seatbelt)、远程容器(Amp Orbs/e2b)、Docker/K8s/Namespace 检测(Warp)三档;不少开源框架核心不含沙箱、建议接第三方(CrewAI)。
  • ⑪ 模型协同演化 — Aider 为几十个模型量身定制 ModelSettings(编辑格式/提示位置)是”重模型协同、轻通用框架”的代表;模型厂商自建 harness(Qwen/Kimi/MiMo/Hermes/UI-TARS 的 VLM 共训)天然带模型-harness 协同。
  • ⑫ 轨迹利用 — Hermes 把 agent 轨迹压成 ShareGPT 喂下一代 tool-calling 模型、ByteDance Trae 的离线 ensemble(多候选 patch→剪枝→selector 投票),是”harness 产出反哺模型训练”的两个具体样本。

怎么读这份调研

  1. 先看本页——用上面的名单表定位你关心的 harness 属于哪一类、证据强度如何(能不能 pin 到 commit)。
  2. 按兴趣下钻:想深挖某一个产品 → 进对应 dossier(research/harness/<slug>.md,12 维度全展开);想横向对比某一能力 → 进对应的跨维度 section(research/harness/sections/<slug>.md)。
  3. 核对一手证据:每份 dossier 对应 sources/harness/<slug>/ 目录,里面有原始摘录与 NOTES.md 抓取笔记,可回溯到 commit/行号或抓取日期。

局限与证据边界

  • 闭源产品只能靠官方披露(kind: design:Cursor、Devin、Replit、Amp、Kiro、Junie、Copilot Agent Mode、v0、Amazon Q 等,全部结论是”文档/博客披露”级别,不是源码读出——官方可能美化、省略或与实际实现有出入,不能当作已核实的实现事实。
  • 部分证据锚定的是抓取日期而非 commit:闭源产品无法 pin SHA,本页用版本号(npm/VSIX/API version)或抓取/发布日期(2026-07-07 前后)替代;这些产品滚动发布,结论有时效性,日后可能失效。
  • claude-code 源自非官方泄露提取:其源码级论断基于第三方从 npm @anthropic-ai/claude-code v2.1.88 的 cli.js.map sourcemap sourcesContent 字段还原的代码(2026-03-31 公开),非 Anthropic 官方发布,需谨慎——虽已用 6 篇官方博客交叉验证,但泄露还原可能不完整或含打包噪声。
  • 闭源但标 kind: code 的中国厂商样本(Qoder/Comate/CodeGeeX/AutoClaw)本体不可读源码:或为闭源 npm 私有包、或 VSIX 经 Pyarmor 字节码加密、或纯营销站,实际证据强度接近 design,正文已逐条标注”来自文档还是代码”。
  • 半开源样本(Warp 客户端开源/服务端闭源、Amazon Q CLI 已 fork 为闭源、Augment 靠未混淆 bundle 逆向)的结论有明确的可见性边界,dossier 内已标注 client/server 或 bundle 可见范围。
  • 12 篇跨维度 section 系机器汇总:section 正文由子代理通读全部 dossier 后归纳,个别归类/“谁抄谁”判断可能有主观性;有争议处请以对应 dossier 的源码级原始记述为准。

本轮查漏补缺后明确判定”不补”的项

为免读者以为遗漏,这里如实交代查漏补缺时评估过、但明确决定不收录的对象及原因:

  • 已归档/停更(曾主流但已只读或长期无更新):Void(28.8k, archived)、Devika(19.5k, 2025-09 停)、SuperAGI(17.6k, 2025-01 停)、gpt-engineer(55k, 2026-04 archived)、AgentGPT(36k, archived)、OpenAI Swarm(22k, 官方标 experimental 且已被 Agents SDK 取代)、Sourcegraph Cody(仓库已下架,被已收录的 Amp 取代)、XAgent(8.5k, 2024 停)、AgentVerse / Codel / Refact 开源本体 archived。
  • 非 harness(是平台/补全/RAG,无自主 agent loop):Dify(148k)、Flowise(55k)、Tabby(33.7k, 纯 FIM 补全 + RAG)、Task Master(27.8k, MCP 任务管理层)、Bloop(代码搜索)、CogAgent(是模型而非 harness)。
  • 真 harness 但低于主流门槛(国产/学术,star 偏低或增长放缓,仅在此列名):Tencent Youtu-agent(4.6k)、Ant agentUniverse(2.3k)、Kunlun/Skywork DeepResearchAgent(3.5k)、Shanghai AI Lab/InternLM Lagent(2.3k)、面壁 AgentCPM-GUI(1.4k)、OpenBMB IoA(825)、RA.Aid(2.2k)、AutoCodeRover(3.1k, 学术)。
  • 与已收录项重叠而略过:OWL(建于 CAMEL 之上)、ChatDev(与 MetaGPT 概念重叠)、ModelScope-Agent(与 AgentScope 重叠)、LlamaIndex / Haystack(RAG 为主、agent 为辅)、bolt.diy(与 v0/Replit 重叠)。