总览:这个维度的设计谱系

先厘清一个反复被混为一谈的边界:几乎没有任何一个 harness 在运行时改主推理模型的权重。所谓”自进化”,落到源码里其实分布在七条差异极大的路线上,抽象程度从”改权重”到”改一句 prompt”递减。前五条是原 42 家就已成型的谱系,后两条是新纳入的 19 家(尤其 claude-flowGoogle ADKCAMEL)把边界推出来的新分支:

  1. 离线权重级 eval 驱动模型改进——训一个专精小模型来纠错/评分,信号来自真实轨迹或 eval 集,训练全在 harness 运行时之外(厂商侧离线流水线)。代表:v0 的 AutoFix(RFT)、Factory Droid Shield 的 LoRA、Zed Zeta 的数据修正回路、OpenHands 的 critic-4b。

  2. 单次运行内的 rubric/critic 评分-重试循环——一个评分器(子代理 / LM-as-judge)对轨迹打分,不达标就注入反馈续跑,受 max_iterations 约束,不持久化。这是”eval 驱动纠错”在产品里最主流的落地形态。代表:deepagents RubricMiddleware、SWE-agent Reviewer、GPT-Pilot BugHunter、Plandex validate-fix。

  3. 学习型记忆:后台巩固(“dream”)+ 自编辑记忆——跨会话学习,学的是上下文/文件不是权重。内部又分两支:(a) 空闲/定时触发独立子代理蒸馏轨迹(MiMo-CodeQoderLetta sleeptime);(b) agent 用工具主动改写自己的记忆/行为文件(Letta rethink_memory、Agent-Zero behaviour.md)。这是新增 19 家里最拥挤的一条路线。

  4. 人在环经验蒸馏闭环——用户纠正一次 → 提炼成可泛化规则 → 存记忆 → 未来输出预先自纠,强调显式批准、反对”偷偷改自己”。代表:CrewAI HITL lesson、AutoClaw 进化卡片、Devin Session Insights、DeerFlow Skill 自进化。

  5. eval 驱动纠错基础设施(改 harness 自身,不是运行中的 agent)——CI 里跑 benchmark、轨迹聚类做根因分析,团队或 bot 据此迭代 harness 代码/prompt/工具描述。代表:Kiro CORAL、OpenHands verification stack、Replit 自改进闭环。

  6. 在线 adapter/config 持续学习——只有 claude-flow 一家:把轨迹结果实时喂给一个 Q-learning router + MicroLoRA rank-2 adapter,成功做 EWC++ 巩固,是真正在运行时跑的 RL/持续学习代码——但学的全是极小的 router/retrieval adapter,从不动 base 权重,且代码里自带”不许过度声称”的诚实注释。这是全景里唯一真正意义上的”在线自我改进”。

  7. 自动化 prompt 进化 / 训练数据自生成——Google ADKoptimization/ 接入 GEPA 做反思式 prompt 进化 + pareto 挑选、以及 simple_prompt_optimizer 的”生成候选→eval 批打分→迭代”;CAMEL 的 Self-Improving CoT 走 STaR 式”生成→reward 打分→反馈改写”产出训练数据。比第 5 组更自动——无需人挑,eval 信号直接驱动 prompt/数据的搜索优化。

一批 harness 在这个维度基本未实现,且大多如实标注,符合其”人机协同编码助手 / 编排基座”而非”自主 agent 框架”的定位:Roo CodeOpenCodeLangGraphSemantic KernelsmolagentsAugmentCodeGeeXUI-TARS DesktopOpenManusContinuePydantic AI

对比表

Harness主要机制路线改权重?触发 / 门控关键设计点
v0AutoFix 模型(vercel-autofixer-011是(离线 RFT)流式生成中途+流后各跑一次与 Fireworks 合作 RFT,86.14 分 @ 通用模型 10-40x 吞吐;三级纠错级联
FactoryDroid Shield 2.01是(LoRA)安全扫描流水线Qwen3.6 底座 + 两个 PEFT adapter;CredData 经 LLM judge 重标;按仓库 holdout;权重开源
ZedZeta 编辑预测数据修正回路1是(微调 Qwen2.5-Coder-7B)ep CLI 离线管线Score/Qa 做 LLM-judge,Repair 重生成低质预测,反哺微调;prompt 格式版本史可追
OpenHandsCriticBase + critic-4b + verification stack2+1+5critic 离线训得分<0.6 自动重试(≤3);PR 标签跑 evalcritic 在真实生产轨迹上训(纯 benchmark 数据 AUC 比随机还差);Best@8 73.8%
claude-flowSONA 在线 RL + harness-flywheel + MicroLoRA6是(rank-2 adapter,非 base)每 trajectory-end 在线更新 + 离线 flywheel tickQ-learning router + EWC++ 巩固;flywheel 爬山优化 retrieval config 带 held-out GATE;代码带”HARD HONESTY RULE”
Google ADKAgentOptimizer / GEPA / simple_prompt_optimizer7否(只优化 prompt)eval 批打分驱动迭代接外部 GEPA 反思式 prompt 进化 + pareto;simple 版生成候选→打分→final validation
CAMELWorkflow Memory + Self-Improving CoT3+7否(CoT 产训练数据)任务完成存 workflow / STaR 迭代summarizer 从成功轨迹蒸结构化 workflow 带版本号,按角色检索复用;STaR reward 驱动改写
LettaSleeptime “dreaming” + 记忆自编辑工具3否(RL 见轨迹章)每 N 轮触发后台 sleeptime agent行号感知 patch 式自编辑(仿 computer-use edit tool);subagent 用 git worktree 并发改记忆;系统提示自称 self-improving agent
Replit完整自改进闭环 + Agent 3 自测试 + ViBench5+2人门控上线Telescope 轨迹聚类 → draft PR → ViBench显式”工程师保留发布决定权”;ViBench 揭示模型扩写自己代码更差
KiroCORAL + property-aware code evolution5+2否(明确不重训)每天抽样数千生产会话做 RCA一行文案把错误 glob 用法从 26.1%→0.3%;bug-fix 先写可证伪测试
SWE-agentReviewer + ScoreRetryLoop2得分<accept 触发全新尝试LM-judge 采样 5 次取均值;环境硬重置重跑;get_best() 选最优轨迹
deepagentsRubricMiddleware2agent 欲停止时评分satisfied/needs_revision/failed 三态;仅 needs_revision 续跑;评分子代理沙箱化
GPT-PilotBugHunter + CodeMonkey 自审2命令结果 LLM 判定触发调试日志埋点式调试循环(ADD_LOGS/PROBLEM_IDENTIFIED);逐 hunk 自审 diff(MAX_CODING_ATTEMPTS=3)
Plandexvalidate-fix + 自动调试2tree-sitter 语法非法则重修针对产物 diff(非推理)的有界循环 MaxValidationFixAttempts=3;plandex debug 喂回失败重试≤5
browser-usejudge.py LLM-as-judge + 逐步自评2done 后判 trace;每步评上一步judge 结果不覆盖 agent 自报、双写遥测供 eval 平台对比;截图当 ground truth
GPT-Researcherfact_checker→writer / reviewer→reviser2多 agent 批评-修订回环每次从零、无长期学习;learnings 仅单次运行树内传递,结束即丢
QwenPawRubricGate + Mission verifier + Auto Dream2+3update_goal / rubric SATISFIEDSubAgentRubric 仍是 stub(引 ralph 模式,已规划未实现);model_capability_cache 学 rejects_media
Aiderlint/test 反射循环2编辑后自动 lint/test,失败反馈max_reflections=3;benchmark 是人工挑默认 edit_format,非自动
AutoGPTReflexion + Watchdog + Dream-eval2+5重复 command 检测 / 夜间批处理直接引 arXiv Reflexion/Self-Refine;platform 侧记忆 staleness eval
OpenAI Agents SDKsandbox learning-memory 两阶段3Phase1 抽取 + Phase2 巩固gpt-5.4-mini 抽 / gpt-5.5 巩固;遗忘保最新 256;live_update 允许 run 中途重写 MEMORY.md
Open Interpreterlearning memory 两阶段管线3历史 rollout 抽取 → 巩固子 agent更新 MEMORY.md / skills/ 跨会话复用;默认关;与 OpenAI SDK/MiMo 同谱系
Kilo Codepackages/kilo-memory3turn-close 蒸馏 remember/correct/forgetcorrect 动作 = 修正旧记忆;下次启动索引注入;in-loop 有 CorrectedError 反馈
AgentScope长期记忆中间件(三后端)3on_reply 异步选记忆文件AgenticMemoryMiddleware 近乎逐字复刻 Anthropic memory skill;_reme 后端即 QwenPaw 默认长期记忆
AgnoLearningMachine + Culture + Curator3每 run 后台 future 抽写六路 learning store + decision_log;Culture 跨 agent/team 沉淀共享文化知识(集体经验反哺);Curator prune/dedup
Agent-Zerobehaviour 自调整 + solutions memory3+4UpdateBehaviour 工具 mergeagent 能永久改自己的行为准则(behaviour.md 注入每轮系统提示);成功解法自动存 SOLUTIONS 区复用
DeerFlowSkill 自进化 + 自我配置更新4+35+ 工具/踩坑/被纠正后(默认关)skill_manage 持久化 per-user skill,写前经 LLM+静态安全审查;update_agent 改自己 SOUL.md/model,untrusted webhook 渠道禁用
MiMo-Codedream(7d) + distill(30d)3定时,新会话首步后台触发SQLite 轨迹为真相源、MEMORY.md 为派生索引;无法验证的事实标 [unverified]
Qwen CodeDream + Extract + skillReview3每轮后 Extract,Dream 定时/手动逐项目游标去重;skillReview 从重复模式建新 Skill
Gemini CLIAuto Memory3会话闲置≥3h、≥10 用户消息只产 .patch/SKILL.md 草稿进 inbox,从不自动应用;跑 Flash preview
Codex CLIMemory Phase 2 + Record & Replay3sub-agent 定期改写屏幕录制演示 → 起草可复用 Skill
QoderDreams3异步作业,单飞(409)写时复制、最小权限(仅 3 记忆工具)、1-5 分钟;一等产品 API
HermesThe Curator3空闲≥2h 且距上次≥1 周只碰 agent 创建的 skill;从不删只归档;pin 跳过;学习图谱可视化
Claude Codeverification-agent + 自动记忆抽取2+3每轮结束抽取,非平凡改动强制验证对抗式验证契约(禁实现者自评);skillImprovement 线索未深读
ComateMemory 自动演化 + Rules 半自动3自动整理 / AI 提议规则待批上下文自适应,非权重;Rules 需用户接受
GooseSuccessCheck 重试 + toolshim 微调2+1toolshim 离线shell 检查失败驱动重试确定性 shell 验证;toolshim 微调是独立小解释器模型(dev 期)
Kimi CodeGoal Mode2(弱)每 turn 模型自评是否达成硬预算超限强制 blocked;无外部评测信号,属弱意义纠错
Anthropic MAO工具/prompt 改进闭环5agent 分析 transcript 重构工具工具测试 agent 数十次调用重写描述,下游耗时 -40%;留出测试防过拟合
AutoGentask_centric_memory(实验)4train_on_task 反复试到失败诊断失败→总结 advice→稳定修复则存 insight;标 EXPERIMENTAL
MetaGPTexp_pool 经验缓存4(案例)默认关闭相似 (req,resp) 完美匹配则跳过 LLM;AFlow/SPO 是 opt-in 研究模块
CrewAIHITL lesson 蒸馏 + crew.train()4人类纠正后 distill提炼可泛化规则存记忆,未来输出预先自纠;train() 收集三元组转 prompt 前缀
AutoClawHermes 自进化(进化卡片)4关键词(“以后/记住”)+自动检测三步人在环显式批准;被拒提案 2 周冷却;四文件分发
DevinSession Insights → playbook/knowledge4+5每 session 结束自动分类标注 Knowledge 帮了还是误导了;成功 session 建 playbook、失败作反例
CopilotCopilot Memory 自我修正4引用校验发现矛盾时覆写矛盾记忆覆写、通过则刷新时间戳;曾用植入错误记忆做对抗评估
Cursorauditor 模型 / strict harness5离线复核轨迹发现”已解决”63% 实为答案查找;剥离历史后 87.1%→73.0%
Traereflect_on_result(SWE agent 禁用)2工具失败合成反思句最小反思在 TraeAgent 被改成 no-op;ensemble 多数投票
Cline三层 eval 金字塔 + 失败分类器5CI / nightlycontract→smoke→cline-bench;MistakeTracker 是单次运行护栏
WarpAgent Memory + agent_mode_evals4+5完成任务时可写记忆记忆写入逻辑在服务端;内部 eval 用户列表 + X-Eval-User-ID header
Amazon Qknowledge 工具 + Hooks4用户 /knowledge add用户显式整理,非模型自主;重设计源于数十次离线实验
Pydantic AIModelRetry → RetryPromptPart2(仅 in-run)工具/输出校验失败只有运行内重试反馈;pydantic_evals 是离线工具、不自动回灌;整体判未实现

未实现 / 官方未披露:Roo CodeOpenCodeLangGraphSemantic KernelsmolagentsAugmentCodeGeeXJunieAmpUI-TARS Desktop(快照系统仅回归测试)、OpenManus(RL 在解耦的 OpenManus-RL 另一仓)、Continue(仅 ReportFailure + 运行内 checklist)。

分组讨论

一、真正动权重的一档:eval 信号 → 专精小模型(离线)

这是最”硬核”、也最需要澄清定位的一组:它们确实训模型,但训练全在 harness 运行时之外,训出来的往往是个辅助纠错/评分小模型,不是主推理模型。

  • v0 的 AutoFix 是文档最扎实的一例:从”Gemini Flash 2.0 当规则纠错器”演进到自研 vercel-autofixer-01,用**强化微调(RFT,与 Fireworks 合作)**在追踪到的错误类别上训练,博客给了按类别的错误率训练曲线(真实曲线而非话术),换来通用模型 10-40 倍吞吐下接近的准确率。
  • Factory Droid Shield 2.0 是最完整的一条 ML 流水线:Qwen3.6 底座 + 两个 PEFT LoRA(Risk/Downgrade),Samsung CredData 经 GPT-5.5 主评委 + Opus 4.8 仲裁的 LLM-judge ensemble 重标,按仓库整体做 holdout(因为发现文件级 holdout 有信息泄漏),甚至公开了 Downgrade 的效用函数 net utility = false_alarms_cleared − λ·secrets_wrongly_cleared,权重开源在 HF。工程严谨度在全部 61 家里最高。
  • Zed Zeta 走的是同一思路的另一形态:ep CLI 定义 Score→Qa→Repair→Distill 的数据管线,用 LLM-as-judge 修正低质预测,反哺 Qwen2.5-Coder-7B 微调;ZetaFormat 枚举的版本史是这条持续迭代的代码级证据。
  • OpenHands 的 critic-4b 补上了一个关键洞见:只用 benchmark 数据训 critic,在生产结果上 AUC 0.45-0.48(比随机还差),混入真实生产监督后才到 0.58-0.69——这是”benchmark ≠ 生产”最直接的量化证据。
  • Goose 的 toolshim 微调也属这档,但改进的是随附的独立小解释器模型,离主 agent 更远。

这几家的共同点:都不声称”从你的对话在线学习”,都明确把训练划为聚合信号驱动的离线过程。v0 dossier 里那句”不能把 eval 驱动的模型训练等同于在线自我修改”是这一组的统一注脚——而下面第六组的 claude-flow 恰恰是唯一的反例。

二、单次运行内的 rubric/critic 自纠错:产品化最普及的形态

如果说第一组是少数派,那这一组是”eval 驱动纠错”在产品里真正跑起来的主流。机制高度同构:一个评分器(子代理 / LM-judge)对轨迹判定,不达标就注入反馈续跑,受 max_iterations 约束

学术源头清晰:AutoGPTReflexionPromptStrategy 直接引用 arXiv:2303.11366(Reflexion)、2303.17651(Self-Refine),是这条”GENERATE→EXECUTE→REFLECT→RETRY”谱系在开源 harness 里最早、最忠实的实现之一。之后各家做的都是它的工程变体:

  • deepagents 的 RubricMiddleware 是设计最干净的现代版:调用方声明 rubric,agent 欲停止时评分子代理判 satisfied|needs_revision|failed只有 needs_revision 才续跑,评分子代理还被沙箱化限定在证据路径内。QwenPaw 的 RubricGate 与它几乎同构,且诚实标注 SubAgentRubric 引用了 “ralph 模式” 但还是 stub、未实现
  • SWE-agent 的 Reviewer + ScoreRetryLoop 更”重”:LM-judge 采样 5 次取均值、失败施加惩罚、触发时做环境硬重置+全新 agent,最后 get_best() 选分最高轨迹——把 best-of-N 和 reviewer 融进了一个循环。
  • Kiro 的 property-aware code evolution 把这套做得最形式化:bug-fix 前先写可证伪的 bug-condition 测试(必须在未修复代码上 FAIL)和 preservation 测试,修完重跑,测试没翻转就说明假设被证伪要重查——red-green TDD + property-based testing(底层 Hypothesis)的严谨版。
  • 新增的三家把这条路线的”验证信号”来源做出了差异:GPT-Pilot 的 BugHunter 是日志埋点式——用魔法词让 LLM 判”问题已定位 / 需更多日志”(ADD_LOGS/PROBLEM_IDENTIFIED),Developer 插桩、用户复现、循环重复,且 CodeMonkey 会逐 hunk 自审自己的 diff(MAX_CODING_ATTEMPTS=3);Plandex 的 buildValidateLoop 用确定性 tree-sitter 语法校验驱动重修(针对产物 diff 而非推理,MaxValidationFixAttempts=3),外加 plandex debug 把命令失败输出喂回重试;browser-use 则把截图当 ground truth——每步强制 evaluation_previous_goal 判定上一步成败,done 后 judge.py 的 LLM-as-judge 对整条 trace 打 verdict,但关键设计是 judge 结果不覆盖 agent 自报、两者双写遥测供 eval 平台对比,是评测而非在线纠错。
  • 轻量端:Aider 的 lint/test 反射(max_reflections=3)、CrewAI 的 guardrail 重试、Kimi Goal Mode 的每-turn 自评、GPT-Researcher 的 fact_checker→writer / reviewer→reviser 批评-修订回环(每次从零、无长期学习),都是这套的简化版;Pydantic AI 只到 ModelRetry → RetryPromptPart 的类型化校验重试,smolagents 只到”把错误当 Observation 追加”的 prompt 层重试,是下限。
  • 反面案例值得记:Trae 的基类有 reflect_on_result 合成反思句,但 TraeAgent 把它重写成了 no-op——即在实际的 SWE agent 上,连最小反思都被关掉。这提示”反思注入”未必总是净收益。

三、学习型记忆:dream 后台巩固 + 记忆自编辑

这是全景里最有趣的趋同现象,也是新增 19 家最集中落地的一条路线。机制骨架一致——跨会话把轨迹蒸馏成持久化的记忆/技能文件——但内部分成两个明显的子谱系。

3a. 后台巩固(“dream”式 sleep-time compute):空闲或定时触发独立子代理读原始轨迹再蒸馏。至少五家不约而同用 “dream” 命名:

  • MiMo-Code 把它做成配对功能 dream(每 7 天,巩固记忆) + distill(每 30 天,打包工作流),官方博客直接列为独立的 “evolution” 主题;把 SQLite 轨迹 DB 当真相源、MEMORY.md 当派生索引,无法验证的事实标 [unverified],还鼓励把 “Created nothing” 当合法成功输出——防过度沉淀。
  • Qoder 的 Dreams 安全设计最讲究:写时复制(输入 store 永不原地改)、最小权限(Dreaming Agent 只有 memory/session_list/session_read 三工具、无代码执行无网络)、单飞(同用户并发 409)。把这个能力做成了一等产品 API。
  • Hermes 的 Curator 是”技能生命周期管理”版:空闲≥2h 且距上次≥1 周触发,只碰 agent 自己创建的 skill、从不删只归档、pin 的跳过。
  • 新增家里,OpenAI Agents SDK 是这条谱系的官方 SDK 级实现:sandbox learning-memory 明确”让未来 run 从过去 run 学习”,Phase1(gpt-5.4-mini 抽取)+ Phase2(gpt-5.5 巩固)两阶段写 MEMORY.md,还带遗忘机制(按 recency 只留最新 256 条)和 live_update 允许 run 中途重写过时记忆——把 MiMo 那套用一线厂商的严谨度重做了一遍。Open Interpreter 的两阶段 learning memory、Kilo Codekilo-memory(turn-close 蒸馏 remember/correct/forget,correct 即修正旧记忆)都是同一模板的成员。
  • AgentScope 值得单独点名:它的 AgenticMemoryMiddleware 近乎逐字复刻 Anthropic 的 memory skill(memory 分 user/feedback/project/reference、两步保存=写 md + 加索引行、还带”记忆会过期用前先核实”的告诫),而其 _reme 后端正是 QwenPaw 的默认长期记忆——AgentScope 作为 QwenPaw 的底座,这条记忆自进化能力是从底座继承而来的,两者应连起来看。
  • Qwen Code 的 Dream/Extract、Gemini CLI 的 Auto Memory、Codex 的 Memory Phase 2、QwenPaw 的 Auto Dream(cron 0 23 * * *)都是这一子谱系的成员。安全姿态分两极:Gemini CLI 最保守——只产 .patch/SKILL.md 草稿进 inbox、从不自动应用、默认关闭;MiMo-Code/Qoder/OpenAI SDK 则默认自动写入(靠证据门槛 + 写时复制/遗忘兜底)。

3b. 记忆自编辑(agent 用工具主动改自己的记忆/行为):这是新增家带来的、比”后台巩固”更激进的子模式——不是等空闲再策展,而是把”改记忆”做成一等工具让 agent 随时调。

  • Letta 是这个维度的集大成者,也是整份对比里记忆自进化设计最完整的一家:一方面有 Sleeptime / “dreaming” 后台异步子代理(前台回复后派 sleeptime agent 整理/去重/提炼 lessons,sleeptime_agent_frequency 每 N 轮门控、断点续处理)——属 3a;另一方面把记忆自编辑做成行号感知的 patch 式工具族rethink_memory 重写整块、memory_replace/memory_insert/memory_apply_patch明确参考 Anthropic computer-use 的 edit tool),还支持”记忆去碎片化 / doctor”用 git worktree 让 subagent 并发改记忆不阻塞主 agent。系统提示直接自称 “self-improving agent”,step_manager 还给每步打 positive/negative feedback。
  • Agent-Zero 是同一思路作用在行为准则上:UpdateBehaviour 工具把新调整用 utility model merge 进 behaviour.md,而该文件被注入每轮系统提示——agent 能在对话中永久改写自己的行为守则;配合 solutions memory 自动存成功解法供 recall 复用。
  • DeerFlow 把这条推到自我配置update_agent 工具让自定义 agent 改自己的 SOUL.md/config.yaml/tool_groups/model——但配了明确安全闸门:来源不可信的 webhook 渠道(如 GitHub 外部评论)不给 update_agent

四、人在环经验蒸馏 + Skill 自进化:反对”偷偷改自己”

与第三组”后台自动巩固”相对,这一组把显式批准 / 显式触发当作第一原则,机制是”用户纠正 → 提炼可泛化规则 → 存记忆/skill → 未来预先自纠”:

  • AutoClaw 是这个维度披露最详尽的一家,品牌名就叫”Hermes 自进化”:三步流程(陈述 → 提”进化卡片”展示打算记什么 → 用户显式批准),原则明写”AutoClaw 永远不会偷偷修改自己”;触发分关键词(以后/记住/永远/从不)和自动检测(10+ 次工具调用)两路;护栏具体到”被拒提案 2 周冷却期”。
  • CrewAI 的 HITL lesson 是代码层面最完整的闭环:_distill_and_store_lessons() 从人类纠正提炼 DistilledLessons_pre_review_with_lessons() 在人类看到下一次输出之前就把匹配教训应用上——真正做到”预先自我修正”。
  • Devin 的 Session Insights 把评估颗粒度做得最细:每 session 结束自动标注每条 Knowledge 帮了还是误导了,直接反哺 Knowledge 质量;还能”用失败 session 作反例优化已有 playbook”。
  • 新增的 DeerFlow 是”Skill 自进化”的代表实现:任务用了 5+ 工具 / 踩了非显然坑 / 被用户纠正后新解法有效 / 发现可复用工作流 → skill_manage 持久化 per-user skill(默认关),且写 skill 前经 LLM moderation + 静态扫描双重安全审查,防自写 skill 引入危险内容——是这条”从经验固化 skill”路线里安全设计最完整的一家(对比 Qwen Code skillReview、Hermes Curator 只做生命周期管理,DeerFlow 多了内容安全门)。
  • Copilot Memory 的自我修正最像”自愈”:引用校验发现矛盾时覆写为修正版、通过则刷新时间戳,GitHub 还用植入错误记忆做过对抗性评估——记忆一致性被当成可测指标。AutoGen 的 task_centric_memory(实验)、MetaGPT 的 exp_pool 经验缓存也在这一组的更”案例推理”一端。

五、改 harness 自身,不是改运行中的 agent

这一组容易被误当成”自进化”,但改的对象是产品/harness 代码本身,靠人或 bot 在 CI/离线闭环里迭代:

  • KiroCORAL 是”轨迹反哺 harness”最清晰的证据:每天抽样数千真实会话做 LLM 根因分析,把高置信经验转成已上线的 prompt/工具描述改动(明确”无需模型重训”)——一行文案把错误 glob 用法从 26.1% 降到 0.3%;自动改写 cd X && cmd 消除一个影响 18% 会话、100% 失败的模式。
  • Replit 的自改进闭环把这套做成产品哲学(“能造软件的 agent 也该能改进 agent 自身”):Telescope 聚类 → draft PR → ViBench + A/B 评测 → 建议上线,但显式声明不自动上线,工程师保留发布权。ViBench 还贡献两条实证:前沿代码基准分不能可靠迁移到完整应用构建;多数模型扩写自己先前代码时表现更差。
  • OpenHands 的 verification stack(评审 bot + QA agent 跑在自己每个 PR 上,合并耗时 -58%、覆盖率 +25%)、Anthropic 的工具改进工作流(工具测试 agent 数十次调用重写描述,下游耗时 -40%)都是样板。
  • Cursor 的 auditor 模型是这组里的”eval 方法论纠错”:复核 731 条轨迹发现”已解决”里 63% 实为答案查找,据此构建剥离历史的 strict harness,分数从 87.1% 掉到 73.0%——纠正的是评测本身的诚实度

六、在线 adapter/config 持续学习:claude-flow 的独一份

claude-flow 是整份 61 家对比里唯一一个在运行时跑真 RL/持续学习代码的 harness,也是”被吹得最凶却意外部分为真”的一维。它三层叠加,全都在学小型本地 adapter/config、从不动 base Claude 权重:

  1. 轨迹→routing 在线学习:每次 trajectory-end 把轨迹持久化(带 embedding + 成功/失败标签),SONA optimizer 用 reward(+1.0 成功 / -0.5 失败)更新 Q-learning router,成功时做 EWC++ 巩固(Fisher-info 更新、用 trajectory embedding 当梯度代理)——是真的在线 RL。
  2. eval 门控 config 自优化(离线 flywheel)harness-flywheel 每 tick 从本地 store 采自监督 benchmark,在 TRAIN split 爬山优化 retrieval config,再在 HELD-OUT split 经真实 eval GATE(held_out_improves + anchor-no-regress + drift≤thr + replay 确定性 + canary-no-worse)冠军化——一个合法的 eval 驱动纠错环,$0、确定性。
  3. adapter 训练:MicroLoRA rank-2 adapter + InfoNCE 对比学习,走真实 epoch/loss/EWC/磁盘 checkpoint,但训的是极小的 router/memory adapter。

最值得学的是它代码里写死的诚实边界weight-eft.ts 头部有一条 “HARD HONESTY RULE (do not overclaim)“,明说它的 train 从不真 spawn GPU tune、resolved 标签只是代理(“ruflo 没有 SWE-bench gold oracle”)。所以”越跑越聪明、有证据”只适用于在自标注数据上的 router/retrieval config,而非可证明的端任务准确率提升。这种把 overclaim 风险写进源码注释的做法,本身就是这个营销重灾区最稀缺的品质。

七、自动化 prompt 进化 / 训练数据自生成

比第五组更自动的一支——eval 信号不经人挑,直接驱动 prompt 搜索或训练数据生成:

  • Google ADKoptimization/框架内置的 eval 驱动 prompt 优化器(但不做参数训练):gepa_root_agent_prompt_optimizer 接外部 GEPA 框架做反思式 prompt 进化——evaluate(跑 agent 打分)+ make_reflective_dataset(把失败轨迹喂反思)+ pareto 挑选;另有 simple_prompt_optimizer 走”生成候选→eval 批打分→迭代→final validation”。这把”人看 eval 再改 prompt”(第五组)自动化成了闭环搜索。
  • CAMEL 有两块:Workflow Memory(workforce worker 完成任务后用 summarizer agent 从对话+工具轨迹蒸出结构化 workflow,带 workflow_version,下次按角色检索注入——从自身成功轨迹学经验跨任务复用,属第三组);Self-Improving CoT(STaR 式:generate_reasoning_trace → evaluate_trace(reward model 打分)→ 分数不够则 improve_trace 迭代,支持 rejection sampling),产物是训练数据而非在线改权重——是把 eval/reward 驱动的自纠错用作离线数据引擎。

最值得借鉴的设计

1. Letta 的”记忆自编辑工具族 + sleeptime 后台巩固”双层组合,是学习型记忆这条主线的集大成参考。 全景里”跨会话学习=改上下文/文件”已是共识,但绝大多数 harness 要么只做后台巩固(3a,被动、定时),要么只做主动写记忆(一个 remember 工具了事)。Letta 把两者拼成完整体系:前台随时可调行号感知的 patch 式自编辑工具memory_apply_patch 等,直接借鉴 Anthropic computer-use edit tool 的成熟设计),后台再由 sleeptime agent 异步整理去重、甚至用 git worktree 并发改记忆不阻塞主循环。这套”实时自编辑 + 睡眠时巩固”的分工,加上 Qoder Dreams 的安全三件套(写时复制 + 最小权限 + 单飞)Gemini CLI”只产草稿进 inbox、从不自动应用”保守姿态,共同拼出了”记忆型自进化”从激进到保守的完整可选谱系——任何要做长期记忆的 harness 都能按信任级别在其中取一档。而 DeerFlow 给自写 skill 加内容安全审查、给 update_agent 按渠道可信度设闸门,补上了”自编辑”最容易被忽视的安全维度。

2. claude-flow 的”HARD HONESTY RULE”与 OpenHands critic-4b「benchmark≠生产」量化教训——把自欺写进纪律。 自进化是整份调研里营销水分最大的维度,而这两条恰恰是解药,且不是某个可复制模块而是方法论纪律:OpenHands 用实测证明”只在 benchmark 上训的评分器在生产上 AUC 比随机还差(0.45-0.48)“,Factory 补上”文件级 holdout 有信息泄漏、必须按仓库整体 holdout”,Cursor 的 auditor 揭穿”已解决里 63% 实为答案查找”,而 claude-flow 干脆把”不许 overclaim、resolved 只是代理信号、没跑过真 GPU tune”写进源码注释。它们的共同价值在于:前六组所有花哨的自纠错/自学习循环,只要评分信号本身不可信、评估集有泄漏、或对能力提升过度声称,就全是空转——先诚实地定义”什么算变好”,比任何一个具体循环设计都更该先记住。