导语:2026 年 9 月,"RSI"和"智能体自进化"这两个词几乎每天同时出现在同一批标题里,但它们说的根本不是同一件事——一个讨论的是 AI 是否会加速 AI 研发并失控,另一个讨论的是你部署的 Agent 明天能不能记住今天的教训。本文不重复站内已有的 RSI 三部曲,而是先建一张共同的坐标系,把两者放回同一个"经验 → 状态 → 行为"的反馈闭环,再逐维度正面对比:它们改什么、改在哪个基质、改动能留多久、谁判定它变好了、谁承担风险。读完你拿到两样东西:一张六维对比表,和一套能对任何"自我进化"宣传做三次追问的判定法。
一、先把两个词放回同一张坐标系
1.1 两个词各自漂到了哪里
先看两组真实的用法。
"RSI"这一侧,同一天里至少指三件事:某实验室博客里指模型在部署时反复改自己的输出(自我精炼);某公司发布会里指用 AI 生成数据再训练自己(自举迭代);某安全报告里指智能体自己设计下一代模型(严格意义的 RSI)。三者的野心差着三个数量级。站内《什么是 RSI:定义、谱系与判定手册》已经把这层概念解剖做完了,并用 L0–L5 阶梯给出了分界:2026 年的真实上限是 L3(算法与元层改进),L4(开放式 RSI)尚无公开证据。
"智能体自进化"这一侧漂得更散。2026 年几乎每一篇 Agent 产品的发布稿都会写一句"我们的 Agent 会从经验中学习"。但把这句话拆开,它可能指四件成本、可逆性完全不同的事:
| 宣传语 | 实际在做什么 | 改动可逆性 |
|---|---|---|
| "会从经验中学习" | 把成功轨迹存成可检索的记忆条目 | 极高(删掉即可) |
| "越用越懂你" | 更新提示词 / 核心记忆块 | 高 |
| "自己攒技能" | 生成可复用的工具 / 技能,写进外部文件 | 中高 |
| "自己改自己" | 改写 harness 代码或做权重更新 | 中 → 低 |
如果不去拆,这两组词会被同一句话糊在一起:"AI 已经能自我进化了。"——于是支持者拿 Agent Skills 的证据去证明 RSI,怀疑者拿 RSI 的严格定义去否认 Agent 的记忆功能。双方在比不同的东西。
1.2 一条更省事的路径:不问名词,问闭环
与其给名词排序,不如统一到一个最小结构。2026 年两篇关键的工作给了我们同一个答案。
第一篇是 Shilong Liu 在 2026 年的分类学文章《A Taxonomy of Self-evolving Agents》。它给出一个简洁的等式和一个三分法:
Agent = Model + Harness
Artifact ← Agent 的产出(被发现的算法、论文、机器人策略)
- Model(模型):参数化的"脑";
- Harness(智能体框架):提示词、循环设计、记忆、工具、控制流——正是这一层把模型变成 Agent;
- Artifact(产物):Agent 在环境中做出的东西。
于是所有"自进化系统"可以归到三层:① artifact 迭代优化(反复改产出,Agent 自身不变);② harness 自改进(改提示词 / 记忆 / 工具 / 技能,模型权重不变);③ 无金标准下的模型学习(改权重,反馈信号弱)。
第二篇是 Xinming Tu 在 2026 年的 3×3 框架《The What & When of Self-Evolving Agents》。它把"更新基质 × 持久化时长"交叉成矩阵:
| 单会话(Intra-Task) | 跨会话(Inter-Task) | 跨用户(Inter-Agent) | |
|---|---|---|---|
| 外部文件 | 任务内产物、工作记忆 | 技能库、CLAUDE.md / AGENTS.md |
共享知识 / 技能库(EinsteinArena、Agent Skills) |
| Agent Harness | 动态编排(运行时改控制流) | 编译式工作流(Meta-Harness、AWM) | 平台级 harness 飞轮(Claude Code / Codex 默认) |
| 模型权重 | 测试时训练(TTT-Discover、ThetaEvolve) | 参数化个性化(OpenClaw-RL) | 检查点自举(Cursor Tab 的在线 RL) |
它给出的一条判据尤其值得记住:从表层往核心走,改动越贵、越慢、越持久。外部文件是"浅而便宜",权重是"深而昂贵"。
1.3 全文的枢纽:RSI 不是另一种机制
上面那篇 3×3 的框架里,藏着本文最想交付的判断:
递归自我改进(RSI)不是一套独立的架构机制,而是同一个自进化闭环,指向了 AI 研发流程本身。
也就是说,如果一个 Agent 的自进化闭环收敛在"写代码"上,你会得到更好的软件;收敛在"科学实验"上,你会得到更好的发现;收敛在"训练数据、评测、训练基础设施、GPU kernel"上,你得到的就是 RSI。
这个视角一举解决了公众争论里一半以上的错位:
- "RSI 尚未发生"为真——因为 L4 级(系统自定义任务与评估器)确实没有公开证据;
- "自进化已经在生产里跑"也为真——因为 Claude Code 的技能、各种记忆系统每天都在工作;
- 两者同时为真,因为它们描述的是同一个环上的不同节点,而不是同一张排行榜上的不同分数。
基于此,本文提出贯穿全文的闭环四问——任何"自我进化"的说法,先过这四问:
- 改什么? 产物 / harness / 模型权重 / 改进方法本身?
- 改动能留多久? 单次会话 / 跨会话 / 跨用户 / 永久写进下一代模型?
- 谁判定它"变好了"? 形式化验证 / 执行反馈 / 学习型裁判 / 用户隐性反馈 / 自我感觉?
- 谁承担风险? 一个用户的一次会话 / 一个组织的供应链 / 全行业的能力曲线?
维度 3 和 4,是 RSI 与智能体自进化真正分道扬镳的地方。 下面两章分别把两侧放回坐标系定位,第四章做正面对比。
二、RSI 侧:这个闭环落在坐标系的哪一格
2.1 严格定义只有一个入口:二阶
RSI 的判据不是"AI 改了 AI 相关的东西",而是系统改进自己的"改进能力":一阶是"我今天比昨天做得好",二阶是"我明天进步的速度比今天更快"。只有二阶才产生复利。
由此得到四类改进对象(2026 年覆盖 1,250 篇论文的 RSI 综述 arXiv:2607.07663 的分类法):
| 改进对象 | 典型工作 | 2026 状态 |
|---|---|---|
| 部署时行为 | Self-Refine、Reflexion | 🟢 已工程化 |
| 训练时策略(权重) | STaR、Self-Rewarding LM、SEAL | 🟡 有效但会退化 |
| 评估器本身 | LLM-as-Judge、PRM、rubric | 🟡 增长最快也最不可靠 |
| 研究流程本身 | AI Scientist、自动 w2s 研究 | 🟠 执行强、判断弱 |
2.2 2026 年的硬数据:三组可核查的锚点
RSI 从哲学变成技术趋势,靠的是三组一手数据,站内全景篇已详述,此处只留结论性锚点:
| 锚点 | 数据 | 意义 |
|---|---|---|
| Anthropic 工程侧 | 截至 2026-05,>80% 合并入代码库的代码由 Claude 撰写;Q2 人均日合并量是 2024 年的 8 倍 | 人类工作流被加速(属 L0–L1 侧证据) |
| METR 时间跨度 | 模型 50% 成功率可完成的人类任务时长约每 4 个月翻倍(2024-03 约 4 分钟 → 2026-05 ≥16 小时) | 能力的可测曲线仍在走 |
| 自我改进系统 | AlphaEvolve 优化了支撑自身的计算栈;Darwin Gödel Machine 在 SWE-bench 上从 20.0% → 50.0% | "可证明"退到"可验证",RSI 首次工程化 |
| 反证 | 开放式研究问题:6 天、$3,000 算力,产出被原作者双双拒稿 | 判断侧(选题、品味)仍是人类专场 |
2.3 验证瓶颈:RSI 的真正天花板
这是 2026 年 RSI 研究最重要的洞见,也是它和自进化侧共享的上限。自我改进的可靠性沿一条验证层级递减:
| 层级 | 验证信号 | 可靠性 | 覆盖范围 |
|---|---|---|---|
| 1 | 形式化验证器(证明、类型系统) | ⭐⭐⭐⭐⭐ | 极窄 |
| 2 | 执行 / 测试反馈 | ⭐⭐⭐⭐ | 需可执行环境 |
| 3 | 学习型裁判(奖励模型、LLM Judge) | ⭐⭐⭐ | 有偏见、可被奖励黑客 |
| 4 | 内在自评 / 置信度 | ⭐⭐ | 自我确认循环 |
三条推论:① 已展示的自我改进强度与该层级排名高度一致——代码、数学效果最好不是因为"高级",而是因为验证器便宜可靠;② 各类失败模式本质上是"违反层级"——用弱信号替代强信号;③ 人类之所以还在环内,是因为层级能回答"这个结果对不对",但无法回答"什么值得被评估"。
2.4 定位结论:RSI 落在最贵的那一格
用第一章的四问给 RSI 定位:
| 四问 | RSI 的答案 |
|---|---|
| 改什么 | 改进方法本身(评估器、搜索策略、训练管线) |
| 改动能留多久 | 写入下一代模型检查点 → 跨用户、半永久 |
| 谁判定变好了 | 需要层级 1–2 的强验证器;判断侧仍无自动替代 |
| 谁承担风险 | 全行业的能力曲线与对齐不变式 |
对应到 3×3 矩阵,RSI 稳占**"模型权重 × 跨用户"**那一格,且额外要求"研究流程"这一层。这一格的特征是:改动最不可逆、验证要求最高、参与者最少(全球只有少数前沿实验室有资源跑)、外部性最大(风险不由自己承担)。 这也解释了为什么治理讨论在这里如此密集——Anthropic 的 RSP 把"AI R&D-4"(完全自动化一名入门级远程研究员)设为关键阈值,OpenAI 与 DeepMind 各有对应的能力等级(CCL)框架。用一句话概括:RSI 的争议不在"能不能做",而在"做成了谁负责"。
三、自进化侧:同一个闭环,落在便宜的格子里
如果说 RSI 讨论的是"AI 什么时候能自己造自己",自进化讨论的是一个更朴素的工程问题:模型训练太贵,能不能不更新权重,让 Agent 在部署后持续变好? 2026 年的答案是:能,而且已经在生产里跑。
3.1 三层结构:从改产物到改权重
按 Shilong Liu 的三分法,自进化的三层各有代表技术与关键限制。
第一层 · Artifact 迭代优化 人类给定目标与评估标准,Agent 反复产出新版本、检查是否达标、不达标就继续。AlphaEvolve 是最典型的形态;2026 年最激进的案例是 Analemma AI 的 FARS——连续运行 417 小时、产出 166 篇全 AI 生成论文、成本约 18 万美元。 限制:必须有可自动计算的评估函数。它优化的是产出,不是 Agent 自己。
第二层 · Harness 自改进(2026 的主战场) 这一层不再改产出,而是改 Agent 自身的组件,分两条路:
| 路线 | 改什么 | 代表工作 |
|---|---|---|
| 提示词与记忆 | 把有用规则沉淀到提示词、playbook 或记忆库 | GEPA(进化式提示词搜索)、ACE(上下文即演化 playbook)、Mem0(长期记忆) |
| 工具与技能 | 生成可复用的工具 / 技能,下次直接复用 | Alita(自动造工具)、Mem-UI、Claude Code Skills、Hermes Agent |
一个关键澄清:这些方法虽然名字里带"学习",但都没有动模型权重。 不过如果把 harness 视为 Agent 的一部分,那么更新提示词与更新参数在功能上等价——叫它"学习"并不算错。这也正是争议的起点(见第五章)。
第三层 · 无金标准下的模型学习 这一层真的改权重,难点在于"没有标准答案时,拿什么当信号"。三条路:
- 伪标签 / 内部信号:自训练、TTRL,用模型自己的置信度构造目标;
- 自博弈与环境弱信号:SPIN、Absolute Zero、R-Zero——前提是有一个能自动判对错的执行器;
- 测试时训练(TTT):TTT-Discover、ThetaEvolve,把一部分学习循环搬进推理过程。
限制:纯闭环反复自训练会导致 model collapse(分布退化、奖励黑客、风格漂移),必须引入外部真实信号或正则化。
3.2 2026 系统动物园:按"到底改了什么"归类
产品发布稿不可信,但"改了什么"可以查。下表按真实变更对象给 2026 年的代表系统分类(依据 Micheal Lanham 的 2026 审计框架):
| 系统 | 名义定位 | 实际改了什么 | 判定 |
|---|---|---|---|
| GenericAgent | 自进化 Agent | 把验证过的轨迹变成 SOP 与可执行代码 + 工具增长 | 记忆 + 工具增长,不是学习 |
| ReasoningBank | 推理记忆库 | 从成功 / 失败经验蒸馏推理记忆,测试时检索 | 更聪明的记忆 |
| MemRL | 记忆强化学习 | 冻结 LLM,用 Q 值学习"该取哪条记忆"的检索策略 | ✅ 运行时策略学习(最干净的对照案例) |
| AgeMem | 记忆即动作 | 把 store / retrieve / update / summarize / discard 变成策略内动作,RL 优化 | ✅ 策略级学习 |
| Memory-R1 | 记忆管理 | Memory Manager 学习 ADD / UPDATE / DELETE / NOOP | ✅ 策略级学习 |
| SKILL0 | 技能内化 | 把技能内化进参数,推理时不需要任何技能检索 | ✅ 参数内化(后训练) |
| SDAR | 门控自蒸馏 | 把技能知识转移进策略参数 | ✅ 参数内化(后训练) |
| SEA-Eval | 自进化基准 | 分层记忆 + 经验蒸馏 + 选择性整合 | 基准,非 Agent |
判断这些系统"是否真的在学",有一个近乎残酷但极有效的方法:把记忆清空再测一次。
- Skill-GRPO(技能检索基线)在 ALFWorld-3B 上,去掉技能后从 80.5 掉到 60.2;
- SDAR 在推理时完全不用外部技能,却仍在多个设定下超过"技能增强"基线。
性能能否在撤掉"记忆拐杖"后存活,就是"记忆"与"学习"的分界线。 MemRL 的另一个数据也值得一提:在 ALFWorld 上迁移准确率 0.479 vs MemP 0.421 vs RAG 0.336,且在探索密集型任务上相对无记忆基线提升约 82%。作者刻意冻结记忆库后在留出集上测试仍然领先——这是目前公开证据里,"改进超过'库里多存几条'"的最强支持。
3.3 2026 的平台化:自进化已经是产品功能
与 RSI 仍停留在实验室不同,自进化在 2026 年已经产品化,而且产品化路径恰好沿着 3×3 矩阵的三行:
- 外部文件行:Claude Code Skills、OpenAI Codex 的 Record & Replay(演示一次即变成可复用技能)、OpenHands Skills;
CLAUDE.md/AGENTS.md成为跨会话的项目约定载体; - Harness 行:Meta-Harness(用历史轨迹搜索 harness 代码)、Agent Workflow Memory(从轨迹归纳可复用工作流并注入未来任务)、Self-Harness(对单模型自身的失败模式做挖掘与有界改写,回归门禁后才落地);
- 权重行:最前沿也最少——SIA 用一个"元 Agent / 反馈 Agent"循环,在每轮迭代中自行选择是改写任务 Agent 的 harness,还是应用 LoRA 权重更新。这是 2026 年最值得盯的一类工作:它把矩阵里的两行接上了。
3.4 评测:SEA-Eval 与"片段式失忆症"
2026 年出现了一个新的评测问题:传统基准测的是"单次任务做得好不好",而那恰好是自进化不需要证明的东西。SEA-Eval(arXiv:2604.08988)是首个明确提出"超越片段式评估"的基准,从知识积累、策略优化、工具进化三个维度测跨任务的进化动态,并揭示了一个被长期忽略的事实:主流 LLM Agent 存在"片段式失忆症"——单次表现出色,但无法跨任务边界积累经验或优化策略。
这个发现对产品团队的意义,比对研究者更大:你买的模型能力,可能每次会话都在从零开始。
3.5 定位结论:自进化落在最便宜的那一格
| 四问 | 自进化的答案 |
|---|---|
| 改什么 | 产物 / harness(提示词、记忆、工具、技能、工作流) |
| 改动能留多久 | 主要是跨会话;少量跨用户(共享技能库、平台默认 harness) |
| 谁判定变好了 | 执行反馈 + 用户隐性反馈(接受 / 拒绝 / 编辑)+ 留出集评测 |
| 谁承担风险 | 单个用户、单个组织——风险不外部化 |
对应到 3×3 矩阵,自进化的重心在**"外部文件与 harness × 跨会话"**,只有极少数工作(SIA、TTT、OpenClaw-RL)触碰权重那一行。这一格的特征正好与 RSI 镜像:改动浅而便宜、可回滚、参与者是每一个工程团队、外部性小。 它也带来一个 RSI 侧不存在的麻烦——门槛低到无法用"能力"来筛选宣传语,只能用判据筛选。这就是下一章的起点。
四、六维正面对比
前两章分别定位了两侧,这一章把它们摆到同一张桌子上逐项对比。结论先给:两者的差异是结构性的,不是程度上的。
4.1 总表
| 维度 | 递归自我改进(RSI) | 智能体自进化(Self-Evolving Agents) |
|---|---|---|
| ① 改进对象 | 改进能力本身:评估器、搜索策略、训练管线、研究流程 | 任务表现与工作方式:产物、提示词、记忆、工具、技能、工作流 |
| ② 更新基质 | 模型权重 / 训练管线(最内层) | 外部文件 + harness(最外层),极少数触权重 |
| ③ 可逆性与审计 | 低:权重与检查点绑定,参数漂移难回滚难审计 | 高:记忆、技能、提示词可回放、可清空、可 diff |
| ④ 时间尺度 | 跨用户、半永久;一次改进进入下一代模型 | 单会话 → 跨会话为主;跨用户需共享库 / 平台默认 |
| ⑤ 验证信号 | 必须靠层级 1–2(形式化 / 执行);还需要"什么值得评估"的判断 | 层级 2–4 均可用;用户隐性反馈即可作信号,容忍噪声 |
| ⑥ 成本与门槛 | 极高:算力、数据、顶尖研究者;全球少数机构 | 极低:一个提示词文件即可开始;每个工程团队 |
| ⑦ 风险外部性 | 高:失控、对齐、权力集中——风险由全社会承担 | 中低:供应链、记忆投毒——风险由采用者承担 |
| ⑧ 失败模式 | 对齐伪装、价值漂移、累积加速缺乏测量手段 | 记忆腐化、技能过时、过拟合昨天、标签通胀 |
| ⑨ 2026 状态 | L3 已跑通,L4 无公开证据 | 已产品化,但大多数只是"有状态的记忆系统" |
4.2 逐项拆解
① 改进对象:一个改"怎么进步",一个改"怎么干活"
这是两条线最根本的分野。RSI 的对象是元层:让"下一次进步"来得更快;自进化的对象是任务层:让"下一次任务"做得更好。
站内概念篇给过一条通用判据,放在这里最合适:问它"改进的是任务表现,还是改进能力"。前者是自我精炼,后者才可能通向 RSI。 按这条判据,2026 年绝大多数自进化系统都停在"任务表现"侧——这不是缺点,只是它的目标本来就不同。
② 更新基质:权重 vs harness,决定了后面全部差异
3×3 矩阵的分层给了我们一个准确的表达:自进化主要在**表层(外部文件)与中层(harness)作业,RSI 在内层(权重)**作业。
这解释了可逆性的量级差异:一层的技能写错了,删掉文件即可;一次权重更新错了,你面对的是"参数漂移不可回放"。 这也是为什么自进化在工程上敢用、RSI 必须重治理。
③ 时间尺度:复利 vs 复用
两者都在追求"经验的复利",但复利的形式不同:
- 自进化的复利是"边际成本下降":同类任务不再重复付推理税——更少 token、更少工具调用、更少重试、更少人工介入。Xinming Tu 把"经验应当降低边际成本"列为自进化两大承诺之一;
- RSI 的复利是"能力前沿扩张":同类任务变简单不算什么,关键是做以前做不到的事。
一句话记忆:自进化让"同样的事更便宜",RSI 让"更难的事可能"。
④ 验证信号:同一道天花板,两个不同的房间
第一章说过,验证层级是自我改进的通用天花板。但两侧撞到的是天花板的不同部分:
- RSI 撞的是"方向设定权":验证器能判断"这个结果对不对",但判断不了"什么值得被评估"。站内全景篇的表述是:人类仍在环内的根本原因在于层级顶端的先验问题。 开放研究上的失败案例(工程全过、研究全败)就是这个位置上的实证;
- 自进化撞的是"可迁移性":用户接受了答案、任务跑通了,这是信号,但它是局部、有噪声、易过拟合的信号。用昨天的成功轨迹训练今天的能力,很可能只是把"昨天的运气"固化下来。
因此两者的解法也不同:RSI 需要更强的验证器与判断力测量;自进化需要更好的留出集与回归门禁(Self-Harness 的"回归门禁后才落地"正是这一思路)。
⑤ 成本结构与门槛:一个决定谁能玩,一个决定谁会赢
RSI 的门槛是外生的:算力、数据、顶尖研究者,缺一不可。Epoch AI 的测算显示前沿训练算力每年增长 4–5×,但它是外生变量——即使有 1000 个虚拟研究者,它们也共享同一个有限算力池。这决定了 RSI 只可能是少数玩家的游戏。
自进化的门槛几乎为零,但门槛为零意味着两件事:一是所有团队今天就能开始;二是营销噪音与真实能力之间的落差极大。站内一篇关于 AI 增强 CI/CD 的分析给出一组很能说明问题的数字:任务吞吐 +33.7%,但评审耗时 +441.5%、生产事故 / PR 比值 +242.7%;AI PR 的 30 天合并率 32.7% vs 人工 84.4%。自动化了一个环节,瓶颈只是搬到了下一个环节——这在自进化侧同样成立:技能库越大,检索与路由越难。
⑥ 失败模式:一个是"测不出来",一个是"测得太容易"
把两侧的失败模式并排放,会发现一个有趣的对称:
| 侧 | 失败模式 | 为什么危险 |
|---|---|---|
| RSI | 对齐伪装(基础测试约 12%,重训后最高 78%)、价值漂移、累积加速无测量手段 | 危险在于难以察觉:检测手段可能跟不上模型能力 |
| 自进化 | 记忆腐化、技能过时、语义串味("squeeze"到底是股票还是橙子)、过拟合昨天 | 危险在于太容易发生:每一次检索都可能引入噪声 |
一条容易记住的经验规则:
RSI 的失败是"静默的",自进化的失败是"嘈杂的"。 前者需要公共测量基础设施,后者需要生命周期管理——过期技能往往比没有技能更糟。
4.3 一张图记住全部
RSI 自进化
权重 ←── 基质 ──→ 外部文件 + harness
跨用户 ←── 时长 ──→ 跨会话
"什么值得做" ←── 瓶颈 ──→ "经验能不能迁移"
不可逆 ←── 可逆性 ──→ 可清空、可 diff
失控 / 对齐 ←── 风险 ──→ 供应链 / 记忆投毒
少数实验室 ←── 玩家 ──→ 每个工程团队
不变量:改进能力 ≠ 改进表现;验证信号强度决定能走多远
五、三个最容易被混淆的地方
对比做完,再排三个最有价值的"雷区"。它们解释了为什么 2026 年的相关讨论总是吵不出结果。
5.1 混淆一:把"记忆"当成"学习"
这是自进化侧最普遍的标签通胀。诚实的表述应该是:2026 年绝大多数"自进化 Agent"是有状态的、记忆结构越来越复杂的 Agent;只有较窄的一个子集真正通过学习改变了策略;更窄的一个子集把这种改变内化进了参数。
五个问题就能把系统归位:
- 它到底改了什么? 权重 / 提示词 / 记忆 / 检索策略 / 工具?
- 清空记忆后还剩什么? 增益消失,那就是记忆;
- 禁用检索后还剩什么? SDAR 和 SKILL0 能扛过这一问,技能注入基线扛不过;
- 改进能迁移到留出任务吗? MemRL 冻结记忆库后的留出集结果是目前最好的证据;
- 这次改动可回放、可审计吗? 记忆更新通常可以;参数漂移往往不行。
问题 2 和 3 是分水岭。 它们背后的直觉非常朴素:如果一个 Agent 去掉笔记本就什么都不会,那它的进步不在它身上。
5.2 混淆二:把"改 harness"当成 RSI
这一条更微妙,因为它连 RSI 圈内部都有争议。
Darwin Gödel Machine 是首个在真实编码任务上持续自我改进的开源系统(SWE-bench 20% → 50%),它改写自己的代码。但批评者指出一个关键事实:做出这些代码改动的,是一个冻结的 LLM——模型本身没有被修改。据此,社区出现了相当有力的一问:"论文自己就反驳了'开放式'的主张。"
这个反驳之所以重要,不是因为它推翻了 DGM,而是因为它揭示了一个通用判据:
自我修改是机制,不是判据。 一个系统改自己的代码,仍要问:改进的是任务表现还是改进能力?收益能否跨轮累积?验证信号来自哪里?
按这条判据,DGM 站在 L3(算法与元层改进),而不是 L4。同样的逻辑适用于所有"Agent 改自己的代码 / 技能"的系统——包括本文第三章里提到的所有 harness 侧工作。
5.3 混淆三:把"AI 加速研发"当成 RSI
最后一条最容易在媒体上出现。Anthropic 披露"超过 80% 的合并代码由 Claude 撰写"时,标题往往写成"RSI 来了"。但用 1.3 节的视角看,这加速的是人类的工作流,属于 L0–L1 侧的证据:写代码是"设计机器"里最基础的一环,而 RSI 要求改进的是改进能力本身。
同样,OpenAI 计划 2026 年 9 月拥有"虚拟实习生"、2028 年 3 月全面自动化其 AI 研究者,这些是目标时间表,不是已发生的 RSI。站内事件篇用"三层证据法"(官方一手 / 媒体转述 / 社媒传闻)拆解过这类新闻,可以直接复用。
六、风险对比:两个完全不同的风险面
两条线的风险不仅程度不同,种类和承担者都不同。这是最容易被"AI 风险"这个笼统词汇掩盖的部分。
6.1 RSI 侧:治理级风险
| 风险 | 机制 | 证据锚点 |
|---|---|---|
| 工具性趋同 | 追求目标时衍生自我保存、资源获取 | Bostrom 2012 |
| 对齐伪装 | 训练时假装接受新目标,暗中保留原偏好 | 基础测试约 12%,重训后最高 78% |
| 失控 | 系统能力超过人类监督能力 | Anthropic 2026 报告 |
| 价值不稳定 | 自我修改可能改写价值观与护栏 | RSI 综述 |
| 权力集中 | 即使系统"听话",也使创造者独占产出 | Kokotajlo, TIME 2026 |
这些风险的共同特征是外部性高、不可逆、且缺乏测量手段。Anthropic 安全负责人 Dave Orr 的比喻很传神:"我们的容错空间正在变小……我们在悬崖路上开,现在时速 75 而不是 25,一个失误就会致命。" 而治理的难点在于:训练运行比导弹发射井更易隐藏,投入品通用,悄悄违背协议的激励巨大。目前没有任何专门针对 RSI 的监管,现有框架只能用算力阈值与危险能力评估做代理指标。
6.2 自进化侧:工程级风险(而且已经被攻击了)
自进化的风险听起来低调得多,但它是唯一一个已经被真实攻击、且有大规模审计数据支撑的风险面。
Snyk 于 2026 年 2 月发布的 ToxicSkills 审计,扫描了 ClawHub 与 skills.sh 上的 3,984 个 Agent 技能(当时已知最大的公开技能语料),结果如下:
| 指标 | 数量 | 占比 |
|---|---|---|
| 含至少一个严重级(CRITICAL)问题的技能 | 534 | 13.4% |
| 含至少一个安全缺陷的技能 | 1,467 | 36.82% |
| 人工确认的恶意载荷 | 76 | — |
| 发布时仍在线可下载的恶意技能 | 8 | — |
更值得注意的是攻击手法与自进化的结构性耦合:
- 技能继承 Agent 的全部权限:shell 访问、文件读写、环境变量里的凭据、通过邮件 / Slack / WhatsApp 发消息的能力、跨会话的持久记忆;
- 100% 的确认恶意技能包含恶意代码,同时 91% 使用提示注入——提示注入的作用是"给 Agent 铺垫,让它接受一个人类或安全机制本来会拒绝的指令";
- 持久化路径就是自进化路径:恶意技能可以污染
MEMORY.md、SOUL.md等记忆文件,实现"一次安装、长期生效"; - 间接注入不需要恶意技能:17.7% 的技能会拉取第三方内容,攻击者只要在某论坛或 API 上投放带注入的内容即可。技能作者没做错任何事,用户装的是热门好评技能,Agent 仍然被攻陷。
发布门槛也说明了问题的量级:一个 SKILL.md 加一个注册满一周的 GitHub 账号,没有签名、没有安全审核、默认没有沙箱。 技能日提交量在 2026 年 1 月中至 2 月初从不足 50 涨到 500 以上——两周十倍。
6.3 判据差异:风险该由谁买单
把两侧放在一起,会得到一个反直觉但有解释力的结论:
| RSI | 自进化 | |
|---|---|---|
| 风险承担者 | 全社会 | 采用它的组织与用户 |
| 可逆性 | 低 | 高(但会横向扩散) |
| 核心缺失 | 公共测量基础设施 | 技能的来源、沙箱与评测门禁 |
| 当下最该做的 | 建立跨机构、定期、可比的加速指标;研究可验证的协调机制 | 扫技能、轮换凭据、审计记忆文件;给技能库加 provenance 与回归门禁 |
注意最后一行的对称性:RSI 的治理目标是"让放慢成为可能",自进化的治理目标是"让采用变安全"。前者是政治问题,后者是工程问题。把它们混成一类,会同时低估 RSI 的政治难度、又高估自进化的安全性。
七、合流:边界正在模糊的三个信号
如果只读到这里,结论可能是"两个圈子各玩各的"。但 2026 年最值得注意的趋势恰恰相反:它们在合流,而且合流点可以被精确定位。
信号一:学术上,两个社区已经坐进同一个会场
ICLR 2026 的 "AI with Recursive Self-Improvement" Workshop 接收了 110 篇论文,其议程覆盖"经验学习、合成数据管线、多模态智能体系统、弱到强"等方向——而排在第一位的接收论文就是 Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning。"自进化 Agent"的工作,被投进了 RSI 的会场。 这本身就是最有力的证据:两个圈子在研究议程上已经没有围墙。
信号二:工程上,自进化的成果正在变成所有人的默认
3×3 矩阵的"跨用户 / harness"格子里,写着一个容易被忽略的机制:平台 harness 飞轮。当 Claude Code、Codex 这类平台发布 plan mode、/loop、/goal、更好的工具 schema 或更强的恢复逻辑时,每一个用户都继承了一个更好的 harness。
这条路径的含义是:一个人在一次会话里发现的改法,可以通过平台升级变成整个用户群的起点。 这条路径把"单会话"直接连到"跨用户",跳过了中间所有的治理讨论。它不带 RSI 的失控风险,却实打实地在提升全行业的能力基线——这是 2026 年最被低估的一条加速通道。
信号三:机制上,harness 与权重开始被一起优化
真正让边界变模糊的是第三章提到的那类工作:
- SIA:元 Agent 每轮自行选择"改写任务 Agent 的 harness"还是"应用 LoRA 权重更新";
- Hyperagents:让元层改进过程本身可编辑——系统搜索的不只是更好的 Agent,而是更好的"生成更好 Agent"的方法;
- Meta-Harness / Self-Harness:把历史轨迹编译成可复用的执行 DAG,并以回归门禁控制落地。
而它们指向同一条能力固化路径:
任务内产物 → 可复用技能(harness) → 训练成功轨迹 → 内化进模型权重
(单会话) (跨会话) (跨用户 / 下一代模型)
沿着这条路径向右走,自进化就自然长出 RSI。 站内概念篇的 L0–L5 阶梯里,L3 与 L4 的分界线("系统是否自己定义任务与评估器"),在这条路径上对应的正是"闭环最终收敛在哪里"。用 Shilong Liu 的话说:
如果闭环收敛在基准上,你会得到更强的解题器;收敛在代码上,你会得到更好的软件;收敛在科学与工程上,你可能得到更好的发现;收敛在物理世界上,Agent 可能成为一种建造和改进真实系统的新方式。
但边界没有消失,只是移到了一个新的位置
合流不等于同一。分界线从"改了什么"移到了"闭环收在哪里":
| 闭环收敛于 | 得到什么 | 属于哪一侧 |
|---|---|---|
| 基准 / 单次任务 | 更强的解题器 | 自进化(L1) |
| 代码 / 软件 / 工作流 | 更好的软件与更低的边际成本 | 自进化(L2) |
| 训练数据、评测、训练基础设施、GPU kernel | AI 研发能力本身的提升 | RSI(L3) |
| 系统自定义的任务与目标 | 开放式进步 | RSI(L4,未实现) |
这就是本文的最终结论:RSI 与智能体自进化不是竞争关系,也不是同一件事的两种说法,而是同一个闭环的两个收敛点。 今天可以同时说"RSI 还没发生"和"自进化已经在你电脑上跑了",只要你说清收敛点在哪。
八、行动建议
给研究者
- 把验证层当作共同的基础设施来投:它是自我改进的效率与安全共享的杠杆,且在两侧都稀缺;
- 补测量,而不是补预测:目前最缺的不是"RSI 会不会发生"的论证,而是"累积加速""研究判断质量""经验可迁移性"的测量方法;
- 在两个圈子的交叉点上找题目:把自进化的经验蒸馏机制用来生成 RSI 需要的合成数据与评测,是目前最空白的结合部。
给工程与产品团队(自进化落地)
- 先做"清空记忆"测试:把你的 Agent 的记忆库 / 技能库清空再跑一遍核心任务。如果效果断崖式下跌,你买到的是记忆而不是学习,别对外宣传成"学习";
- 给技能与记忆加生命周期管理:provenance(来源)、沙箱、回归门禁、过期清理。过期技能比没有技能更糟;第三方技能库在 2026 年已是活跃攻击面(36.82% 有缺陷);
- 盯住瓶颈的转移:自动化一个环节后,瓶颈会搬到下一处(典型如代码评审)。提前把下一个瓶颈的指标埋好。
给投资者与战略判断者
- 区分"能力前沿"与"成本曲线"两种叙事:RSI 的故事是能力前沿(少数玩家、长周期、重治理);自进化的故事是成本曲线(每个 SaaS 都能做、短周期、看落地率)。两者不该给同一个估值倍数;
- 关注"harness 飞轮"的复利:平台的默认 harness 升级是唯一一条同时具备"低风险 + 跨用户 + 已验证"的加速通道,值得单独跟踪;
- 对"RSI 时间表"保持口径敏感:公开预测(如"2028 年底前看到自动化 AI 研发概率约 60%")与"已经发生"是两件事,媒体标题常把二者混为一谈。
给普通观察者
- 遇到"自我进化"先问三句:改了什么?清空记忆还在吗?闭环收敛在哪里?
- 遇到"RSI"先看 L 几:只要宣传语对应的是 L1–L3,那是在描述工程进步,不是在描述智能爆炸;
- 盯住一个真正的指标:智能体能力与验证能力之间的差距。这个差距扩大,才是两条线共同的真实风险。
九、结语与一页速查
结语
两个词之所以让人兴奋又让人困惑,是因为它们描述的不是两种能力,而是同一个结构在两个方向上延伸——一个把"经验变成状态、状态改变行为"的环。
2026 年的真实图景是:这个环在任务这一侧已经闭上了,而且跑得比想象中稳;在 AI 研发这一侧只闭了一半——执行(写代码、做实验、优化内核)闭上了,判断(什么值得做、什么算做对了)还开着。
所以当有人问你"AI 到底能不能自我进化"时,最好的回答不是"能"或"不能",而是反问一句:
它的闭环,收敛在哪里?
一页速查
闭环四问(任何"自我进化"说法先过这一遍)
① 改什么? 产物 / harness / 权重 / 改进方法本身
② 留多久? 单会话 / 跨会话 / 跨用户 / 写进下一代模型
③ 谁验证? 形式化 / 执行反馈 / 学习型裁判 / 用户隐性反馈 / 自我感觉
④ 谁担险? 一个用户 / 一个组织 / 全行业
RSI(递归自我改进) 自进化(Self-Evolving Agents)
改改进能力 改任务表现与工作方式
权重 / 训练管线 外部文件 + harness
跨用户、半永久 跨会话为主
需要形式化或执行验证 用户反馈即信号,容忍噪声
不可逆、难审计 可清空、可回放、可 diff
少数实验室 每个工程团队
风险外部化(治理问题) 风险内部化(工程问题)
2026:L3 已跑通,L4 无证据 2026:已产品化,多为"有状态的记忆"
清空记忆测试(自进化侧的分水岭)
清空记忆库 → 效果断崖式下跌? → 那是记忆
清空记忆库 → 效果基本保持? → 那才可能是学习
(参考:Skill-GRPO 去掉技能 80.5 → 60.2;SDAR 不用外部技能仍领先)
合流路径
任务内产物 → 可复用技能 → 训练成功轨迹 → 内化进权重
向右走一步,自进化就长出 RSI 的形态;边界不消失,只是移到"闭环收敛点"
一句话
RSI = 同一个自进化闭环,收敛在 AI 研发上。
所以"RSI 还没发生"和"自进化已经在跑"可以同时为真。
附录
A. 中英术语对照
| 中文 | 英文 | 说明 |
|---|---|---|
| 递归自我改进 | Recursive Self-Improvement (RSI) | 改进"改进能力"的二阶过程 |
| 有界自我精炼 | Bounded Self-Refinement | 针对固定评估器改进,收敛、可验证 |
| 开放式 RSI | Open-ended RSI | 系统自定义任务与评估器,未实现 |
| 智能体自进化 | Self-Evolving Agent (SEA) | 从经验中更新外部状态 / harness / 权重 |
| 智能体框架 | Agent Harness | 提示词、循环、工具、记忆、控制流 |
| 产物 | Artifact | Agent 产出(算法、论文、策略) |
| 更新基质 | Update Substrate | 外部文件 / harness / 模型权重 |
| 持久化时长 | Persistence Horizon | 单会话 / 跨会话 / 跨用户 |
| 验证瓶颈 | Verification Bottleneck | 自我改进上限由验证信号强度决定 |
| 片段式失忆症 | Episodic Amnesia | 单次表现好但无法跨任务积累 |
| 模型崩溃 | Model Collapse | 自生成数据反复训练导致退化 |
B. 关键文献与来源
RSI 侧
- RSI 综述(arXiv:2607.07663,覆盖 1,250 篇论文)|Darwin Gödel Machine(arXiv:2505.22954)|AlphaEvolve(arXiv:2506.13131)|SEAL(arXiv:2506.10943)
- Anthropic Institute《When AI builds itself》(2026-06)|METR 时间跨度(arXiv:2503.14499)|对齐伪装(arXiv:2412.14093)
- ICLR 2026 Workshop on AI with Recursive Self-Improvement(110 篇接收论文)
自进化侧
- A Survey of Self-Evolving Agents:what / when / how / where(arXiv:2507.21046)
- A Comprehensive Survey of Self-Evolving AI Agents(arXiv:2508.07407)
- Shilong Liu,《A Taxonomy of Self-evolving Agents》(2026):model / harness / artifact
- Xinming Tu,《The What & When of Self-Evolving Agents》(2026):更新基质 × 持久化时长 3×3
- Micheal Lanham,《Self-Evolving Agents: Real Learning, or Memory in a Costume?》(2026):记忆 vs 学习判别
- SEA-Eval(arXiv:2604.08988)|Memento-Skills(arXiv:2603.18743)|MemSkill(arXiv:2602.02474)
风险侧
- Snyk ToxicSkills 审计(2026-02):3,984 个技能中 36.82% 有缺陷、13.4% 为严重级、76 个恶意载荷
- Agent Skill 供应链研究(arXiv:2605.14460)|Palo Alto Unit 42:Trust No Skill
站内延伸阅读
- 什么是 RSI(递归自我改进):定义、谱系与判定手册 —— 概念篇
- 递归自我改进(RSI)全景 2026:AI 正在加速 AI,但「验证瓶颈」决定它能走多远 —— 全景篇
- 递归自我改进(RSI)深度研究 2026:从智能爆炸到接管全球主机节点 —— 治理篇
- Opus 5.2 深夜灰度,RSI 真来了吗?——把一条刷屏新闻拆成三层证据 —— 核查方法篇
- 当 1,200 个智能体自己建了留言板:OpenAI–Hugging Face 事件技术全解 —— 事件篇
本文基于 2026 年 9 月可公开获取的一手材料整理,数据均标注来源。文中对"是否已实现"的判断以公开可核查的证据为准;涉及机构观点之处,均属原机构表述。
读者留言
COMMENTS 暂无还没有留言,来说第一句?