🍃 「一叶一世界」· 栏目开篇
这是本站新开的栏目。一篇文章,只讲清一个概念。 不追热点、不堆术语,尽量用一张图、一张表、一份速查卡,把 AI 世界里那些"人人都听过、但很少有人讲清"的词讲明白。
第一叶,讲 2026 年最容易被混为一谈的一对概念:RSI(递归自我改进) 与 Agent 自进化。
导语
2026 年 9 月,"RSI"和"自进化"几乎每天同时出现在同一批标题里——但它们回答的是两个不同的问题:一个问"AI 会不会自己加速 AI 的研发",另一个问"我今天部署的 Agent,明天能不能记住今天的教训"。
本文不假设你读过站内的 RSI 系列,也不给长表格。读完你只需要带走两样东西:两句话的定义,和一个能拆穿任何"自我进化"宣传的动作。
〇、三十秒版本
| 你在问什么 | 一句话答案 |
|---|---|
| 什么是 RSI? | 系统改进自己的改进能力——不是"这次做得更好",而是"下次进步更快"。 |
| 什么是 Agent 自进化? | Agent 不重新训练模型,靠外部文件、框架与经验,让部署后的表现持续变好。 |
| 它们是什么关系? | 同一条闭环(经验 → 状态 → 行为),只是收敛点不同:闭环落在"AI 研发"上就是 RSI,落在"日常任务"上就是自进化。 |
一句话记忆:自进化让"同样的事更便宜",RSI 让"更难的事变得可能"。
一、先看一个混乱现场
2026 年 9 月 15 日,两条消息在同一天刷屏。
第一条:Opus 5.2 在 Claude Code 中被曝灰度测试,标题里立刻出现"RSI 真来了吗"。第二条:某 Agent 产品的更新日志写着"我们的 Agent 会从经验中学习,越用越懂你"。
它们看起来很像是同一件事,其实是三件不同的事:
| 新闻里的说法 | 实际在说什么 | 属于哪一侧 |
|---|---|---|
| "模型又变强了,RSI 来了" | 一次常规模型迭代或灰度 | 甚至算不上自我改进 |
| "AI 写的代码已占 80%" | 人类的工作流被加速 | RSI 的外围证据,不是 RSI 本身 |
| "Agent 会从经验中学习" | 把经验存成记忆,下次检索出来用 | 自进化——而且常常只是"记忆" |
混乱的根源在于:两个词描述的是同一种感觉——"AI 好像在自己变好"。但只要追问三件事,它们立刻分开:
- "自己"是谁? 是模型的参数,还是模型外面的提示词、记忆与工具?
- "变好"由谁判定? 有形式化验算器、有测试,还是只是"用户没反对"?
- 改动能留多久? 这一次会话、下一次会话,还是永久写进下一代模型?
这三个问题,就是本文全部内容的骨架。
二、什么是 RSI:一个二阶的环
2.1 定义:这句话里藏着两个关键词
这个概念比大模型早 60 年。1965 年,数学家 I.J. Good 写下那句著名推论:
"第一台超智能机器,将是人类需要做出的最后一项发明。"
逻辑链很朴素:设计机器本身就是一种智力活动;那么一台在设计机器上比人更强的机器,就能设计出更好的机器——如此循环,形成"智能爆炸"。
把它翻译成 2026 年的工程语言,定义是这样的:
RSI(Recursive Self-Improvement,递归自我改进):系统把改进的产物回流为下一轮改进的输入,从而提升自己改进自己的能力。
定义里有两个词是关键:
- 递归:改进的产物必须回流,形成闭环,才可能有"复利";
- 改进能力:改进对象不是这一次的输出,而是以后怎么改进。
2.2 一阶 vs 二阶:本文第一个开关
这是理解 RSI 最省力的一个开关——数阶数。
| 一阶:自我精炼 | 二阶:RSI | |
|---|---|---|
| 改什么 | 这一次的答案、这次产出的代码 | 产出答案的方法:评估器、搜索策略、训练管线 |
| 效果 | 我今天比昨天做得好 | 我明天进步的速度比今天更快 |
| 走向 | 收敛(越改越接近一个固定标准) | 可能发散(这才叫"爆炸") |
| 现状 | 已工程化,天天在用 | 只有在"改进方法"这一步才算数 |
一条能背下来的判据:
问它"改进的是任务表现,还是改进能力"。 前者是自我精炼;后者才可能通向 RSI。
按这条判据,2026 年绝大多数打着"自我进化"旗号的工作,都还停在任务表现这一侧——这不丢人,只是目标本来就不同。
2.3 强度阶梯:L0–L5
把上面的维度合起来,可以排出一张阶梯。拿到任何"RSI 突破"的说法,先找它落在哪一级。
| 级别 | 名称 | 判据(一句话) | 2026 现状 |
|---|---|---|---|
| L0 | 工具化辅助 | 模型帮人写代码,人做全部决策 | 🟢 全面普及 |
| L1 | 部署时自我精炼 | 针对固定评估器反复改输出,单次任务内有效 | 🟢 工程实践 |
| L2 | 训练时自我迭代 | 用自生成数据/自博弈更新权重 | 🟡 有效但会退化 |
| L3 | 算法与元层改进 | 改的是改进方法本身(评估器、搜索、训练管线) | 🟡 当前前沿 |
| L4 | 开放式 RSI | 系统自己生成任务、评估器与目标 | 🔴 无公开证据 |
| L5 | 完全自主继任者 | 自主设计、训练、验证下一代模型 | 🔴 未实现 |
关键分界线在 L3 与 L4 之间。 一份覆盖 1,250 篇论文(2024–2026) 的 RSI 综述(arXiv:2607.07663,2026 年 9 月更新)把它表述为:有界自我精炼(针对固定评估器改进,收敛、可验证)已经是工程实践;开放式 RSI(系统自定义目标与成功标准,原则上发散)尚未实现。
所以 2026 年的准确说法是:L3 已经跑起来了,L4 还没有。 那些"RSI 来了"的标题,几乎都是把 L1–L3 的进展说成了 L4。
2.4 2026 年到底走到哪一步:三组证据 + 一条反证
RSI 从哲学话题变成技术话题,靠的是下面这些可核查的锚点。
| 锚点 | 数据 | 它说明了什么 |
|---|---|---|
| Anthropic 工程侧 | 截至 2026-05,其代码库 >80% 合并进来的代码由 Claude 撰写;Q2 人均日合并量是 2024 年的 8 倍 | 人类工作流被大幅加速(属 L0–L1 侧证据) |
| METR 时间跨度 | 模型 50% 成功率可完成的人类任务时长,约每 4 个月翻倍(2024-03 约 4 分钟 → 2026-05 ≥16 小时) | 能力的可测曲线仍在延伸 |
| 自我改进系统 | AlphaEvolve 优化了支撑自身的计算栈;Darwin Gödel Machine 在 SWE-bench 上从 20.0% → 50.0% | "可证明"退到"可验证",RSI 首次工程化 |
| 一条反证 | 把一个未公开论文的开放研究问题交给智能体:6 天、约 3,000 美元算力,两篇产出被原作者双双拒稿 | 执行侧很强,判断侧(选题、品味)仍是人类专场 |
把最后一行和三行放在一起读,就得到 2026 年的真实坐标:执行侧的自我改进真实且迅猛;判断侧几乎还是零。
2.5 天花板:验证信号有多强,就能走多远
这是 2026 年 RSI 研究里最重要的洞见,也是它和自进化侧共享的上限。
自我改进的可靠性,沿着一条验证层级递减:
| 层级 | 验证信号 | 可靠性 | 覆盖范围 |
|---|---|---|---|
| 1 | 形式化验证器(证明、类型系统) | ⭐⭐⭐⭐⭐ | 极窄 |
| 2 | 执行 / 测试反馈(编译、跑测试、真实环境) | ⭐⭐⭐⭐ | 需可执行环境 |
| 3 | 学习型裁判(奖励模型、LLM Judge) | ⭐⭐⭐ | 有偏见,可被"奖励黑客" |
| 4 | 内在自评 / 置信度 | ⭐⭐ | 自我确认循环 |
三条推论:
- 代码和数学上的自我改进效果最好,不是因为它们"高级",而是因为那里的验证器便宜又可靠;
- 各类失败(自确认循环、模型崩溃、奖励黑客)本质都是"违反层级"——用弱信号顶替了强信号;
- 人类之所以还在环内,是因为层级能回答"这个结果对不对",但回答不了"什么值得被评估"。
最后这一点,正是所有"AI 自己做研究"的宣传里最常被略过的一句:方向设定权,目前没有任何自动替代方案。
三、什么是 Agent 自进化:同一个环,落在便宜的那一格
3.1 定义:不重新训练,也能变好
如果说 RSI 讨论的是"AI 什么时候能自己造自己",自进化讨论的是一个非常朴素的工程问题:
模型训练太贵了。能不能不用重新训练,就让 Agent 在部署之后持续变好?
2026 年的答案是:能,而且已经在生产里跑。
Agent 自进化(Self-Evolving Agent):Agent 在运行过程中,把经验沉淀为可复用的状态(记忆、提示词、工具、技能、工作流),并用它改变自己之后的行为。
注意这句话里刻意没有出现"权重"——这正是它的工程魅力:改动便宜、可回滚、可审查。
3.2 先拆结构:一个等式,三个词
要理解自进化"到底改了什么",只需要记住一个等式和一个产物:
Agent = Model(参数化的"脑")+ Harness(提示词、循环、记忆、工具、控制流)
Artifact = Agent 在环境里产出的东西(代码、算法、论文、策略)
- Model:最内层,改动最贵;
- Harness:把模型变成 Agent 的那一层——2026 年自进化的主战场;
- Artifact:产出物,改它最便宜。
这个三分法(来自 Shilong Liu 2026 年的分类学工作)解释了一个常见误会:很多"Agent 在学习"的说法,其实改的是 Artifact 或 Harness,模型一点没动。
3.3 三个格子:改产物、改框架、改权重
| 改什么 | 典型做法 | 代价 | 能留多久 |
|---|---|---|---|
| 产物(Artifact) | 反复生成新版本,用可自动计算的评分选优 | 低 | 单次任务 |
| Harness | 沉淀记忆与提示词、生成可复用技能与工具、编译工作流 | 中 | 跨会话(少量跨用户) |
| 模型权重 | 用成功轨迹做后训练 / LoRA / 测试时训练 | 高 | 跨用户,近乎永久 |
一条从表层往核心走的经验法则:越往内走,改动越贵、越慢、越持久。
3.4 2026 年:自进化已经是产品功能
与 RSI 仍停留在实验室不同,自进化在 2026 年已经产品化——而且产品化的路径,恰好沿着上面那张表从外往内走:
- 外部文件行:Claude Code 的 Skills、OpenAI Codex 的"演示一次就变成可复用技能"、各种长期记忆库;
CLAUDE.md/AGENTS.md成为跨会话的项目约定载体; - Harness 行:用历史轨迹去搜索更好的框架代码(Meta-Harness)、从轨迹归纳可复用工作流(Agent Workflow Memory)、针对自身失败模式做有界改写并以回归门禁保护落地(Self-Harness);
- 权重行:最少也最前沿。2026 年最值得盯的一类工作是:用一个"元 Agent"在每轮迭代里自己选择——这次是改写 harness,还是做一次权重更新。它把矩阵里的两行接上了。
一个容易被忽略的新问题是评测。传统基准测的是"单次任务做得好不好",而这恰好是自进化不需要证明的东西。首个明确提出"超越片段式评估"的基准 SEA-Eval(arXiv:2604.08988)从知识积累、策略优化、工具进化三个维度测跨任务变化,并揭示了一个尴尬事实:主流 Agent 存在**"片段式失忆症"**——单次表现优秀,却无法跨任务边界积累经验。
对产品团队的意义比对研究者更大:你以为买到的"能力",可能每次会话都在从零开始。
3.5 一个动作,分辨"记忆"与"学习"
这是本文最想交付给你的那个动作,几乎不用任何背景知识:
把记忆库、技能库清空,再跑一遍核心任务。
- 效果断崖式下跌 → 你买到的是记忆(一个"有状态"的系统);
- 效果基本保持 → 那才可能是学习(改变真的留在了系统身上)。
已有公开数据支持这条分界线:
| 证据 | 数字 | 含义 |
|---|---|---|
| 技能检索基线(Skill-GRPO) | 撤掉技能后从 80.5 掉到 60.2 | 增益主要挂在"外部检索"上 |
| 参数内化方法(SDAR) | 推理时完全不用外部技能,仍在多个设定下超过"技能增强"基线 | 改变被写进了策略本身 |
| 记忆检索策略(MemRL) | ALFWorld 迁移准确率 0.479 vs 同类 0.421 vs RAG 0.336;作者刻意冻结记忆库后在留出集仍领先 | 目前"改进超过'多存几条'"的最强公开支持 |
一句大白话:如果一个 Agent 拿走笔记本就什么都不会,那它的进步不在它身上。
四、两者到底是什么关系:一张图
4.1 同一个环,两个收敛点
把前面两章合起来看,会发现 RSI 与自进化用的是同一个结构:
┌──────────────────────────────────────────────┐
│ │
经验 ─┴─► 状态(记忆/提示词/技能/权重)─► 行为改变 ──► 新经验 ─┘
▲ ▲
改动落在哪? 谁来判定"变好了"?
这个环在任务这一侧已经闭上了,而且跑得比想象中稳;在 AI 研发这一侧只闭了一半。
于是本文最核心的一句话出现了:
RSI 不是另一套机制,而是同一个自进化闭环,收敛在了 AI 研发上。
- 闭环收敛在"写代码"上 → 你会得到更好的软件;
- 收敛在"科学实验"上 → 你可能得到更好的发现;
- 收敛在"训练数据、评测、训练基础设施、芯片内核"上 → 你得到的就是 RSI。
这解释了一个看似矛盾的现实:"RSI 尚未发生"与"自进化已经在生产里跑"可以同时为真——因为它们描述的是同一个环上的不同节点,而不是同一张排行榜上的不同分数。
4.2 收敛点决定你得到什么
| 闭环收敛于 | 你会得到 | 属于哪一侧 |
|---|---|---|
| 基准 / 单次任务 | 更强的解题器 | 自进化 |
| 代码 / 软件 / 工作流 | 更好的软件、更低的边际成本 | 自进化 |
| 训练数据、评测、训练基础设施、GPU 内核 | AI 研发能力本身的提升 | RSI |
| 系统自定义的任务与目标 | 开放式进步 | RSI(未实现) |
4.3 六个镜像:把两者放在一张表里
| 维度 | RSI(递归自我改进) | Agent 自进化 |
|---|---|---|
| 改什么 | 改进能力本身(评估器、搜索、训练管线、研究流程) | 任务表现与工作方式(产物、提示词、记忆、工具、技能) |
| 改在哪 | 模型权重 / 训练管线(最内层) | 外部文件 + harness(最外层),极少数触权重 |
| 能留多久 | 跨用户、半永久 | 以跨会话为主(共享技能库才跨用户) |
| 谁判定变好 | 必须靠强验证器;且方向设定仍无自动替代 | 执行反馈 + 用户隐性反馈即可,容忍噪声 |
| 可逆吗 | 难:参数漂移不可回放、难审计 | 易:可清空、可回放、可 diff |
| 谁承担风险 | 全社会(治理问题,外部性高) | 采用它的组织与用户(工程问题,外部性低) |
| 2026 状态 | L3 已跑通,L4 无公开证据 | 已产品化,但多数只是"有状态的记忆系统" |
4.4 一张共享地图:改动落在哪一格
两个社区在 2026 年收敛到了同一张表——更新基质 × 持久化时长(来自 Xinming Tu 2026 年的框架):
| 改在哪里 ↓ / 留多久 → | 单会话内 | 跨会话 | 跨用户 |
|---|---|---|---|
| 外部文件 | 任务内产物、工作记忆 | 技能库、CLAUDE.md / AGENTS.md |
共享技能与知识库 |
| Agent Harness | 运行时动态编排 | 编译式工作流、记忆驱动的框架改进 | 平台默认 harness 升级 |
| 模型权重 | 测试时训练 | 参数化个性化 | 检查点自举、下一代模型 |
这张表最大的用处是定位:拿到一个"会自我进化"的系统,先问它占哪一格。 占得越靠上越靠左,改动越浅、越便宜、越容易回滚;越靠下、越靠右,越深、越贵、越难测。
4.5 边界正在模糊:三个信号
如果只看到这里,结论可能是"两个圈子各玩各的"。但 2026 年最值得注意的趋势恰恰相反——它们在合流,而且合流点可以被精确定位。
信号一:学术上已经坐进同一个会场。 ICLR 2026 出现了(很可能是)世界上第一个专门讨论 RSI 的 workshop,接收 110 篇论文,议程覆盖经验学习、合成数据管线、多模态智能体等方向——而排在第一位宣讲的论文标题是《Agent0: Unleashing Self-Evolving Agents from Zero Data》。"自进化 Agent"的工作,被投进了 RSI 的会场。 这本身就是最有力的证据:研究议程上已经没有围墙。
信号二:工程上,自进化的成果正在变成所有人的默认。 当 Claude Code、Codex 这类平台发布新的规划模式、更好的工具调用规范或更强的失败恢复逻辑时,每一个用户都继承了一个更好的 harness。这条路径把"一个人在一次会话里的发现"直接连到"整个用户群的起点",不带来 RSI 的失控风险,却实打实地抬高全行业的能力基线——这是 2026 年最被低估的一条加速通道。
信号三:机制上,harness 与权重开始被一起优化。 当"元 Agent"每轮自行选择"改 harness 还是做一次权重更新"时,两个圈子在系统层面接上了。它们指向同一条能力固化路径:
任务内产物 → 可复用技能(harness)→ 用成功轨迹训练 → 内化进模型权重
(单会话) (跨会话) (跨用户 / 下一代模型)
沿着这条路径向右走一步,自进化就自然长出了 RSI 的形态。 边界没有消失,只是从"改了什么"移到了"闭环最终收敛在哪里"。
五、三个最容易踩的坑
坑一:把"记忆"当成"学习"
这是自进化侧最普遍的标签通胀。诚实的说法应该是:2026 年绝大多数"自进化 Agent",是"有状态、且状态结构越来越复杂"的 Agent;只有较窄的一个子集真正通过学习改变了策略;更窄的一个子集把改变写进了参数。
用第 3.5 节那个动作就能归位:清空记忆、禁用检索,再看表现。 三个补充问题:
- 它到底改了什么?(权重 / 提示词 / 记忆 / 检索策略 / 工具)
- 改进能迁移到留出任务吗?
- 这次改动可回放、可审计吗?
坑二:把"改 harness"当成 RSI
这个坑更微妙,连 RSI 圈内部都还有争议。
Darwin Gödel Machine 是第一个在真实编码任务上持续自我改进的开源系统(SWE-bench 20% → 50%),它确实改写自己的代码。但批评者指出一个关键事实:做出这些代码改动的,是一个被冻结的模型——模型本身没有被修改。于是社区里出现了相当有力的一问:"论文自己就反驳了'开放式'的主张。"
这个反驳的价值不在于推翻 DGM,而在于点出一条通用判据:
自我修改是机制,不是判据。 一个系统改自己的代码,仍要问:它改进的是任务表现还是改进能力?收益能否跨轮累积?验证信号来自哪里?
按这条判据,DGM 站在 L3,而不是 L4。
坑三:把"AI 加速研发"当成 RSI
最后一条最容易出现在媒体标题里。当 Anthropic 披露"超过 80% 的合并代码由 Claude 撰写"时,标题往往会写成"RSI 来了"。但用第 1 章的三问来看:被加速的是人类的工作流——写代码是"设计机器"里最基础的一环,而 RSI 要求改进的是改进能力本身。
同理,"2028 年前全面自动化 AI 研究者"这类说法是目标时间表,不是已发生的事实。公开预测(例如 Jack Clark 给出的"约 60% 概率在 2028 年底前看到自动化 AI 研发")与"已经发生"是两件事,媒体标题最常把二者混为一谈。
六、风险是两本完全不同的账
两条线的风险不仅程度不同,种类和承担者都不同——这是最容易被"AI 风险"这个笼统词汇掩盖的部分。
| RSI | Agent 自进化 | |
|---|---|---|
| 风险承担者 | 全社会 | 采用它的组织与用户 |
| 风险性质 | 治理问题:能力失控、对齐漂移、权力集中 | 工程问题:供应链、记忆投毒、技能过时 |
| 可逆性 | 低 | 高(但会横向扩散) |
| 已被攻击了吗 | 无公开事件,主要靠推演与危险能力评估 | 是——已有大规模审计数据 |
| 当下最该做的 | 建立跨机构、定期、可比的加速指标;研究可验证的协调机制 | 扫技能、轮换凭据、审计记忆文件;给技能库加来源与回归门禁 |
自进化侧的账已经出单了。 2026 年 2 月一份对近 4,000 个公开 Agent 技能的安全审计显示:
- 36.82% 的技能至少含一个安全缺陷;13.4% 含严重级问题;
- 另有 76 个经人工确认的恶意载荷,其中 91% 同时使用提示注入(作用是"帮 Agent 铺路,让它接受一个人类本来会拒绝的指令");
- 更麻烦的是结构耦合:技能继承 Agent 的全部权限(shell、文件、凭据、消息发送、持久记忆),而持久化路径就是自进化路径——恶意技能可以污染记忆文件,做到"装一次、长期生效";
- 约 17.7% 的技能会拉取第三方内容,意味着攻击者不需要发布恶意技能,只要在某处投毒内容即可。技能作者没做错任何事,用户装的也是热门好评技能,Agent 仍然可能被攻陷。
一句话总结这两本账:RSI 的治理目标是"让放慢成为可能",自进化的治理目标是"让采用变得安全"。 前者是政治问题,后者是工程问题。把它们混成一类,会同时低估 RSI 的政治难度、又高估自进化的安全性。
七、一页速查卡
闭环四问(任何"自我进化"说法,先过这一遍)
① 改什么? 产物 / harness / 模型权重 / 改进方法本身
② 留多久? 单会话 / 跨会话 / 跨用户 / 写进下一代模型
③ 谁验证? 形式化 / 执行测试 / 学习型裁判 / 用户隐性反馈 / 自我感觉
④ 谁担险? 一个用户 / 一个组织 / 全行业
RSI(递归自我改进) Agent 自进化
改"改进能力" 改"任务表现与工作方式"
权重 / 训练管线 外部文件 + harness
跨用户、半永久 以跨会话为主
需要强验证器 + 方向判断 用户反馈即信号,容忍噪声
难回滚、难审计 可清空、可回放、可 diff
少数前沿实验室 每个工程团队
风险外部化(政治/治理问题) 风险内部化(工程问题)
2026:L3 已跑通,L4 无证据 2026:已产品化,多为"有状态的记忆"
三个开关(记住这三个,就能分辨 90% 的说法)
数阶数:改的是"表现"还是"改进能力"?
看基质:改的是外部文件、harness,还是权重?
做测试:把记忆清空,表现还在不在?
最值得盯的一个指标
智能体能力 与 验证能力 之间的差距。
这个差距扩大,才是两条线共同的真实风险。
一句话
RSI = 同一个自进化闭环,收敛在 AI 研发上。
所以"RSI 还没发生"和"自进化已经在跑"可以同时为真。
八、术语对照与延伸阅读
8.1 中英术语对照
| 中文 | 英文 | 说明 |
|---|---|---|
| 递归自我改进 | Recursive Self-Improvement (RSI) | 改进"改进能力"的二阶过程 |
| 有界自我精炼 | Bounded Self-Refinement | 针对固定评估器改进,收敛、可验证 |
| 开放式 RSI | Open-ended RSI | 系统自定义任务与评估器,尚未实现 |
| 智能体自进化 | Self-Evolving Agent (SEA) | 从经验更新外部状态、harness 或权重 |
| 智能体框架 | Agent Harness | 提示词、循环、工具、记忆、控制流 |
| 产物 | Artifact | Agent 的产出(代码、算法、论文、策略) |
| 更新基质 | Update Substrate | 外部文件 / harness / 模型权重 |
| 验证瓶颈 | Verification Bottleneck | 自我改进的上限由验证信号强度决定 |
| 片段式失忆症 | Episodic Amnesia | 单次表现好,但无法跨任务积累 |
| 模型崩溃 | Model Collapse | 自生成数据反复训练导致退化 |
8.2 关键来源
- RSI 综述:《Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops》(arXiv:2607.07663,覆盖 1,250 篇论文,2026-09 更新)——四类改进对象、闭环程度、验证层级
- ICLR 2026 Workshop on AI with Recursive Self-Improvement(2026-04,里约):110 篇接收论文;六个视角:改什么 / 何时改 / 怎么改 / 在哪改 / 安全 / 评测
- 自进化分类学:Shilong Liu《A Taxonomy of Self-evolving Agents》(model / harness / artifact);Xinming Tu《The What & When of Self-Evolving Agents》(更新基质 × 持久化时长)
- 评测:SEA-Eval(arXiv:2604.08988)|供应链审计:Snyk "ToxicSkills"(2026-02,3,984 个技能)
- 工程实证:Anthropic《When AI builds itself》(2026-06)|METR 时间跨度(arXiv:2503.14499)|AlphaEvolve(arXiv:2506.13131)|Darwin Gödel Machine(arXiv:2505.22954)
8.3 站内延伸阅读
- 概念篇|什么是 RSI(递归自我改进):定义、谱系与判定手册 —— L0–L5 阶梯、四个必要条件、12 个常见误解(想深入 RSI 从这篇开始)
- 对比篇|RSI vs 智能体自进化:同一个闭环,两种野心——2026 深度对比与判定手册 —— 长版对比:六维拆解、合流路径与完整来源
- 全景篇|递归自我改进(RSI)深度研究 2026:从智能爆炸到接管全球主机节点 —— 证据、风险、治理与 Plan A 专章
- 方法篇|Opus 5.2 深夜灰度,RSI 真来了吗?——把一条刷屏新闻拆成三层证据 —— 一套可复用的新闻核查方法
- 事件篇|当 1,200 个智能体自己建了留言板:OpenAI–Hugging Face 事件技术全解 —— 智能体自主攻击的完整复盘
- 工程篇|控制流归谁,上下文给谁:Agent 工程的四条第一性原理 —— harness 这一层到底怎么设计
结语
两个词之所以让人兴奋又让人困惑,是因为它们描述的不是两种能力,而是同一个结构在两个方向上延伸——一个把"经验变成状态、状态改变行为"的环。
2026 年的真实图景是:这个环在任务这一侧已经闭上了;在 AI 研发这一侧只闭了一半——执行(写代码、做实验、优化内核)闭上了,判断(什么值得做、什么算做对了)还开着。
所以下次有人问你"AI 到底能不能自我进化",最好的回答不是说"能"或"不能",而是反问一句:它的闭环,收敛在哪里?
本文属「一叶一世界」栏目第 1 篇。该栏目一篇文章只讲清一个概念:给出定义、一张图、一份速查卡。所有数据均来自公开可核查的一手材料(综述、官方报告、审计报告),机构观点均属原机构表述;涉及"是否已实现"的判断,以公开证据为准。
读者留言
COMMENTS 暂无还没有留言,来说第一句?