系列说明:这是「智谱 RSI 最新进展深度研究」的中篇,共三篇。上篇 复盘事件并拆解"稠密反馈"三个工程案例;中篇(本文)做 RSI 分级定位、拼上 GLM-6.0 的三支柱拼图,并逐条核查七个流传最广的数字;下篇(即将发布)谈五条边界线、风险管理与给三类读者的行动清单。
从稠密反馈到完全自训练:智谱 RSI 最新进展深度研究(中)· RSI 分级定位与七组数字口径核查
上篇拆完了技术。中篇要回答一个更容易被标题带偏的问题:这件事在递归自我改进(RSI)的坐标系里,站在哪一级?
答案需要用现成的工具来判定,而不是靠感觉。本站已有两套工具可以直接使用:概念篇的 L0–L5 强度阶梯与验证层级,以及对比篇的"闭环四问"。
三、坐标系定位:这落在 RSI 的第几级
3.1 用 L0–L5 逐级排除
| 级别 | 判据(一句话) | 本次是否命中 | 依据 |
|---|---|---|---|
| L0 工具化辅助 | 模型帮人写代码,人做全部决策 | ✗ 已被越过 | Infra Agent 自主提出假设、实施修改、执行实验;人退到目标定义与关键审核 |
| L1 部署时自我精炼 | 针对固定评估器反复改输出,单次任务内有效 | ✗ 已被越过 | 工作跨两周、跨多个子系统,产物落进骨架库与上游仓库,不是单次会话内的输出筛选 |
| L2 训练时自我迭代 | 用自生成数据/自博弈更新权重 | ✗ 未命中 | 长文未披露任何"模型自训权重"环节;GLM-5.3 相对 5.2 的提升官方明确来自后训练,且由人主导 |
| L3 算法与元层改进 | 改的是改进方法本身(评估器、搜索、训练管线、基础设施) | ✅ 命中 | 改的是承载自身迭代的推理系统:验证入口、算子、并行策略、并发边界、服务栈;经验以骨架库/上游 PR 形式回流 |
| L4 开放式 RSI | 系统自己生成任务、评估器与目标 | ✗ 无公开证据 | 长文明确:"选择目标、设定边界、判断风险,仍然是人的工作";优化目标与系统边界由工程师定义 |
| L5 完全自主继任者 | 自主设计、训练、验证下一代模型 | ✗ 未实现 | 长文原文:"我们还没有走到递归自我改进" |
结论:L3 命中,L4 未到。 这与站内全景篇的判断("有界自我精炼已工程化,开放式 RSI 尚未发生")完全一致,只是这次提供了一个更硬的样本:不是论文里的原型,是上线跑流量的生产系统。
3.2 验证层级:为什么"基础设施"最先闭合
本站讨论过一条重要规律:自我改进的可靠性沿着验证信号强度递减,而验证信号分四层。把本次证据对号入座,结构非常整齐:
| 验证层级 | 信号 | 可靠性 | 本次的对应物 |
|---|---|---|---|
| 1 形式化验证 | 证明、类型系统 | ⭐⭐⭐⭐⭐ | 未使用(推理系统无法形式化) |
| 2 执行/测试反馈 | 编译、精度比对、微基准、Trace、端到端指标 | ⭐⭐⭐⭐ | 本次几乎全部落在这里 |
| 3 学习型裁判 | 奖励模型、LLM Judge | ⭐⭐⭐ | 未出现在长文的核心链路 |
| 4 内在自评 | 置信度、自我感觉 | ⭐⭐ | 未使用(长文强调"不能仅凭现象之间的相关性确认根因") |
由此得到一个干净的推论:智谱这次的"稠密反馈",本质上是一次"层级 2 信号的人工增密工程"。 他们没有发明新的验证手段,而是把已有的测试、日志、Trace、微基准重新组织,让它们能在 Agent 需要的时候被精确调用。
这也解释了为什么基础设施层会成为 RSI 最先闭合的一段:
- 信号天然是层级 2 的。 编译能不能过、数值对不对、跑得快不快——三个信号全部客观、全部可自动化、分辨率以纳秒计。
- 问题可以被局部化。 一次修改的影响面在算子、线程、执行区间这一级可以被隔离,不需要重建整个世界模型。
- 失败可以回滚。 改坏了就 revert,不像权重更新那样"参数漂移不可回放"。
一句话概括:基础设施是 AI 工业里"考试最好打分"的那门课,所以它最先被自动化。
3.3 闭环四问:这次到底是自进化还是 RSI
| 问题 | 本次答案 | 归类倾向 |
|---|---|---|
| ① 改什么? | 推理服务栈、算子、并行策略、并发边界、验证入口——不触模型权重 | 自进化侧(harness / 外部系统) |
| ② 留多久? | 跨会话、跨版本:骨架库 + 上游 PR(PR #1180 已进社区主线)+ 写回验收标准 | 持久,且部分溢出到组织之外(开源社区) |
| ③ 谁验证? | 执行/测试反馈(层级 2)+ 工程师审核关键修改 | 强信号为主 |
| ④ 谁担险? | 采用它的组织(工程风险,可回滚) | 风险内部化 |
于是得到本报告最核心的一次定性:
按"改什么",它是自进化;按"闭环收敛在哪里",它是 RSI。
站内对比篇给过一句判据——"闭环收敛在训练数据、评测、训练基础设施、芯片内核上,你得到的就是 RSI"。智谱这次改的正是推理基础设施(与训练基础设施同属"承载自身迭代的系统"),并且明确说"这项工作将直接改变下一代模型的训练方式"。所以它不是"AI 帮人写代码"这类 L0 故事,而是 RSI 三根支柱中"基础设施自我优化"这一支的首个公开工程实证。
需要补一句边界说明:推理侧优化不等于训练侧加速。 把 3.22× 的推理吞吐等同于"模型训练快 3 倍",是本次最容易被传播、也最容易被专业读者挑错的误读(见第五章)。
3.4 关于"没改权重就不算"的两个反驳
RSI 圈内部有一种常见质疑:"改 harness/基础设施不算自我改进,因为模型本身没变。" 这个质疑在 Darwin Gödel Machine 的争论里出现过——"做出这些代码改动的,是一个被冻结的模型"。按同一把尺子量智谱这次,需要给出两个层面的回答:
第一,按严格定义,这个质疑是对的。 如果 RSI 被定义为"系统改进自己的改进能力,且改变留在系统自身(权重/训练管线)",那么"修改外部推理栈"确实更靠近自进化。本报告因此在定性上把它称为 RSI 的工程前体,而非 RSI 本身。
第二,但"改哪些东西能产生复利"这个问题,比"改的东西在不在模型里"更本质。 站内算子篇引用过一个关键表述,值得再引一次:
"AI 不必修改自己,只要参与制造更快的自己。"
这句判断的推理结构是:模型能力迭代速度由"单位时间能跑多少实验"决定;实验效率由训练与推理吞吐决定;吞吐由算子、通信库、编译器、芯片决定。这一层基础设施的自动化完全不触碰权重,却直接改写了"算力换智能"的汇率。 当 AI 接管这一层,递归就成立——定义 RSI 的最小充分条件从来不是自我意识,而是系统改进的产物反哺系统自身的改进速度,形成正反馈回路。
所以准确的表述是:智谱这次闭合了"推理基础设施"这一段的回路,它是完整 RSI 回路的一个必要组成段,而不是全部。
3.5 谨慎的量化:这次闭环的"复利"有多大
不夸大,逐项列清楚三个可用的量,并说明各自不能推出什么:
| 指标 | 数值 | 口径 | 不能推出什么 |
|---|---|---|---|
| 端到端服务吞吐 | 相比同一硬件上的初始基线 3 倍(长文图示 T+0 1.00× → T+13 3.22×) | 推理侧,同硬件 | ❌ 不能推出"相比英伟达快 3 倍";官方表述是"硬件效率与单 token 成本已达到相当水平" |
| 单位 token 推理成本 | 较年初 −80% | 综合口径(含架构重设计、量化、国产卡、Infra Agent 加速) | ❌ 不能单独归因给 Infra Agent |
| 算子开发周期 | 缩短一半 | 中报电话会口径 | ❌ 与"不到两周上线"是两套基线,不可并列相加 |
如果一定要给一个"复利"的量化直觉,最稳的表述是:这次闭环在"人时"维度上有明确节省(算子开发周期减半),在"系统"维度上有明确增益(同硬件 3 倍吞吐),而在"模型能力"维度上没有可直接归因的增益证据。 前两者真实但有限,第三者才是 RSI 叙事真正要证明的东西——尚待 GLM-6.0 兑现。
四、拼图:GLM-6.0 的三支柱,与这次的对应关系
4.1 官方口径里的"完全自训练"是什么
智谱在港交所融资公告的释义部分,给出了"完全自训练"(Fully Self Training)的定义,并明确它是公司对 RSI 的具体技术表述:
下一代 GLM 模型将在上一代 GLM 所搭建的环境里训练,形成递归式自我改进(RSI)闭环,涵盖数据自产、环境自造、基础设施自我优化三个维度。
| 支柱 | 官方定义要点 | 落到具体动作 |
|---|---|---|
| 数据自产 | 不再完全依赖人类标注 | 模型间自我对弈、规则校验、执行验证、模型评审、人工抽检 → 自动生成/筛选/积累高质量训练数据,回流到预训练、中训练、后训练各阶段 |
| 环境自造 | 让智能体去采集和转化真实世界的任务 | 智能体自己试做、自己生成验证器、自己检查任务是否可解,持续扩充训练环境的数量、类型与复杂度;让任务环境成为"可规模化生产及复用的训练资源" |
| 基础设施自我优化 | 让模型帮忙优化自己赖以运行的训练与推理系统 | 协助开发与优化算子、内核、调度、缓存和服务栈,使模型逐步参与支撑其自身迭代的基础设施升级 |
唐杰在 8 月底中报电话会上用更通俗的话讲过同一个意思:让模型可以自己学习预训练、中训练、后训练,自己搭建平台,让整个训练过程完全自主化。
4.2 三支柱的进度表(关键:只有一根有公开工程实证)
| 支柱 | 已公开证据 | 证据等级 | 缺口 |
|---|---|---|---|
| 基础设施自我优化 | 长文三案例(含上游 PR #1180);官方发布文技术栈(ReplaySSM/W8A8/LayerSplit/EPD);中报口径"算子开发周期缩短一半";10 万卡集群承载真实流量 | A:官方一手 + 代码物证 + 生产流量 + 财务口径 | 具体芯片型号与数量未官方确认;Infra Agent 在总工作量中的占比未量化 |
| 数据自产 | 融资公告的定义;"30T token 多模态预训练语料"(该语料是否以自产为主未披露);GLM-5.3 的"任务环境规模化训练"提法 | C:战略表述 + 间接线索 | 合成数据占比、自博弈产物进入各训练阶段的比例、质量校验通过率,均未公开 |
| 环境自造 | 融资公告的定义;中报提到"建设贴近真实专业工作的任务环境" | C:战略表述 | "智能体自己生成验证器"的具体机制、可解性判定标准、环境规模,未见公开材料 |
换句话说:9 月 17 日的长文,等于为三支柱中的第三支柱交出了第一份可核查的作业;另外两根目前仍停留在公告与路线图层面。 这不是否定,而是把"已兑现"与"已承诺"分开标注——对任何要引用这套叙事的人来说,这个区分是必须的。
4.3 为什么是"基础设施"这一根最先落地
- 奖励最密。 编译通过率、数值正确性、执行时间——三个信号客观、自动、细粒度,不需要人类判定"这个回答好不好"。
- 目标最清。 吞吐、TTFT、单 token 成本是纯工程指标,目标可被标量定义,而"什么是更好的研究问题"至今无法标量。
- 回滚最易。 代码可 diff、可 revert、可回放;权重漂移不可回放、难审计。
- 边界最实。 工程师可以给出"Prefill+KV Transfer 差距不超过 5%"这种可验证的约束——这在开放式研究里做不到。
反过来说,这也预示了后续两支柱的难度来源:数据自产要解决"合成数据的质量谁来判",环境自造要解决"任务的可解性与价值谁来定"。 这两个问题的共同点,是它们都要求系统自己生成评估标准——正好是 L4(开放式 RSI)的门槛所在。
4.4 钱和人:235 亿港元压在"完全自训练"上
| 用途 | 金额 | 占比 |
|---|---|---|
| 下一代 GLM 基础模型与**"完全自训练"体系**研发,以及大规模训练/推理/算力基础设施部署升级 | 约 235 亿港元 | 60% |
| 业务拓展、战略投资与潜在并购 | 约 59 亿港元 | 15% |
| 优化资本结构与补充运营资金 | 约 98 亿港元 | 25% |
公告同时说明,全部所得款项预计将在 2028 年 6 月 30 日前悉数动用;并提到当前"优质算力资源的供给及交付条件较为有利",将综合推进算力采购与租赁,投入芯片适配、算子开发、集群互联和性能调优,建立"来源多元且可灵活调配"的算力供给体系。
一个容易被忽略的细节:公告把"自研推理引擎和服务栈"单独列入投入清单,覆盖多模态编码、提示词预填充、逐 Token 解码、量化、缓存、通信及弹性扩缩容——这正是上篇那套技术栈的财务版本。叙事与预算对得上,这一点比叙事本身更重要。
4.5 距离"完全自训练"还差什么
按智谱自己的阶梯(Chat → Coding → Agent → Cowork → Autonomous AI),从 Cowork 到 Autonomous AI 的门槛是**"模型能否自己判断做的对不对"**。用这句话回看三支柱,缺口变得非常具体:
| 要跨的门槛 | 现在的状态 | 需要什么 |
|---|---|---|
| 模型自己判断"做得对不对"(推理/工程域) | 基本具备:编译、数值、性能、Trace 全是强验证信号 | 稠密反馈的进一步工程化与自动化 |
| 模型自己判断"数据好不好" | 部分具备:规则校验、执行验证可用;但"高质量"仍含人类品味 | 可扩展的自动评估器 + 抽检机制 |
| 模型自己生成"该做什么任务" | 不具备:任务价值判断仍是人类专场 | 开放式目标生成——即 L4 的门槛 |
| 模型自主设定"风险边界" | 不应具备(官方立场):"这条线应当由人来守" | 治理与对齐机制,而非能力 |
最稳的预期是:基础设施自我优化会在 2026–2027 继续快速推进并大量复用;数据自产会在"可验证任务"范围内扩大;环境自造与开放式目标生成仍是研究前沿。 任何把 2026 年的进展直接外推到"自主继任者"的说法,都跳过了 4.3 节四条结构性原因中的后两条。
五、口径核查:哪些数字成立,哪些被误读
这一章是全篇最实用的部分。传播中,这次事件已被压缩成几个漂亮的数字:10 万卡、3 倍、1/40、62 万亿。它们每一个都能成立,但每一个都有前置条件;把条件去掉,意思就会翻转。
5.1 总表:七组数字的成立条件
| 数字 | 成立的说法 | 常见误读 | 证据等级 |
|---|---|---|---|
| 3 倍 | 相对同一批国产硬件上的初始基线,端到端服务性能提升约 3 倍(T+0 1.00× → T+13 上线 3.22×) | "国产卡性能是英伟达的 1/3"或"比英伟达快 3 倍" | A(官方一手,含性能曲线图) |
| 1/40 | 面向用户的价格约为 Claude Opus 4.8 的 1/40(输出价 $25 vs 半价期 $0.6) | "推理成本只有英伟达的 1/40" | A(官方定价)+ B(媒体明确提示无硬件成本数据) |
| 10 万卡 | 承载本次线上流量的国产芯片集群规模达 10 万张量级 | "官方确认 10 万张某型号芯片" | B(官方仅称"大规模国产芯片集群";数量为媒体口径) |
| 62 万亿 token | 上线 6 天内,模型在 OpenCode + OpenRouter 双平台的累计调用量 | "智谱单模型 6 天消耗 62 万亿(占全平台)" | A(官方口径)+ B(第三方报道) |
| 平台 +20% | 该模型带动 OpenCode/OpenRouter 整体调用量提升超过 20% | 与"62 万亿"混为一谈 | A(中报电话会口径) |
| 不到两周 | 从模型适配到生产可用的跨度(T+0 → T+13 上线) | "两周做完一整套推理系统" | A(官方一手) |
| 缩短一半 | Infra Agent 使算子开发周期缩短约一半(中报口径) | 与"两周"相加或绑定理解 | A(中报电话会口径) |
5.2 "3 倍"的分母到底是什么
- 分母:同一批国产硬件上的初始基线(图 1 中标注为 W8A8 基线,T+0 = 1.00×);
- 分子:经过异步调度、排序算子优化、逐层缓存切分、上下文并行、KV 传输与计算重叠、混合缓存量化、分块 MQA、预填充反量化算子、激活与量化融合算子、线性注意力优化等一系列改动后的 T+13 版本 = 3.22×;
- 官方对跨厂商比较的表述:是"硬件利用效率与单 Token 成本均达到主流 NVIDIA GPU 的相当水平",而不是"超过"。
所以"3 倍"衡量的是同一硬件上工程优化的收益。这其实是个更有价值的信息:它说明国产卡的瓶颈很大程度上在软件栈而非硅片——同一批硬件,仅靠系统层优化就能拿到 3 倍。但它不能被读成"国产芯片 vs 英伟达"的性能比。
5.3 "1/40" 是价格,不是成本
这是本次传播中被媒体明确纠正过的一条,值得重复:
所谓"1/40",并不是说国产芯片的硬件推理成本只有海外 GPU 的 1/40。目前并没有公开数据支持这样的比较。更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了 Claude Opus 4.8 的大约 1/40。
成本结构里至少包含四层:硬件单价与折旧、集群利用率、软件栈效率(Infra Agent 的作用面)、以及商业定价策略(限时半价、开源引流)。把"价格比"读成"成本比",会把一个定价与工程混合的结论,误当作一个纯硬件结论。
5.4 "10 万卡"与芯片型号:官方说到哪里为止
| 来源 | 措辞 |
|---|---|
| 智谱官方发布文(8/26) | "我们首次在大规模流量中尝试用大国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接" |
| 中报电话会 | "已实现 10 万卡级国产芯片的规模化低成本推理" |
| 媒体(观察者网等) | "由 10 万张国产算力芯片组成的超大集群全程承载,累计处理请求流量高达 62T Token" |
| 媒体(钛媒体) | "官方没有确认具体供应商,也没有公布具体芯片数量……有知情人士透露训练或由海光 DCU 等国产芯片支持" |
结论:"10 万卡级"是可用的官方口径;"具体型号与供应商"是不可用的传闻。 引用时建议写"10 万卡级国产芯片集群(型号未公开)",而不是"10 万张某厂商卡"。
5.5 "62 万亿"与"带动 20%":两个不同的问题
- 62 万亿 / 6 天,回答的是"这个模型有多受欢迎"——它是双平台累计调用量;
- 平台整体调用量提升超过 20%,回答的是"它对平台的带动效应有多大";
- 另有一条单日口径:Ox-Alpha 上线首日冲至 OpenRouter 榜首,刷新单日 token 用量历史纪录,相较平台此前最大 token 量提升 4 倍。
三条都可以用,但要各归各位:62 万亿是模型量,4 倍是单日峰值比,+20% 是平台增量。混着说就会变成"智谱让 OpenRouter 流量涨了 20 倍"这类错误。
5.6 "不到两周"与"缩短一半":两套基线,不能相加
- "不到两周"描述从模型适配到生产可用的整体跨度;
- "缩短一半"描述 Infra Agent 对算子开发周期的加速效果。
两者的时间窗口、统计对象、口径来源都不同。把它们理解成"本来要四周,Agent 压到两周,其中算子部分省了一半"是一种合理但未经官方确认的解读。稳妥写法是分别引用,不作合并计算。
5.7 三条必须保留的限定语
- "取代我们"是修辞,不是结论。 长文自己写了:"当然,我们还没有走到递归自我改进。选择目标、设定边界、判断风险,仍然是人的工作,而且我们认为,在相当长的时间里,这条线应当由人来守。"引用前半句而删掉后半句,是本次最常见的断章。
- PR #1180 是"内容吻合的物证",不是"归属证明"。 已核实该 PR 存在、日期吻合、描述与长文一致(tf32x3、避免长上下文精度损失)。但 PR 提交者与智谱的雇佣关系无法从公开信息确认——它的价值在于证明"这类修复确实发生在真实上游项目中",而非证明归属。
- "数千个漏洞"属于能力自述。 长文提到 2025 年 10 月启动安全能力增强研究后,"安全伙伴使用 GLM 在真实代码库中发现了数千个漏洞",并为此设计了受信访问计划。这是官方自述,没有第三方审计数据支撑;但它与"模型能力改变网络安全格局"这一判断方向一致,值得作为风险项记录。
5.8 未获取清单(写清楚我们不知道什么)
| 序号 | 未获取信息 | 为什么重要 |
|---|---|---|
| 1 | 国产芯片具体型号、数量、互联拓扑细节 | 决定"3 倍"的硬件天花板与可复制性 |
| 2 | Infra Agent 在总工作量中的占比(改写行数、决策数、被回滚比例) | 决定"AI 主导"这一表述的强度 |
| 3 | 人工介入的时点分布(哪些修改必须人审、占比多少) | 决定"人的位置"到底是瓶颈还是关口 |
| 4 | 骨架库的规模与复用率 | 决定"回流机制"是否真的形成复利 |
| 5 | 3.22× 曲线中各优化项的边际贡献拆分 | 决定能否对外归因"哪一类优化最值钱" |
| 6 | 合成数据/自博弈产物在 GLM-5.3 与 6.0 训练中的实际占比 | 决定"数据自产"支柱的真实进度 |
| 7 | "智能体自己生成验证器"的机制与准确率 | 决定"环境自造"是否具备可扩展性 |
| 8 | 本次优化对训练侧的任何直接收益证据 | 决定"RSI 前体"结论的强度 |
5.9 一个反向检查:如果这件事被夸大了,我们应该看到什么
好的核查不止于"看有没有漏洞",还要能预设可证伪条件。如果这次的真实进度远低于叙事,以下几件事应该先后出现(截至本文撰写日尚未观察到):
- 上游 PR 无法复现——应看到社区对 #1180 的技术质疑或回退;目前未见。
- 生产流量上不去——应看到 Ox-Alpha/GLM-5.3-Flash 的调用量在首发热度后迅速回落至低位;目前公开口径为 6 天 62 万亿并带动平台 +20%,至少短期未证伪。
- 3 倍只存在于自家曲线——应看到独立第三方压测无法得到接近的同硬件提升幅度;目前无独立复测,这是本次证据链最大的外部缺口。
- GLM-6.0 的"完全自训练"变成纯营销词——应看到其发布时没有"预测/中训/后训自产数据占比"这类可核查指标;这才是 2026–2027 年真正需要盯的验收点。
中篇小结:定位结论是 L3 命中、L4 未到,性质是"RSI 三支柱中基础设施自我优化这一支的首个公开工程实证";GLM-6.0 的另外两根支柱目前只有公告级证据。七组数字全部可用,但必须带上各自的口径前置条件——其中最重要的两条是:"3 倍"的分母是同硬件初始基线,"1/40"是价格比而非成本比。
继续阅读:上篇(事件切片与三个工程案例)|下篇(即将发布)五条边界线、五条可复用做法与五个评审问题。
本文为公开信息整理与工程逻辑分析,不构成投资建议;凡未经官方确认的媒体报道均已标注证据等级;数据截至 2026 年 9 月 17 日。
读者留言
COMMENTS 暂无还没有留言,来说第一句?