第 13 章 · 前沿专题
前十二章覆盖了 2026 年 Agent 工程的"生产共识"。本章是三个高薪高门槛的前沿方向:用训练提升 Agent 能力上限、全双工语音、编码智能体内核。每个方向给"能落地"的深度——原理、管线、工具链、与前面章节的衔接点。
13.1 后训练:Agent 能力上限的来源
Prompt 工程与工具设计有天花板;模型自身的能力上限由**后训练(post-training)**决定。2026 年的标准管线:
阶段一 SFT(监督微调)
数据:成功轨迹(messages + tools + 助手的完整输出序列)
作用:教会"形态"——怎么用工具、输出什么格式。稠密监督但 off-policy
(数据来自别的策略分布,学生只会模仿没见过自己的错误)
阶段二 偏好优化 / 可验证强化
DPO:同场景 成功/失败 轨迹配对,直接优化偏好(简单稳定,无需奖励模型训练)
RLVR:可验证奖励的强化学习(GRPO/DAPO 算法族)——奖励由"验证器"给出:
单元测试通过、断言满足、工具调用正确。on-policy(模型在自己的分布上
探索),但奖励稀疏(长轨迹只有终局一个信号)
阶段三 On-Policy Distillation(OPSD,2026 年兴起)
学生模型自己滚动采样,教师模型对每个学生动作给稠密反馈
——把"RL 学到的能力"压缩进更小/更快的模型,解决 RL 后的部署成本问题
Agentic RL 的两大工程难点(也是岗位 JD 里"通过 SFT、RL 提升 Agent 能力上限"的实际内容):
- 长程 credit assignment:一个 50 步任务只有终局成功信号——第 3 步的错误和第 47 步的错误被同等惩罚,训练信号噪声极大。前沿方向:过程奖励模型(PRM)、步级信用分摊(MileGPO 类工作);
- 可验证奖励需要可靠执行环境:数学题的验证器是答案比对,Agent 任务的验证器是执行环境——代码跑不跑得通、断言过不过、文件状态对不对。这就是第 6 章沙箱(尤其快照与确定性回放)被称为"RL 基础设施"的原因:没有可重复的执行环境,就没有可信的奖励信号。
数据飞轮:从生产轨迹到训练集
前九章的建设在这里收网——你已有的评测、轨迹、反馈系统就是数据飞轮的上游:
完整轨迹采集(第 9 章 9.4,按会话归档)
+ 结果信号(任务成败 / 用户反馈 / 评测分)
→ 导出 schema:messages 序列 + tools 声明 + reward
→ SFT 集:成功轨迹(过滤:评测分达标 + 无敏感信息,脱敏复用第 11 章审计链路)
→ DPO 对:同一场景的 成功/失败 轨迹配对
→ 训练(TRL / LLaMA-Factory:SFT → DPO → GRPO 逐段可插拔)
→ 回灌验证:微调后模型跑同一评测集,pass_rate 对比
这条管线的每一环都在前面的章节建好了——评测体系就是训练数据的质量门禁,没有第 9 章就没有可信的"微调后变好了"。
13.2 全双工语音 Agent
回合制语音(说完 → 转文字 → 生成 → 逐句播)与全双工(可随时打断、自然抢话)的差距是纯工程,三块积木:
- 流式 ASR:音频分块进流式识别(faster-whisper 流式解码),拿到带时间戳的部分假设——不等说完就开始理解;
- VAD(语音活动检测):判断用户在说话/停顿,管理轮次——当前句尾静音 > 500ms 判定说完(阈值是体验的核心调参点);
- Barge-in(打断):AI 播报期间检测到用户开口 → 立即停止 TTS 播放 → 中断当前的生成链 → 用户的插话进入新一轮。工程关键在取消语义:TTS 是分句排队播放的,打断要清空播放队列 + 终止正在合成的句子 + 取消进行中的 LLM 调用(否则退了播放声音还在烧 token)。
端到端延迟预算(全双工体验的硬指标,目标 < 1.5s):
用户停止说话 → VAD 判定(~100-300ms)
→ 流式 ASR 出文本(~200-400ms)
→ LLM 首 token(~300-800ms,流式)
→ TTS 首包音频(~200-300ms,逐句流式合成)
升级路径:WebRTC 传输(替代 WebSocket 音频,抗抖动/回声消除)、Omni 端到端模型(语音直接进模型,跳过 ASR/TTS 两跳延迟,但可控性下降)。Proteus 已有的 STT→Agent→TTS 流水线与分句 TTS 是第一版 barge-in 的现成底座。
13.3 编码智能体内核
AI Coding 工具(Claude Code / Codex / Cursor 类)是当前商业上最成功的 Agent 形态,其岗位(AI Coding 工具研发专家)考察的就是"harness 内核"的理解。分析框架:
编码智能体 = 模型 + Harness。模型决定能力上限,harness 决定兑现率。对 11 个编码智能体的源码研究(《Harness Engineering》,2026)显示:各家差异集中在循环控制、上下文管理、扩展机制三处,而非工具本身。
harness 的六个核心机制(与前面章节一一对应,这正是"通法"的证据):
| 机制 | 在编码 Agent 里的形态 | 对应章节 |
|---|---|---|
| Agent Loop | 读文件→改代码→跑测试→修错的循环,带轮数/token 预算 | 02 |
| 上下文管理 | 项目记忆文件(常驻约定)+ 对话压缩 + 子智能体隔离脏活 | 03 |
| 工具编排 | 文件读写/shell/搜索 + 权限分级(只读直通、写操作确认) | 05、11 |
| 沙箱执行 | 测试与命令跑在受限环境 | 06 |
| Hook | 生命周期拦截(提交前跑 lint、工具调用前后审计) | 05 |
| Skill/子智能体 | 专项能力包 + 派生研究任务 | 03、07 |
动手路径(这是三个方向里最"自助"的):以任意开源 CLI Agent(如你自己实现的第 2 章升级版)为对象,逐机制与 Claude Code 公开文档对照,写"它怎么做 ↔ 我怎么做 ↔ 我会怎么改"的三方笔记。做完这份笔记,编码工具岗位的核心面试题(Agent Loop / 上下文 / 权限 / Hook / Skill / MCP)每一条你都有第一手答案。
13.4 方向选择建议
| 你的背景/兴趣 | 建议切入点 | 先修章节 |
|---|---|---|
| 评测/数据功底,想碰训练 | 数据飞轮(13.1)——轨迹导出 + 微调回灌 | 06、09 |
| 音视频工程背景 | 全双工(13.2)——barge-in 的取消语义 | 02、12 |
| 系统工程背景、求职 Coding 工具岗 | 内核拆解(13.3)——三方对照笔记 | 02-07 全部 |
| 研究倾向 | Agentic RL 的 credit assignment | 06、09、13.1 |
三个方向的共同点:都建立在前十二章之上——没有可靠的执行环境、评测与数据管道,三个方向都无法起步。这也是为什么它们"前沿"却不是空中楼阁。
实现作业
- 数据飞轮:给第 9 章的评测轨迹加导出器——SFT(JSONL:messages+tools)与 DPO(同场景成败配对)各一份,跑通 LLaMA-Factory 或 TRL 的一次小模型微调,用原评测集对比前后 pass_rate;
- Barge-in:给语音流水线加打断——TTS 分句播放 + VAD 检测 + 播放队列清空 + LLM 调用取消,实测端到端响应 < 1.5s;
- 内核对照笔记:选 5 个机制(循环/压缩/权限/Hook/子智能体),对照一个开源 CLI Agent 与 Claude Code 文档,产出三方对照文档——这份文档同时是求职作品。
深入材料
- Nathan Lambert, RLHF Book 与 Post-Training Course(rlhfbook.com,后训练系统教材)
- TRL 文档(github.com/huggingface/trl,SFT/DPO/GRPO 工具链)
- arXiv 2609.31900(SFT/RLVR/On-Policy Distillation 协同的机制研究)
- Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents(2026,11 系统源码研究)
- LiveKit Agents / Pipecat 文档(实时语音 Agent 框架)
- WebRL、Agent Q(agentic RL 的代表性工作)
读者留言
COMMENTS 暂无还没有留言,来说第一句?