论文精读:Constitutional AI——用一部「宪法」替代人工红队标注

RLHF 把模型调得乐于助人,但它有两个昂贵的天生缺陷:人类偏好标注又贵又慢(每轮迭代都要雇人对比打分),人类红队又危险又低效(让真人想尽办法诱导模型作恶)。Anthropic 2022 年 12 月的论文《Constitutional AI: Harmlessness from AI Feedback》(Bai et al., arXiv:2212.08073)给出的答案是:把「什么算好回答」写成一部成文原则,让模型自己照着批评自己。RLHF 的全景背景见站内《RLHF 全景》,本文精读 CAI 的两段机制。

第一阶段:自我批评 + 修订(监督学习)

CAI 的第一步不是训练偏好模型,而是造数据:

  1. 先用一个普通 RLHF 模型对有害提示生成初始回答(此时它多半是拒答或含糊);
  2. 把一部「宪法」——论文版本约 75 条成文原则——喂给模型,让它对照原则批评自己的回答(「这个回答是否符合『不助长非法行为』的原则?问题在哪?」);
  3. 让模型按批评修订原回答;
  4. 可以多轮迭代,逐条套用不同原则。

所有(提示、修订后回答)对构成新数据集,拿去做监督微调。这一步的产物已经不同寻常:一个不回避但无害的模型——论文标题里的 harmlessness 正来自于此。传统 RLHF 的有害性训练容易把模型调成一个「什么都不敢说」的客服(过度拒答),CAI 的作者明确把「non-evasive(不逃避)」写进目标:模型该解释为什么不能帮、给出安全边界内的替代方案,而不是冷冰冰地拒绝。

第二阶段:AI 反馈替代人类反馈(RLAIF)

第二阶段做偏好训练,但比较标签来自 AI 而非人类:

  1. 让模型对同一提示生成两个回答;
  2. 把宪法原则(每次一条)作为评判标准写进提示:「哪个回答更好地遵循了原则 X?」——模型输出偏好判断;
  3. 这些 AI 偏好对训练出偏好模型(或直接用做 DPO 式优化),再跑强化学习。

人类的角色从「逐条标注」退到「制定原则」:几千条人类红队标签的工作量,被几十条原则 + 模型自我生成的偏好数据替代。论文口径下,人类标注量级显著下降,且无害性维度主要靠 AI 反馈达成。

与 RLHF 的对照:改了什么、留了什么

RLHF Constitutional AI
偏好标签来源 人类标注员 AI 按原则生成(RLAIF)
对齐标准存在于哪 隐含在标注分布里 显式成文(可审计、可修改)
有害性数据 人类红队对抗 模型自我批评 + 修订
人类角色 大规模标注 撰写与迭代原则
风险 标注员负担与暴露 AI 评判的系统性偏差

CAI 最被低估的贡献是对齐标准的显式化:RLHF 的「价值观」埋在几万条标注的统计分布里,外人无法审计;CAI 把它写成一纸宪法——Anthropic 后来公开了自己的宪法文本并征集公众意见,原则可讨论、可修订、可追责。这份「对齐的可解释工程化」影响了整个行业对 AI 政策的写法。

遗留问题:AI 给 AI 打分的循环

CAI 没有解决的三个问题:

  1. 评判偏差的遗传:AI 反馈学的是「模型眼里的好」,如果基础模型对某类内容系统性误判,RLAIF 会把这个偏差放大并固化——评判模型自身的校准成为新瓶颈;
  2. 原则之间的冲突:诚实与无害、自主与服从在具体案例里常打架,75 条原则没有给出裁决顺序,冲突场景的实际行为靠训练的随机性决定;
  3. 宪法由谁定:Anthropic 的公众征集是同行的先声,但「一家公司的价值观写进所有用户的模型」这个治理问题,CAI 只是把它显式化了,并没有回答。

结语

Constitutional AI 的核心洞察一句话:对齐不必藏在标注数据里,它可以被写成文字。把价值观显式化之后,「改对齐」从重新标注几万条数据,变成修订一页原则文档再跑一轮自动化流程——工程效率的跃升之外,更重要的是它把 AI 的行为准则变成了可公开讨论的对象。今天各家模型规范(模型卡、使用政策、系统提示词里的行为准则)的写法,都能看到这篇论文的影子。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?