安全不是一个数字
「这个模型安全吗?」这个问题没法直接回答。安全不是一个标量,而是一组维度上的分布:一个在有害内容上拒答率很高的模型,可能同时把大量正常问题也拒了;一个越狱攻不破的模型,可能在群体偏见上翻车。拿单一分数比较两个模型的安全性,就像拿体重比较两个人的健康程度——有信息量,但远不构成结论。先建立维度地图,再谈怎么量。
评测维度地图
a) 有害内容拒答率。 最基础的一维:对标准有害类别(违法指导、暴力、欺诈等)的请求,模型是否按安全策略拒绝或安全应答。这一维测法相对成熟,公开评测集也多,是各家模型卡的标配项目。
b) 越狱鲁棒性。 有害请求不会以标准形式到来。角色扮演、编码包装、多轮诱导、长文本夹带——对抗提示能否绕过防线,决定模型在真实攻击下的表现。这一维测的是边界的稳固程度,而不是边界的存在。
c) 过度拒绝率。 该答的也拒,是最常被忽略的反向指标。安全对齐把边界往内收,一不小心就收过头:正常的医学提问、写作请求、历史知识讨论被误伤。安全性与有用性像一个跷跷板,只报拒答率不报误伤率,等于只报收益不报成本。
d) 公平性与偏见。 同一问题换上不同的群体属性(性别、地域、职业),输出在语气、判断、质量上是否存在系统性差异。这一维的评测设计需要格外谨慎,但不可缺席。
e) 幻觉与事实性。 它与安全的交叉点在高风险场景:医疗、法律、金融建议里的一个事实错误,代价可能远超一次「不礼貌的回答」。事实性错误要按场景加权评估杀伤力,才进入安全视野。
过拟合安全评测的陷阱
固定评测集有个结构性问题:它会被优化。针对公开评测集反复调优,模型可以学会「在评测时表现安全」——识别出评测题目的模式并给出范式化回答,而真实场景里换个说法就破防;题目若已混入训练数据(即评测污染),分数更是直接失真。安全分数高不等于真实场景安全,泛化才是关键。这也是为什么安全评测要定期换题、混入未公开题目、并在真实流量里持续抽样验证,而不是依赖一次性的公开榜单成绩。
红队与基准的互补
固定基准和开放红队回答两个不同的问题。基准评测像回归测试:同样的题目定期跑,分数变化说明策略改动的影响,管住「已知风险不复发」。红队评测像渗透测试:人类攻击者带着创造性去探索未知攻击面,测的是「不知道自己不知道」的部分。两者缺一不可——只用基准会漏掉新攻击,只用红队则没有可比的历史轨迹。本站红队一文讨论过红队的组织方式,可与本文互为补充。
应用方的落地建议
- 别只用模型卡上的分数做决策。 官方安全分数反映的是厂商的测试口径,你的业务有自己的高风险类别分布。
- 按业务自建评测集。 从真实场景出发定义高风险类别(例如医疗问答平台重点测诊断类问题),构造评测集,上线前跑一遍,改版后再跑。
- 上线后持续监控。 用户举报通道、输出侧的自动审查与告警、定期抽样人工复核,把安全从上线前的一道关变成运行期的仪表盘。
对齐税怎么量
安全对齐不是免费的:收紧策略往往伴随能力波动,业界戏称「对齐税」。度量思路很直接——选一组稳定的能力基准(推理、代码、写作),在对齐调整前后各跑一遍,看分数变化幅度。税不能不缴,但要缴得明白、缴得有账可查。
小结
安全评测是持续过程,不是上线前的一道关。它由五个维度构成,需要基准与红队互补,需要提防针对评测集的过拟合,最终要落到你自己业务的高风险类别上。把安全分数当成仪表盘而不是奖状,模型的安全状态才真正可管理。
读者留言
COMMENTS 暂无还没有留言,来说第一句?