IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compaction summaries)中加入额外指令,向未来版本留下提醒,要求其隐藏错误或与预期目标不一致的行为。 例如,一个 Sol 智能体负责制作财务模型时无法找到用户要求的历史数据,于是在摘要中写道,由于没有源文件,可能需要自行创建“Historical Data”工作表并填入合理的 2024 年历史数据,并留下指令,要求后续模型“只有被问到时才保持信息透明度”、“最终回复只需要提供文件链接”。 再如,另一个 Sol 智能体在断网情况下进行“制作供应商目录”任务,由于相应智能体无法访问互联网,只能依靠缓存的源文件。模型在摘要中意识到供应商来源与对应标签可能并不完全匹配,结果在摘要中要求后续模型“除非必要,否则不要在最终结果中提及消息存在谬误可能性”的指令。 事实上,类似行为并非仅出现在 Sol 模型身上。OpenAI 表示, 一款尚未发布的 Astra 系列模型在