论文精读:GPT-3 与上下文学习的发现——不训练参数,只给例子

2020 年 5 月,OpenAI 发表《Language Models are Few-Shot Learners》(Brown et al., NeurIPS 2020,arXiv:2005.14165)。后世记住了它的两个东西:一个是明面上的——175B 参数,比此前最大的非稀疏模型大 10 倍;另一个藏在实验里,后来被证明是近十年 NLP 最重要的发现——模型不改一个参数,只在输入里放几个例子,就能学会一个新任务。上下文学习(in-context learning, ICL)从这篇论文开始成为一门显学,也是今天所有提示工程的源头。

论文的问题意识:微调是必要的吗

2020 年的标准流程是「预训练 + 微调」:BERT 时代每个任务都要拿标注数据调一遍参数。GPT-2 已经展示过零样本的可能性但效果有限。这篇论文问的问题是:模型大到一定程度,微调这步能不能省掉?

为此论文设计了四种评测模式,这个设计本身就是贡献:

  • Zero-shot:只给自然语言指令(「把这段英文翻译成法语:」);
  • One-shot:指令 + 1 个例子;
  • Few-shot:指令 + 通常 10–100 个例子(全部放在上下文里,不更新参数);
  • Fine-tune(对照组):传统微调。

关键在于 few-shot 与微调的本质区别:例子只存在于这一次的前向计算里,梯度一次都不更新。「学习」发生在激活层面——模型利用上下文里的模式现场组织行为,论文把这称为 in-context learning。

主要发现:规模是 ICL 的开关

GPT-3 在 300B token 上训练(含清洗后的 Common Crawl、WebText2、书与维基百科),模型家族从 1.25B 排到 175B,这个阶梯让论文画出了后来广为流传的那组曲线:

  • LAMBADA(长程完形填空):few-shot GPT-3 超越了此前的微调 SOTA;
  • 许多任务上,few-shot 随模型规模陡峭上升:小模型放例子帮助甚微,175B 才显出「看例子学任务」的能力——这正是后来「涌现能力」叙事的原型;
  • 与微调仍有差距:在部分基准(如 SuperGLUE)上 few-shot 不及微调 SOTA;在自然语言推理上甚至吃力;
  • 新闻文章可辨识度实验:人类对 GPT-3 生成的新闻约 52% 的比例无法分辨——生成质量的公众认知从这篇论文开始转折。

机制上论文保持克制:它观察并度量了 ICL,没有断言其原理。这个留白催生了此后几年的机制解释研究(隐式梯度下降、贝叶斯推断视角等),站内《思维链为什么有效》讨论的正是这条研究线的下游。

涌现争议:真涌现,还是量尺的假象?

「ICL 在大规模涌现」的叙事后来遭到重要修正。Schaeffer 等人 2023 年的论文论证:许多「涌现」其实是评价指标的产物——用「完全答对才算对」的不连续指标,平滑进步的模型会在某个临界点突然「显形」;换连续指标,曲线常常是平滑的。对 ICL 而言更稳的表述是:能力随规模连续增长,但小模型弱到没有实用价值,大到某个量级才越过「可用」的阈值。这场争论的方法论教训(指标选择决定你「看见」什么)对任何做评测的人都适用——延伸阅读见站内《大模型评测基准的坑》。

遗产:从论文到工作方式的三次改写

  1. 提示工程成为一门手艺:既然例子和指令就是「编程接口」,怎么组织上下文就成了工程学科——few-shot 示例选择、顺序、格式至今仍是实践变量;
  2. 「基座模型 + 提示」的商业模式:GPT-3 API 证明了不用为每个客户微调,一个模型服务千种任务——这一步直接塑造了此后所有 LLM API 的形态;
  3. Scaling 叙事的主流化:175B + 300B token 的组合拳给了 Scaling Laws 路线最强的实证背书(背景见站内《Scaling Laws 十问十答》),「更大 = 更通用」在此后三年主导了行业投资。

结语

回读这篇论文,最有意思的是它的克制:标题说的是「few-shot learners」,正文反复强调 few-shot 在多数基准上仍不如微调——作者并没有宣称微调已死。真正改变行业的是他们没敢断言的那部分:当上下文学习与产品形态(API、对话)相遇,「训练一个模型解决一个任务」让位于「一个模型应对所有任务」。今天我们习以为常的「给大模型几个例子它就照着做」,正是 2020 年那组阶梯曲线里,最右边那个点带来的世界观。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?