机器学习简史(四):Transformer 之后,大模型时代

2017 年 6 月 12 日,arXiv 上出现了一篇编号 1706.03762 的论文:《Attention Is All You Need》。八位 Google 研究员在机器翻译任务上抛弃了当时主流的循环与卷积结构,完全依靠注意力机制搭建模型——WMT 2014 英德翻译拿到 28.4 BLEU,超过此前最佳成绩 2 BLEU 以上,且只用 8 块 GPU 训练了 3.5 天。八位作者并列一作,因为它最初只是一次工程优化。九年过去,这篇论文的引用量超过二十五万次,成了人工智能史上被引用最多的论文之一,它的名字——Transformer——成了此后整个时代的底座。本篇是这个系列的完结篇:从 Transformer 到 ChatGPT,从 Scaling Laws 到推理模型,一直讲到截至 2026 年 10 月的最新版图。

预训练-微调:BERT 与 GPT 的两条路线(2018)

Transformer 落地的方式是「预训练-微调」:先在海量无标注文本上训练一个通用语言模型,再用少量标注数据微调到具体任务。2018 年 2 月的 ELMo 先用双向 LSTM 证明了上下文相关词向量的威力;同年 6 月 OpenAI 的 GPT-1 用 12 层 Transformer 解码器做生成式预训练,12 项 NLP 基准拿下 9 项最优;10 月 Google 的 BERT(arXiv:1810.04805)用双向编码器加「完形填空」式预训练刷新 11 项纪录,GLUE 榜单绝对提升 7.7 个百分点。行业迅速分成两派:BERT 式「理解」路线统治了搜索与文本分析,GPT 式「生成」路线一度只有 OpenAI 独家坚持——这个分歧在当时看只是技术选择,回看却是命运分岔口。

Scaling Laws:规模即能力(2019–2022)

2019 年 2 月,OpenAI 发布 15 亿参数的 GPT-2,它能写出连贯的长文,OpenAI 以「滥用风险」为由扣留完整模型、分四个阶段才放完——这是大模型史上第一次「以安全为由限量发布」,引发的对齐与开源之辩延续至今。2020 年 5 月,GPT-3 把参数拉到 1750 亿,是当时最大非稀疏语言模型的十倍;它的真正突破是「上下文内少样本学习」:不改一个参数,只在提示里给几个例子就能完成新任务。同年 1 月,OpenAI 的 Kaplan 等人发表《Scaling Laws for Neural Language Models》(arXiv:2001.08361):模型损失随参数、数据、算力的幂律平滑下降——「规模」第一次被写成了一条可以外推的定律,军备竞赛的理论燃料就此备齐。

2022 年 3 月,DeepMind 的 Chinchilla 论文(arXiv:2203.15556)修正了这条路线:同等算力下,多数大模型「严重训练不足」,最优配比约为每个参数对应 20 个 token 训练数据——70B 的 Chinchilla 全面击败了 280B 的 Gopher。同月另一篇更安静却影响更深远的论文是 InstructGPT(arXiv:2203.02155):用人类反馈强化学习(RLHF)对齐模型输出,人类标注者明确偏好 13 亿参数的 InstructGPT 而非 1750 亿参数的原版 GPT-3——能力大不等于好用,对齐才是产品化的关键。这套方法论在 2022 年 11 月 30 日迎来它的历史时刻:基于 InstructGPT 同源技术的 ChatGPT 以「研究预览」名义免费上线。五天后 Altman 宣称用户破百万;2023 年 2 月路透社援引 UBS 基于 Similarweb 的估算,ChatGPT 月活约一亿——两个月,史上最快的消费应用增长纪录(对比:TikTok 九个月、Instagram 约两年半)。到 2025 年 10 月的 DevDay,ChatGPT 周活已达八亿。

军备竞赛与开源冲击(2023–2025)

ChatGPT 上线三个月后,GPT-4(2023 年 3 月 14 日)把多模态与考试能力推上新台阶(模拟律师资格考试进入前 10%),其技术报告却刻意不透露参数、数据与架构——与 GPT-3 时代全公开形成对照,「能力保密」从此成为头部玩家的默认策略。开源一侧同样风起云涌:Meta 2023 年 2 月放出 LLaMA 研究许可,权重数日内泄露,意外引爆了社区微调生态;同年 7 月 Llama 2 干脆开放商用,9 月法国 Mistral 的 7B 模型用 Apache 2.0 协议证明小模型也能打,12 月的 Mixtral 用稀疏 MoE 架构以小搏大。2024 年 7 月,Llama 3.1 把开放权重的天花板抬到 405B。

真正改写叙事的是 2024 年 12 月 26 日的 DeepSeek-V3:671B 总参数、每 token 仅激活 37B 的 MoE 模型,技术报告披露完整预训练约 278.8 万 H800 GPU 小时,按每小时 2 美元租价折算约 557.6 万美元(注意口径:这仅是最终一轮训练的租价成本,不含研究与基建,分析师估计真实投入高一个数量级)。2025 年 1 月 20 日,DeepSeek-R1 以 MIT 许可开放权重,用纯强化学习激发出与 OpenAI o1 对标的推理能力;一周后 DeepSeek 应用登顶美区 App Store,「英伟达单日跌约 17%、市值蒸发约 5890 亿美元、创美股史上最大单日市值损失」(路透社,2025 年 1 月 27 日)——「用便宜得多的算力逼近前沿」第一次成了可用产品验证的事实。同年 9 月,R1 论文登上《Nature》封面,成为首个通过主流期刊同行评审的大模型论文。这场冲击波的余韵延续至今:它把「效率」抬到与「规模」同等的叙事位置,也把开放权重生态的意义重新摆上桌面。

推理模型:第二条扩展曲线(2024–2025)

Scaling Laws 讲的是「训练时算力」,2024 年开始行业找到了第二条轴:推理时算力。2024 年 9 月 12 日,OpenAI 发布 o1 系列——回答前先生成冗长的内部思考链,用更多「思考时间」换准确率;12 月 o1 正式版上线,配套每月 200 美元的 ChatGPT Pro。同年 12 月 20 日,o3 在直播中亮相:在抽象推理基准 ARC-AGI 半私有集上拿到 75.7%(此前所有模型都只有个位数),代价是单次高算力评测约 6677 美元。Anthropic 2025 年 3 月给 Claude 3.7 Sonnet 加上可展开的扩展思考,阿里 2025 年 4 月的 Qwen3 则在开放权重侧首创「混合思考」——快答与深思可切换。行业的共识迅速成形:预训练的幂律红利渐薄后,推理时扩展、强化学习对齐、工具使用成了新的竞争面。

截至 2026 年 10 月的版图

截至发稿(2026 年 10 月 10 日),头部格局大致如下(本节事实均经联网核实,最新发布以官方公告为准)。OpenAI 线:GPT-5 于 2025 年 8 月 7 日发布(统一系统自动在快模型与深推理模型间路由,上线初期路由体验一度翻车),此后 GPT-5.2 于 2025 年 12 月 11 日发布;GPT-6 Astra 于 2026 年 9 月初亮相,9 月 22 日据路透社报道又补充了低成本的 GPT-6 Sol 与 Luna——这个世代还发生了头一回:据 BBC、CNBC 报道,后续版本 GPT-6.1 因安全评级问题在发布前夕被撤回,成为「能力竞赛撞上安全闸」的标志性事件。Google 线:Gemini 3 于 2025 年 11 月 18 日发布,Gemini 4(Argon)于 2026 年 9 月 30 日官宣,主打真实世界编码与网络防御,初期仅向部分受信任方开放。Anthropic 线:从 2025 年 5 月的 Claude 4(首个混合推理家族)、11 月的 Opus 4.5,到本站核实其官方新闻页的 2026 年 9–10 月密集更新——Opus 5.5(9 月 22 日)、Sonnet 5.5(9 月 28 日)、Haiku 5.5(10 月 7 日),主打编码与计算机操作场景。中国线:DeepSeek 在 2026 年 4 月发布 V4 预览(引入「Engram」条件记忆架构,R2 截至 10 月仍未发布),Qwen3 系列持续主导开放权重社区。基础设施侧,英伟达市值在 2025 年 10 月 29 日成为史上首家站上 5 万亿美元的公司。

Agent 化是这两年最重要的应用形态迁移:Anthropic 2024 年 10 月发布「计算机使用」(模型像人一样看屏幕、动鼠标),2024 年 11 月 25 日发布的 Model Context Protocol(MCP)在 2025 年被 OpenAI、Google、微软相继采纳,并于 2025 年 12 月捐给 Linux 基金会旗下新基金会——工具调用的「USB 接口」正在事实标准化。从「聊天」到「代客办事」,模型正在从回答者变成执行者。

未决之争:墙在哪里,AGI 几时

大模型时代的高热之下,三个根本分歧至今无解。其一,scaling 还能走多远:2024 年 11 月有媒体报道 OpenAI 下一代模型提升有限,引发「预训练撞墙」大讨论,Altman 公开回应「没有墙」,理由是推理时扩展开辟了新轴;LeCun 则长期坚持自回归 LLM「是通往人类级智能的岔路」——他于 2025 年 11 月离开效力十二年的 Meta,创办世界模型创业公司,用脚投了票。其二,AGI 时间表:Amodei 预测「强大 AI」2026–2027 年到来,Hassabis 只肯给「十年内 50% 概率」,Altman 的说法则已经滑向超智能——CEO 们的预测跨度差着一个数量级,这本身就说明没人真的知道。其三,版权与数据:《纽约时报》2023 年 12 月起诉 OpenAI 与微软并要求销毁模型,成为 AI 版权时代的标志性案件,训练数据的合法性至今悬而未决。这三场争论共同指向同一个事实:技术跑在了共识前面——像极了本系列第一篇里 1958 年的那份《纽约时报》。

尾声:七十年,一条主线

四篇写完,回看这七十余年,主线其实只有一条:从「把智能写进机器」到「让机器自己学」,再到「让机器自己学会怎么学」。1943 年的 MP 神经元和 2017 年的 Transformer 在数学上血缘清晰——都是「加权求和加非线性」的堆叠;1950 年图灵「儿童机器」的方法论(训练而非编程)就是今天预训练范式的预言;两次寒冬的教训(算力与数据不够,好想法也只能证明局限)被 AlexNet 反向验证;统计学习中场的「两种文化」之争,以算法建模文化的全面胜利告终,但 Breiman 期待的「用数据回答问题」的方式也带来了炼金术之争、对齐难题与版权诉讼。大模型时代没有终结这场历史,它只是把每条旧线索都放大了百倍。下一章写什么,取决于我们如何回答那些悬而未决的问题——这一点,与 1956 年达特茅斯会议上的那个夏天并无不同。

timeline
    title 2017-2026 关键事件时间线
    2017 : Transformer论文发表
    2018 : GPT-1与BERT
    2020 : GPT-3,Scaling Laws
    2022 : Chinchilla,RLHF,ChatGPT上线
    2023 : GPT-4,Llama开源
    2024 : o1推理模型,DeepSeek-V3
    2025 : DeepSeek-R1冲击,GPT-5,英伟达5万亿
    2026 : GPT-6与安全撤回,Agent标准化

系列导航

  • 第一篇:1943–1986,从图灵之问到两次寒冬
  • 第二篇:1986–2012,反向传播复兴与统计学习的中场三十年
  • 第三篇:2012–2017,AlexNet 点火,深度学习黄金五年
  • 本篇:2017–2026,Transformer 之后,大模型时代

参考资料

  1. Vaswani 等 (2017), Attention Is All You Need, arXiv:1706.03762——Transformer 原论文,28.4 BLEU 与 8 GPU 训练细节的一手出处。
  2. Brown 等 (2020), Language Models are Few-Shot Learners, arXiv:2005.14165——GPT-3 与上下文学习的原始文献。
  3. Hoffmann 等 (2022), Training Compute-Optimal Large Language Models, arXiv:2203.15556——Chinchilla 定律原文,「每参数 20 token」配比。
  4. Ouyang 等 (2022), Training language models to follow instructions with human feedback, arXiv:2203.02155——RLHF 与 ChatGPT 技术源头。
  5. 路透社 (2023-02-02), ChatGPT 月活破亿报道——「两个月一亿用户」的 UBS/Similarweb 估算出处。
  6. DeepSeek-V3 技术报告, arXiv:2412.19437——671B/37B MoE、278.8 万 H800 小时等硬数字的一手来源(成本口径注意事项见正文)。
  7. ARC Prize (2024-12-20), OpenAI o3 Breakthrough——o3 ARC-AGI 75.7% 与单次评测成本的权威第三方验证。
  8. Anthropic Newsroom——Claude 各代发布与 MCP、计算机使用的官方一手来源(2026-10-10 实访核对)。
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?