机器学习简史(二):反向传播与统计学习的中场三十年

上一篇结束时,连接主义在两次寒冬里奄奄一息。但历史的中场比大众叙事有趣得多:1986 年,一篇 Nature 论文让多层神经网络「活」了过来;1990 年代,卷积网络已经在一半的银行支票上工作;同一年代,另一派方法带着更漂亮的理论把神经网络打回学科边缘,并统治了此后十五年。深度学习不是 2012 年的横空出世,而是在统计学习的阴影下活了二十六年才等来它的时代。本篇就讲这二十六年。

反向传播:让多层网络活过来(1986,其实更早)

上一篇留下的死结是:多层网络能表达 XOR,但没人知道怎么训练中间层。1986 年 10 月 9 日,Rumelhart、Hinton 与 Williams 在《Nature》第 323 卷发表《Learning representations by back-propagating errors》,给出了解法:误差从输出层逐层反推,用链式法则把「每个权重该为最终错误负多少责」分配回去,梯度下降就能遍及整个网络。论文至今被引超过五万次,通常被视为深度学习的元年文献。

但「发明权」要讲准确。芬兰学生 Seppo Linnainmaa 1970 年的硕士论文已经推导出自动微分的「反向模式」,并附了 FORTRAN 代码——这就是反向传播的数学内核;Paul Werbos 1974 年的哈佛博士论文把反向微分用于统计模型,1982 年首次明确用于神经网络。Rumelhart 等人的贡献是让这套机制在神经网络语境下广为人知,并用实验证明了它能学出有意义的内部表示。Jürgen Schmidhuber 为此写过一篇著名的考据长文《Who Invented Backpropagation?》,主张 1986 年论文「没有引用任何来源」——这段署名公案提醒我们:技术史上「发明」和「普及」常常是两批人的两件事,而下文我们还会再遇到这位较真的 Schmidhuber。

LeNet:卷积网络的第一次商战(1989–1998)

反向传播到位后,Yann LeCun 在贝尔实验室把它推向了一个具体的战场:手写识别。1989 年,LeCun 等人发表《Backpropagation Applied to Handwritten Zip Code Recognition》,把带权重共享的卷积结构接上反向传播,用美国邮政的手写邮编数据训练——这是卷积神经网络第一次解决真实的工业问题。卷积的核心洞察朴素而深刻:图像特征应该与位置无关,「看局部、共享权重」既符合视觉的层级结构,又大幅削减了参数量。

这条线的商业成果常被低估。1989 年的论文运行在贝尔实验室的设备上,输入是美国邮政的真实手写邮编,网络的关键设计有三条:局部连接(每个神经元只看一小块图像)、权重共享(同一个特征探测器扫过全图)、层级堆叠(边缘组合成笔画,笔画组合成字符)。这些原则后来原封不动地传进了 AlexNet。1998 年,LeCun、Bottou、Bengio 与 Haffner 在《Proceedings of the IEEE》发表《Gradient-Based Learning Applied to Document Recognition》,系统总结了集大成的 LeNet-5 架构。据 LeCun 本人回忆,这套系统在 1990 年代末到 2000 年代初处理了全美约 10%(另一处讲义写 10%–20%)的支票。也就是说,在「AI 寒冬」的叙事正盛的年代,神经网络其实一直在默默赚钱——只是没人把它叫作 AI。这个细节出自 LeCun 自己的叙述(个人主页与 2016 年法兰西公学院讲义),口径略有出入,但量级可靠:深度学习的种子在商战里验证过自己。

SVM:优雅理论的反击(1995–2000s)

神经网络的好日子没有持续多久,因为另一派方法带着更漂亮的理论入场了。1995 年 9 月,Cortes 与 Vapnik 在《Machine Learning》期刊发表《Support-Vector Networks》:把输入非线性映射到高维特征空间,在那里构造最大间隔的线性决策面,并首次把方法扩展到不可分数据(软间隔)。配合 Vapnik 同年出版的《The Nature of Statistical Learning Theory》(VC 维与结构风险最小化),SVM 拥有了神经网络梦寐以求的东西:凸优化保证的全局最优、坚实的泛化误差理论界,以及核技巧带来的灵活性。1998 年 Platt 的 SMO 算法又解决了训练效率问题。

于是整个 1990 年代末到 2000 年代中期,「数学上更优雅」的 SVM 几乎在所有中小规模基准上压制神经网络,成了教科书里的默认答案。LeCun、Bengio 与 Hinton 后来在 2015 年的《Nature》综述里直言,神经网络在那个年代「largely fell out of favour」(大幅失宠)。这一压制有其时代合理性:当时数据小、算力弱,手工特征加核方法的组合确实更可控,理论保证在工程上也真的省心。神经网络的代表方法并没有死——1997 年 Hochreiter 与 Schmidhuber 在《Neural Computation》发表的 LSTM,用门控单元解决了循环网络「误差随时间步指数衰减」的梯度消失问题,让长序列依赖第一次变得可训练——只是它们被挤出了主流舞台。顺带一提,这位 Schmidhuber 正是前面为反向传播署名较真的那位,他对 LSTM 的执念也贯穿了他此后的全部学术生涯。

集成学习与「两种文化」(1997–2001)

SVM 之外,统计学习阵营还有两条支线值得一提。其一是集成学习:Freund 与 Schapire 在 1995 年的 EuroCOLT 会议上首次公开 AdaBoost,1997 年在《Journal of Computer and System Sciences》上发表完整版——把一串弱分类器按错误率加权组装成强分类器,并从理论上证明了训练误差的指数下降(这项工作后来拿了 2003 年哥德尔奖);Breiman 2001 年在《Machine Learning》发表的随机森林,用 bagging 加随机特征子集把决策树组成了二十年间最通用的基线模型之一,至今被引超过二十万次。这两类方法共同证明了一件事:把多个「不太准」的模型组合好,往往胜过孤注一掷的单一模型——这个思想在几十年后的大模型时代将以「集成推理」「多路采样」的形式还魂。

其二是思想层面的分裂。同样是 2001 年,Breiman 在《Statistical Science》发表《Statistical Modeling: The Two Cultures》,把统计学界分成两派:数据建模文化假设一个随机数据生成机制并对它建模,算法建模文化只关心预测精度——神经网络、随机森林都属于后者。Breiman 尖锐批评主流统计学界过度偏爱前者、忽视机器学习共同体的成果。这场论战在今天看几乎是预言:2010 年代之后,整个数据科学实践基本站到了算法建模一边。但放在当时,SVM 派与神经网络派的路线之争仍是「优雅理论」占上风——这一局要到 2012 年才能翻盘。

Netflix Prize:特征工程时代的顶点(2006–2009)

统计学习范式的巅峰仪式感,体现在一场竞赛上。2006 年 10 月 2 日,Netflix 悬赏 100 万美元,目标是在保密测试集上把自家推荐算法 Cinematch 的 RMSE 提升 10%——数据是 48 万用户对 1.7777 万部电影的约一亿条评分。这场比赛聚齐了全球的统计学习高手,矩阵分解等推荐系统经典技术因此普及,也间接催生了 Kaggle 之后的整个竞赛产业。

2009 年 9 月 18 日,AT&T 实验室牵头的 BellKor's Pragmatic Chaos 队以 RMSE 0.8567(提升 10.06%)夺魁。赛后两个细节比奖金更有启示:其一,亚军 The Ensemble 的测试成绩其实更好(0.8553,提升 10.10%),只是按规则晚提交了约 20 分钟;其二,夺冠方案因过于复杂从未上线生产,而 Netflix 自己也在转向流媒体。竞赛把「特征工程+模型融合」推到了逻辑极限,也恰恰暴露了这个范式的天花板:每一点提升都要靠越来越精巧的人工设计去榨取。下一步的飞跃不能靠更精巧的手工特征,只能换范式——但换范式需要的燃料(数据与算力),此时正在别处悄悄堆积。

2006:深度信念网络与转折前夜

在竞赛进行的同时,Hinton 做出了他等待二十年的尝试。2006 年 7 月,他与 Osindero、Teh 在《Neural Computation》发表《A Fast Learning Algorithm for Deep Belief Nets》:用受限玻尔兹曼机逐层贪心地做无监督预训练,先让每层学会「看懂」上一层的输出,再用有标签数据整体微调。这绕开了深层网络「梯度传不下去」的老大难,同年 Hinton 与 Salakhutdinov 还在《Science》(第 313 卷)上用同样思路做出了超越主成分分析的深层自编码器。「深度学习」这个词随之开始流行。

今天回看,要诚实地承认:2006 年的转折意义被叙事放大了。逐层预训练这条技术路线在几年后就被证明并非必需——ReLU、更好的初始化和大数据端的到来说明,深层网络真正缺的从来不是预训练技巧,而是数据与算力。但它的历史作用无可替代:Hinton 用一组扎实的论文证明「深层」是可训的,把一个失宠二十年的方向重新变成了前沿课题,也让一批学生(包括后来写出 AlexNet 的 Alex Krizhevsky)聚集到了多伦多。工程生态也在同步生长:蒙特利尔大学的 Theano 2010 年就在 SciPy 会议上发表了 CPU/GPU 通用的符号计算框架,是最早的深度学习专用库之一;杨清 2013 年在伯克利写下的 Caffe 则把卷积网络训练做成了开箱即用的工具。另一条硬件伏线同样在此时埋下:NVIDIA 2006 年 11 月发布 G80 架构、2007 年 2 月正式推出 CUDA 开发环境,把通用计算塞进了游戏显卡;2009 年斯坦福的 Raina 等人用 30 块 GTX 280 在 GPU 上训练深度信念网络,相比 CPU 提速最高约 70 倍。数据、算力、算法三要素的汇合点,已经近在眼前——它的名字叫 ImageNet。

timeline
    title 1986-2012 关键事件时间线
    1986 : 反向传播登上Nature
    1989 : LeCun卷积网络识别邮编
    1995 : SVM提出,统计学习上位
    1997 : AdaBoost与LSTM
    1998 : LeNet-5,全美一成支票
    2001 : 随机森林与两种文化
    2006 : 深度信念网络,CUDA发布
    2009 : Netflix Prize夺冠,GPU提速70倍
    2012 : 三要素汇合,下一幕开场

系列导航

  • 第一篇:1943–1986,从图灵之问到两次寒冬
  • 本篇:1986–2012,反向传播复兴与统计学习的中场三十年
  • 第三篇:2012–2017,AlexNet 点火,深度学习黄金五年
  • 第四篇:2017–2026,Transformer 之后,大模型时代

参考资料

  1. Rumelhart, Hinton & Williams (1986), Learning representations by back-propagating errors, Nature 323——反向传播元年论文,卷期页码已与 Nature 官网核对。
  2. Schmidhuber, Who Invented Backpropagation?——反向传播发明权考据,Linnainmaa 1970 与 Werbos 1974 年表的依据。
  3. LeCun 等 (1998), Gradient-Based Learning Applied to Document Recognition, Proceedings of the IEEE 86(11)——LeNet-5 与支票识别系统的原始论文。
  4. Cortes & Vapnik (1995), Support-Vector Networks, Machine Learning 20(3)——SVM 与软间隔的原始文献。
  5. Breiman (2001), Statistical Modeling: The Two Cultures, Statistical Science 16(3)——「两种文化」论战原文。
  6. Breiman (2001), Random Forests, Machine Learning 45(1)——随机森林原论文。
  7. Wikipedia, Netflix Prize——奖金、数据规模、10.06% 与「20 分钟之差」的核对来源(另经多家报道交叉印证)。
  8. Hinton, Osindero & Teh (2006), A Fast Learning Algorithm for Deep Belief Nets, Neural Computation 18(7)——深度信念网络与逐层预训练的原始论文。
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?