1950 年 10 月,图灵在《Mind》期刊上写下一个问题:"Can machines think?"——机器能思考吗?他随即补充:这个问题本身毫无意义,因为「思考」和「机器」都无从定义,不如换成一个可操作的实验。三十六年后,同样的热情让《纽约时报》把一台五吨重的机器称作「计算机的胚胎」,预期它有朝一日会走路、说话、自我复制并意识到自身的存在;再过三十年,同样的落差让整个行业跌入谷底,研究者甚至不敢在自己的头衔里写下「人工智能」四个字。
这是「机器学习简史」系列的第一篇。本系列共四篇,按时间线复盘机器学习从 1943 年至今的完整历程:本篇讲 1943–1986 年的史前时代与两次寒冬,第二篇讲 1986–2012 年反向传播与统计学习的角力,第三篇讲 2012–2017 年深度学习的黄金五年,第四篇讲 2017 年 Transformer 诞生至今的大模型时代。所有关键日期与数字均核对了一手文献,来源见文末。
一个神经元和一场模仿游戏(1943–1950)
故事的两个起点互不相识。1943 年 12 月,神经生理学家 Warren McCulloch 与 logician Walter Pitts 在《Bulletin of Mathematical Biophysics》发表《A Logical Calculus of the Ideas Immanent in Nervous Activity》,提出把神经元抽象成一个「全或无」的逻辑单元:多个输入加权汇聚,超过阈值就兴奋。这个后来被称为「MP 神经元」的模型证明了一件事——神经网络的等价物在原则上可以实现任意逻辑运算。今天每一层神经网络里的加权求和加激活函数,数学骨架就是它。
七年后,图灵在《Mind》第 LIX 卷发表《Computing Machinery and Intelligence》,把「机器能否思考」替换成「模仿游戏」:一位评判者通过书面交流同时与一人和一台机器对话,如果机器能让评判者无法可靠区分,就应当承认它在「思考」。这就是图灵测试。同一年,图灵还提出了一个常被忽略的想法——「儿童机器」:与其直接编程成人智能,不如造一台会学习的心智,像教孩子一样用奖惩去训练它。他甚至预测,到二十世纪末(2000 年),人们将造出能在模仿游戏中骗过平均评判者的机器。以 ChatGPT 的标准回看,这个预测准确得惊人——而它的方法论(训练而非编程)正是后来七十年机器学习的主线。
达特茅斯会议:「人工智能」的命名时刻(1956)
1955 年 8 月 31 日,John McCarthy(达特茅斯)、Marvin Minsky(哈佛)、Nathaniel Rochester(IBM)与 Claude Shannon(贝尔实验室)四人联名向洛克菲勒基金会提交了一份提案,申请 13,500 美元经费,希望在 1956 年夏于达特茅斯学院举办为期两个月的研讨会,研究「让机器表现得像人一样智能」的问题。「Artificial Intelligence」这个词就是在这份提案里被 McCarthy 发明并确立下来的,达特茅斯学院至今在官方页面保留着「AI 一词诞生于此」的记载。
1956 年那个夏天,研讨会实际持续了约八周(与会者 Ray Solomonoff 的笔记是这段历史最可靠的记录之一)。到场的包括 Newell 和 Simon——他们中途带来了刚写成的「逻辑理论家」程序,它能自动证明《数学原理》中的定理,被普遍视为第一个 AI 程序。会议没有产出统一报告,也没有达成共识,但它命名了一个学科,并把两条路线的种子埋在了同一间屋子里:一派相信可以通过逻辑与符号规则实现智能(符号主义),另一派相信智能可以从类似神经元的结构中「长」出来(连接主义)。此后七十年的分合,都是这间屋子的回声。
感知机:第一次学习浪潮(1957–1958)
连接主义的第一位主角出场极快。1957 年,心理学家 Frank Rosenblatt 在康奈尔航空实验室写出报告《The Perceptron: A Perceiving and Recognizing Automaton》,次年 11 月在《Psychological Review》发表正式论文《The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain》。感知机有两层含义:它是一个数学模型——对 MP 神经元加上了可调的权重;更关键的是它附带了学习算法——给定带标注的样本,误差驱动的迭代规则能自动把权重调到正确分类,这就是随机梯度下降思想的直系祖先。「机器能学习」第一次从一个哲学愿望变成了可以跑在机器上的流程。
美国海军研究办公室(ONR)出钱把它做成了硬件。Mark I Perceptron 带一块 20×20 的光电池「视网膜」和 512 个联想单元,靠电动电位器调节权重,机身约五吨、占满一间屋子。1958 年 7 月 8 日,《纽约时报》在报道海军的公开展示时写道:这台「电子计算机的胚胎」,海军期望它有朝一日「会走路、说话、看见、书写、自我复制并意识到自身的存在」(walk, talk, see, write, reproduce itself and be conscious of its existence)。这段话今天读来像讽刺,但它精确预演了 2017 年之后每一轮 AI 宣传的修辞结构——技术突破是真的,期待被放大也是真的。
《Perceptrons》:一本小书与一次退潮(1969)
1969 年,Minsky 与 Papert 出版《Perceptrons: An Introduction to Computational Geometry》,严格证明了单层感知机无法表示 XOR(异或)这类线性不可分的函数。这一数学结果本身毫无争议,但它的历史影响被后来的教科书简化成了「Minsky 证明了神经网络不可能」——这不是事实。初版第 13 章明确讨论过多层机器(包括 Gamba 感知机),作者表达的是对多层机「需要多得惊人的单元」的怀疑,以及一个更致命的观察:当时没有人知道如何训练网络的中间层。Minsky 本人在 1988 年的扩版里也承认「情况可能没那么简单」。
真实的历史更平淡也更有意思:1996 年科学社会学者 Michael Olazaran 对「感知机公案」的社会学研究表明,「寒冬是 Minsky 一本书造成的」这一叙事,很大程度上是 1980 年代两派论战时被建构出来的「官方历史」。无论如何,结果是清楚的——单层感知机的局限暴露了理论储备的不足,而多层网络没有训练算法,连接主义研究经费在 1970 年代迅速枯竭。Rosenblatt 本人 1971 年在划船事故中早逝,没能看到他的思想在三十年后统治世界。
第一次寒冬:一份报告与一场砍价(1973–1980)
把「退潮」变成「寒冬」的导火索发生在英国。1973 年,应用数学家 James Lighthill 爵士受英国科学研究委员会委托发表《Artificial Intelligence: A General Survey》,核心批评直指要害:AI 的各种技术只在玩具规模的问题内有效,一旦问题规模扩大就会撞上「组合爆炸」,原文说「在这一领域,迄今的发现没有产生当初承诺的重大影响」。报告据此建议大幅收缩 AI 资助,英国政府照单全收,绝大多数大学的 AI 研究经费被停。同年 5 月,Lighthill 与 Donald Michie、John McCarthy 在伦敦皇家研究所展开公开辩论——录像至今留存,但结论没有改变。
在大洋彼岸,1969 年的曼斯菲尔德修正案已要求美国国防部资助「任务导向」的研究,DARPA 随即在 1973–1974 年收紧了对学术 AI 的资助,卡内基梅隆大学每年约 300 万美元的语音理解合同被砍。通行的时间划分把第一次 AI 寒冬记为 1974–1980 年。值得一提的是,科学史学者 Thomas Haigh 2023 年在《Communications of the ACM》撰文《There Was No "First AI Winter"》,指出 1970 年代的 AI 社区实际仍在增长,「寒冬」更多是回溯建构的叙事——把这段争议写进正文,是因为它提醒我们:历史分期本身就是后人的视角。
专家系统:AI 第一次真正赚钱(1972–1987)
寒冬没有冻死一切,反而逼出了一个更务实的流派:不追求通用智能,把专家知识编码成规则解决具体问题。斯坦福大学 1972 年启动的 MYCIN 用约 600 条「如果……那么……」规则加确定性因子,诊断菌血症并推荐抗生素,后续盲评显示其处方可接受率与专家相当(约 65%–69%,两次评估口径不同)——但它因法律责任问题从未真正进入临床。真正商业成功的是 DEC 公司与卡内基梅隆合作的 XCON:1980 年投产,为 VAX 计算机订单自动配置零部件,到 1988 年规则库膨胀到约一万条。DEC 官方在 1989 年《Communications of the ACM》论文里给出的估计是每年净回报超过 4000 万美元(流行叙事常引「2500 万美元」,两个口径都有出处)。
巨额回报引来的是国家入场。1982 年,日本通产省启动「第五代计算机」十年计划,设立专门机构 ICOT,押注并行推理机与逻辑编程语言 Prolog,官方口径预算约 540 亿日元(约 4 亿美元),西方媒体则普遍渲染成 8.5 亿美元的「国家挑战」。同一时期,各国政府追加 AI 投入,风险资本涌入 Lisp 机器(为 AI 程序优化的专用工作站)行业。1980 年代中期,「AI 公司」一度超过百家。这段繁荣的每一分热度,都在为下一次崩塌蓄能。
第二次寒冬:一年之内消失的行业(1987–1993)
专家系统的内在缺陷在规模面前暴露无遗:规则库维护成本极高、面对新情况极其脆弱、最致命的是——它们不会学习,所有知识都得靠人类工程师一条条录入。与此同时,Sun 工作站等通用计算机性能暴涨,加上便携的 Common Lisp 编译器出现,专用 Lisp 机器的存在理由一夜清零。1987 年,这个年销售额约五亿美元的行业(当时业界估计)在一年之内被通用机取代,龙头 Symbolics 从 1986 年约一亿美元营收的巅峰直坠谷底,1990 年代初走向破产。日本第五代机 1992 年收官时未达预期目标,《纽约时报》形容其「冒着泡收场」;DARPA 也在 1992–1993 年大幅削减战略计算计划中的 AI 预算。
通行划分把第二次 AI 寒冬记为 1987–1993 年,其心理影响比第一次更深:「人工智能」成了融资路演里需要回避的词,研究者改自称「机器学习」「信息学」「模式识别」——这个措辞惯性一直延续到 2012 年之后。而两次寒冬留下的教训,用一句话概括就是:算力与数据不够时,再好的想法也只能证明自己的局限。感知机证明了这一点(多层网络等了三十年才有训练算法与算力),专家系统又证明了一次(知识无法靠人工录入穷尽,必须让机器自己学)。
值得注意的是,即使在最冷的日子里,也有人在坚持。1997 年 Freund 与 Schapire 的 AdaBoost、1998 年 LeCun 的 LeNet-5 都诞生于这段「寒冬」之中——第二篇会讲到,深度学习真正的前夜,恰恰是在统计学习的阴影下度过的。
timeline
title 1943-1993 关键事件时间线
1943 : MP神经元模型
1950 : 图灵测试(《Mind》)
1956 : 达特茅斯会议,AI命名
1958 : 感知机与Mark I硬件
1969 : 《Perceptrons》证明XOR限制
1973 : Lighthill报告,第一次寒冬
1980 : 专家系统XCON投产
1982 : 日本第五代计算机启动
1987 : Lisp机崩塌,第二次寒冬
1993 : 寒冬触底,暗流涌动
系列导航
- 本篇:1943–1986,从图灵之问到两次寒冬
- 第二篇:1986–2012,反向传播复兴与统计学习的中场三十年
- 第三篇:2012–2017,AlexNet 点火,深度学习黄金五年
- 第四篇:2017–2026,Transformer 之后,大模型时代
参考资料
- McCulloch & Pitts (1943), A Logical Calculus of the Ideas Immanent in Nervous Activity——人工神经元模型原论文。
- Turing (1950), Computing Machinery and Intelligence, Mind 59(236)——图灵测试的原始出处。
- McCarthy 等 (1955), A Proposal for the Dartmouth Summer Research Project on AI——「人工智能」命名与达特茅斯会议的一手提案。
- Rosenblatt (1958), The Perceptron, Psychological Review 65(6)——感知机奠基论文。
- Cornell Chronicle (2019), Professor's perceptron paved the way for AI – 60 years too soon——Mark I 硬件细节与 1958 年 NYT 报道的大学官方记载。
- Lighthill (1973), Artificial Intelligence: A General Survey——第一次寒冬导火索原报告全文存档。
- Barker & O'Connor 等 (1989), Expert Systems for Configuration at Digital: XCON and Beyond, CACM 32(3)——XCON 每年 4000 万美元回报的一手出处。
- Thomas Haigh (2023), There Was No "First AI Winter", CACM——对「寒冬」叙事本身的史学批评,本文的平衡视角来源。
读者留言
COMMENTS 暂无还没有留言,来说第一句?