历史第 2 篇,共 9 篇

人工智能发展史:从图灵到 ChatGPT

阅读约 10 分钟更新于 作者: CheblAI 编辑部
阅读语言FrançaisEnglish中文

要点速览

  • 人工智能作为一门学科诞生于1956年(达特茅斯会议),但其根源可追溯到20世纪40年代,以及艾伦·图灵(Alan Turing)1950年的那篇论文。
  • 它的历史在热情与幻灭之间交替,这些低谷被称为“AI 寒冬”(20世纪70年代、80年代末)。
  • 真正的转折点出现在2012年(AlexNet 与深度学习),随后是2017年(Transformer 架构),并由此催生了2022年11月30日发布的 ChatGPT。
本页目录
起源:1943—1955年最初的成功与最初的失望:1956—1980年专家系统与神经网络的回归:1980—2000年深度学习革命:2009—2016年Transformer 与生成式人工智能的爆发:2017—2022年人工智能的当下:2023—2026年这段历史带给我们的启示常见问题来源与参考资料

起源:1943—1955年

早在“人工智能”这个词出现之前,数学家和神经科学家就已经在思考:思维能否用计算来描述?

  1. 1943年第一个人工神经元

    神经科学家 Warren McCulloch 与逻辑学家 Walter Pitts 发表了一个简化的神经元数学模型。它是如今神经网络的鼻祖。

  2. 1950年艾伦·图灵提出问题

    英国数学家艾伦·图灵在论文“Computing Machinery and Intelligence”中提出了一项测试,如今称为图灵测试:机器能否与人交谈,而让对方无法分辨它是不是人类?

  3. 1955—1956年达特茅斯会议

    约翰·麦卡锡(John McCarthy)、马文·明斯基(Marvin Minsky)、Nathaniel Rochester 和 Claude Shannon 于1955年提议在美国达特茅斯学院举办一次夏季研讨会,会议于1956年举行。约翰·麦卡锡在会上推广了“人工智能”这一术语。人们通常把这次会议视为这门学科的诞生。

最初的成功与最初的失望:1956—1980年

  1. 1958年感知机

    美国心理学家 Frank Rosenblatt 提出了感知机,这是一种单层神经网络,能够学习对简单的模式进行分类。

  2. 1966年ELIZA,第一个“聊天机器人”

    麻省理工学院(MIT)的 Joseph Weizenbaum 发布了 ELIZA,这个程序通过复述用户的话来模仿心理治疗师。他惊讶地发现,人们竟会认为它具有理解力和情感,此后这种现象被称为“ELIZA 效应”。

  3. 1969年《Perceptrons》一书

    马文·明斯基与 Seymour Papert 论证了单层感知机的局限。这本书使一部分研究在大约十年间远离了神经网络。

  4. 1973—1974年第一次“AI 寒冬”

    在英国,Lighthill 报告(1973年)对人工智能研究的成果给出了严厉评价,公共资金随之减少。早期那些被认为过于夸张的承诺并未兑现。

专家系统与神经网络的回归:1980—2000年

  1. 20世纪80年代专家系统兴起

    基于专家(医学、工程等领域)所编写规则的程序被企业采用。人工智能产业的规模从几百万美元增长到几十亿美元。但这些系统维护成本高,也不够灵活。

  2. 1982年Hopfield 网络

    John Hopfield 证明,某种类型的神经网络可以记住模式并将其重新找回。这项工作让他获得了2024年诺贝尔物理学奖。

  3. 1986年反向传播得到普及

    David Rumelhart、杰弗里·辛顿(Geoffrey Hinton)和 Ronald Williams 在Nature上发表了一种训练多层神经网络的有效方法:反向传播(梯度反向传播)。神经网络重新受到青睐。

  4. 20世纪80年代末第二次 AI 寒冬

    专家系统市场崩溃,资金再次枯竭。

  5. 1989—1990年卷积神经网络

    杨立昆(Yann LeCun)把卷积神经网络应用于手写数字识别;这项技术后来被用来读取银行支票。

  6. 1997年Deep Blue 击败卡斯帕罗夫

    1997年5月,IBM 的超级计算机 Deep Blue 击败了国际象棋世界冠军加里·卡斯帕罗夫(Garry Kasparov),六局比赛的比分为3.5比2.5。Deep Blue 并不“学习”:它凭借专家调校的规则,以暴力方式每秒搜索数亿个局面。同一年,Sepp Hochreiter 与 Jürgen Schmidhuber 发表了 LSTM 网络,它在 Transformer 出现之前对语言处理十分重要。

深度学习革命:2009—2016年

  1. 2009年ImageNet

    李飞飞(Fei-Fei Li)及其同事发布了 ImageNet,一个包含数百万张带标注图像的庞大数据库。它后来成为图像识别的试验场。

  2. 2011年Watson 在 Jeopardy! 中获胜

    IBM 的 Watson 系统击败了美国电视问答节目 Jeopardy! 的两位冠军,向大众展示了自然语言处理的能力。

  3. 2012年AlexNet:转折点

    Alex Krizhevsky、Ilya Sutskever 和辛顿凭借 AlexNet 赢得 ImageNet 竞赛。这是一个在两块显卡上训练的深度网络,错误率为15.3%,而第二名为25.8%。图形处理器(GPU)、大型数据库和更好的训练技术汇聚到一起:深度学习时代就此开启。

  4. 2013—2014年用数字表示词语,生成图像

    2013年,谷歌的 Tomas Mikolov 发表了 word2vec,用数字向量来表示词语。2014年,Ian Goodfellow 发明了生成对抗网络(GAN),这是第一类能够生成逼真图像的重要模型。

  5. 2016年3月AlphaGo 战胜李世石

    3月9日至15日,在首尔,谷歌 DeepMind 的 AlphaGo 程序以4比1击败了围棋冠军李世石(Lee Sedol);围棋被认为比国际象棋复杂得多。AlphaGo 先是研究了职业棋手约3000万步棋,再通过自我对弈来学习。它在第二局中走出的第37手,让所有解说员都感到意外。

Transformer 与生成式人工智能的爆发:2017—2022年

  1. 2017年6月12日“Attention Is All You Need”

    八位谷歌研究人员(包括 Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Łukasz Kaiser 和 Illia Polosukhin)发表了 Transformer 架构。它用一种可并行处理的“注意力”机制取代了序列式网络,是当今几乎所有大语言模型的基础(参见ChatGPT 是如何工作的)。

  2. 2018年GPT 与 BERT

    OpenAI 发布 GPT-1(6月);谷歌发布 BERT(10月)。其核心思路是:先用未经标注的文本预训练一个大模型,再让它适应具体任务。

  3. 2019年2月GPT-2

    OpenAI 宣布推出 GPT-2(15亿个参数),它能够生成可信的文本。根据已发布的估算,训练成本约为5万美元。

  4. 2020年5月28日GPT-3

    OpenAI 发布 GPT-3:1750亿个参数,训练时使用了约3000亿个词元(token)的文本(取自约5000亿词元的语料库)。该模型令人印象深刻之处在于,只要在提示词中给出几个示例,它无需专门训练就能完成任务。

  5. 2020—2021年AlphaFold 与科学

    DeepMind 的 AI 系统 AlphaFold 2 以前所未有的精度预测了蛋白质的三维结构。其创造者 Demis Hassabis 和 John Jumper 将与 David Baker 共同获得2024年诺贝尔化学奖。

  6. 2021—2022年图像生成走向大众

    OpenAI 发布了 DALL-E(2021年),随后是 DALL-E 2(2022年)。Midjourney 在2022年夏天开启公开测试。2022年8月免费开放发布的 Stable Diffusion,让图像生成得以普及(参见图像生成式 AI)。

  7. 2022年11月30日ChatGPT 发布

    OpenAI 向公众开放了基于 GPT-3.5 的对话助手 ChatGPT。它在五天内用户突破100万,约两个月内突破1亿,成为历史上增长最快的大众服务之一。

人工智能的当下:2023—2026年

  1. 2023年模型竞赛

    GPT-4(3月);Claude(Anthropic)首次公开发布(3月);Meta 的开放模型(LLaMA);法国初创公司 Mistral AI 于2023年4月28日由 Arthur Mensch、Guillaume Lample 和 Timothée Lacroix 创立,并在9月发布了 Mistral 7B。

  2. 2024年监管与科学界的认可

    欧盟《人工智能法案》(AI Act)于2024年8月1日生效。10月,两项诺贝尔奖表彰了与人工智能相关的成果:物理学奖(John Hopfield 与辛顿)和化学奖(David Baker、Demis Hassabis、John Jumper)。

  3. 2025年1月20日DeepSeek-R1

    中国公司 DeepSeek(深度求索)发布了 R1,这是一款开放权重的推理模型,可与美国最强的模型相媲美。该消息导致英伟达(Nvidia)股价下跌,并重新引发了关于训练成本的讨论。

  4. 2025—2026年会推理、能行动的 AI

    如今的助手已经能够上网搜索、分析文档、编写代码,并串联多个操作(这被称为“智能体”)。根据斯坦福大学的 AI Index 2026,88%的受访组织已经在使用 AI,而美国与中国最佳模型之间的性能差距已变得非常小。

想知道这些模型背后是什么,请阅读AI 是如何被造出来的;想了解局限与规则,请阅读局限、风险与监管。

这段历史带给我们的启示

  • 想法先于技术。神经网络诞生于1943年,反向传播出现于1986年:直到2012年,数据和算力足够了,它们才爆发。
  • 热情是周期性的。两次“AI 寒冬”提醒我们,要对夸大的承诺保持警惕。
  • 节奏在加快。从 Transformer(2017年)到 ChatGPT(2022年),只用了不到六年。

常见问题

人工智能是什么时候诞生的?

人们通常把人工智能作为一门学科的诞生定在1956年夏天,即在美国举行的达特茅斯会议。它的理论基础更早:1943年出现人工神经元模型,1950年有艾伦·图灵的论文。

“人工智能”这个词是谁提出的?

美国计算机科学家约翰·麦卡锡,他于1955年在筹备达特茅斯会议时提出这一术语,并于1956年将其推广开来。

什么是 AI 寒冬?

指承诺未能兑现后,人们对人工智能的资金投入和兴趣骤然崩塌的幻灭时期。通常提到两次:一次在1973—1974年前后(Lighthill 报告),另一次始于20世纪80年代末(专家系统崩溃)。

为什么说2012年是关键的一年?

因为 AlexNet 这个在显卡上训练的深度神经网络,在 ImageNet 竞赛中遥遥领先于对手(错误率15.3%,对手为25.8%)。这让学界确信,深度学习优于以往的方法。

ChatGPT 是什么时候发布的?

ChatGPT 由 OpenAI 于2022年11月30日发布;约五天内用户数就达到了100万。

来源与参考资料

  1. Wikipedia — History of artificial intelligence
  2. Vaswani et al., “Attention Is All You Need”, arXiv, 2017年6月12日
  3. Wikipedia — AlexNet
  4. Wikipedia — ChatGPT
  5. Wikipedia — Deep Blue versus Garry Kasparov
  6. Wikipedia — AlphaGo versus Lee Sedol
  7. Wikipedia — ELIZA
  8. Wikipedia — GPT-3
  9. 2024年诺贝尔物理学奖 (Nobel Prize in Physics 2024)
  10. Wikipedia — DeepSeek
  11. Stanford HAI — AI Index Report 2026

独立编辑内容。文中引用的事实、日期和数据均依据页面末尾列出的来源;本内容仅供参考,不构成专业建议。