工作原理第 3 篇,共 9 篇

人工智能是怎么工作的?

阅读约 9 分钟更新于 作者: CheblAI 编辑部
阅读语言FrançaisEnglish中文

要点速览

  • 现代 AI 是一个庞大的网络,由许多微小的计算单元,即“人工神经元”,通过称为权重或参数的数字相互连接而成。
  • 每个神经元把收到的信号相加并加权,再决定是否传出信号。这些简单的运算堆叠成几十层后,就能识别图像或生成语言。
  • AI 的全部“知识”都存储在它的参数里:GPT-3 有1750亿个参数。它们不是存放在内存里的一条条事实,而是一组组数值设置。
本页目录
基本思路:规则由推导得出,而非人工编写人工神经元:一台小小的计算器神经网络:一层层提炼出含义参数:模型“知识”所在之处训练与推理:两个不能混淆的阶段并非所有神经网络都一样需要牢记的几点常见问题来源与参考资料

基本思路:规则由推导得出,而非人工编写

假设你要写一个程序,让它认出照片里的猫。要手工写出所有规则(“两只尖耳朵、胡须……”)几乎不可能,因为猫的形状、颜色和姿态千变万化。现代 AI 绕开了这个难题:给它看数百万张标注为“猫”或“不是猫”的照片,它会自行调整内部的设置,直到能够把它们区分开。

这种调整机制叫作训练(参见AI 是如何学习的)。本文要讲的则是训练结束后得到的东西:模型本身,以及使用它时发生了什么。

人工神经元:一台小小的计算器

人工神经元(非常松散地)借鉴了大脑神经元。第一个数学模型出现于1943年(Warren McCulloch 与 Walter Pitts)。它的工作过程如下:

人工神经元示意图:多个输入分别乘以权重后相加,经过激活函数处理,得到一个输出
示意图 1 — 人工神经元:输入、权重、求和、激活、输出。
  1. 接收输入

    输入是一些数字:例如图像中像素的亮度,或者一个词的数字表示。

  2. 为每个输入加权

    每个输入都乘以一个权重,表示它的重要程度。权重大,意味着“这个信号很重要”;权重为负,意味着“这个信号起相反的作用”。

  3. 把所有结果相加

    它把加权后的输入求和,再加上一个称为偏置的小偏移量。

  4. 应用激活函数

    一条简单的规则决定传出信号的强度(例如:“如果总和为负,就什么都不传”)。没有这一步,把神经元堆叠起来就毫无意义:结果仍然只是一个简单的线性运算。

神经网络:一层层提炼出含义

神经元被组织成层。第一层接收原始数据,最后一层给出结果,中间的层(称为“隐藏层”)则逐步变换信息。这就是所谓的深度学习:“深度”指的就是层数。

三层神经网络示意图:输入层、隐藏层、输出层,以识别猫为例
示意图 2 — 神经网络:信息从左向右流动,每经过一层就被变换一次。

在识别图像的网络中,通常能观察到一种逐级递进:最前面的层检测简单的特征(轮廓、色块),接着是形状(眼睛、耳朵、车轮),最后几层则是完整的物体(人脸、猫、汽车)。这种层级结构不是任何人编程出来的,而是在训练中自然形成的。

参数:模型“知识”所在之处

一个模型全部的权重和偏置合称参数。它们就是训练所调节的“旋钮”。模型里既没有事实数据库,也没有以可读形式记住的句子:它的知识分散在数十亿个数字之中。

GPT-1、GPT-2 和 GPT-3 参数量的柱状图:约1.17亿、15亿和1750亿
示意图 3 — GPT 系列模型的参数量在两年内增长了约1500倍(对数坐标)。

模型的参数越多,能捕捉的细微差别就越多,前提是有足够的数据和算力来训练它。但更大并不总是更好:规模更小但训练得更好的模型,可以胜过更大的模型,而且使用成本更低。

训练与推理:两个不能混淆的阶段

一个 AI 模型的生命周期分为两个截然不同的阶段。

训练推理(使用)
发生了什么?模型根据数据调整自己的参数已固定的模型针对你的请求给出回答
什么时候?一次(或分几个大的阶段),在上线之前每次用户发出请求时
耗时大模型需要数周甚至数月几秒钟
成本极高:最大的模型需要数千块 GPU 和数百万美元单次请求成本低,但有数百万用户时总量巨大
模型会从我的对话中学习吗?会,但这恰恰发生在训练这一阶段不会:在对话中,它不会修改自己的参数(尽管它可以保留对话的上下文)

并非所有神经网络都一样

网络的架构要根据数据类型来调整:

  • 卷积神经网络(CNN):专攻图像。由杨立昆(Yann LeCun)早在20世纪90年代推广开来,2012年凭借 AlexNet 迎来高光时刻。
  • 循环神经网络(RNN、LSTM):为序列(文本、声音)而设计,逐词阅读。到2017年为止,它们一直主导着语言处理。
  • Transformer:2017年提出,借助注意力机制一次性并行读取整个序列。它是 ChatGPT、Claude、Gemini 的基础,也用于许多图像和音频模型(参见ChatGPT 是如何工作的)。
  • 扩散模型:专攻图像、视频和声音的生成(参见生成式 AI)。

需要牢记的几点

  • AI 并不“知道”,它只是在计算。它的回答来自数百万次数值运算,而不是有意识的推理。
  • 我们并没有完全弄明白。神经网络常常是“黑箱”:我们知道如何训练它们,却很难准确解释它们为什么给出某个回答。可解释性是一个活跃的研究领域。
  • 模型反映它的数据。如果它是在有偏见或不完整的数据上训练的,它的回答也会如此(参见局限与风险)。

常见问题

神经网络是怎么工作的?

神经网络是由许多微小计算单元组成的一层层结构。每个单元把加权后的信号相加,并把结果传给下一层。通过根据示例调整权重,网络学会识别模式:一张人脸、一个词、一种声音。

AI 里的“参数”是什么?

参数是模型内部的一个数字(权重或偏置),在训练过程中被调整。AI 的知识分散在它的参数里:GPT-3 有1750亿个参数。

训练和推理有什么区别?

训练是漫长而昂贵的阶段,模型在此阶段根据数据调整参数。推理则是使用已经训练好的模型来回答请求。

AI 会像数据库一样存储信息吗?

不会。模型里没有可供查阅的文件:它的知识以数字的形式编码,分散在参数之中,这也解释了它为什么会把细节弄混甚至编造细节。

为什么说 AI 是“黑箱”?

因为即使我们了解神经网络的架构和数据,也很难解释它在某种情况下为什么恰好给出某个回答。模型的可解释性是一个活跃的研究领域。

来源与参考资料

  1. McCulloch & Pitts, “A logical calculus of the ideas immanent in nervous activity”, 1943
  2. Rumelhart, Hinton & Williams, “Learning representations by back-propagating errors”, Nature, 1986
  3. Wikipedia — Large language model
  4. Wikipedia — GPT-3
  5. Wikipedia — Artificial neural network

独立编辑内容。文中引用的事实、日期和数据均依据页面末尾列出的来源;本内容仅供参考,不构成专业建议。