要点速览
- 现代 AI 是一个庞大的网络,由许多微小的计算单元,即“人工神经元”,通过称为权重或参数的数字相互连接而成。
- 每个神经元把收到的信号相加并加权,再决定是否传出信号。这些简单的运算堆叠成几十层后,就能识别图像或生成语言。
- AI 的全部“知识”都存储在它的参数里:GPT-3 有1750亿个参数。它们不是存放在内存里的一条条事实,而是一组组数值设置。
本页目录
基本思路:规则由推导得出,而非人工编写
假设你要写一个程序,让它认出照片里的猫。要手工写出所有规则(“两只尖耳朵、胡须……”)几乎不可能,因为猫的形状、颜色和姿态千变万化。现代 AI 绕开了这个难题:给它看数百万张标注为“猫”或“不是猫”的照片,它会自行调整内部的设置,直到能够把它们区分开。
这种调整机制叫作训练(参见AI 是如何学习的)。本文要讲的则是训练结束后得到的东西:模型本身,以及使用它时发生了什么。
人工神经元:一台小小的计算器
人工神经元(非常松散地)借鉴了大脑神经元。第一个数学模型出现于1943年(Warren McCulloch 与 Walter Pitts)。它的工作过程如下:
- 接收输入
输入是一些数字:例如图像中像素的亮度,或者一个词的数字表示。
- 为每个输入加权
每个输入都乘以一个权重,表示它的重要程度。权重大,意味着“这个信号很重要”;权重为负,意味着“这个信号起相反的作用”。
- 把所有结果相加
它把加权后的输入求和,再加上一个称为偏置的小偏移量。
- 应用激活函数
一条简单的规则决定传出信号的强度(例如:“如果总和为负,就什么都不传”)。没有这一步,把神经元堆叠起来就毫无意义:结果仍然只是一个简单的线性运算。
神经网络:一层层提炼出含义
神经元被组织成层。第一层接收原始数据,最后一层给出结果,中间的层(称为“隐藏层”)则逐步变换信息。这就是所谓的深度学习:“深度”指的就是层数。
在识别图像的网络中,通常能观察到一种逐级递进:最前面的层检测简单的特征(轮廓、色块),接着是形状(眼睛、耳朵、车轮),最后几层则是完整的物体(人脸、猫、汽车)。这种层级结构不是任何人编程出来的,而是在训练中自然形成的。
参数:模型“知识”所在之处
一个模型全部的权重和偏置合称参数。它们就是训练所调节的“旋钮”。模型里既没有事实数据库,也没有以可读形式记住的句子:它的知识分散在数十亿个数字之中。
模型的参数越多,能捕捉的细微差别就越多,前提是有足够的数据和算力来训练它。但更大并不总是更好:规模更小但训练得更好的模型,可以胜过更大的模型,而且使用成本更低。
训练与推理:两个不能混淆的阶段
一个 AI 模型的生命周期分为两个截然不同的阶段。
| 训练 | 推理(使用) | |
|---|---|---|
| 发生了什么? | 模型根据数据调整自己的参数 | 已固定的模型针对你的请求给出回答 |
| 什么时候? | 一次(或分几个大的阶段),在上线之前 | 每次用户发出请求时 |
| 耗时 | 大模型需要数周甚至数月 | 几秒钟 |
| 成本 | 极高:最大的模型需要数千块 GPU 和数百万美元 | 单次请求成本低,但有数百万用户时总量巨大 |
| 模型会从我的对话中学习吗? | 会,但这恰恰发生在训练这一阶段 | 不会:在对话中,它不会修改自己的参数(尽管它可以保留对话的上下文) |
并非所有神经网络都一样
网络的架构要根据数据类型来调整:
- 卷积神经网络(CNN):专攻图像。由杨立昆(Yann LeCun)早在20世纪90年代推广开来,2012年凭借 AlexNet 迎来高光时刻。
- 循环神经网络(RNN、LSTM):为序列(文本、声音)而设计,逐词阅读。到2017年为止,它们一直主导着语言处理。
- Transformer:2017年提出,借助注意力机制一次性并行读取整个序列。它是 ChatGPT、Claude、Gemini 的基础,也用于许多图像和音频模型(参见ChatGPT 是如何工作的)。
- 扩散模型:专攻图像、视频和声音的生成(参见生成式 AI)。
需要牢记的几点
- AI 并不“知道”,它只是在计算。它的回答来自数百万次数值运算,而不是有意识的推理。
- 我们并没有完全弄明白。神经网络常常是“黑箱”:我们知道如何训练它们,却很难准确解释它们为什么给出某个回答。可解释性是一个活跃的研究领域。
- 模型反映它的数据。如果它是在有偏见或不完整的数据上训练的,它的回答也会如此(参见局限与风险)。
常见问题
神经网络是怎么工作的?
神经网络是由许多微小计算单元组成的一层层结构。每个单元把加权后的信号相加,并把结果传给下一层。通过根据示例调整权重,网络学会识别模式:一张人脸、一个词、一种声音。
AI 里的“参数”是什么?
参数是模型内部的一个数字(权重或偏置),在训练过程中被调整。AI 的知识分散在它的参数里:GPT-3 有1750亿个参数。
训练和推理有什么区别?
训练是漫长而昂贵的阶段,模型在此阶段根据数据调整参数。推理则是使用已经训练好的模型来回答请求。
AI 会像数据库一样存储信息吗?
不会。模型里没有可供查阅的文件:它的知识以数字的形式编码,分散在参数之中,这也解释了它为什么会把细节弄混甚至编造细节。
为什么说 AI 是“黑箱”?
因为即使我们了解神经网络的架构和数据,也很难解释它在某种情况下为什么恰好给出某个回答。模型的可解释性是一个活跃的研究领域。