要点速览
- 人工智能通过不断重复一个循环来学习:先做出预测,再衡量误差,然后略微调整参数。经过数十亿次重复,误差会变得很小。
- 学习方式主要有三类:借助带有正确答案的示例(监督学习)、自行发现数据中的结构(无监督学习),或通过试错与奖励(强化学习)。
- 像ChatGPT这样的助手会结合多种方法:先在海量文本上预测下一个词,再借助人类反馈(RLHF)进行调优。
学习循环:预测、衡量误差、修正
无论采用哪种方法,学习几乎都是把下面四个步骤重复数百万乃至数十亿次。
- 预测
模型接收一条数据(一张照片、一句被截断的话)并给出答案。起初,它的参数是随机的,所以答案毫无道理。
- 衡量误差
通过损失函数把模型的答案与正确答案进行比较。损失函数是一个数值,表示“模型错得有多离谱”。
- 修正
算法会计算每个参数应该朝哪个方向、调整多少,才能减小误差。这种修正依靠梯度下降和反向传播来完成,下文会详细介绍。
- 重新开始
接着处理下一个示例。误差会逐步减小。
梯度下降:在迷雾中走下山
想象你在浓雾笼罩的山上迷了路,想要走到山谷。你看不见周围的景色,却能感觉到脚下的坡度。每走一步,你都朝着下坡最陡的方向前进一点。这正是梯度下降所做的事:海拔代表误差,每一步都在调整参数,以减小误差。
要为数十亿个参数分别算出这个“坡度”,靠的是梯度反向传播(backpropagation)这一高效方法。它于1986年由大卫·鲁梅尔哈特(David Rumelhart)、杰弗里·辛顿和罗纳德·威廉姆斯(Ronald Williams)推广开来,从最终结果出发,逐层回溯到最初的几层,以确定每个参数对误差应负多大的责任。
三种主要的学习方式
1. 监督学习:在老师指导下学习
我们给模型提供带有标注的示例:“这张图片是一只猫”“这封邮件是垃圾邮件”“这张X光片显示有肿瘤”。模型学习还原出这些标注。图像识别(例如2012年借助ImageNet数据集取得突破的AlexNet)、垃圾邮件过滤和银行欺诈检测,背后都是这种方法。它的弱点是:需要大量正确的示例,而且往往要由人工来标注。
2. 无监督学习与自监督学习:没有标注也能学习
这里不提供任何“正确答案”,模型必须自己发现数据中的结构,例如把行为相近的客户归为一类。其中一个重要的变体是自监督学习:它从原始数据中自行设计练习题,比如把句子里的一个词遮住,让模型去猜。大语言模型正是这样在数十亿页文本上完成预训练的。
3. 强化学习:通过试错与奖励来学习
一个“智能体”在环境中行动,并获得奖励或惩罚。它学习的是能让长期收益最大化的策略,就像孩子学骑自行车一样。AlphaGo(谷歌DeepMind)在与自己进行了海量对局之后,于2016年3月击败李世石,靠的就是这种方法;它也被用于训练机器人,以及对对话式助手进行调优。
那么ChatGPT呢?分多个阶段学习
现代对话式助手并不只靠一种方式学习,而是依次结合多种方法:
- 自监督预训练
模型阅读海量文本(网页、书籍、代码、百科全书),学习预测下一个词,更准确地说,是下一个词元(token)。这是成本最高的阶段。
- 监督微调
人类针对各种指令撰写优质回答的示例。模型由此学会遵循指令,而不是单纯地续写文本。OpenAI于2022年通过InstructGPT介绍了这一方法。
- 基于人类反馈的强化学习(RLHF)
人类评估员把模型的多个回答按从优到劣排序。另一个称为“奖励模型”的模型学习预测这些偏好,再通过强化学习用来调优助手。Anthropic提出了一种变体,即“宪法式 AI”,由一份书面原则清单来引导模型。
这些步骤的更多细节,请参阅人工智能是如何打造的和ChatGPT是如何工作的。
学习中的陷阱
- 过拟合(overfitting):模型对训练示例“死记硬背”,而不是学会举一反三。它能答对见过的题,遇到新题就会出错。检测方法是用模型从未见过的数据来测试它。
- 数据偏见:如果模型学习的数据不均衡或带有歧视性,就会复制这些缺陷(参见局限与风险)。
- 标注质量:如果示例标注有误,模型就会学到错误。“Garbage in, garbage out”(垃圾进,垃圾出)是该领域一句经典的格言。
- 能源成本:训练最大的模型需要数以千计的处理器连续运行数周。
常见问题
人工智能到底是怎么学习的?
它不断重复一个循环:先做出预测,用损失函数衡量误差,再略微调整参数以减小误差。经过数十亿次数据上的重复,误差就会变得很小。
监督学习和无监督学习有什么区别?
在监督学习中,每个示例都附有正确答案(例如一张标注为“猫”的图片)。在无监督学习中,则不提供正确答案,由模型自己在数据中寻找结构。
什么是反向传播?
它是一种算法,用来计算神经网络中每个参数对最终误差的“贡献”有多大,从而高效地修正数十亿个参数。它于1986年由Rumelhart、Hinton和Williams推广开来。
什么是RLHF?
RLHF(基于人类反馈的强化学习)是一个训练阶段:由人类对人工智能的回答进行排序,奖励模型学习这些偏好,再用来调优助手,使它的回答更有用、更安全。
人工智能上线之后还会继续学习吗?
通常不会:已部署模型的参数是固定的。它可以记住一次对话的上下文,但不会从中学习。不过,开发商可以根据其隐私政策,用收集到的数据训练新版本。
来源与参考资料
- Rumelhart, Hinton & Williams, “Learning representations by back-propagating errors”, Nature, 1986
- Ouyang et al. (OpenAI), “Training language models to follow instructions with human feedback” (InstructGPT), 2022
- Wikipedia — Reinforcement learning from human feedback
- Bai et al. (Anthropic), “Constitutional AI: Harmlessness from AI Feedback”, 2022
- Wikipedia — AlphaGo versus Lee Sedol