学习方式第 4 篇,共 9 篇

人工智能是如何学习的?

阅读约 9 分钟更新于 作者: CheblAI 编辑部
阅读语言FrançaisEnglish中文

要点速览

  • 人工智能通过不断重复一个循环来学习:先做出预测,再衡量误差,然后略微调整参数。经过数十亿次重复,误差会变得很小。
  • 学习方式主要有三类:借助带有正确答案的示例(监督学习)、自行发现数据中的结构(无监督学习),或通过试错与奖励(强化学习)。
  • 像ChatGPT这样的助手会结合多种方法:先在海量文本上预测下一个词,再借助人类反馈(RLHF)进行调优。
本页目录
学习循环:预测、衡量误差、修正梯度下降:在迷雾中走下山三种主要的学习方式那么ChatGPT呢?分多个阶段学习学习中的陷阱常见问题来源与参考资料

学习循环:预测、衡量误差、修正

无论采用哪种方法,学习几乎都是把下面四个步骤重复数百万乃至数十亿次。

四步循环示意图:预测、衡量误差、修正参数、重新开始
示意图 1 — 神经网络的训练循环。
  1. 预测

    模型接收一条数据(一张照片、一句被截断的话)并给出答案。起初,它的参数是随机的,所以答案毫无道理。

  2. 衡量误差

    通过损失函数把模型的答案与正确答案进行比较。损失函数是一个数值,表示“模型错得有多离谱”。

  3. 修正

    算法会计算每个参数应该朝哪个方向、调整多少,才能减小误差。这种修正依靠梯度下降和反向传播来完成,下文会详细介绍。

  4. 重新开始

    接着处理下一个示例。误差会逐步减小。

梯度下降:在迷雾中走下山

想象你在浓雾笼罩的山上迷了路,想要走到山谷。你看不见周围的景色,却能感觉到脚下的坡度。每走一步,你都朝着下坡最陡的方向前进一点。这正是梯度下降所做的事:海拔代表误差,每一步都在调整参数,以减小误差。

要为数十亿个参数分别算出这个“坡度”,靠的是梯度反向传播(backpropagation)这一高效方法。它于1986年由大卫·鲁梅尔哈特(David Rumelhart)、杰弗里·辛顿和罗纳德·威廉姆斯(Ronald Williams)推广开来,从最终结果出发,逐层回溯到最初的几层,以确定每个参数对误差应负多大的责任。

三种主要的学习方式

三张卡片:带标注示例的监督学习、无标注的无监督学习、依靠奖励的强化学习
示意图 2 — 机器学习的三大类别。

1. 监督学习:在老师指导下学习

我们给模型提供带有标注的示例:“这张图片是一只猫”“这封邮件是垃圾邮件”“这张X光片显示有肿瘤”。模型学习还原出这些标注。图像识别(例如2012年借助ImageNet数据集取得突破的AlexNet)、垃圾邮件过滤和银行欺诈检测,背后都是这种方法。它的弱点是:需要大量正确的示例,而且往往要由人工来标注。

2. 无监督学习与自监督学习:没有标注也能学习

这里不提供任何“正确答案”,模型必须自己发现数据中的结构,例如把行为相近的客户归为一类。其中一个重要的变体是自监督学习:它从原始数据中自行设计练习题,比如把句子里的一个词遮住,让模型去猜。大语言模型正是这样在数十亿页文本上完成预训练的。

3. 强化学习:通过试错与奖励来学习

一个“智能体”在环境中行动,并获得奖励或惩罚。它学习的是能让长期收益最大化的策略,就像孩子学骑自行车一样。AlphaGo(谷歌DeepMind)在与自己进行了海量对局之后,于2016年3月击败李世石,靠的就是这种方法;它也被用于训练机器人,以及对对话式助手进行调优。

那么ChatGPT呢?分多个阶段学习

现代对话式助手并不只靠一种方式学习,而是依次结合多种方法:

  1. 自监督预训练

    模型阅读海量文本(网页、书籍、代码、百科全书),学习预测下一个词,更准确地说,是下一个词元(token)。这是成本最高的阶段。

  2. 监督微调

    人类针对各种指令撰写优质回答的示例。模型由此学会遵循指令,而不是单纯地续写文本。OpenAI于2022年通过InstructGPT介绍了这一方法。

  3. 基于人类反馈的强化学习(RLHF)

    人类评估员把模型的多个回答按从优到劣排序。另一个称为“奖励模型”的模型学习预测这些偏好,再通过强化学习用来调优助手。Anthropic提出了一种变体,即“宪法式 AI”,由一份书面原则清单来引导模型。

这些步骤的更多细节,请参阅人工智能是如何打造的和ChatGPT是如何工作的。

学习中的陷阱

  • 过拟合(overfitting):模型对训练示例“死记硬背”,而不是学会举一反三。它能答对见过的题,遇到新题就会出错。检测方法是用模型从未见过的数据来测试它。
  • 数据偏见:如果模型学习的数据不均衡或带有歧视性,就会复制这些缺陷(参见局限与风险)。
  • 标注质量:如果示例标注有误,模型就会学到错误。“Garbage in, garbage out”(垃圾进,垃圾出)是该领域一句经典的格言。
  • 能源成本:训练最大的模型需要数以千计的处理器连续运行数周。

常见问题

人工智能到底是怎么学习的?

它不断重复一个循环:先做出预测,用损失函数衡量误差,再略微调整参数以减小误差。经过数十亿次数据上的重复,误差就会变得很小。

监督学习和无监督学习有什么区别?

在监督学习中,每个示例都附有正确答案(例如一张标注为“猫”的图片)。在无监督学习中,则不提供正确答案,由模型自己在数据中寻找结构。

什么是反向传播?

它是一种算法,用来计算神经网络中每个参数对最终误差的“贡献”有多大,从而高效地修正数十亿个参数。它于1986年由Rumelhart、Hinton和Williams推广开来。

什么是RLHF?

RLHF(基于人类反馈的强化学习)是一个训练阶段:由人类对人工智能的回答进行排序,奖励模型学习这些偏好,再用来调优助手,使它的回答更有用、更安全。

人工智能上线之后还会继续学习吗?

通常不会:已部署模型的参数是固定的。它可以记住一次对话的上下文,但不会从中学习。不过,开发商可以根据其隐私政策,用收集到的数据训练新版本。

来源与参考资料

  1. Rumelhart, Hinton & Williams, “Learning representations by back-propagating errors”, Nature, 1986
  2. Ouyang et al. (OpenAI), “Training language models to follow instructions with human feedback” (InstructGPT), 2022
  3. Wikipedia — Reinforcement learning from human feedback
  4. Bai et al. (Anthropic), “Constitutional AI: Harmlessness from AI Feedback”, 2022
  5. Wikipedia — AlphaGo versus Lee Sedol

独立编辑内容。文中引用的事实、日期和数据均依据页面末尾列出的来源;本内容仅供参考,不构成专业建议。