语言模型第 6 篇,共 9 篇

ChatGPT是如何工作的?大语言模型原理详解

阅读约 10 分钟更新于 作者: CheblAI 编辑部
阅读语言FrançaisEnglish中文

要点速览

  • ChatGPT、Claude或Gemini都是大语言模型(LLM):它们逐个词元(token)地预测一句话最有可能的后续内容,从而生成文本。
  • 它们的实力来自Transformer架构(2017年)及其注意力机制,该机制能把每个词与上下文中的所有其他词联系起来。
  • 由于它们预测的是“看似合理”的文本,而不是核查事实,因此可能产生“幻觉”:以十足的把握给出错误的回答。
本页目录
基本原理:预测下一个词词元:机器是如何“读”文本的Transformer与注意力机制:大语言模型的引擎上下文窗口:模型的工作记忆从语言模型到助手ChatGPT为什么有时会出错:幻觉当前主要的助手常见问题来源与参考资料

基本原理:预测下一个词

大语言模型(LLM,large language model)是一种神经网络,在海量文本上训练,目标看似朴素,只有一个:预测接下来会出现什么。比如给它“猫咪睡在”,它会估算后面每个可能的词出现的概率(“沙发上”“屋顶上”“地毯上”……),然后从中选出一个。

接着把选中的词加到句子里,再重复一遍:整段整段的文字就是这样一次次重复产生的。你看到的一切,无论是一段回答、一首诗,还是一段程序代码,都是一小块一小块地生成出来的。

预测下一个词的示意图:句子“猫咪睡在”对应沙发上、屋顶上、地毯上及其他词的概率
示意图 1 — 语言模型会估算每种可能后续内容的概率(数值仅为示意)。

词元:机器是如何“读”文本的

计算机只能理解数字。因此,文本首先会被切分成称为词元(token)的小块,它们可以是完整的词、词的一部分或标点符号。每个词元在一个包含数万个条目的词表中都有一个编号。

随后,每个词元会被转换成一长串数字,称为嵌入(embedding)。这些数字把词放在一张“语义地图”上:意思相近的词(如“狗”和“猫”)会落在相邻的位置。这一思想因word2vec(Tomas Mikolov,谷歌,2013年)而广为人知。

实际上,在英语中一个词元约相当于四分之三个单词;法语、中文等语言表达同样内容通常需要更多词元。模型的计费和使用限额都是以词元为单位的。

Transformer与注意力机制:大语言模型的引擎

2017年以前,语言模型是逐词阅读句子的,记忆也很有限。2017年6月12日,谷歌的八位研究人员发表了《Attention Is All You Need》,提出了Transformer 架构。

它的核心思想是注意力机制:为了理解一个词,模型会查看上下文中的所有其他词,并判断哪些词最重要。在“银行拒绝了这笔贷款,因为它很谨慎”这句话中,注意力机制帮助模型把“它”与“银行”而不是“贷款”联系起来。

注意力机制示意图:“它”通过粗细不同的连线与句中其他词相连,其中与“银行”的连线最粗
示意图 2 — 注意力机制:每个词都会为句中其他词的重要程度分配权重(简化示意图)。

这种架构的成功有两个原因。首先,它并行处理所有词,能充分发挥GPU的性能,因此可以训练规模大得多的模型。其次,它擅长处理长距离依赖:把文本开头的一个词与远在后面的另一个词联系起来。这篇论文已被引用超过25万次,是21世纪被引用次数最多的论文之一。

上下文窗口:模型的工作记忆

模型一次只能“看到”有限数量的文本,这就是它的上下文窗口。窗口里包含你的提问、对话历史以及正在生成的回答。GPT-3(2020年)的上限是2048个词元,只有几页文字;近期的模型能容纳多得多的内容,有些多达数十万个词元(相当于整本书)。

超出这个窗口,模型就会“忘记”之前的内容。它并不会永久记住你们的对话,除非工具另外加入了独立的记忆功能。

从语言模型到助手

单独的预训练模型只会续写文本。要把它变成助手,需要教它遵循指令(微调),再让它优先给出人类认为有用的回答(RLHF),详见人工智能是如何学习的。ChatGPT于2022年11月30日发布,基于以这种方式训练的GPT-3.5。

如今,助手会在基础模型之上叠加更多能力:

  • 网络搜索:助手查询搜索引擎并引用来源(Perplexity AI就是这个原理)。
  • 工具:运行代码、分析文件、计算、调用应用程序。
  • 多模态:理解并生成图像、声音,甚至视频。
  • 推理:有些模型在回答之前会“思考”更久,生成中间步骤,从而提升复杂问题上的表现。

ChatGPT为什么有时会出错:幻觉

幻觉是指听起来流畅可信、实际却是错误或编造的回答。它直接源于上文描述的工作方式:模型被训练去生成看似合理的文本,而不是核实事实。当缺少某条信息时,它可能用一个听上去合理的回答来填补空白。

这并非个例。2023年,两名美国律师向纽约联邦法院提交了由ChatGPT编造的法院判决(Mata v. Avianca 案),法官对其处以5000美元的罚款。2024年2月,加拿大一家法庭裁定,加拿大航空应对其聊天机器人提供的有关丧亲票价的错误信息负责。

当前主要的助手

市场上有好几个系列的模型。它们更新很快;以下是主要的几个及其开发商:

助手开发商特点
ChatGPTOpenAI(美国)知名度最高;2026年初宣布每周用户达9亿
ClaudeAnthropic(美国)基于“宪法式 AI”;在长文本和代码方面广受好评
Gemini谷歌与谷歌各项服务集成;多模态
Mistral Le ChatMistral AI(法国)欧洲厂商,提供开放权重模型
Perplexity AIPerplexity引用来源的答案引擎

想进行更细致的比较,请使用我们的对比工具,或浏览AI 工具目录。新手指南介绍了如何选择。

常见问题

ChatGPT的原理是什么,通俗地讲?

ChatGPT是一个大语言模型:一种经过训练、用来预测文本中下一个词(即词元)的神经网络。它一个词接一个词地重复这种预测,就生成了完整的回答。随后,它又经过人类示例和人类反馈的调优,才表现得像一个助手。

什么是词元(token)?

词元是一小段文本(一个词、词的一部分或一个标点符号),被转换成数字,以便模型处理。在法语中,一个单词通常对应一到两个词元。

什么是Transformer架构?

它是谷歌研究人员于2017年6月12日发表的一种神经网络架构。它采用注意力机制,把每个词与上下文中的所有其他词联系起来,并且并行处理文本。大多数大语言模型都以它为基础。

ChatGPT为什么会编造信息?

因为它的设计目标是生成看似合理的文本,而不是核实事实。当信息不足时,它可能生成一个听上去合理但实际错误的回答,这就是所谓的幻觉。因此,重要信息一定要核实。

ChatGPT能上网吗?

模型本身不会访问互联网:它的知识截止于训练日期。不过,ChatGPT和其他助手可以配备网络搜索功能,用来查找最新信息并引用来源。

来源与参考资料

  1. Vaswani et al., “Attention Is All You Need”, arXiv, 2017
  2. Wikipedia — Large language model
  3. Wikipedia — ChatGPT
  4. Wikipedia — Hallucination (artificial intelligence)
  5. Wikipedia — Mata v. Avianca, Inc.
  6. Mikolov et al., “Efficient Estimation of Word Representations in Vector Space” (word2vec), 2013
  7. Brown et al. (OpenAI), “Language Models are Few-Shot Learners” (GPT-3), 2020

独立编辑内容。文中引用的事实、日期和数据均依据页面末尾列出的来源;本内容仅供参考,不构成专业建议。