要点速览
- ChatGPT、Claude或Gemini都是大语言模型(LLM):它们逐个词元(token)地预测一句话最有可能的后续内容,从而生成文本。
- 它们的实力来自Transformer架构(2017年)及其注意力机制,该机制能把每个词与上下文中的所有其他词联系起来。
- 由于它们预测的是“看似合理”的文本,而不是核查事实,因此可能产生“幻觉”:以十足的把握给出错误的回答。
本页目录
基本原理:预测下一个词
大语言模型(LLM,large language model)是一种神经网络,在海量文本上训练,目标看似朴素,只有一个:预测接下来会出现什么。比如给它“猫咪睡在”,它会估算后面每个可能的词出现的概率(“沙发上”“屋顶上”“地毯上”……),然后从中选出一个。
接着把选中的词加到句子里,再重复一遍:整段整段的文字就是这样一次次重复产生的。你看到的一切,无论是一段回答、一首诗,还是一段程序代码,都是一小块一小块地生成出来的。
词元:机器是如何“读”文本的
计算机只能理解数字。因此,文本首先会被切分成称为词元(token)的小块,它们可以是完整的词、词的一部分或标点符号。每个词元在一个包含数万个条目的词表中都有一个编号。
随后,每个词元会被转换成一长串数字,称为嵌入(embedding)。这些数字把词放在一张“语义地图”上:意思相近的词(如“狗”和“猫”)会落在相邻的位置。这一思想因word2vec(Tomas Mikolov,谷歌,2013年)而广为人知。
实际上,在英语中一个词元约相当于四分之三个单词;法语、中文等语言表达同样内容通常需要更多词元。模型的计费和使用限额都是以词元为单位的。
Transformer与注意力机制:大语言模型的引擎
2017年以前,语言模型是逐词阅读句子的,记忆也很有限。2017年6月12日,谷歌的八位研究人员发表了《Attention Is All You Need》,提出了Transformer 架构。
它的核心思想是注意力机制:为了理解一个词,模型会查看上下文中的所有其他词,并判断哪些词最重要。在“银行拒绝了这笔贷款,因为它很谨慎”这句话中,注意力机制帮助模型把“它”与“银行”而不是“贷款”联系起来。
这种架构的成功有两个原因。首先,它并行处理所有词,能充分发挥GPU的性能,因此可以训练规模大得多的模型。其次,它擅长处理长距离依赖:把文本开头的一个词与远在后面的另一个词联系起来。这篇论文已被引用超过25万次,是21世纪被引用次数最多的论文之一。
上下文窗口:模型的工作记忆
模型一次只能“看到”有限数量的文本,这就是它的上下文窗口。窗口里包含你的提问、对话历史以及正在生成的回答。GPT-3(2020年)的上限是2048个词元,只有几页文字;近期的模型能容纳多得多的内容,有些多达数十万个词元(相当于整本书)。
超出这个窗口,模型就会“忘记”之前的内容。它并不会永久记住你们的对话,除非工具另外加入了独立的记忆功能。
从语言模型到助手
单独的预训练模型只会续写文本。要把它变成助手,需要教它遵循指令(微调),再让它优先给出人类认为有用的回答(RLHF),详见人工智能是如何学习的。ChatGPT于2022年11月30日发布,基于以这种方式训练的GPT-3.5。
如今,助手会在基础模型之上叠加更多能力:
- 网络搜索:助手查询搜索引擎并引用来源(Perplexity AI就是这个原理)。
- 工具:运行代码、分析文件、计算、调用应用程序。
- 多模态:理解并生成图像、声音,甚至视频。
- 推理:有些模型在回答之前会“思考”更久,生成中间步骤,从而提升复杂问题上的表现。
ChatGPT为什么有时会出错:幻觉
幻觉是指听起来流畅可信、实际却是错误或编造的回答。它直接源于上文描述的工作方式:模型被训练去生成看似合理的文本,而不是核实事实。当缺少某条信息时,它可能用一个听上去合理的回答来填补空白。
这并非个例。2023年,两名美国律师向纽约联邦法院提交了由ChatGPT编造的法院判决(Mata v. Avianca 案),法官对其处以5000美元的罚款。2024年2月,加拿大一家法庭裁定,加拿大航空应对其聊天机器人提供的有关丧亲票价的错误信息负责。
当前主要的助手
市场上有好几个系列的模型。它们更新很快;以下是主要的几个及其开发商:
| 助手 | 开发商 | 特点 |
|---|---|---|
| ChatGPT | OpenAI(美国) | 知名度最高;2026年初宣布每周用户达9亿 |
| Claude | Anthropic(美国) | 基于“宪法式 AI”;在长文本和代码方面广受好评 |
| Gemini | 谷歌 | 与谷歌各项服务集成;多模态 |
| Mistral Le Chat | Mistral AI(法国) | 欧洲厂商,提供开放权重模型 |
| Perplexity AI | Perplexity | 引用来源的答案引擎 |
常见问题
ChatGPT的原理是什么,通俗地讲?
ChatGPT是一个大语言模型:一种经过训练、用来预测文本中下一个词(即词元)的神经网络。它一个词接一个词地重复这种预测,就生成了完整的回答。随后,它又经过人类示例和人类反馈的调优,才表现得像一个助手。
什么是词元(token)?
词元是一小段文本(一个词、词的一部分或一个标点符号),被转换成数字,以便模型处理。在法语中,一个单词通常对应一到两个词元。
什么是Transformer架构?
它是谷歌研究人员于2017年6月12日发表的一种神经网络架构。它采用注意力机制,把每个词与上下文中的所有其他词联系起来,并且并行处理文本。大多数大语言模型都以它为基础。
ChatGPT为什么会编造信息?
因为它的设计目标是生成看似合理的文本,而不是核实事实。当信息不足时,它可能生成一个听上去合理但实际错误的回答,这就是所谓的幻觉。因此,重要信息一定要核实。
ChatGPT能上网吗?
模型本身不会访问互联网:它的知识截止于训练日期。不过,ChatGPT和其他助手可以配备网络搜索功能,用来查找最新信息并引用来源。
来源与参考资料
- Vaswani et al., “Attention Is All You Need”, arXiv, 2017
- Wikipedia — Large language model
- Wikipedia — ChatGPT
- Wikipedia — Hallucination (artificial intelligence)
- Wikipedia — Mata v. Avianca, Inc.
- Mikolov et al., “Efficient Estimation of Word Representations in Vector Space” (word2vec), 2013
- Brown et al. (OpenAI), “Language Models are Few-Shot Learners” (GPT-3), 2020