要点速览
- 打造一个现代人工智能需要三种资源:数据、算力(GPU)以及研究人员和工程师团队。
- 整个流程步骤明确:数据收集与清洗、预训练、微调、与人类偏好对齐、评估,最后是部署。
- 最大规模模型的成本相当高昂;据国际能源署(IEA)预测,到2030年,数据中心的耗电量可能增长一倍以上。
本页目录
全景概览:人工智能模型的生命周期
打造ChatGPT、Claude、Gemini或Mistral这样的助手,并不是给智能“编程”。这是一个分为多个阶段的工业化项目,需要数百人参与和庞大的基础设施。
下面逐一展开说明。
第1步:收集并整理数据
语言模型要在海量文本上训练。GPT-3(2020年)训练时使用了约3000亿个词元(token),取自约5000亿词元的语料库;其中过半来自Common Crawl(对大部分网络内容的公开副本),另外还有书籍、维基百科页面和其他语料库。
但原始数据不能直接使用,需要:
- 过滤低质量内容、重复内容和垃圾信息;
- 尽可能剔除个人信息和违法内容;
- 平衡各类来源和语言;
- 遵守法律:使用受保护的作品来训练人工智能,已引发多起诉讼,例如《纽约时报》诉OpenAI和微软一案,该案于2023年12月提起。
第2步:预训练,最耗资源的阶段
模型在整个语料库上学习预测下一个词元。这是最耗算力的阶段,也让模型获得了语言和文化方面的通用知识。
预训练依赖GPU(graphics processing units,图形处理器)。这种处理器最初是为电子游戏设计的,能够并行执行成千上万个小规模计算,非常适合神经网络。2012年的AlexNet只用了两块消费级显卡。如今,一个大型模型需要在数据中心调用数万块GPU,持续数周甚至数月。
以下是文献中公布的数量级(均为估算,因为企业并不总会披露真实成本):GPT-2(2019年)约5万美元,PaLM(2022年)约800万美元,而近期最大的模型则高达数亿美元。DeepSeek(深度求索)在2025年1月声称,其V3模型的训练算力成本约为560万美元,但据观察人士分析,这一数字只涵盖了总成本的一部分。
研究人员观察到的“缩放定律”表明:当模型规模、数据量和算力同时增加时,性能会稳步提升。OpenAI(2020年)以及随后DeepMind借助Chinchilla模型(2022年)发表的这些观察结果,推动了模型规模的竞赛。
第3步和第4步:微调与对齐
预训练结束时,模型已经会“续写文本”,但还不是助手:如果你向它提问,它可能用另一个问题来回应,或者像论坛帖子那样接着往下写。有两个步骤能让它变得有用且安全:
- 监督微调(fine-tuning):用数千到数万条由人类撰写的优质对话示例对模型重新训练。
- 对齐,尤其是通过RLHF(基于人类反馈的强化学习):评估员对回答进行排序,模型据此调整,以给出更有用、更诚实、更无害的回答。一些实验室还会加入书面原则(例如Anthropic的宪法式 AI)。
这些步骤的成本比预训练低得多,但对用户所感知到的助手质量起着决定性作用。
第5步:评估与安全测试
发布模型之前,团队会让它接受基准测试(benchmark):一系列标准化测试,涵盖数学、代码、通用知识、文本理解等。团队还会进行红队测试(red teaming):专家有意设下陷阱,试图找出模型的漏洞(危险回答、数据泄露、偏见)。
第6步:部署与持续改进
随后,模型会以多种方式提供给用户:聊天网站、应用程序,或是开发者集成到自己软件中的API。每一次回答都需要算力(即推理),这也解释了为什么有些服务需要付费,或限制请求次数。
上线之后,开发商会监测使用情况、修复缺陷,并定期发布新版本。一些公司会公开其模型的“权重”,用户可以下载并自行运行:这类模型称为开放权重模型(open weights),例如Mistral AI或DeepSeek的模型。另一些公司则保持模型闭源,只通过自己的服务提供。
能源与环境成本
数据中心既要消耗电力来训练模型,也要消耗电力来响应每天数以百万计的请求。据国际能源署(IEA)统计,2024年数据中心的耗电量约为415太瓦时(TWh),约占全球电力的1.5%。国际能源署预计,到2030年这一数字将翻一番,达到约945太瓦时,其中人工智能是推动增长的主要因素之一。
影响大小因所用能源、冷却方式和模型效率而差异很大。研究人员正在努力降低这一成本:更小的模型、更高效的芯片、压缩技术。对用户来说,也有一些简单的做法:根据任务选择合适的模型,而不是一味选最大的;避免不必要的请求。
谁在打造人工智能?
最大规模模型的研发由少数几家机构主导:OpenAI(成立于2015年12月)、谷歌DeepMind、Anthropic(成立于2021年)、Meta、Mistral AI(法国,2023年)、DeepSeek(中国,2023年)等。据斯坦福大学《AI Index 2026》,超过90%的知名模型来自产业界而非学术界,美国和中国在其中都扮演着重要角色。
你可以在我们的AI 工具目录中了解并对比这些机构推出的助手,例如ChatGPT、Claude、Gemini或Mistral Le Chat。
常见问题
如何打造一个人工智能?
先收集大量数据,再借助算力(GPU)在数据上训练神经网络,然后用人类示例和人类反馈对它进行调优,接着进行评估,最后通过应用程序或API部署上线。
训练一个人工智能要花多少钱?
差别极大:小模型只需几千美元,最大的模型则要数亿美元。作为已公布的数量级参考:GPT-2(2019年)约5万美元,PaLM(2022年)约800万美元。近期模型的真实数字很少公开。
为什么人工智能要用GPU?
因为这类处理器最初为图形处理而设计,可以同时执行成千上万个计算。而训练神经网络恰好是大量相似的运算,非常适合并行计算。
我可以自己做一个人工智能吗?
可以,但只能是小规模的。你可以用自己的数据训练一个小模型,或者更简单地,在电脑或云服务上对现有的开放权重模型进行微调。从零开始训练超大模型,仍然只有资源雄厚的机构才能做到。
人工智能很耗电吗?
从整体上看,是的:据国际能源署统计,2024年数据中心约占全球电力的1.5%(415太瓦时),到2030年可能达到约945太瓦时。单次请求耗电很少,但用户数以百万计,总量就很可观。
来源与参考资料
- 国际能源署 (IEA) — Energy and AI (2025)
- Stanford HAI — AI Index Report 2026
- Wikipedia — GPT-3
- Wikipedia — Large language model(训练成本与缩放定律)
- Wikipedia — DeepSeek
- Hoffmann et al. (DeepMind), “Training Compute-Optimal Large Language Models” (Chinchilla), 2022
- Kaplan et al. (OpenAI), “Scaling Laws for Neural Language Models”, 2020