要点速览
- 生成式人工智能能够创造全新的内容:文本、图像、语音、音乐、视频和代码。它从数百万个样本中学习规律,再生成看起来合理的变体。
- 在图像领域,主流技术是扩散:模型先学会去除噪声,生成时则从随机噪声出发,按照你的描述一步步“去噪”,最终得到一张图像。
- 合成内容(“深度伪造”)带来了版权、知情同意和虚假信息等问题,欧盟的监管规则已开始对其加以规范。
本页目录
生成式人工智能:重在“创造”,而不只是“分类”
“传统”人工智能(即判别式人工智能)回答的是这类问题:“这张图片是猫吗?”而生成式人工智能恰恰相反:“给我画一只宇航员猫。”它并不是复制已有的图片,而是学习了数百万张图像的统计规律(形状、纹理、风格),再据此生成与之相似的全新图像。
文本生成的原理,可参阅ChatGPT 是如何工作的。本文重点介绍图像、声音和视频。
第一代技术:GAN(2014年)
2014年,研究者 Ian Goodfellow 及其同事提出了生成对抗网络(GAN)。其原理是两个网络之间的对决:生成器负责制造假图像,判别器则努力分辨真假。在不断较量的过程中,生成器逐渐能够生成非常逼真的图像。
GAN 让“根本不存在的人”的合成人脸广为人知。但它训练难度大,也很难根据文字进行控制,后来基本被扩散模型取代。
扩散:去除噪声的艺术
扩散模型在2020年前后发表的研究成果中走红,是 DALL-E 2(2022年)、Midjourney、Stable Diffusion(2022年8月开放发布)以及众多视频生成器的基础。它的思路有些反直觉:
- 训练阶段
取一张真实图像,逐步给它添加噪声(就像电视机的雪花点),直到它变成完全随机的噪声。模型学习如何逆转每一步:一点点去除噪声。
- 生成阶段
模型从纯粹的随机噪声出发,在你的文字描述(即提示词)引导下,一步步“去噪”,图像便逐渐显现出来。
- 与文本的关联
另一个模型会把你的描述转换成数字,用来引导去噪过程。CLIP 这类模型在数百万组图像与说明文字上训练,学会了把词语和图像对应起来。
每次生成都从不同的噪声开始,所以同一个提示词每次得到的结果都不一样。
语音、音乐、视频:其他领域
| 领域 | 工作原理(简述) | 工具示例 |
|---|---|---|
| 图像 | 由文字引导的扩散 | Midjourney、Stable Diffusion、Adobe Firefly、Leonardo AI |
| 语音(语音合成) | 模型学习一个声音的特征(音色、节奏、语调),从而朗读任意文本 | ElevenLabs |
| 音乐 | 模型根据描述风格和歌词的文字生成音频信号 | Suno AI |
| 视频 | 将扩散应用于连续的图像序列,并保持时间上的一致性 | Runway Gen-4 |
| 剪辑与字幕 | 先自动转写,再编辑文本 | Descript |
更多此类工具及其替代品,请查看 AI 工具目录。
AI 生成图像和视频的技术局限
- 细节不一致:手部、画面中的文字、倒影或对称结构是典型的薄弱环节,不过新一代模型进步很快。
- 时间一致性:在视频中,要在整个时长内保持同一张脸、同一个场景和同样的物理规律,依然很困难。
- 可控性有限:想得到心中所想的画面,往往需要多次尝试,并且提示词要足够精确。
- 偏见:模型会复现训练数据中存在的刻板印象(例如把某些职业与特定性别联系起来)。
版权、知情同意与深度伪造
生成式人工智能引发了重大的法律和伦理问题,目前仍在逐步厘清之中:
- 版权:模型是在海量图像和文本上训练的,其中很多受版权保护。目前有多起诉讼正在进行,例如 Getty Images 起诉 Stability AI(2023年),以及《纽约时报》起诉 OpenAI(2023年12月)。各国规则不尽相同,且在不断变化。
- 肖像权与知情同意:未经本人同意克隆其声音或面孔,会带来严重的法律和伦理问题。
- 虚假信息:深度伪造(逼真的虚假视频或声音)可能被用来欺骗、冒充他人身份或实施骚扰。
- 透明度:欧盟人工智能法规要求告知用户其正在与 AI 交互,并标识合成内容,尤其是深度伪造;这些透明度义务自2026年8月2日起适用,对于已在市场上的系统所生成的内容,其标识义务设有宽限期,至2026年12月2日为止(参见局限、风险与监管)。
常见问题
AI 是如何生成图像的?
目前大多数生成器采用扩散模型:它从随机噪声出发,在你的文字描述引导下逐步去噪,一步一步地得到一张连贯的图像。
AI 生成的图像是在抄袭已有图片吗?
模型并不是把存储的图像碎片拼凑起来,而是根据学到的规律生成像素。不过,它可能复现某种风格,偶尔也会生成与训练数据非常接近的元素,这也是版权法律争议的来源之一。
GAN 和扩散模型有什么区别?
GAN 让两个网络(生成器和判别器)相互对抗;扩散模型则学习去除噪声,并通过逐步去噪来生成内容。如今扩散模型更稳定、更易控制,在图像生成领域占据主导地位。
AI 生成的图片可以商用吗?
这取决于所用工具的使用条款,以及所在国家(AI 生成作品的法律地位各不相同)。请仔细阅读平台条款,并避免与受保护的作品、商标或人物相似。
什么是深度伪造(deepfake)?
深度伪造是指由 AI 生成或修改、逼真模仿真实人物的内容(视频、图像或声音)。它可以用于创作,但也可能被用于传播虚假信息或冒充他人身份。