生成式人工智能第 7 篇,共 9 篇

生成式人工智能:AI 是如何创作图像、视频和声音的

阅读约 9 分钟更新于 作者: CheblAI 编辑部
阅读语言FrançaisEnglish中文

要点速览

  • 生成式人工智能能够创造全新的内容:文本、图像、语音、音乐、视频和代码。它从数百万个样本中学习规律,再生成看起来合理的变体。
  • 在图像领域,主流技术是扩散:模型先学会去除噪声,生成时则从随机噪声出发,按照你的描述一步步“去噪”,最终得到一张图像。
  • 合成内容(“深度伪造”)带来了版权、知情同意和虚假信息等问题,欧盟的监管规则已开始对其加以规范。
本页目录
生成式人工智能:重在“创造”,而不只是“分类”第一代技术:GAN(2014年)扩散:去除噪声的艺术语音、音乐、视频:其他领域AI 生成图像和视频的技术局限版权、知情同意与深度伪造常见问题来源与参考资料

生成式人工智能:重在“创造”,而不只是“分类”

“传统”人工智能(即判别式人工智能)回答的是这类问题:“这张图片是猫吗?”而生成式人工智能恰恰相反:“给我画一只宇航员猫。”它并不是复制已有的图片,而是学习了数百万张图像的统计规律(形状、纹理、风格),再据此生成与之相似的全新图像。

文本生成的原理,可参阅ChatGPT 是如何工作的。本文重点介绍图像、声音和视频。

第一代技术:GAN(2014年)

2014年,研究者 Ian Goodfellow 及其同事提出了生成对抗网络(GAN)。其原理是两个网络之间的对决:生成器负责制造假图像,判别器则努力分辨真假。在不断较量的过程中,生成器逐渐能够生成非常逼真的图像。

GAN 让“根本不存在的人”的合成人脸广为人知。但它训练难度大,也很难根据文字进行控制,后来基本被扩散模型取代。

扩散:去除噪声的艺术

扩散模型在2020年前后发表的研究成果中走红,是 DALL-E 2(2022年)、Midjourney、Stable Diffusion(2022年8月开放发布)以及众多视频生成器的基础。它的思路有些反直觉:

扩散过程示意图:训练时,图像逐步变成噪声;生成时,模型从噪声出发,在文字引导下还原出一张图像
示意图 1 — 扩散:先学会加噪声,再学会去噪声,从而创造图像。
  1. 训练阶段

    取一张真实图像,逐步给它添加噪声(就像电视机的雪花点),直到它变成完全随机的噪声。模型学习如何逆转每一步:一点点去除噪声。

  2. 生成阶段

    模型从纯粹的随机噪声出发,在你的文字描述(即提示词)引导下,一步步“去噪”,图像便逐渐显现出来。

  3. 与文本的关联

    另一个模型会把你的描述转换成数字,用来引导去噪过程。CLIP 这类模型在数百万组图像与说明文字上训练,学会了把词语和图像对应起来。

每次生成都从不同的噪声开始,所以同一个提示词每次得到的结果都不一样。

语音、音乐、视频:其他领域

领域工作原理(简述)工具示例
图像由文字引导的扩散Midjourney、Stable Diffusion、Adobe Firefly、Leonardo AI
语音(语音合成)模型学习一个声音的特征(音色、节奏、语调),从而朗读任意文本ElevenLabs
音乐模型根据描述风格和歌词的文字生成音频信号Suno AI
视频将扩散应用于连续的图像序列,并保持时间上的一致性Runway Gen-4
剪辑与字幕先自动转写,再编辑文本Descript

更多此类工具及其替代品,请查看 AI 工具目录。

AI 生成图像和视频的技术局限

  • 细节不一致:手部、画面中的文字、倒影或对称结构是典型的薄弱环节,不过新一代模型进步很快。
  • 时间一致性:在视频中,要在整个时长内保持同一张脸、同一个场景和同样的物理规律,依然很困难。
  • 可控性有限:想得到心中所想的画面,往往需要多次尝试,并且提示词要足够精确。
  • 偏见:模型会复现训练数据中存在的刻板印象(例如把某些职业与特定性别联系起来)。

版权、知情同意与深度伪造

生成式人工智能引发了重大的法律和伦理问题,目前仍在逐步厘清之中:

  • 版权:模型是在海量图像和文本上训练的,其中很多受版权保护。目前有多起诉讼正在进行,例如 Getty Images 起诉 Stability AI(2023年),以及《纽约时报》起诉 OpenAI(2023年12月)。各国规则不尽相同,且在不断变化。
  • 肖像权与知情同意:未经本人同意克隆其声音或面孔,会带来严重的法律和伦理问题。
  • 虚假信息:深度伪造(逼真的虚假视频或声音)可能被用来欺骗、冒充他人身份或实施骚扰。
  • 透明度:欧盟人工智能法规要求告知用户其正在与 AI 交互,并标识合成内容,尤其是深度伪造;这些透明度义务自2026年8月2日起适用,对于已在市场上的系统所生成的内容,其标识义务设有宽限期,至2026年12月2日为止(参见局限、风险与监管)。

常见问题

AI 是如何生成图像的?

目前大多数生成器采用扩散模型:它从随机噪声出发,在你的文字描述引导下逐步去噪,一步一步地得到一张连贯的图像。

AI 生成的图像是在抄袭已有图片吗?

模型并不是把存储的图像碎片拼凑起来,而是根据学到的规律生成像素。不过,它可能复现某种风格,偶尔也会生成与训练数据非常接近的元素,这也是版权法律争议的来源之一。

GAN 和扩散模型有什么区别?

GAN 让两个网络(生成器和判别器)相互对抗;扩散模型则学习去除噪声,并通过逐步去噪来生成内容。如今扩散模型更稳定、更易控制,在图像生成领域占据主导地位。

AI 生成的图片可以商用吗?

这取决于所用工具的使用条款,以及所在国家(AI 生成作品的法律地位各不相同)。请仔细阅读平台条款,并避免与受保护的作品、商标或人物相似。

什么是深度伪造(deepfake)?

深度伪造是指由 AI 生成或修改、逼真模仿真实人物的内容(视频、图像或声音)。它可以用于创作,但也可能被用于传播虚假信息或冒充他人身份。

来源与参考资料

  1. Goodfellow et al., “Generative Adversarial Nets”, 2014
  2. Ho, Jain & Abbeel, “Denoising Diffusion Probabilistic Models”, 2020
  3. Rombach et al., “High-Resolution Image Synthesis with Latent Diffusion Models”, 2022
  4. Wikipedia — Stable Diffusion
  5. 欧盟委员会 — AI Act

独立编辑内容。文中引用的事实、日期和数据均依据页面末尾列出的来源;本内容仅供参考,不构成专业建议。