汽车行业深度报告_AI系列深度08期_GAN与Diffusion两类生成范式有何差异_12页_569kb
报告摘要
汽车行业深度报告总结
核心内容
本报告围绕生成模型在AI领域的演进与应用,重点分析了GAN与Diffusion两种生成范式的差异,以及它们在图像和视频生成中的发展路径和产业应用前景。报告指出,生成模型的核心目标是学习数据分布并生成新样本,与判别模型不同,它关注的是如何从噪声或条件输入中生成符合分布的数据。当前,图像和视频生成的通用主线已转向Diffusion模型及其变体,如流匹配,而GAN并未完全退出,仍在特定场景中发挥重要作用。
主要观点
-
生成模型与判别模型的区别:
- 判别模型用于识别和分类,关注类别边界。
- 生成模型用于还原数据分布,关注样本生成质量与多样性。
-
生成模型演进路径:
- VAE:显式概率建模,训练稳定但生成质量有限。
- GAN:对抗训练,生成质量高但训练不稳定。
- 自回归模型:逐元素预测,训练稳定但速度慢。
- Diffusion模型:通过多步去噪实现生成,训练稳定、分布覆盖全。
- 流匹配与得分匹配:统一不同生成范式,提升效率与可控性。
-
GAN与Diffusion的路线差异:
- 采样速度:GAN一步生成,速度快;Diffusion多步迭代,速度较慢。
- 训练稳定性:GAN对抗训练不稳定;Diffusion去噪回归稳定。
- 样本多样性:GAN易模式崩溃,多样性差;Diffusion分布覆盖更全。
- 可控性与编辑能力:GAN控制能力弱;Diffusion通过CFG、ControlNet等手段实现强可控性。
-
产业应用趋势:
- 数字AI领域:扩散与Transformer结合成为主流,如Stable Diffusion、DALL-E2、Sora等。
- 物理AI领域:生成式世界模型用于自动驾驶仿真、机器人动作生成等,但需解决条件化、长时域一致性和可靠评估等问题。
关键信息
-
GAN的优势与局限:
- 优势:采样速度快,适合实时生成与特定垂类(如人脸合成)。
- 局限:训练不稳定、易模式崩溃、分布覆盖不全。
-
Diffusion的优势与局限:
- 优势:训练稳定、样本多样性好、条件控制强。
- 局限:推理速度慢、算力开销大。
-
技术演进方向:
- 流匹配与整流:减少采样步数,提升生成效率。
- 一致性模型与蒸馏:将多步生成压缩为少量步骤。
- Diffusion与Transformer结合:如DiT模型,实现高质量、可扩展的生成能力。
-
GAN思想回流:
- 通过对抗蒸馏等方式,GAN被用于提升扩散模型的生成速度和质量。
风险提示
- 技术迭代不及预期。
- 大模型厂商ARR增速放缓。
- 云服务商资本开支不及预期。
- 智能驾驶及机器人商业化落地不及预期。
投资建议
- 本报告认为,数字AI底座模型发展路径已清晰,但物理AI作为AI在物理世界的解决方案,具有更大的增量空间。
- 智能驾驶作为物理AI的代表性场景,应重点关注。
总结
生成模型作为AI从识别世界走向生成世界的关键技术,GAN与Diffusion是当前最具代表性的两种范式。GAN以对抗训练为核心,速度快但稳定性差;Diffusion以多步去噪为核心,稳定性强但推理慢。随着技术发展,Diffusion已逐渐成为图像与视频生成的主流,而GAN在特定场景中仍有应用价值。未来,流匹配、一致性模型、Transformer结合等技术将进一步提升生成效率与质量。在产业应用中,数字AI与物理AI的发展路径各具特点,而物理AI在AI与现实世界的融合中展现出更大潜力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载