> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容 本报告围绕生成模型在AI领域的演进与应用,重点分析了GAN与Diffusion两种生成范式的差异,以及它们在图像和视频生成中的发展路径和产业应用前景。报告指出,生成模型的核心目标是学习数据分布并生成新样本,与判别模型不同,它关注的是如何从噪声或条件输入中生成符合分布的数据。当前,图像和视频生成的通用主线已转向Diffusion模型及其变体,如流匹配,而GAN并未完全退出,仍在特定场景中发挥重要作用。 ## 主要观点 - **生成模型与判别模型的区别**: - 判别模型用于识别和分类,关注类别边界。 - 生成模型用于还原数据分布,关注样本生成质量与多样性。 - **生成模型演进路径**: - VAE:显式概率建模,训练稳定但生成质量有限。 - GAN:对抗训练,生成质量高但训练不稳定。 - 自回归模型:逐元素预测,训练稳定但速度慢。 - Diffusion模型:通过多步去噪实现生成,训练稳定、分布覆盖全。 - 流匹配与得分匹配:统一不同生成范式,提升效率与可控性。 - **GAN与Diffusion的路线差异**: - **采样速度**:GAN一步生成,速度快;Diffusion多步迭代,速度较慢。 - **训练稳定性**:GAN对抗训练不稳定;Diffusion去噪回归稳定。 - **样本多样性**:GAN易模式崩溃,多样性差;Diffusion分布覆盖更全。 - **可控性与编辑能力**:GAN控制能力弱;Diffusion通过CFG、ControlNet等手段实现强可控性。 - **产业应用趋势**: - 数字AI领域:扩散与Transformer结合成为主流,如Stable Diffusion、DALL-E2、Sora等。 - 物理AI领域:生成式世界模型用于自动驾驶仿真、机器人动作生成等,但需解决条件化、长时域一致性和可靠评估等问题。 ## 关键信息 - **GAN的优势与局限**: - 优势:采样速度快,适合实时生成与特定垂类(如人脸合成)。 - 局限:训练不稳定、易模式崩溃、分布覆盖不全。 - **Diffusion的优势与局限**: - 优势:训练稳定、样本多样性好、条件控制强。 - 局限:推理速度慢、算力开销大。 - **技术演进方向**: - 流匹配与整流:减少采样步数,提升生成效率。 - 一致性模型与蒸馏:将多步生成压缩为少量步骤。 - Diffusion与Transformer结合:如DiT模型,实现高质量、可扩展的生成能力。 - **GAN思想回流**: - 通过对抗蒸馏等方式,GAN被用于提升扩散模型的生成速度和质量。 ## 风险提示 - 技术迭代不及预期。 - 大模型厂商ARR增速放缓。 - 云服务商资本开支不及预期。 - 智能驾驶及机器人商业化落地不及预期。 ## 投资建议 - 本报告认为,数字AI底座模型发展路径已清晰,但物理AI作为AI在物理世界的解决方案,具有更大的增量空间。 - 智能驾驶作为物理AI的代表性场景,应重点关注。 ## 总结 生成模型作为AI从识别世界走向生成世界的关键技术,GAN与Diffusion是当前最具代表性的两种范式。GAN以对抗训练为核心,速度快但稳定性差;Diffusion以多步去噪为核心,稳定性强但推理慢。随着技术发展,Diffusion已逐渐成为图像与视频生成的主流,而GAN在特定场景中仍有应用价值。未来,流匹配、一致性模型、Transformer结合等技术将进一步提升生成效率与质量。在产业应用中,数字AI与物理AI的发展路径各具特点,而物理AI在AI与现实世界的融合中展现出更大潜力。