人工智能行业AI模型系列报告:从世界模型看算力需求变化_20页_3mb
报告摘要
AI模型系列报告:从世界模型看算力需求变化
核心观点
- Sora是首个展现“涌现”能力的视频生成模型:随着模型规模的扩大,Sora能够理解世界,这是其在视频生成领域的重要突破。
- Sora的成功依赖于DiffusionTransformer架构与高质量数据积累:Sora通过引入Transformer架构和优化数据处理流程,显著提升了视频生成的质量与灵活性。
- 视频生成模型正走向算力密集型:Sora的推理过程相较于大语言模型,更依赖于芯片算力和内存容量,而对内存带宽的需求相对较低。
- Sora将对影视与游戏行业产生深远影响:它有望降低内容制作门槛,重塑影视与游戏制作流程,提升创作效率与质量。
一、Sora模型的特点
1.1 Sora在生成视频的质量、灵活性和时长方面具有显著优势
- 视频时长:Sora可生成长达60秒的视频,远超之前模型的3s-18s。
- 分辨率与比例:支持1080P任意比例视频生成,克服了传统模型对固定比例的限制。
- 高保真渲染:在模拟数字世界(如Minecraft)时,Sora可生成接近真实画面的视频。
- Scaling Law的体现:更高的算力、更大的模型规模和更多的Patch数量能显著提升生成效果。
- 三维空间连贯性:生成的视频具有正确的空间关系和动态相机运动,保证内容连贯。
- 任务场景多样:支持图生视频、文生图片、文+图生视频、视频拓展、视频编辑、连接两个视频等任务。
二、视频生成模型的历史与现状
2.1 文生视频的发展历程
- 起源:最早可追溯至2015年的GAN生成模型。
- 挑战:包括计算成本高、视频信息复杂、高质量数据集缺乏、视频描述模糊等。
2.2 GAN与VAE时代
- 早期模型:如Text2Filter和TGANs-C,局限于低分辨率和短时长。
- 局限性:难以处理复杂的场景变化和多维信息。
2.3 Transformer架构的引入
- 第二波浪潮:以Phenaki、Make-A-Vide、VideoGPT等为代表。
- 创新点:能够根据故事情节生成任意长度的视频,提升生成能力。
2.4 Diffusion架构的兴起
- 第三波浪潮:基于扩散模型,如VDM、MagicVideo、Tune-a-Video等。
- 优势:在生成多样化、超现实和上下文丰富的视频方面表现突出。
2.5 视频生成模型的前沿发展
- 时空块处理:将卷积网络拓展为Diffusion Model,提升视频生成能力。
- 国内进展:多数文生视频模型仍处于Diffusion阶段,但研发机构正在快速跟进。
三、Sora模型逆向工程
3.1 视频编码
- 关键步骤:将视频内容编码为潜空间特征,保留时间、空间和内容信息。
- 技术方法:采用“Patch n’ Pack”技术处理不同分辨率和宽高比的输入,提高灵活性。
3.2 模型核心:Diffusion Transformer
- 架构:基于Transformer的DiT,替代了传统UNet结构。
- 优势:支持高分辨率、长时长视频生成,提升模型表现。
3.3 算力与内存需求分析
- 训练与推理资源:大语言模型训练需要高算力和网络带宽,推理则依赖内存带宽。
- 视频生成模型:推理过程更依赖算力和内存容量,而非带宽。
3.4 算力与内存需求关系
- Patch数量影响:随着Patch数量增加,内存需求显著上升。
- 算力需求增长:在推理过程中,算力需求增长快于内存带宽需求。
- 芯片适配:高算力、大显存芯片更适合视频生成模型的推理需求。
四、世界模型之争:三种AI路线的争论
4.1 Encoder特征理解派
- 代表人物:Yann LeCun(Meta首席科学家)。
- 观点:认为生成模型未真正理解内容,AGI应通过Encoder提取特征实现。
4.2 Autoregressive生成派
- 代表模型:Sora。
- 观点:认为Sora展现的涌现能力是向AGI迈进的重要一步,强调语言与图像的结合。
4.3 语言中轴派
- 代表人物:王小川。
- 观点:AGI应以语言为核心,构建虚拟、生命、真实世界模型。
五、高质量视觉模型的应用与行业影响
5.1 影视制作
- 应用实例:央视《千秋诗颂》和《中国神话-补天》均采用AI辅助或全流程制作。
- 影响:提升制作效率,降低制作门槛,改变传统制作流程。
5.2 游戏行业
- 动态环境与实时反馈:AI生成视频可实现环境随玩家行为实时变化。
- 故事叙述能力:支持实时生成剧情与场景,增强玩家沉浸感。
- 资源优化:减少对专业团队的依赖,提升开发效率与质量。
- 创新机制:推动真实物理反应与交互体验,提升游戏可玩性。
六、风险提示
- 模型架构变化影响算力需求:未来可能因架构调整导致算力需求分布变化。
- 算力发展不及预期:芯片制程和互联技术的限制可能影响模型性能。
- 中美科技政策恶化:中美竞争加剧可能对AI发展带来不确定性。
图表目录
- 图表1:Sora在镜头和人物变化下的连贯性和一致性是Scaling Law下涌现出的能力
- 图表2:Sora适配任务场景非常丰富,覆盖了图像生成/编辑领域大多数任务
- 图表3:视频生成模型发展历史
- 图表4:最初的GAN文生视频模型在分辨率、上下文和长度方面极为有限
- 图表5:DiT证明了Scaling Law在图像领域的生效
- 图表6:Genie在生成视频中对主体动作的识别更为优秀
- 图表7:国产视频生成模型比较
- 图表8:Sora模型概览
- 图表9:Sora技术报告中的Encoding模式
- 图表10:视频生成模型Patch方法对比
- 图表11:Sora生成不同比例的视频内容保存度更好
- 图表12:Navit的数据处理方法
- 图表13:DiT的核心架构
- 图表14:不同算力下Sora生成视频的对比
- 图表15:大语言模型最新发展追踪
- 图表16:大语言模型训练和推理过程的计算需求分布
- 图表17:大语言模型训练过程
- 图表18:大语言模型推理过程
- 图表19:视频生成模型与大语言模型对计算资源的不同需求
- 图表20:Diffusion模型推理生成图片的过程
- 图表21:目前用于训练和推理计算卡的算力/内存对比
- 图表22:LeCun提出的世界模型
- 图表23:V-JEPA实现的视频预测
- 图表24:通往AGI的不同流派
- 图表25:视频生成模型的应用行业
- 图表26:代表AI应用访问量热度变化
- 图表27:AI辅助制作的《千秋诗颂》
- 图表28:AI全流程制作的《中国神话-补天》片花
- 图表29:根据Sora生成的视频制作的3D模型
- 图表30:Genie实现操作输入图片中的主体
附:机构信息
- 分析师:刘道明(执业S1130520020004)
- 联系人:黄晓军(执业S1130122050092)
- 邮箱:liudaoming@gjzq.com.cn、huangxiaojun@gjzq.com.cn
- 国金证券研究所:提供专业研究报告,具备证券投资咨询业务资格。
特别声明
- 版权说明:本报告为国金证券所有,未经许可不得复制、转发、转载、引用等。
- 免责声明:报告内容基于公开资料,不保证其准确性与完整性,不构成投资建议。
- 适用范围:仅限于中国境内使用,仅供风险评级高于C3级的投资者参考。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载