深度报告-20240321-国金证券-AI模型系列报告_从世界模型看算力需求变化_20页_3mb
报告摘要
视频生成模型Sora深度分析
核心观点
- 涌现能力里程碑:Sora是首个展示"涌现"能力的视频生成模型,随着模型规模增大,在理解世界方面取得突破,标志着计算机视觉领域的里程碑。
- 技术架构:采用DiffusionTransformer(DiT)架构,证明了Scaling Law,即更高算力和更大模型规模可显著提升生成质量。
- 差异化需求:视频生成模型推理属于算力密集型场景,对芯片算力和内存容量要求更高,与大语言模型推理需求不同。
技术演进
- 发展阶段:文生视频从GAN/VAE时代→Transformer架构→Diffusion架构,DiT/DiT架构成为关键突破。
- 国内进展:超15家机构参与,字节、百度等大厂和智象未来等初创公司快速跟进,产品仍处于测试阶段。
模型剖析
- 视频编码创新:通过时空压缩与Spacetime Patch技术,支持多分辨率视频生成,保持内容一致性。
- 架构优势:
- Encoder-Only Transformer架构,一次性生成完整视频
- 每步输出全尺寸帧,大幅降低访存需求
- Token数量平方增长提升计算效率
行业影响
- 影视变革:
● 前期制作替代分镜/概念片
● 后期特效优化工作流
● 案例:AI参与创作《千秋诗颂》加速内容生产 - 游戏革命:
● 动态环境实时生成
● 策略引导的叙事体验
● 高效开发工具链
风险提示
- 算力需求变革:新型架构可能影响当前资源分布格局
- 技术发展滞后:芯片制程突破可能受摩尔定律限制
- 政策风险:中美AI领域竞赛可能加剧技术封锁
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载