20240228-西南证券-OpenAI_Sora专题_Transformer扩展优势凸显_视频理解与生成能力提升_37页_3mb
报告摘要
Sora模型分析总结
核心观点
- 事件:OpenAI于2024年2月16日发布文生视频模型Sora及技术报告。
- Sora是基于Transformer架构的扩散模型,强调Transformer的扩展特性(scaling up)在生成视频中的优势。
- 市场分析:视频生成模型将赋能广告、设计、短视频、游戏等行业,短期作为创作工具。
- 投资建议:关注算力、云服务和光通信领域,相关标的包括英伟达、超威半导体、微软。
- 风险提示:技术进展不及预期、行业竞争加剧、应用开发不及预期。
从Sora看文生视频模型的技术路径
- 模型背景:OpenAI团队年轻有为,技术积累深厚,Sora源于GPT和DALL·E系列模型的积淀。
- 技术路径:扩散模型与Transformer结合,Sora是扩散+Transformer架构的案例。
- 未来趋势:Transformer扩展能力突出,扩散模型与Transformer持续结合,未来可能出现多种模型构建方式。
从Sora看文生视频模型的最新能力
- 理解能力:Sora能理解Prompt内容和物理世界规则,例如咖啡波浪和蜡烛火焰的模拟。
- 生成能力:
- 长度:支持60秒视频生成。
- 复杂度:能处理多角色、多主题场景。
- 逼真度:高分辨率(1920x1080p),细节丰富。
- 连贯性:保持角色外观和空间一致性。
- 可控性:微调关键词能快速生成优质视频。
- 其他能力:包括图生视频、视频扩展/编辑/拼接/模拟。
从Sora看文生视频模型的影响
- 应用端:前期以助手角色落地,赋能文娱等行业的创作。
- 算力端:模型参数扩展提升训练算力,视频生成应用拉动推理算力。
- 其他:云服务补充算力需求,视频传输推动光通信发展。
总体趋势
- 多模态发展:AI从文本向视觉扩展,视频生成技术兴起。
- 扩散模型为主:现阶段主流,但自回归模型有潜力。
- 技术进展:Transformer优势强化,视频生成领域2024年或迎热潮。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载