计算机行业专题研究:Text-to-Video的GPT-3时刻已来:OpenAI的SORA模型引领新技术突破-20240222-天风证券-12页_1mb
报告摘要
SORA模型总结
核心内容
OpenAI近期发布了新一代文生视频大模型SORA,该模型在视频生成领域实现了重要突破。SORA能够直接生成长达60秒的视频,具备高度细致的背景、复杂的多角度镜头以及富有情感的多个角色,其效果显著优于目前市面上的其他AI视频生成工具,如Runway Gen 2和Pika等。
主要观点
- 强大的视频生成能力:SORA能够根据文本提示生成高质量、长时长的视频,并且在视频内容一致性、细节还原和镜头多样性方面表现突出。
- 涌现能力:模型在大规模训练后展现出对物理世界模拟的能力,包括三维一致性、长时时间一致性、物体持久性和与世界互动等特性,使其能够生成更加真实和连贯的视频内容。
- 技术路径:SORA采用Diffusion Transformer结构,通过将图像和视频统一压缩为时空Latent Patches进行训练,提升了模型在不同分辨率、持续时间和宽高比视频/图像上的适应性。
- 语言理解:通过引入DALL-E3中的re-captioning技术,SORA能够生成描述性合成字幕,从而提高对文本提示的理解和遵循能力。
- 局限性:尽管SORA在视频生成方面表现出色,但仍然存在“幻觉”问题,如物理交互不准确、空间细节混淆等,需进一步优化。
关键信息
1. SORA模型功能
- 文本到视频:可直接根据文本生成60秒长视频。
- 视频编辑:支持视频内容的扩展、修改和编辑。
- 图片生成:也能用于生成图片。
- 多模态支持:能够处理不同分辨率、宽高比和持续时间的视频/图像数据。
2. 技术细节
- 时空Latent Patches:将视频和图像数据统一为时空Latent Patches,作为Transformer的输入。
- Diffusion Transformer:采用Diffusion Transformer结构进行大规模训练,提升视频生成质量。
- 合成字幕:使用描述性合成字幕来增强模型对文本提示的理解能力。
- 训练数据:使用了970M图片文字对和89M视频文字对的数据集进行训练。
3. 与其他模型对比
- W.A.L.T模型:同样是基于Transformer的扩散模型,展示了模型参数规模对视频质量的重要性。
- 性能表现:在多个视频生成基准测试中,W.A.L.T模型实现了SOTA(State-of-the-Art)效果。
4. 投资建议
- AI多模态:关注万兴科技、美图公司、易点天下、焦点科技、当虹科技。
- AI应用:关注金山办公、科大讯飞、恒生电子、鼎捷软件、福昕软件、用友网络、金蝶国际、泛微网络、致远互联。
- AI算力:关注华为链+海光信息、寒武纪、云天励飞、景嘉微。
风险提示
- 实际效果不及预期:模型在实际应用中的表现可能不如预期。
- 国内算力进展不足:国内算力基础设施可能无法满足模型的高性能需求。
- 场景落地不达预期:文生视频技术在实际应用场景中的推广可能受限。
投资评级
- 行业评级:强于大市(维持评级)
- 投资评级体系:
- 股票投资评级:买入(预期相对收益20%以上)、增持(预期相对收益10%-20%)、持有(预期相对收益-10%-10%)、卖出(预期相对收益-10%以下)
- 行业投资评级:强于大市(预期行业指数涨幅5%以上)、中性(预期行业指数涨幅-5%-5%)、弱于大市(预期行业指数涨幅-5%以下)
图表目录
- 图1:SORA模型生成视频的样本示例
- 图2:SORA模型生成视频的样本示例截图
- 图3:SORA模型生成视频的样本示例截图
- 图4:SORA模型让DALL-E的图片动起来
- 图5:SORA模型拓展生成视频
- 图6:SORA模型用于视频编辑
- 图7:SORA模型用于视频生成
- 图8:生成视频中的人在吃完汉堡后留下咬痕
- 图9:生成Minecraft的数字世界
- 图10:生成视频的机器人在多镜头中保持一致
- 图11:在动态相机中人和场景元素保持一致
- 图12:SORA产生的视频中未能将椅子建模为刚性对象
- 图13:SORA产生的视频可能在现实世界不可实现
- 图14:SORA训练过程中将视觉数据转为Patch
- 图15:Bill Peebles发现随着transformer尺寸的增加,生成的样本质量显著提高
- 图16:Bill Peebles发现扩大模型大小和输入token的数量可以提高DiT的性能
- 图17:随着计算量的增加,样本质量迅速增加
- 图18:W.A.L.T模型的训练结构
- 图19:W.A.L.T发现提高模型参数对生成高质量视频至关重要
- 图20:W.A.L.T在多个基准下实现了SOTA
- 图21:DALL-E3中使用描述性合成字幕的案例
- 图22:DALL-E3中发现使用描述性合成字幕的训练温升图模型效果更好
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载