【阿里巴巴集团万象团队】WAN:开放和先进的大模型视频生成模型_60页_21mb
报告摘要
Wan: 开放和先进的大规模视频生成模型
核心内容
Wan是由阿里巴巴集团万象团队开发的全面开放视频基础模型套件,旨在推动视频生成技术的发展。该模型基于扩散变压器(DiT)架构,并结合了Flow Matching框架,显著提升了生成能力。Wan具有两个主要版本:1.3B参数模型和14B参数模型,分别用于效率和性能。Wan在多个任务上表现出色,包括图像到视频生成(I2V)、指导式视频编辑(V2V)、文本到图像生成、视频个性化、实时视频生成和音频生成。此外,Wan是第一个能够生成中文和英文视觉文本的视频生成模型,极大地增强了其实用性和多样性。
主要观点
- 性能优势:Wan在多个内部和外部基准测试中表现优于现有开源模型和部分商业模型,特别是在动态质量、图像质量和指令遵循准确性方面。
- 全面性:Wan支持多种下游任务,包括图像到视频、视频编辑、个性化生成等,且支持中文和英文文本的生成。
- 资源效率:1.3B模型仅需8.19GB VRAM,可在消费级GPU上运行,显著提升了推理效率。
- 创新设计:Wan引入了时空变分自动编码器(Wan-VAE),结合了高效的并行策略和内存优化技术,使得模型在大规模训练和推理中保持高效。
关键信息
模型特性
- 领先性能:Wan的14B模型在包含数十亿张图像和视频的大规模数据集上训练,达到了O(1)万亿标记。
- 消费级效率:1.3B模型在保持高分辨率的同时,显著降低了资源需求。
- 多功能性:Wan支持图像到视频、视频编辑、文本到图像、个性化视频生成等任务,展示了强大的多功能性。
数据处理流程
- 预训练数据:从内部版权和公开数据中筛选高质量、多样化数据,通过四步清洗流程去除低质量、重复和不相关的内容。
- 后期训练数据:通过优化图像和视频的处理策略,提高生成的视觉保真度和运动质量。
- 密集视频字幕:通过合成和真实数据生成密集字幕,提升模型对文本内容的理解和生成能力。
模型设计与加速
- Wan-VAE架构:设计了3D因果VAE,支持视频的时空压缩,显著减少了计算和内存需求。
- 训练策略:采用三阶段训练方法,从低分辨率图像和视频开始,逐步提升分辨率和复杂度。
- 并行策略:结合数据并行(DP)和完全分片数据并行(FSDP)策略,优化GPU内存使用和计算效率。
- 推理优化:引入扩散缓存和量化技术,如FP8 GEMM和8位FlashAttention,显著提高推理效率。
评估与基准测试
- Wan-Bench:提出了一种自动化、全面且与人类对齐的视频生成模型评估框架,涵盖14个细粒度指标。
- 定量结果:Wan在多个维度上表现出色,如动态质量、图像质量和指令遵循,尤其在14B模型中表现更优。
- 定性结果:Wan能够生成高质量、多样化的视频,包括复杂动态场景和多种艺术风格。
结构与性能对比
| 维度 | Wan-Bench | CNTopB | Hunyuan | Mochi | CogVideoX | Sora | Wan 1.3B | Wan 14B |
|---|---|---|---|---|---|---|---|---|
| 大运动生成 | 0.690 | 0.405 | 0.413 | 0.420 | 0.284 | 0.482 | 0.468 | 0.415 |
| 人类制品 | 0.690 | 0.712 | 0.734 | 0.622 | 0.833 | 0.786 | 0.707 | 0.691 |
| 像素级稳定性 | 0.690 | 0.977 | 0.983 | 0.981 | 0.974 | 0.952 | 0.976 | 0.972 |
| ID一致性 | 0.690 | 0.940 | 0.935 | 0.930 | 0.936 | 0.932 | 0.930 | 0.952 |
| 物理合理性 | 0.690 | 0.836 | 0.898 | 0.728 | 0.759 | 0.721 | 0.790 | 0.939 |
| 平滑度 | 0.690 | 0.765 | 0.890 | 0.530 | 0.880 | 0.930 | 0.790 | 0.910 |
| 综合图像质量 | 0.690 | 0.621 | 0.605 | 0.530 | 0.668 | 0.665 | 0.596 | 0.640 |
| 场景生成质量 | 0.690 | 0.369 | 0.373 | 0.368 | 0.386 | 0.388 | 0.385 | 0.386 |
| 风格化能力 | 0.690 | 0.623 | 0.386 | 0.403 | 0.346 | 0.606 | 0.430 | 0.328 |
| 单个物体准确度 | 0.690 | 0.987 | 0.912 | 0.949 | 0.942 | 0.932 | 0.930 | 0.952 |
| 多目标准确率 | 0.690 | 0.840 | 0.850 | 0.693 | 0.880 | 0.882 | 0.859 | 0.860 |
| 空间位置精度 | 0.690 | 0.518 | 0.464 | 0.512 | 0.434 | 0.458 | 0.476 | 0.590 |
| 相机控制 | 0.690 | 0.465 | 0.406 | 0.605 | 0.529 | 0.380 | 0.483 | 0.527 |
| 跟随动作指令 | 0.690 | 0.917 | 0.735 | 0.907 | 0.783 | 0.721 | 0.844 | 0.860 |
| 加权分数 | 0.690 | 0.690 | 0.673 | 0.639 | 0.693 | 0.700 | 0.689 | 0.724 |
限制与未来展望
- 计算瓶颈:随着序列长度的增加,注意力机制成为训练和推理的主要瓶颈。
- 硬件依赖:模型在特定硬件上表现更佳,如NVIDIA Hopper GPU。
- 未来工作:将探索更多性能优化技术,如混合精度量化、更高效的并行策略和更精细的模型结构优化。
贡献
- 开源发布:Wan模型及其训练、评估流程和数据集已向公众开放,推动视频生成领域的创新。
- 社区支持:Wan的架构设计和实验结果为其他研究者和开发者提供了宝贵的参考和灵感。
- 多模态整合:Wan在文本、图像和视频的整合方面表现出色,为跨模态生成任务提供了新思路。
Wan的发布标志着视频生成领域的一个重要里程碑,其高性能、多功能性和开放性为未来的视频生成研究和应用提供了坚实的基础。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载