阿里视频模型万相2.1技术报告_60页_21mb
报告摘要
WAN: 开放和先进的大规模视频生成模型
核心内容
WAN是由阿里巴巴集团万象团队开发的全面开放视频基础模型套件,旨在推动视频生成技术的边界。WAN建立在主流扩散变压器(DiT)范式之上,并结合了Flow Matching框架,以提高模型性能。WAN模型具备四个关键特性:领先性能、全面性、消费级效率和扩展应用能力。
WAN提供了两个模型:1.3B 和 14B 参数版本,分别用于效率和生成质量。1.3B模型仅需8.19GB VRAM,可以在消费级GPU上运行,而14B模型则在大规模数据集上训练,展现出卓越的生成能力。
WAN支持多种下游任务,包括图像到视频(I2V)、指导式视频编辑(V2V)、文本到图像(T2I)、视频个性化、实时视频生成和音频生成。此外,WAN是第一个可以生成中英文视觉文本的模型,极大增强了其实用性。
主要观点
- 领先性能:WAN在多个内部和外部基准测试中始终优于现有的开源模型和商业解决方案,表现出显著的性能优势。
- 全面性:WAN不仅提供两个模型,还覆盖多个视频生成任务,包括I2V、V2V、T2I等。
- 消费级效率:1.3B模型的高效设计使其能够在消费级硬件上运行,显著降低了视频生成的门槛。
- 扩展应用:WAN支持多种视频生成场景,包括动态内容生成、摄像机运动控制、实时生成等。
- 自动化评估:WAN引入了自动化评估指标和流程,以确保生成内容的质量和一致性。
关键信息
数据处理流程
- 预训练数据:WAN的数据集经过多步清洗,包括文本检测、美学评估、不良内容评分、水印和标志检测、黑边检测、过曝光检测、合成图像检测和模糊检测。
- 后期数据:后期训练阶段对图像和视频分别采用不同的策略,以提高视觉保真度和运动质量。
- 密集视频字幕:WAN生成密集字幕以增强文本和视频的对齐,提升生成内容的连贯性和细节准确性。
模型设计与加速
- 时空变分自动编码器(Wan-VAE):采用3D因果VAE架构,将视频压缩至 $4 \times 8 \times 8$,实现高效推理。
- 模型训练:基于流匹配框架,采用分阶段训练策略,包括图像预训练、图像-视频联合训练和视频后训练。
- 并行策略:使用2D上下文并行和FSDP分片策略,优化模型在大规模GPU集群上的训练和推理效率。
- 内存优化:结合激活卸载和梯度检查点技术,减少GPU内存使用,提高推理效率。
- 推理优化:采用量化(FP8 GEMM和8位FlashAttention)、扩散缓存和分布式计算技术,显著降低推理延迟。
扩展应用
- 图像到视频生成:WAN能够将静态图像扩展为动态视频,保持内容的一致性。
- 统一视频编辑:支持指导式视频编辑,包括帧引用、动作调整等。
- 文本到图像生成:通过文本条件生成高质量图像,具有良好的文本嵌入和视觉对齐能力。
- 视频个性化:支持基于用户需求的个性化视频生成,如人物、场景和风格。
- 实时视频生成:通过模型蒸馏和优化策略,实现低延迟的视频生成。
- 音频生成:结合视觉和文本信息,生成与视频内容匹配的音频。
评估与基准测试
- Wan-Bench:WAN引入了Wan-Bench,这是一个自动化、全面且与人类对齐的评估框架,涵盖14个细粒度指标,包括动态质量、图像质量、指令遵循、风格化能力等。
- 定量评估:WAN在多个维度上表现出色,例如动态质量(0.482)、图像质量(0.640)、指令遵循(0.860)等。
- 定性评估:WAN在生成质量、风格化能力和多语言文本生成方面表现出色,生成的视频具有高保真度和逼真细节。
限制与结论
WAN虽然在多个方面表现出色,但仍存在一些限制,如对特定复杂场景的处理仍需进一步优化。然而,WAN的开放性和多功能性为视频生成领域树立了新的基准。
贡献者
本报告由阿里巴巴集团万象团队撰写,涵盖了模型设计、数据处理、训练策略、推理优化和评估方法等多个方面,为社区提供了宝贵的设计细节和实验结果。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载