阿里视频模型万相2.1技术报告_60页_20mb
报告摘要
总结:WAN - 开源且先进的大规模视频生成模型
核心内容
Wan 是阿里巴巴集团推出的一套全面且开放的视频基础模型,旨在推动视频生成技术的边界。它基于主流的扩散Transformer(DiT)范式,并结合了流匹配(Flow Matching)方法,显著提升了视频生成的能力。Wan 不仅在性能上表现出色,还具备多种功能和应用,包括图像到视频生成(I2V)、指令引导的视频编辑(V2V)、个性化视频生成、实时视频生成和音频生成等。
主要观点
- 性能领先:Wan 的 14B 模型在大规模数据集(包含数十亿张图像和视频)上训练,展示了视频生成的规模定律。它在多个内部和外部基准测试中均优于现有的开源模型和商业解决方案。
- 全面性:Wan 提供了 1.3B 和 14B 两个参数版本,分别针对效率和效果优化。它支持多种下游任务,涵盖多达八种应用场景。
- 消费者级效率:1.3B 模型仅需 8.19GB VRAM,即可在大多数消费级 GPU 上运行,显著提升了推理效率。
- 开放性:Wan 完全开源,包括源代码和所有模型,旨在促进视频生成社区的发展,推动行业和学术界的创新。
关键信息
1. 数据处理流程
- 高质量、高多样性、大规模:Wan 的数据集构建遵循这三大核心原则,包含数十亿张图像和视频。
- 预训练数据:通过四步数据清洗流程,包括基础维度过滤、视觉质量评估、运动质量评估和内容过滤,有效去除了低质量数据。
- 视觉文本数据:引入合成和真实数据结合的方法,通过 OCR 模型提取中英文文本,并输入到 Qwen2-VL 模型中,以生成自然且精确的视觉描述。
2. 模型设计与加速
- 时空变分自编码器(Spatio-temporal VAE):Wan 采用定制的时空 VAE,用于视频的编码与解码,提升生成质量。
- 扩散Transformer架构:基于 DiT 模型,结合交叉注意力和全注意力机制,提升文本条件嵌入和生成能力。
- 训练与推理优化:包括并行策略、扩散缓存和量化技术,以提升训练效率和推理速度。
3. 评估与实验
- 评估指标与结果:Wan 在多个维度(如运动幅度、质量、视觉文本生成、相机控制、指令遵循和风格多样性)均表现出色。
- 消融实验:通过消融实验验证了模型设计的各个部分对性能的影响,为未来视频生成模型的设计提供了参考。
4. 扩展应用
- 图像到视频生成(I2V):支持从图像生成高质量视频,分辨率可达 480p。
- 统一视频编辑(V2V):通过指令引导实现视频内容的编辑和修改。
- 个性化视频生成:支持零样本个性化定制,满足不同用户需求。
- 实时视频生成:通过流式处理和一致性模型蒸馏技术,实现低延迟视频生成。
- 音频生成:Wan 还具备音频生成能力,进一步扩展了其应用范围。
限制与展望
- 现存挑战:尽管 Wan 在多个方面表现优异,但与最新的闭源模型相比,仍存在一定差距,尤其是在性能和效率方面。
- 未来方向:Wan 的开源和全面设计为视频生成领域提供了重要的工具和资源,有助于推动技术进步和应用拓展。
结论
Wan 通过其先进的模型架构、高效的训练策略和全面的下游应用,为视频生成技术的发展提供了强有力的支持。其开源特性也促进了学术界和工业界的合作与创新,推动了视频生成领域的开放生态建设。
参与者
- 本报告由阿里巴巴集团的 Wan 团队完成,涵盖模型设计、数据处理、训练策略和评估方法等多个方面。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载