阿里团队Qwen2.5-1M系列大模型技术报告_19页_2mb
报告摘要
Qwen2.5-1M 技术报告总结
核心内容
Qwen2.5-1M 系列模型是阿里巴巴集团推出的大型语言模型,支持长达100万标记的上下文长度,显著提升了长上下文处理能力。该系列包括开源模型 Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M,以及API模型 Qwen2.5-Turbo,后者在性能上与 GPT-4o-mini 相当,但具有更长的上下文长度和更具竞争力的定价。
主要观点
- 长上下文处理能力增强:Qwen2.5-1M 模型通过长上下文预训练和后训练显著提升了对长文本任务的处理能力,同时保持短文本任务的性能。
- 关键技术:
- 长度外推方法:通过双块注意力(DCA)和 YaRN 注意力缩放,使模型能够处理超过训练长度四倍的上下文。
- 稀疏注意力机制:显著降低推理成本,同时保持高精度,适用于长序列处理。
- 推理引擎优化:BladeLLM 引入内核优化、管道并行和调度优化,显著提升推理性能。
- 开源与部署:Qwen2.5-1M 的推理框架已开源并集成到 vLLM,便于开发者部署。
关键信息
模型架构
- Qwen2.5-1M 保持与 Qwen2.5 相同的 Transformer 架构。
- 使用 GQA、SwiGLU、RoPE、QKV 偏置和 RMSNorm 等技术。
- 模型包括 7B、14B 和 MoE 架构的版本。
预训练
- 数据合成:结合自然数据和合成数据(如 FIM、基于关键词的检索、段落重新排序)提升模型对长距离依赖关系的理解。
- 训练策略:采用分阶段训练方法,逐步扩展上下文长度,优化 RoPE 基础频率,以提高模型对长序列的适应能力。
- 性能提升:在 RULER 基准上,Qwen2.5-14B-Instruct-1M 在128K 序列上达到 92.2% 的准确率。
后训练
- 合成指令数据:通过 Qwen-Agent 生成高质量长上下文问答对,用于提升模型在长文本任务上的表现。
- 两阶段监督微调:第一阶段保持短序列训练,第二阶段引入长序列数据,以保持模型在不同长度上的性能平衡。
- 强化学习:使用 DPO 方法,通过短上下文训练提升模型与人类偏好的一致性,并在长上下文任务上有效泛化。
推理与部署
- 长度外推:DCA 和 YaRN 技术使模型能够处理超出训练长度的上下文,且不影响短序列性能。
- 稀疏注意力:MInference 技术显著降低计算和内存成本,加速推理过程。
- 推理引擎优化:BladeLLM 提供了高效的内核、管道并行和调度优化,提升整体性能。
评估结果
长上下文任务
- Passkey 检索:Qwen2.5-14B-Instruct-1M 和 Qwen2.5-Turbo 在100万标记上下文中达到完美准确率。
- RULER 基准:Qwen2.5-1M 系列模型在长文本任务中显著优于 GPT-4o-mini 和其他模型。
- LV-Eval 和 LongBench-Chat:模型在多个长文本任务中表现优异,显示出强大的长文本理解能力。
短上下文任务
- 通用任务:Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M 在短文本任务上表现与128K 版本相当。
- 数学与科学任务:在 GPQA、GSM8K 和 MATH 上表现良好,优于许多其他模型。
- 编码任务:在 HumanEval、MBPP、MultiPL-E 和 LiveCodeBench 上表现优异,显示出良好的代码生成能力。
- 对齐任务:在 IFEval 和 Arena-Hard 上保持较高准确率,表明模型在遵循指令和对齐人类偏好方面表现良好。
推理速度
- TTFT(首令牌时间):在 1M 上下文长度下,Qwen2.5-14B-Instruct-1M 和 Qwen2.5-Turbo 在 H20 和 A100 GPU 上分别实现 3.2 至 6.7 倍的加速。
- 性能与效率平衡:Qwen2.5-Turbo 在处理速度和成本上表现优异,是更具成本效益的选择。
结论
Qwen2.5-1M 系列模型在长文本任务中表现出卓越的性能,同时保持了短文本任务的能力。通过多种优化技术,包括长度外推、稀疏注意力和推理引擎改进,模型在处理大规模上下文时显著提升效率。开源和API支持使得该模型在实际应用中更具可行性。未来将继续探索更高效的训练策略和模型架构,以进一步提升模型性能和适用性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载