20250320-中智凯灵_北京_科技-SUBLLM新架构_文本下采样机制革新大语言模型效率_44页_4mb
报告摘要
2024 AI+研发数字峰会总结
核心内容概述
本次2024 AI+研发数字峰会聚焦于AI驱动研发变革,促进企业降本增效,重点探讨了大语言模型(LLM)在处理长文本时所面临的技术挑战以及SUBLLM新架构的创新解决方案。SUBLLM由小米大模型团队高级算法工程师王全东与Daniel Povey等人提出,旨在通过动态资源分配优化模型效率,同时保持模型性能。
主要观点
长文本模型的技术挑战
- 长文本需求旺盛:涵盖多人会议摘要、行业报告分析、长文写作、长篇翻译等场景。
- 训练与推理成本高:由于使用Decoder only Transformer结构,其复杂度为attention的平方,导致在处理长文本时计算和内存消耗显著增加。
- 模型窗长扩展方法:现有技术如投机解码、动态稀疏attention、Kv cache压缩等在推理加速方面表现良好,但训练加速和内存优化仍有局限。
- 其他长文本模型结构:如Infini-Transformer、MEGALODON等,通过不同的机制实现效率提升,但部分方法在兼容性和可扩展性上存在不足。
关键信息
SUBLLM架构
SUBLLM架构结合了下采样(Sub-sampling)、**上采样(Up-sampling)和旁路(Bypass)**三个核心模块,以动态方式分配资源,提升模型效率:
- 下采样模块:通过Score层评估token重要性,选择保留重要token,减少冗余。
- 上采样模块:将下采样后的token与原始序列合并,恢复序列长度。
- 旁路模块:对下采样前后的序列进行加权求和,增强训练收敛性和稳定性。
优势与特点
- 资源优化:在保持模型能力不变的前提下,显著降低训练和推理成本。
- 兼容性:支持主流attention-based模型,如Llama,可实现可持续训练。
- 可导性:通过减法操作使token选择可导,提升score层的判别能力。
实验结果与性能对比
训练效率
- SUBLLM 1.3B:相比Llama 1.3B,仅多8192个参数。
- 训练加速:在不同窗长下,SUBLLM实现**34%**的训练加速。
- 显存减少:训练显存降低10~11GB/GPU。
- Valid Loss:与Llama持平,未出现性能下降。
推理效率
- 推理加速:在8k窗长下,SUBLLM实现**50%**的推理加速。
- 显存减少:推理显存降低1.35~2.44GB。
- 实际保留比例:在不同窗长下,保留比例为43%~44%,实现高效推理。
分析与讨论
- 优化器兼容性:SUBLLM适用于Adam和ScaledAdam等优化器,提升训练稳定性。
- 下采样次数与保留比例:实验表明,**下采样2次,保留比例75%**时,Valid Loss最低。
- token重要性分布:下采样前后的token注意力分布接近,说明模型能有效识别重要token。
- 未来方向:探索SUBLLM在200K窗长场景下的最优保留比例,以及其在多模态模型(如视觉标记处理)中的应用潜力。
总结与展望
SUBLLM贡献
- 提出SUBLLM新架构,实现资源的动态分配。
- 提出token重要性评分机制,提升模型效率。
- 在训练与推理方面分别实现**34%和50%**的加速,同时显著降低内存成本。
未来研究方向
- 通用性优化:研究不同tokenizer对压缩率的影响,确保SUBLLM结构的广泛应用。
- 长文本场景落地:探索SUBLLM在200K窗长等长文本任务中的表现。
- 多模态扩展:将SUBLLM应用于视觉标记处理,提升视觉语言模型(VLM)效率。
结论
SUBLLM架构通过创新的下采样、上采样和旁路机制,有效解决了长文本模型在训练和推理中的资源消耗问题。其在保持模型性能的同时,显著提升了效率,具有广泛的应用前景。未来,随着对不同场景的适配和优化,SUBLLM有望成为大语言模型研发的重要方向。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载