复旦大学(张奇):2023年大规模语言模型中语言与知识报告-47页_4mb
报告摘要
ML-Summit2023:大规模语言模型中语言与知识对齐分析总结
ML-Summit2023全球机器学习技术大会探讨了大规模语言模型(如LLaMA系列)中的语言与知识对齐现象。以下是核心内容总结:
1. 多语言对齐在预训练模型中的体现
研究表明,多语言BERT和大型语言模型中存在显著的多语言语法和结构对齐。例如,mBERT在不同层中恢复各种语言的语法关系时,第7层的可视化显示了高对齐性。跨语言训练在词性标注等任务中可达到高精度,但通过中文等低资源语言二次预训练时,需注意可能丢失原始信息。实验显示,扩展词元后,模型性能依赖大量训练数据才能恢复。
2. 大语言模型中的语言与知识分离
大语言模型参数中存在“语言核心区”,即特定语言的核心区域(如阿拉伯语、中文等)。通过二次预训练不同语言数据,参数变化最小的1-5%层显示高度集中现象(如Q_proj、K_proj等权重变化),表明语言知识分区的稳定性。扰动实验显示,核心区域参数敏感,仅微调少量数据或使用不匹配的指令可能导致整体性能下降,甚至模型失效。
3. 训练数据的影响与参数敏感性
二次预训练需谨慎配比数据,避免过度依赖单一语言,否则会引发参数大幅度变化。实验中,训练数据中的连续噪音(如重复单词)或微调指令中不匹配的内容会引起模型PPL(困惑度)波动,影响整体性能。恢复实验中,模型展示了一定“代偿”能力,但锁定语言核心区时恢复效果有限。
4. 总结与启示
这些现象揭示了大型语言模型的语言与知识对齐本质,体现了参数对训练数据的高度依赖。理论上,维度集中和列聚集现象支持了语言核心区的存在,但实验结果尚需验证。未来训练需优化数据配比和微调策略,确保模型稳定性和跨语言泛化能力。
字数:456
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载