大语言模型能力来源与边界_55页_12mb
报告摘要
复旦大学大语言模型能力来源与边界研究总结
-
模型基础与训练
- 复旦大学大语言模型的预训练语料库涵盖大量中文文本,训练后具备基础知识记忆与语义理解能力。通过调整参数(如修改语言非核心区LayerNorm、扩大其他维度10倍),可提升模型表现,但部分实验(如LLaMA2-13B修改核心区)显示效果不稳定。
- 研究指出,大模型的能力本质是统计机器学习结果,而非人类认知能力的逐项提升。其“推理”仍依赖数据驱动,缺乏对物理世界的深层理解与因果推理能力。
-
知识利用层级
- 知识利用层次图显示,当前大模型主要停留在“记忆”层级,难以实现“理解”与“推理”。例如,在高考数学考试中,多数模型平均分仅70%,部分低至25%,且对填空题表现较差。
- 未经公开数据污染的USAMO数学竞赛题目验证,LLM几乎无法掌握数学证明技巧,表明其在复杂逻辑任务中存在显著局限。
-
SFT训练与数据需求
- 有监督微调(SFT)阶段仅需少量数据即可优化模型表现。研究发现,无论使用何种数据微调,模型对预训练中记忆较好的知识仍能提供更准确答案。
- 不同LLM在SFT阶段的数据需求差异显著:例如,Qwen模型通过强化学习(RL)训练后表现提升明显,而Llama模型则停滞不前,可能与预训练数据质量及微调策略相关。
-
推理能力来源
- 认知行为(如验证、回溯、子目标设定、逆向链式推理)被提出为推理能力的关键。通过在SFT中引入含有这些行为的示例,可显著提升模型表现。
- 强化学习(RL)对生成式任务(如代码生成、翻译偏好建模)有重要影响,但其核心仍依赖于预训练阶段的知识记忆与语义分布。
-
能力边界与挑战
- 大模型在复杂数学推理(如乘法步骤、归纳推理)中表现欠佳,任务复杂度增加时准确率骤降。例如,GPT-o1-mini在小学数学题中因忽略“平均大小”细节导致答案错误。
- 工具调用能力存在瓶颈:即使训练数据量庞大(如180万条),模型对工具的使用仍需逐项优化,且对输入形式的微小变化敏感。
-
关键结论与展望
- 语言核心区理论揭示,大模型的语言能力与参数规模、训练数据分布密切相关。实现更高效的推理需依赖因果学习技术。
- 预训练与SFT是能力构建的核心阶段:预训练激活知识记忆,SFT微调语义分布,RL则用于生成任务的优化。然而,大模型仍无法突破统计学习框架,需避免对其能力进行过度拟人化。
- 实践中,大模型在特定场景(如高考数学、工具调用)表现差异显著,未来研究应聚焦数据多样性、训练策略优化及因果推理能力的增强。
注:总结涵盖研究论文核心观点、实验结果及实践启示,强调大模型能力的统计性、局限性与改进方向。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载