2024年大语言模型的能力边界与发展思考报告-复旦大学_101页_17mb
报告摘要
复旦大学张奇:大语言模型能力边界与发展思考
大模型现状与挑战
2023年大模型表现“无所不能”,2024年却面临落地“差一口气”的困境。模型实际表现与宣传存在落差,特别表现在知识逆向搜索、复杂推理和数学陷阱题等场景上。
知识处理能力分析
- 知识记忆依赖“曝光”次数(2bit/参数需1000次),高频率词汇更易被记住
- 知识密度与数据来源影响学习效果,高质量训练数据至关重要
- MathTrap测试显示:GPT-4在改编数学题上的准确率仅为24%-38%(远低于预期)
微调调优策略研究
- 少量高质量样本(60条)即可启动基础能力
- 领域匹配数据提升效果,模型内部知识层级差异显著
- 单任务优于混合训练,在高资源场景存在性能冲突
推理能力局限
- 物理问答显示:模型存在知识跳跃拼接错误
- 数学归纳推理在复杂时失效(步骤增加,准确率骤降)
- 规划任务中表现出“无规划”特性
落地应用思考
- 船厂设计资料审核案例显示:
- 数据标准化是使用大模型的首要前提
- 自动审核系统的实际效能低于预期
- 需强化模型对分布外数据的处理能力
发展路径探讨
- AGI路线(OpenAI模式):
- 规模化投入(1万亿参数、100万GPU卡)
- 困难在于推理能力构建与知识建模
- “超级对齐”需要持续资源投入
- 专业化应用路线:
- 参数规模更精简
- 切实解决特定领域问题
- 短时间内可落地见效
核心理论基础
模型能力边界取决于对基础理论的认知深度,缺少对核心原理的突破,任何规模扩展都难以实现根本性能力跃升。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载