2025大模型原理_技术与应用_从GPT到DeepSeek-哈尔滨工业大学-2025.2.28_67页_22mb
报告摘要
一、自然语言处理技术演进与大模型发展
1. 技术范式变迁
自然语言处理经历了五到六次范式变迁,从浅层机器学习(1990-2010)到深度学习与预训练语言模型(如BERT、GPT),再到大语言模型与推理能力强化(如DeepSeek-R1)。
2. 大模型关键特点
- 推理能力:Cot改进:类LLM架构,更强调实用性和可控性。
- 模型优化:算法优化(CAME, MultiMoE 等),提高推理速度与容量。
- 开源贡献:支持商用,安全性指标高,如活字模型。
3. 应用领域
- 知识密集型任务:医学(本草模型)、心理咨询平台。
- 工具增强生成:检索增强生成、科学家智能助理。
- 教育健康:对话陪伴系统,如“巧板”“巧环”。
二、大语言模型核心技术突破
1. 推理能力强化:(718推理格式)
用于开发能解决复杂科学问题的AI模型,65个专家,提升推理准确性,接近LLM水平。
2. 架构与训练优化
- 算法优化:
- 门控混合精度训练,降低计算成本。
- 多头隐含注意力机制,提高效率与长文本支持。
- 训练策略:多阶段训练,结合监督微调与强化学习,提升泛化力。
- 开源模型性能提升:训练成本比Llama低10倍,适合宽泛场景。
3. 多模态和感知发展
模型已从文本扩展到视觉、听觉、具身感知,具备一定的具身智能、复杂社会交互、情绪猜读等能力,支持语言之外的认知任务。
三、未来发展方向
通向AGI之路
挑战:从语言能力向多模态与物资互动扩展,实现在真实世界中的理解、规划与因果推理。
路径:
- 拓展语言外能力,掌握物理世界交互。
- 多代码数据协同训练,多语言模型融合。
- 强化模型可解释性与安全性。
- 人机混合决策机制,支持信任机制与社会责任。
参考资源和机构
- 大模型演进图景:DeepSeek R1级别推理、模型参数、训练机制。
- 高校实践:哈工大SCIR团队,人工智能学院,开发活字、珠算、Medical等系统。
- 报告结尾建议:开源策略与应用原则,如“Give the model time to 'think'”。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载