DS系列专题:DeepSeek技术溯源及前沿探索_50页_3mb
报告摘要
浙江大学DS系列专题总结
核心内容
浙江大学计算机科学与技术学院的朱强教授在“DeepSeek技术溯源及前沿探索”专题中,系统地介绍了语言模型的发展历程、Transformer架构的创新、ChatGPT的技术演进以及DeepSeek模型的技术细节与应用场景。
主要观点
语言模型的发展
语言模型的目标是计算任意词序列成为一句话的概率,其技术演进经历了多个阶段:
- 基于统计的N-gram模型:通过计算词序列的概率来理解语言。
- 基于神经网络的LSTM/GRU模型:引入深度学习技术,提升语言理解能力。
- 基于Transformer的模型:通过自注意力机制、多头注意力等创新,实现并行计算和全局上下文理解,成为现代语言模型的核心架构。
Transformer架构创新
Transformer模型通过以下关键技术突破,成为现代自然语言处理的基石:
- 自注意力机制:允许模型在处理输入时关注不同位置的信息。
- 多头注意力:从多个角度捕捉复杂的语义关系。
- 前馈网络、位置编码、层归一化:解决传统模型的诸多局限性。
ChatGPT的演进
ChatGPT基于GPT-3.5,引入了基于人类反馈的强化学习(RLHF),提升了模型的回应质量与安全性:
- 翔实的回应:提供准确、有逻辑的回答。
- 公正的回应:避免偏见,拒绝不当问题。
- 上下文学习:模型能够通过上下文泛化,而不依赖于显式训练数据。
- 零样本与少样本学习:无需额外训练即可完成任务。
DeepSeek的技术特点
DeepSeek模型并非基于颠覆性理论创新,而是通过系统级协同工程优化,显著提升了推理能力和效率:
- 混合专家模型(MoE):DS-V3模型使用6710亿参数,但每次token仅激活8个专家,大幅降低显存占用。
- 多头潜在注意力机制(MLA):提升模型的注意力效率。
- FP8混合精度:减少计算资源消耗。
- DualPipe算法:提升训练效率。
DeepSeek的训练方法
DeepSeek通过强化学习(GRPO)和知识蒸馏提升模型性能:
- GRPO:使用规则奖励和数据驱动方法,提升推理能力。
- 知识蒸馏:将高参数量模型的知识转移到低参数量模型中,实现模型瘦身。
关键信息
模型参数与数据规模
- GPT-1:1.17亿参数,约5GB预训练数据。
- GPT-2:15亿参数,40GB预训练数据。
- GPT-3:1750亿参数,45TB预训练数据。
- ChatGPT:千亿级参数,百T级预训练数据。
- DeepSeek-V3:6710亿参数,显存占用为其他模型的5%-13%。
技术演进与应用
- 语言模型:从统计模型到深度学习模型,再到Transformer模型。
- 多模态模型:如GPT-4v和GPT-4o,具备跨模态理解和交互能力。
- 推理模型:如OpenAI-o1/o3和DeepSeek-R1,具备更强的逻辑推理和数学编程能力。
- 大模型开发工具:如LangChain、LlamaIndex,支持快速构建和部署大模型应用。
- 垂类模型:如Code Llama、MathGLM、LawBench,专注于特定领域。
大模型的影响
- 大模型应用层:包括垂直应用(如教育、医疗、法律)和通用类应用(如智能客服、数据经营分析)。
- 大模型中间层:包括Agent开发平台(如AutoGPT、JARVIS)和应用开发框架(如Langchain)。
- 基础模型层:包括LLM、插件、嵌入等,支持多样化应用场景。
未来趋势
- 系统1与系统2:LLM作为“系统2”,具备逻辑推理能力,与“系统1”(快速、直觉)结合,提升智能体的综合能力。
- 时空智能:通过闭环多智能体协同系统,实现流程自组织、任务自执行、内容自生成。
总结
浙江大学的朱强教授通过本次专题,全面梳理了语言模型的发展历程,介绍了Transformer架构的创新,深入解析了ChatGPT和DeepSeek的技术细节,并展望了新一代智能体的发展方向。DeepSeek通过系统级优化,显著提升了推理效率和模型性能,为受限资源下的通用人工智能探索提供了新路径。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载