DeepSeek技术溯源及前沿探索-浙江大学-2025_50页_3mb
报告摘要
总结
一、语言模型
- 对词序列进行概率建模。
- 主要任务包括:编码、计算词序列概率。
- 从 One-hot 编码到 Word Embedding:
- One-hot 编码局限:高维稀疏、无法表示语义。
- Word Embedding:将词语映射为低维向量,捕捉语义关系。
- 语言模型演进:N-gram、LSTM/GRU、Transformer 架构。
- 从 One-hot 编码到 Word Embedding:
二、Transformer
- 核心架构:基于自注意力机制与多头注意力,支持并行计算。
- 2017 年提出,是现代大模型的基础。
三、ChatGPT
- 大语言模型的发展阶段(* 参考点 *):
- 2017:GPT(初代)
- 2018:BERT、GPT-2
- 2019:GPT-3、T5、BERT 2.0
- 2020-2023:GPT-4、Tayl
or LM、LLaMA、DeepSeek 等
- 技术演进:自监督预训练 + 强化学习微调(RLHF)、代码训练、思维链等。
四、DeepSeek 大模型
- 技术架构:
- 混合专家制度(MoE):
- 基础模型:671B/37B 激活参数。
- 所有令牌仅激活少量专家,提升计算效率(FP8 精度)。
- 推理能力增强:
- 通过监督微调(SFT)与强化学习(GRPO)提升推理性能。
- 使用结构化提示与规则引导,减少人工标注依赖。
- 模型蒸馏:将高参数模型压缩为低参数模型(如 7B-70B)保持性能。
- 混合专家制度(MoE):
五、智能体(Agent)
- 结构组成:
- 工具使用:如
Calendar()、Calculator()。 - 内存与内存管理:短期/长期记忆。
- 计划与反思能力:
- 分解任务、执行子目标、实现链式思考。
- 规划技能与工具链结合,面向目标问题求解。
- 工具使用:如
六、大模型应用
- 全栈影响:
- 应用层面:教育、医疗、客服服务、制造业。
- 工具层面:LangChain、AutoGPT 等 Agent 框架。
- 开发支持:包括开源模型(如 DeepSeek-R1)和闭源模型。
七、新一代智能体系统
- 系统1(直觉) vs 系统2(分析):
- 强调 Agent + 大模型组合,合成为基于规划与行动的智能系统。
- 拥有工具使用、记忆管理和际多协同能力。
- 应用:趋向高度自主化,如时空智能 Agent 系统。
通过本讲座,可清晰了解 语言模型发展、大模型架构变化,了解 DeepSeek的技术路径,以及 大模型在智能体系统与应用领域的可能性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载