深度报告-20250324-浙江大学-DS系列专题_DeepSeek技术溯源及前沿探索_50页_3mb
报告摘要
浙江大学DS系列专题总结
核心内容
本次专题围绕大型语言模型(LLM)的技术演进与前沿探索展开,涵盖了从语言模型的基本概念、Transformer架构、ChatGPT的发展、DeepSeek的技术创新到新一代智能体的构建。
主要观点
1. 语言模型
语言模型的核心任务是计算任意词序列成为一句话的概率。这一能力使模型能够理解和生成自然语言,广泛应用于日常交流和复杂任务处理中。
- One-hot Encoding:虽然简单,但无法有效捕捉语义关系。
- Word Embedding:通过低维向量表示词语,使语义相近的词具有相似的向量表示,提高了模型对语义的理解能力。
2. Transformer 架构
Transformer 是一种基于自注意力机制的模型架构,具有并行计算和全局上下文理解能力,极大推动了语言模型的发展。
- 自注意力机制:允许模型在处理序列时关注不同位置的信息,提高模型的表达能力。
- 多头注意力:从多个角度捕捉复杂的语义关系。
- 前馈网络、位置编码、层归一化:解决传统模型的诸多局限性。
3. ChatGPT 的发展
ChatGPT 是基于 GPT-3.5 的大型语言模型,通过 RLHF(基于人类反馈的强化学习)提升模型的推理和交互能力。
- RLHF:通过人类反馈优化模型行为,使其更符合用户需求。
- 能力提升:包括翔实回应、公正回应、拒绝不当问题、处理多语言和复杂任务等。
4. DeepSeek 技术创新
DeepSeek 是一种基于 Transformer 的大型语言模型,通过系统级协同工程创新,显著优化了模型的效率和性能。
- DS-V3:对标 GPT-4o,具备强大的推理和生成能力,采用 MLA(多头潜在注意力)机制和 FP8 混�合精度,显著降低显存占用。
- DS-R1:对标 OpenAI-o1,通过强化学习和知识蒸馏技术,提升推理能力,同时压缩模型参数,使其适用于低资源环境。
- 技术特点:强调工程优化而非基础理论创新,实现了性能与效率的平衡。
5. 新一代智能体
新一代智能体基于 LLM 构建,具备逻辑推理、任务规划、工具使用和记忆管理等能力。
- LLM 作为大脑:智能体的核心能力在于“逻辑推理”,即系统2的能力。
- Agent 技术:包括 AutoGPT、JARVIS 等,通过 LLM 实现任务自动执行和内容自生成。
关键信息
1. 大型语言模型的发展历程
- N-gram:基于统计的方法,用于语言建模。
- LSTM/GRU:基于神经网络的方法,提升了语言建模能力。
- Transformer:2017 年提出,成为 LLM 的基础架构。
- GPT 系列:从 GPT-1 到 GPT-3,参数量从 1.17 亿到 1750 亿,逐步提升模型能力。
- ChatGPT:基于 GPT-3.5,引入 RLHF 技术,显著提升交互能力。
- GPT-4v/o:具备多模态能力和更强大的推理能力。
- DeepSeek-V3/R1:在推理和生成能力上与 GPT-4o/o1 相对标,同时注重工程优化。
2. 大模型的三大要素
- 数据:训练数据量庞大,如 GPT-3 使用 3000 亿单词,DeepSeek 使用 45TB 数据。
- 模型:参数量巨大,如 GPT-3 有 1750 亿参数,DeepSeek-V3 有 6710 亿参数。
- 算力:训练需要大量算力,如 ChatGPT 需要 1 万张 V100 芯片,DeepSeek 通过优化显著降低算力需求。
3. 大模型的开源与闭源对比
- 国际企业:如微软、亚马逊、谷歌、Meta 等,既有闭源模型也有开源模型。
- 中国企业:如阿里、华为、腾讯、百度等,也在推动开源模型的发展,如通义千问、Qwen 系列等。
4. 多模态模型
- GPT-4v:具备视觉理解能力,支持跨模态任务。
- GPT-4o:全模态模型,具备更强的交互能力。
- DeepSeek:通过多头潜在注意力机制,实现高效的多模态处理。
5. 知识蒸馏
- DeepSeek-R1-Distill:通过知识蒸馏技术,将大模型的知识转移到小模型,显著提升小模型性能,使其在移动设备上也能运行。
技术全景图
DeepSeek 技术全景图展示了其从基础模型到推理模型的完整架构,包括:
- DS-V3:具备强大的生成和推理能力,采用 MLA 机制。
- DS-R1:通过强化学习和知识蒸馏,实现高效推理。
- DS-R1-Distill:知识蒸馏技术,使小模型性能大幅提升。
大模型全栈影响
| 层次 | 应用层 | 中间层 | 基础层 |
|---|---|---|---|
| 大模型应用层 | 垂直应用(教育、医疗、法律、制造等) | GPT Agent(Prompt-based 应用) | 基础模型应用支持 |
| 大模型中间层 | 大模型应用开发框架(LangChain) | 训练数据管理与生成 | 微调、插件、嵌入 |
| 基础模型层 | LLM(如 ChatGPT、LLaMA) | 大模型开发工具(LangChain、LlamaIndex) | 垂类应用(如 LLM VSCode、DB GPT-Hub) |
未来方向
- 系统1 vs 系统2:LLM 是智能体的“系统2”,负责逻辑推理,而智能体还需具备“系统1”的快速响应能力。
- 时空智能:通过“时空型 GPT”构建闭环多智能体协同系统,实现流程自组织、任务自执行、内容自生成。
- 自主化服务:智能体在复杂任务中展现出自主化能力,如任务规划、工具使用和记忆管理。
总结
本次专题系统梳理了从语言模型到新一代智能体的发展脉络,强调了 Transformer 架构的重要性,展示了 ChatGPT 和 DeepSeek 在技术上的突破,以及 LLM 在多模态、推理和应用开发中的广泛应用。DeepSeek 通过系统级优化,实现了性能与效率的平衡,为受限资源下的通用人工智能探索提供了新思路。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载