【浙大】DeepSeek技术溯源及前沿探索_50页_3mb
报告摘要
报告分析总结
浙江大学DS系列专题由朱强主讲,内容涉及人工智能领域的核心技术演进。以下是本次讲座的主要内容:
1. 语言模型基础
- 定义:语言模型的目标是计算任意词序列的概率。它让计算机更“理解”语言。
- 技术演进:
- N-gram模型:基于统计的方法(1970年代)。
- 神经网络语言模型:使用LSTM/GRU等循环结构(2000年后)。
- Transformer架构:通过自注意力机制实现高效并行计算(2017年)。
- Embedding与统计关系:词嵌入(word embedding)用低维向量表示词,捕捉语义相似性。
2. Transformer架构解析
- 核心创新:
- 自注意力机制(Attention),捕换单词间语义关系。
- 多头注意力机制(Multi-head Attention),从不同角度捕捉复杂语义。
- 位置编码与层归一化,增强模型全局与局部表达能力。
- 技术演进时间轴:
- 2017:《Attention Is All You Need》论文提出Transformer架构。
- 2018:BERT、GPT两大类语言模型出现,推动技术爆发。
3. 大语言模型演进史(LLM)
- 代表性模型里程碑:
- GPT系列:从GPT-1/GPT-2到ChatGPT/GPT-4,参数量持续扩容,模型能力展现“涌现”特性。
- BERT系列:基于双向预训练机制,优化上下文表示。
- 其他主要玩家:LLaMA、T5、MPT等。
- 中国力量:DeepSeek、DeepSeek-V3、Qwen、文心一言等走向开源与高质量推理模型。
- 技术趋势:
- 参数量、数据量、算力门槛持续扩大。
- 从指令微调(Instruction Tuning)到人类反馈的强化学习(RLHF)。
- 引入多模态能力(文+图+声),如GPT-4V、GPT-4o。
4. DeepSeek模型架构与突破
- 创新点:
- Haiku体系结构:支撑百亿参数规模运行,高效推理结构。
- 动态路由专家机制(Mixture of Experts),激活精简高速版本(如DS-V3-37B)。
- 融合“规则奖励+语言一致性训练”,提高推理准确性。
- 极致工程优化:FP8混合精度支持、DualPipe训练框架,降低显存占用。
- 训练数据与代价控制:
- 支持open-weights开源模式,缩短与国际巨头生态代差。
5. 新一代智能体(Agent)与未来展望
- 智能体组成:
- 规划能力:分解任务为子目标。
- 工具使用:支持调用外部工具如计算器、搜索引擎等。
- 记忆系统:短期记忆与长期记忆存储。
- 发展框架:
- LangChain、AutoGPT等工具支持Agent开发。
- 大模型精调和 插件/中间件生态促进场景落地。
- 多智能体协同、时空智能决策、数学/逻辑推理能力升级。
总结技术简图
| 时间 | 核心模型 | 特点 |
|---|---|---|
| 2017 | Transformers | Attention基础,新架构 |
| 2018 | GPT/BERT | 推动LLM起始,均值预训练 |
| 2020s | ChatGPT | Inflection Point,RLHF |
| 2024 | DeepSeek-R1 | 中文顶级推理模型,国内领先 |
| 2025 | 新一代智能体 | Agent集成规划/记忆/工具使用 |
大语言模型(LLM)正在驱动人工智能从语言理解走向逻辑推理、几何规划等系统性智能,在算力与工程创新背景下,未来发展已浮现多方协同、自主智能体为主的形态。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载