浙江大学(朱强):2025年DeepSeek技术溯源及前沿探索报告_50页_3mb
报告摘要
浙江大学DS系列专题总结
核心内容概述
本次讲座围绕大型语言模型(LLM)的技术发展路径展开,从语言模型的基础理论到Transformer架构,再到ChatGPT、DeepSeek以及新一代智能体的发展历程进行了深入分析。讲座还探讨了大模型在不同应用场景下的表现与创新,包括多模态能力、推理能力提升、模型优化与开源策略等。
主要观点与关键信息
一、语言模型
- 语言模型的核心任务是计算任意词序列作为一句话的概率。
- One-hot Encoding存在维度高、无法捕捉语义关系的缺点。
- Word Embedding通过低维向量表示词语,使语义相近的词向量距离更近。
- N-gram模型是基于统计的语言模型,但存在上下文理解能力有限的问题。
- LSTM/GRU是基于神经网络的语言模型,虽有所改进,但仍无法完全替代Transformer。
二、Transformer架构
- Transformer通过自注意力机制、多头注意力、前馈网络等技术革新,实现了并行计算和全局上下文理解。
- Attention机制在自然语言处理和图像处理任务中均有广泛应用,其本质是捕捉元素之间的关系。
- Transformer成为现代语言模型的核心架构,推动了大语言模型的发展。
三、ChatGPT与大语言模型发展
- ChatGPT基于GPT-3.5,引入了人类反馈强化学习(RLHF)技术,提升了模型的推理能力和安全性。
- GPT-3标志着大语言模型的转折点,其参数量达到1750亿,展示了强大的涌现能力。
- GPT-4具备多模态输入输出能力,推理能力显著提升,且在非英文文本处理上表现优异。
- GPT-4o进一步提升了模型的交互能力和响应速度,接近人类水平。
四、DeepSeek技术探索
- DeepSeek-V3是基于Transformer的模型,但通过系统级协同工程创新,大幅提升了训练和推理效率。
- DeepSeek-V3采用混合专家模型(MoE)和多头潜在注意力机制(MLA),参数量为6710亿,但每次token仅激活8个专家,显著降低了显存占用。
- DeepSeek-R1模型通过强化学习(GRPO)提升推理能力,具备与OpenAI-o1相当的逻辑推理能力。
- DeepSeek-R1-Distill模型通过知识蒸馏技术,大幅压缩参数,提升低参数量模型的性能,使得AI可应用于移动设备。
五、新一代智能体
- 智能体是基于LLM的系统,具备任务规划、工具使用、记忆管理等能力。
- Agent的开发依赖于LLM作为“大脑”,其核心能力是“逻辑推理”。
- 新一代智能体如AutoGPT、JARVIS等,通过LLM实现任务自执行、流程自组织、内容自生成。
大模型技术演进简史
| 模型 | 发布时间 | 参数量 | 预训练数据量 | 核心技术 |
|---|---|---|---|---|
| GPT-1 | 2018 | 1.17亿 | 约5GB | Transformer架构 |
| GPT-2 | 2019 | 15亿 | 40GB | 模型规模提升 |
| GPT-3 | 2020 | 1750亿 | 45TB | 多模态与推理能力 |
| ChatGPT | 2022 | 千亿级 | - | 强化学习与安全训练 |
| GPT-4 | 2023 | - | 百T级 | 多模态与逻辑推理 |
| GPT-4o | 2024 | - | - | 全模态交互能力 |
| DeepSeek-V3 | 2024 | 6710亿 | - | MoE与MLA机制 |
| DeepSeek-R1 | 2024 | - | - | 强化学习与RLHF |
大模型的挑战与机遇
- 算力需求:大语言模型依赖大量算力,但DeepSeek通过系统级优化显著降低了训练与推理的算力门槛。
- 开源与闭源:国际企业多采用闭源策略,而中国企业如阿里、腾讯等则在开源领域取得进展,推动技术普惠。
- 多模态与跨领域应用:GPT-4v和GPT-4o展示了跨模态能力,而DeepSeek在多任务处理和推理方面表现出色。
- 知识蒸馏与模型瘦身:通过知识蒸馏技术,DeepSeek-R1-Distill模型可大幅压缩参数,实现模型的轻量化部署。
未来展望
- 系统1 vs 系统2:LLM从“生成”向“推理”转变,从快速直觉(系统1)到缓慢分析(系统2)。
- 智能体发展:新一代智能体将实现流程自组织、任务自执行、内容自生成,推动人工智能在更多领域的应用。
- 时空智能:基于“时空型GPT”的智能体系统,可实现自主化服务,如教育、医疗、法律等垂直领域。
总结
本次讲座系统梳理了从语言模型到Transformer、ChatGPT、DeepSeek以及新一代智能体的发展脉络,强调了技术演进中算法创新、模型优化和系统协同的重要性。DeepSeek通过工程优化和系统级创新,为受限资源下的通用人工智能探索提供了新路径。未来,大模型将在多模态、推理能力、智能体开发等方面持续突破,推动人工智能向更深层次发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载