20250526-浙江大学-DeepSeek技术溯源及前沿探索_50页_3mb
报告摘要
浙江大学DS系列专题总结
核心内容概述
本专题围绕语言模型、Transformer架构、ChatGPT、DeepSeek以及新一代智能体展开,系统性地介绍了大型语言模型(LLM)的技术演化、架构创新、训练方法及应用场景。
主要观点与关键信息
一、语言模型
- 定义:语言模型用于计算词序列作为一句话的概率,是人工智能领域的重要基础。
- 应用场景:我们每天都在使用语言模型进行交流、理解、生成等任务。
- 编码方式:
- One-hot Encoding:将每个词转化为一个向量,但存在高维、低效率等缺点。
- Word Embedding:使用低维向量表示词,使相近语义的词向量更接近。
二、Transformer架构
- 理论创新:
- 自注意力机制:支持并行计算与全局上下文理解。
- 多头注意力:从多角度捕捉复杂语义关系。
- 前馈网络、位置编码、层归一化:解决传统模型的局限。
- 影响力:2017年NIPS会议发表的《Attention Is All You Need》论文,引发深度学习模型的范式转变,成为现代语言模型的核心架构。
- 模型演进:从GPT-1(12层,1.17亿参数)到GPT-3(1750亿参数),再到ChatGPT(基于GPT-3.5),模型规模和性能不断提升。
三、ChatGPT
- 技术特点:
- 基于GPT-3.5,采用来自人类反馈的强化学习(RLHF)进行训练。
- 具备强大的推理能力、多模态处理能力(如GPT-4v、GPT-4o)和跨语言支持。
- 能力提升:
- 零样本(zero-shot)和少样本(few-shot)学习能力。
- 数学推理、编程能力显著增强。
- 安全性大幅提升。
四、DeepSeek
- 技术特点:
- 基于Transformer架构,但通过系统级协同工程创新提升训练与推理效率。
- DS-V3模型拥有6710亿参数,但每次token仅激活8个专家(约370亿参数),显存占用仅为其他模型的5%-13%。
- 采用多头潜在注意力机制(MLA)、FP8混合精度、DualPipe算法等优化技术。
- 训练方法:
- R1-Zero通过强化学习(GRPO)提升推理性能,结合人工标注和奖励模型进行训练。
- DS-R1-Distill通过知识蒸馏技术,将大模型能力迁移至低参数量模型,提升其性能。
- 技术影响:
- 在大模型应用层,DeepSeek支持垂直应用(如教育、医疗)和通用类应用(如客服、数据经营分析)。
- 在大模型中间层,支持Agent开发、模型精调等。
- 在基础模型层,与LLM、开源模型等并存,推动AI技术的普及与应用。
五、新一代智能体
- 定义:基于LLM的智能体,具备逻辑推理能力(系统2),能够进行任务规划、工具使用和记忆管理。
- 能力构成:
- Planning Skills:拆解问题并制定解决路径。
- Tool Use:评估并选择工具,生成调用请求。
- Memory:包括短期记忆(工具返回值、已完成推理路径)和长期记忆(外部长期存储)。
- 应用前景:通过“时空型GPT”作为决策大脑,构建闭环多智能体协同系统,实现流程自组织、任务自执行、内容自生成。
关键技术与发展趋势
- 大模型发展:从统计模型(N-gram)到神经网络(LSTM/GRU),再到Transformer,模型性能和规模不断提升。
- 数据驱动与知识引导:结合人工标注和奖励模型,提升模型的推理能力和对人类偏好的理解。
- 开源与闭源:国际企业如微软、谷歌、Meta等既有闭源模型也有开源模型,而中国企业如阿里、华为、腾讯、百度等也积极参与开源和闭源模型的开发。
- 算力与效率:DeepSeek通过工程优化大幅降低算力需求,为受限资源下的通用人工智能探索开辟新路径。
- 多模态能力:如GPT-4v和GPT-4o具备处理文本、图像、音频等多种模态的能力。
总结
浙江大学DS系列专题系统梳理了语言模型的发展历程,从基础理论到实际应用,展示了Transformer架构的创新与影响,以及ChatGPT和DeepSeek等大型语言模型的技术突破与应用潜力。通过工程优化与训练方法的改进,DeepSeek在推理效率和模型性能上取得了显著进展,为大模型在资源受限环境下的应用提供了新的可能。新一代智能体的发展则标志着AI从“生成”向“推理”和“自主化服务”的转变,具有广阔的应用前景。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载