浙江大学2025年DeepSeek技术溯源及前沿探索报告50页_3mb
报告摘要
总结内容:
本报告围绕语言模型、Transformer架构、ChatGPT、DeepSeek及新一代智能体技术展开,系统梳理了大模型的发展脉络与技术突破。
一、语言模型
语言模型的核心任务是计算词序列的概率,早期依赖统计方法如N-gram模型,但其局限性显著。随着深度学习的发展,基于神经网络的LSTM/GRU模型逐步取代,并最终被Transformer架构革新。Transformer通过自注意力机制(Self-Attention)实现并行计算和全局上下文理解,多头注意力(Multi-Head Attention)进一步捕捉复杂语义关系,成为大模型的技术基座。
二、大模型演进
自2017年Transformer论文发表,大模型发展经历多个关键阶段:
- BERT系列(2018年):引入双向编码,通过自监督学习(MLM)提升语言理解能力;
- GPT系列(2018年):采用单向语言模型,通过大规模预训练数据和参数量(如GPT-1的117亿参数、GPT-3的1750亿参数)实现文本生成与知识获取;
- ChatGPT(2022年):基于人类反馈的强化学习(RLHF)进行指令微调,增强与人类对齐能力,实现更准确、安全的对话交互;
- GPT-4o(2024年):全模态能力扩展,支持文本、图像、音频等多类型输入输出,同时提升数学推理、编程等垂直领域性能。
三、DeepSeek的技术突破
DeepSeek通过系统级协同工程创新,打破大模型依赖算力的瓶颈,成为开源领域的重要代表。其技术路线包括:
- 模型架构:采用混合专家模型(MoE),V3基座模型参数量达6710亿(仅激活370亿参数),通过动态路由机制实现高效计算;
- 训练优化:使用FP8混合精度、DualPipe算法降低显存占用(仅为其他模型的5%-13%),提升训练效率;
- 推理能力:通过规则奖励(GRPO)和语言一致性奖励增强推理性能,结合冷启动阶段生成少量推理数据,逐步构建全场景能力;
- 知识蒸馏:将DeepSeek-R1模型压缩至7亿参数,提升通用性(如支持手机端运行)。DeepSeek的出现缩短了中美大模型的技术差距,尤其在开源与闭源模型的效率对比中表现突出。
四、新一代智能体
新一代智能体(Agent)结合语言模型与工具使用能力,实现自主化服务。其核心组成包括:
- LLM大脑:负责逻辑推理,如拆解任务、生成解决方案;
- 工具链:集成外部工具(如计算器、搜索API),通过执行链完成具体操作;
- 记忆系统:分短期记忆(工具返回值)和长期记忆(外部知识库),支持多智能体协同。
五、应用场景与挑战
大模型已广泛应用于教育、医疗、法律、制造等领域,如智能客服、数据分析、文档处理等。然而,其发展面临算力成本高昂、数据依赖性强、安全性与伦理问题等挑战。开源模型(如LLaMA、DeepSeek)通过降低门槛和提升效率,推动技术普惠,而闭源模型(如GPT-4o)则聚焦高端场景。未来趋势包括多模态能力融合、推理性能突破及通用人工智能(AGI)的探索。
六、中美竞争与技术趋势
中美在大模型领域存在明显竞争:OpenAI的GPT系列以闭源模式主导,而DeepSeek等中国开源模型通过高效架构和宽松的开放策略缩小差距。技术路线呈现多元化,涵盖垂直领域模型(如数学GLM、法律LawBench)和通用模型,推动大模型在各行业的深度应用。
报告强调,大模型发展需兼顾技术创新与实际需求,通过数据驱动、知识引导、算力优化等手段实现高效能与低成本的平衡,为未来人工智能的应用提供更坚实的支撑。
试读结束,高清完整版pdf/doc/ppt,请点下载