DeepSeek基础知识_42页_1mb
报告摘要
DeepSeek的背景知识:由杭州深度求索公司创建于2023年7月,创始人梁文峰,专注于通用人工智能研发。公司成员来自国内顶尖高校,致力于AGI领域发展。
DeepSeek大模型发展迅速,发布了一系列产品如DeepSeek LLM、DeepSeek-Coder、DeepSeek-Math、DeepSeek-VL、DeepSeek-V2、DeepSeek-R1-Lite等,涵盖了文本、代码、数学、视觉语言等多个领域。
DeepSeek-V3是该公司重要的开源模型,拥有6710亿参数(运行时激活约370亿)。其发表时间为2024年12月26日。该模型使用了混合专家系统、多头潜在注意力等技术创新,训练成本仅为Meta Llama3.1的约十分之一。定价方面也具竞争力,API调用价格显著低于市场平均水平。
技术特点包括:混合专家系统(MoE)实现优势组合;多头潜在注意力(MLA)提升长序列处理效率;多令牌预测(MTP)提高性能;FP8精度训练结合多种量化技术;双向流水线技术(DualPipe)提升分布式训练效率;跨节点通信优化支持大规模集群。此外还有跨任务的知识蒸馏与模型压缩技术。
DeepSeek-R1和R1-Zero均基于V3架构,参数总量6710亿,每请求激活约10%参数。R1-Zero采用纯强化学习训练,具推理潜力但输出欠稳定;R1则结合监督微调与强化学习,平衡性能与表达质量。
模型性能优异:在数学、代码生成及复杂推理任务中接近或超越GPT-4 Turbo,可与Claude-3.5-Sonnet竞争。在Chatbot Arena中排名靠前,赢得了市场关注。
DeepSeek发布的模型也引起了广泛关注和应用,其开源策略被多个云厂商和基础设施供应商采纳,提升了中国在全球AI领域的影响力,推动了端侧AI应用及开源生态发展。
主要影响包括:改变了大模型发展路径,倡导低消耗、高性能理念;影响全球AI格局,挑战了美国技术主导地位;加速AI在端侧应用,降低AI使用门槛;推动开源力量,减少对闭源模型依赖;促使云厂商全面接入,提升了中国AI产业链价值。
使用方法:包括官方渠道(官网、API、App)、第三方接入以及本地化部署。本地部署需根据模型大小匹配硬件(如DeepSeek-R1系列覆盖从1.5B到70B parameter范围)。支持联网搜索模式、满足多样任务需求。还可通过明确提示引导模型输出,适用于文本生成、代码编程、图表绘制等场景。
DeepSeek作为中国锐意创新发展开源基础模型的代表,在算力友好、模型性能与对外开放上成绩显著,为全球AI生态发展注入新活力。
试读结束,高清完整版pdf/doc/ppt,请点下载