DeepSeek洞察与大模型应用-人工智能技术发展与应用实践_37页_5mb
报告摘要
DeepSeek是由中国私募量化巨头幻方量化于2023年5月成立的大模型企业。其技术团队推出DeepSeek-V3(对标GPT-4o)和DeepSeek-R1(对标GPT-o1)两款模型,分别在2024年12月和2025年1月发布。V3基于Transformer架构,采用MoE混合专家模型,总参数量达671B,生成每个token时激活37B参数,训练成本较Llama405B低一个量级。R1通过多阶段训练和少量冷启动数据优化,实现与OpenAI-o1-1217相当的推理性能,且在代码、数学等复杂场景表现突出。两者在模型性能和价格比上处于国际领先水平,V3在MMLU等评测中超越Qwen25-72B和Llama-31-405B,R1更成为全球表现最佳的开源模型之一。
DeepSeek的推出引发中美AI竞争格局变化。美国参议员提出《2025年与中国AI能力脱钩法案》,禁止技术合作、资本流动,并对DeepSeek实施特别禁令。前白宫新闻秘书莱维特称其威胁国家安全,商务部长提名人卢特尼克指责其违反芯片出口禁令。尽管DeepSeek以低成本和开源策略打破技术壁垒,但美国仍强化管制措施,如限制芯片出口和禁止其产品使用。中国则通过DeepSeek提升大模型技术自信,推动科技股发展。模型性能方面,DeepSeek-V3和R1在参数量与训练效率上与国际顶尖模型比肩,且开源策略降低AI应用门槛,加速行业落地。
国内应用案例显示,DeepSeek在政务热线、经济决策、公安视侦、医疗智能、船舶设计和文物活化等领域取得突破。例如,辽宁政务热线项目将工单填单时间缩短至133秒,北京发改委经济大模型实现一屏总览全省经济数据,公安部门利用其视觉分析能力提升案件侦破效率。医疗领域中山三院部署私域GPT助手,整合1500+业务文件和1800+医学教材,辅助精准医疗。船舶设计中通过微调和RAG技术优化参数计算与知识召回,文物活化项目则支持数字文创产品生成。
然而,DeepSeek在应用落地时仍面临挑战。其满血版模型需16-32张910B算力,超出多数企业预算;R1版推理耗时10-20秒,难以满足B端高实时需求;私域知识训练效果有限,且模型仍存在幻觉、知识更新滞后、偏见与安全风险等问题。用户需通过多模型协同、外挂工具和RAG技术弥补不足,同时注意避免敏感问题提问以规避法律风险。尽管如此,DeepSeek凭借高性能、低成本和开源特性,已显著改变全球AI技术格局,推动中美竞争进入应用与工程化交付能力比拼的新阶段。
试读结束,高清完整版pdf/doc/ppt,请点下载