2025年DeepSeek模型优势:算力、成本角度解读报告_24页_1mb
报告摘要
DeepSeek模型优势:算力、成本角度解读总结
核心内容
DeepSeek是一款由浙江大学计算机学院和人工智能协同创新中心开发的大型语言模型,其优势主要体现在算力效率和成本控制两个方面。通过算法创新(如MLA和MoE)与系统优化(如自研轻量级框架、FP8训练、DualPipe技术)的结合,DeepSeek在训练和推理过程中实现了高性能与低成本的平衡。
主要观点
算力与成本的辩证关系
- 算力是实现复杂计算和模型训练的基础,但成本是限制其大规模应用的关键因素。
- 传统算力(如大脑)擅长处理复杂逻辑,但速度慢;现代外部算力工具(如计算机)擅长高速简单运算,但无法处理复杂逻辑。
- 国际大模型发展依赖大资金、大算力、大模型,而DeepSeek通过算法与系统协同优化,在成本控制上具有显著优势。
DeepSeek的创新技术
- MoE(Mixture of Experts):采用“1共享专家 +256路由专家”的架构,仅激活8个路由专家,大幅降低计算量。
- MLA(Memory Efficient Attention):通过低秩压缩技术,减少KV缓存的存储空间需求,降低93.3%,提升推理性能并降低成本。
- DualPipe:优化GPU通信与计算的重叠度,提高资源利用率。
- PTX优化:绕开CUDA的限制,提升对国产硬件的适配性,虽未完全绕开CUDA,但为国产硬件设计提供了参考。
国内大模型商业模式
- 国内大模型发展遵循融资→购买GPU→训练模型→提供服务的循环模式。
- 优势:国内在AI人才、工业化低成本、政策风险规避等方面具备优势,尤其在算力受限的情况下,仍能通过战术穿插(即算法优化)实现性能突破。
国际与国内算力限制
- 美国对高端AI芯片、HBM芯片、7nm光刻机等实施禁令,限制了国内获取先进算力工具的能力。
- 国内需突破工艺卡脖子,通过高算力密度和系统级优化来弥补算力差距。
关键信息
算力与数据量关系
- 数据量(D)需大于模型参数量(N)的15倍。
- 万亿模型(N=10¹²)需数据量(D)>1.5×10¹³ tokens。
- 计算量(C)≈6×N×D,约为1.5×10²⁵次计算。
算力成本估算
- 单张H800 GPU每小时租赁成本为2美元。
- DeepSeek V3训练成本为5,576,000美元,远低于Llama 3.1的30.84 M美元。
- 单H800训练需约1.5×10¹⁰秒(174000天),而1000张H800仅需约1.5×10⁷秒(174天)。
国内与国际大模型对比
- Llama 3.1:训练Token为15T,模型规模为405B,训练成本为30.84 M美元。
- DeepSeek V3:训练Token为14.8T,模型规模为671B(激活37B),训练成本为5.6 M美元。
- DeepSeek通过算法创新和系统优化,在成本和效率上优于国际大模型。
AI发展历史阶段
- 大型机时代(1940-1980):数字化未开始,算力需求潜力未发掘。
- PC时代(1980-2000):一个应用只需一台电脑,算力足够。
- 云计算时代(2000-2020):应用需要多台机器,算力基本满足。
- 人工智能时代(2020-):算力开始不足,需大量高性能AI加速器。
未来展望
- DeepSeek代表了国内大模型在算力受限背景下的突破,通过战术穿插(算法优化)和火力覆盖(系统优化)实现性能与成本的平衡。
- 中国在工业化水平和成本控制方面具有绝对优势,未来有望通过突破模型与算力卡脖子,在AI竞赛中取得领先。
个人预测
- 以中国的工业化水平,突破模型、算力卡脖子将使AI发展更具自主性,提升国际话语权。
- “健身可以让SB跟你好好说话” → “突破模型、算力卡脖子可以让A国跟咋们好好说话”,强调了技术自主的重要性。
本次讲座性质
本次讲座为科普性质,部分内容可能存在不严谨之处,敬请谅解。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载