20240512-中国银河-计算机行业_国产开源MoE模型DeepSeek-V2性能媲美GPT-4_大模型价格战拉开帷幕_2页_257kb
报告摘要
行业点评报告:国产开源MoE模型DeepSeek-V2性能媲美GPT-4,大模型价格战拉开帷幕
核心观点
2024年5月7日,幻方量化旗下AI公司DeepSeek发布新一代混合专家模型DeepSeek-V2,其性能接近GPT-4Turbo,综合能力处于顶级水平。作为拥有2360亿参数的MoE模型,DeepSeek-V2能够在仅激活210亿参数的情况下处理每个token,并支持128K上下文长度,代表了大模型迭代的新方向。
纵向对比显示,DeepSeek-V2相比前代DeepSeek-67B模型在多个性能指标上取得显著突破:训练成本降低至原来的42.5%;KV缓存减小93.3%;最大生成吞吐量提升至576倍。横向对比也表明,其在中文(AlignBench)和英文(MT-Bench)评测中分别领先于多个开源和闭源顶级模型,多项核心能力指标与GPT-4Turbo相媲美。
DeepSeek-V2通过优化架构设计大幅降低了训练和推理成本。在训练侧采用Transformer架构创新,设计了MLA(多头潜伏注意力机制)和Dense MoE架构,在推理阶段KV缓存消耗仅为普通密集模型的1/5至1/100,训练计算量约为GPT系列的十分之一,但整体性能基本持平。这表明模型性能并不单纯依赖参数规模,架构优化对效率提升的作用日益突出。
在价格策略上,DeepSeek-V2将API调用成本降至约GPT-4Turbo的百分之一,采用了每百万输入token 1元、输出token 2元(32K上下文)的定价机制,几乎低于市场上所有主流大模型价格,标志着大模型领域即将进入激烈的价格竞争阶段,将推动AI技术快速渗透至各应用领域。
基于国产大模型迭代加速、训练成本降低的趋势,投资机构建议重点关注以下方向:
- 国产算力供应商(海光信息、中科曙光等)
- 多模态AI企业(科大讯飞、万兴科技等)
- AI垂直领域(医疗、办公、教育、法律、金融、能源等)
风险提示: 技术研发进度、供应链、政策、消费以及行业竞争风险均需关注。
注:以上内容基于银河证券研究院行业点评报告,观点仅供参考,不构成投资建议,详细内容请参阅报告原文。
试读结束,高清完整版pdf/doc/ppt,请点下载