2025-02-11-DeepSeek-Coder_当大型语言模型遇到编程时-代码智能的兴起_23页_2mb
报告摘要
DeepSeek-Coder 是一系列开源代码智能大型语言模型(LLMs),规模从1.3B到33B参数不等。这些模型从2万亿标记的代码语料库中训练而成,涵盖87种编程语言,并采用FIM(Fill-in-the-Middle)和Next Token预测策略,以增强代码生成和填充能力。开源许可允许广泛研究和商业应用。
在评估中,DeepSeek-Coder-Base 33B在多个基准如HumanEval和MBPP上超越现有开源模型,其性能甚至在某些任务上接近闭源模型如GPT-3.5。例如,Base 6.7B模型参数虽少,但性能与CodeLlama-34B相当。指令微调(Instruct)版本进一步提升零样本性能,跨文件代码完成和FIM任务表现卓越。
数据收集自GitHub和StackExchange,经严格的去重和质量筛选,确保语料纯净。训练用16K上下文窗口和高效算法,支持大规模扩展。模型还结合自然语言和数学数据进行预训练,提升综合能力。
总体上,DeepSeek-Coder展示了开源模型的竞争力,提供了高性能、易访问的代码智能解决方案,推动软件开发效率提升。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载