【天津大学】DeepSeek原理与效应_44页_7mb
报告摘要
DeepSeek技术原理与效应分析总结
报告旨在深度解读DeepSeek系列模型,涵盖其原理、效应及AI未来发展路径。报告基于天津大学自然语言处理实验室的研究视角,回顾了生成式AI从1950年代到2024年的演变历程,包括Attention机制、Transformer架构、ScalingLaws、RLHF等关键创新,并探讨了ASCII-related path to AGI.
DeepSeek技术原理部分聚焦于其创新架构:V2引入了稀疏MoE模型,实现了部分激活以降低计算成本;V3进一步优化了基础设施、多token预测和FP8训练;R1则采用推理模型框架R1-Zero,结合大规模强化学习和GRPO框架,提升了逻辑推理性能,并展示了创新能力。
DeepSeek效应分析了开源策略对AI格局的影响,挑战了美国的技术主导地位,并探讨了其对大模型研发成本、人才培养和AGI愿景的里程碑意义。
未来展望部分预测了AGI发展可能需要3-5个重大突破,并分段讨论了未来1-5年、5-10年和10-20年的关键技能和AI范式演变,强调了DeepSeek在推动科研和创新方面的潜力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载