2025-02-11-天津大学-DeepSeek原理与效应_44页_7mb
报告摘要
天津大学自然语言处理实验室技术报告总结
一、生成式 AI 发展路线图
- 演进历程:涵盖从 ENIAC 到 AGI/ASI 的 50 年发展,标志性事件包括图灵测试、达特茅斯会议、Transformer 模型、GPT-3 和 RLHF 等技术节点。
- 生成式 AI 技术脉络:包含 Attention 机制、Transformer 架构、规模规律、RLHF 和 Chain-of-Thought 推理。
- 语言模型发展:从传统语言建模到超大规模预训练语言模型(LLM),包括任务对齐和领域微调。
二、大语言模型关键技术栈与生命周期
- 模型技术栈:纵向包括预训练、微调和强化学习,横向涉及数据处理、硬件优化和推理部署流。
- 生命周期与范式:数据治理和预训练是基础,RAG 等技术增强通用能力,扩展能力范围到文本、代码等专业领域。
- 降低成本策略:采用 MoE、FP8 训练等底层技术实现“性价比领先”。
三、DeepSeek 技术体系
- V2 架构:首次将 MoE 稀疏激活模型系统化,并引入 MLA、FP8 等七项技术创新,实现 128K 上下文窗口,开启高性能 LLM 发展新阶段。
- V3 架构:参数规模达 670B,提出 MTP,采用高效数据加载机制,并通过十余项开源前沿创新压缩模型训练成本。
- R1 推理模型:重量级通用推理引擎 DeepSeek-R1,研发成本仅 2600 吨 GPU 小时,突破先驱者的工作目标,解决“推理”难题。采用《4 步强化学习》和 GRPO 机制自主优化。
- RL 训练组织策略:设置拒绝训练样本、高质量推理数据等策略,提升能量转化为收益的比例。
四、DeepSeek 技术创新及影响效应
- 技术领先性:绕开美国技术封锁,打破 AI 天花板,霸权式 “开源和闭源之争” 快速逆转。
- 赋能中国 AI 产业体系自信:实现了从 Zero 到 One 在路径探索上的重要突破,扩大了我国在高端 AI 创新基础环节的自主权。
- 人才战略意义:强调科研四种人才——技术探索者与战略型创意者,推动研发与产业融合。
五、未来展望
- AGI 之路:预测人类社会全面 AGI 化需要 30 年,突破需依赖硬科技、交叉研究和持续性投入。
- LLM 范式迁移:从垂直技术应用向 AGI 演进,下一代 DeepSeek 路径或进入推理者-智能体分层发展阶段。
- 科研变革趋势:AI 将重构科学范式,DeepSeek 将在多学科交叉融合中扮演推进器角色。
报告 / 天津大学自然语言处理实验室
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载