ChatGPT的前世今生(2023)-南京航空航天大学_464页_35mb
报告摘要
ChatGPT的前世今生总结
个人介绍
李丕绩,从事自然语言处理与人工智能研究,拥有香港中文大学博士、山东大学本科与硕士背景,曾就职于百度、腾讯等企业,现为南京航空航天大学教授。其研究聚焦于语言模型、机器翻译、多模态技术等领域,推动AI技术发展。
AI技术发展史
人工智能发展历程可分为三个阶段:
- 计算智能:侧重计算机处理能力,如CNN、SVM等模型。
- 感知智能:涉及语音、图像处理,如AlphaGo、GPT等,解决“能听会说、能看会认”问题。
- 认知智能:关注语言理解、推理与抽象,如BERT、GPT系列,代表“能理解会思考”的核心能力。
核心技术演进
- 基础模型:从N-gram、RNN、LSTM到Transformer,逐步优化语言建模与文本生成能力。
- RNN/LSTM:解决长程依赖,但存在梯度消失/爆炸问题。
- Transformer:采用自注意力机制,支持并行计算,成为语言模型主流。
- 预训练技术:
- BERT:双向Transformer,通过Masked LM和Next Sentence Prediction进行预训练,踏入文本理解新阶段。
- GPT系列:单向自回归模型,逐步提升参数量(如GPT-3的175B)与语言能力,实现生成式模型突破。
- 多模态模型:结合文本与图像,如DALL-E(文本生成图像)和CLIP(图像-文本匹配),推动跨模态理解。
ChatGPT的技术原理
- 诞生背景:基于Transformer架构,通过大规模文本预训练(如GPT-3),融合人类反馈(RLHF)优化对话表现。
- 关键技术:
- SFT(监督微调):使用高质量指令数据集(如13k个训练提示)提升模型对指令的响应能力。
- RM(人类偏好):通过标注数据(如33k个提示)对齐用户需求,增强安全性与可控性。
- PPO(强化学习):基于API生成数据,利用排序任务优化模型输出质量。
- 模型特性:
- 大规模参数量:GPT-3的175B参数使其具备强大的语言理解与生成能力。
- 指令学习:通过In-context Learning(基于上下文推理)减少显式训练需求。
- 多模态扩展:GPT-4支持结合文本、图像、代码等,完成复杂任务(如视觉问答、代码生成)。
应用领域与效果
- 教育:用于改写论文、生成代码、辅助学习,但存在逻辑错误与事实偏差风险。
- 医疗:生成病历总结、医疗建议,但需警惕安全性和伦理问题(如误判抑郁诉求)。
- 军事:辅助情报分析、模拟训练、自动化报告生成,提升作战效率。
- 互联网/IT:漏洞检测(如GitHub代码分析)、智能客服、内容创作(如歌词、诗歌生成)。
- 文娱:音视频生成、个性化对话(如腾讯AI“艾灵”创作歌曲),实现创意输出。
技术挑战与应对
- 生成质量问题:
- 长文本一致性:需事件规划(如Event Transition Planning)与格式约束(如SongNet的歌词生成)提升连贯性。
- 事实性与逻辑性:依赖RLHF与外部知识库(如ConceptNet),但仍有偏差风险。
- 伦理与安全:
- 隐私与偏见:模型可能无意中暴露训练数据、存在偏见或引发危险行为(如医疗建议失误)。
- 可控性:通过指令微调(Prompt Learning)、蒸馏压缩(如TinyBERT)优化安全性。
- 规模化落地:
- 成本与效率:需采用分布式训练(如Google的256GPU集群)、模型压缩与API接口降低部署门槛。
- 行业适配:研究领域如金融、法律需适应具体场景的语义需求。
未来展望
- 技术趋势:
- 模型同质化:多厂商(如Meta的LLaMA、百度GLM)加速发展,形成差异化竞争。
- 多模态融合:Towards统一模型(如GPT-4)处理文本、图像、代码等多任务。
- 涌现能力:模型规模扩张带来新能力(如推理),但需验证其本质价值而非单纯规模竞赛。
- 研究方向:
- 神经符号化:结合符号推理与深度学习(如Neuro-Symbolic框架)提升逻辑性。
- 可控生成:通过Prompt Engineering、符号约束优化输出质量。
- 安全与合规:建立评估体系、开放数据集(如ShareGPT)推动模型透明化。
总结
ChatGPT作为生成式AI的代表,依托Transformer架构与预训练技术,重新定义了自然语言处理范式。其成功依赖于大规模数据、优化的微调策略(RLHF与SFT)及多模态扩展,但面临生成质量、伦理风险与行业适配等挑战。未来需平衡技术创新与安全管控,探索长程推理、符号推理等方向,推动AI在教育、医疗、军事等领域的可持续应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载