深度报告-20230831-财通证券-计算机行业深度分析报告_大语言模型的前世_今生与未来_20页_2mb
报告摘要
大语言模型的前世、今生与未来总结
核心内容
本报告系统梳理了大语言模型的发展历程、技术演进、应用方向以及相关投资建议,揭示了其在人工智能领域的重要地位和未来潜力。报告从技术探索、技术应用、技术跃迁三个维度剖析了大语言模型的演进路径,指出其可能成为通往通用人工智能(AGI)的关键技术。
主要观点
1. 大语言模型:NLP技术的奇点时刻
- 技术探索:深度学习通过非线性空间变换和GPU加速,成为NLP领域核心技术。
- 技术应用:预训练语言模型成为NLP主流范式,通过“预训练+提示”替代“预训练+下游任务改造”。
- 技术跃迁:大语言模型可能成为通往AGI的路径,但面临“幻觉”与模型性能天花板的挑战。
2. OpenAI与GPT:算法、工程、商业的融合
- 发展历程:从GPT-1到GPT-4,模型性能逐步提升,特别是GPT-3.5通过指令微调实现了“涌现”。
- 训练方法:预训练赋予模型“智商”,指令微调提升“情商”,通过RLHF实现更自然的交互。
- “涌现”现象:模型在一定规模后,开始展现出复杂的推理能力,如数学、代码、多模态等。
3. 大模型应用:数据感知与代理(Agent)能力
- 外部数据融合:通过三种方式(预训练+微调、指令微调、上下文学习)将垂域数据融入大模型。
- 代理能力:赋予大模型与计算机环境和物理世界交互的能力,如插件、代码解释器、机器人控制等。
- 上下文长度:是提示工程的重要因素,影响模型应用潜力和复杂任务处理能力。
- 模型小型化:通过参数压缩、结构优化等手段降低推理成本,提升边缘端部署能力。
4. 应用分析框架:通用能力与外部能力的组合
- 通用能力 + 数据感知:用于信息检索、汇总与再生成,如智能客服、企业知识库问答等。
- 通用能力 + 代理能力:用于自主执行、循环调用和环境控制,如RPA、自主AI系统等。
关键信息
技术演进路径
- 深度学习:从RNN、LSTM到Transformer,推动数据无损压缩与模型能力提升。
- 预训练+微调:从BERT到GPT,模型逐步具备更强的泛化能力和复杂任务处理能力。
- “预训练+提示”:成为当前NLP主流范式,显著提升模型灵活性和应用边界。
- “涌现”能力:模型在一定规模后展现复杂推理能力,成为生成式AI浪潮的核心驱动力。
应用方向
- C端应用:标准化工具类产品(如办公软件、创作工具)有望率先受益。
- B端应用:具备垂域数据与客户资源的企业(如金融、法律、医疗)将优先落地。
- 代理系统:通过插件、代码解释器、机器人控制等方式,实现复杂任务自动化处理。
技术路径
- 模型小型化:参数剪枝、量化、低秩分解等技术降低推理成本。
- 上下文学习:通过In-Context Learning扩展模型能力,无需重新训练。
- 代理能力:通过外部工具和环境交互,提升模型实用性。
投资建议
- C端:关注金山办公、万兴科技、同花顺、科大讯飞、福昕软件。
- B端:关注恒生电子、拓尔思、税友股份等具备行业数据和客户资源的企业。
- 算力支持:关注AI服务器厂商(浪潮信息、中科曙光)和国产AI芯片厂商(寒武纪、海光信息)。
风险提示
- 技术迭代不及预期:可能限制模型性能和应用场景扩展。
- 商业化落地不及预期:ChatGPT等模型尚未形成成熟盈利模式。
- 政策支持不及预期:新行业新技术的发展依赖政策推动。
- 全球宏观经济风险:影响下游企业的运营与投资回报。
结论
大语言模型作为NLP技术的奇点时刻,正在推动人工智能进入新的发展阶段。其“预训练+提示”范式、代理能力与数据感知能力的结合,为多个行业带来深远影响。在投资层面,建议关注具备技术优势和应用场景的企业,同时重视算力基础设施的发展。然而,技术与商业化的不确定性仍是潜在风险,需持续关注行业动态与政策支持。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载