深度报告-20240919-国盛证券-通信_合成数据+强化学习_大模型进化的新范式_18页_2mb
报告摘要
OpenAI o1模型与合成数据强化学习分析
主要发现
OpenAI 发布了新模型系列 o1(代号“草莓”),其核心特点是优先“思考”,生成较长的内部思维链,以提升科学、数学和代码问题的推理表现。o1-preview 和 o1-mini 的 API 定价不同,前者较高,后者较亲民,且使用受限。这或为 OpenAI 新模型“猎户座”生成合成数据,提升模型智能推理能力,尤其在数学、代码等领域。合成数据作为缓解“数据荒”的关键手段,具有性价比高、全面性好、隐私性强等优点,但可能引入噪声或泛化不足,可通过诱导幻觉、数据评估机制或训练积累数据等方法解决。强化学习(如 RLAIF)与合成数据结合,确认了大模型进化新范式,即 Scaling Law 可出现在推理阶段,利好算力板块。
合成数据分析
合成数据是模仿真实数据的非人工创建数据,优点包括成本低、覆盖全面场景、保护隐私;不足包括可能噪声多或泛化有限。解决方案包括“诱导-对比解码”策略减少幻觉、加入奖励模型评估数据质量,或在训练中积累数据避免模型崩溃。
投资机会
报告建议关注光模块(如中际旭创、新易盛)、液冷服务(如英维克)、PCB 服务(如沪电股份)和 AIDC(如润泽科技)产业链,因为推理 Scaling Law 提升算力需求,利好相关硬件。o1 在竞赛中表现优异,强化了投资信心。
风险提示
大模型技术进展不及预期、应用落地缓慢或全球经济衰退可能导致风险。
参考文献:国盛证券报告_2024-09-16。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载