OpenAI_GPT_4.5_报告_32页_2mb
报告摘要
OpenAI GPT-4.5 系统卡总结
核心内容
OpenAI GPT-4.5 是一项研究预览版模型,基于 GPT-4o 进一步扩展,旨在提升通用性和安全性。该模型在知识库、自然对话、情感理解及创造力方面表现更优,适用于写作、编程和问题解决等任务。尽管 GPT-4.5 在多个方面有所改进,但其仍被评估为中等风险模型,需采取多种缓解措施以降低潜在危害。
主要观点
- 模型特性:GPT-4.5 在推理能力、自然语言处理、情感识别及多语言支持方面表现更优。
- 训练方式:采用监督微调(SFT)和人类反馈强化学习(RLHF)等传统技术,结合无监督学习扩展,提升模型的泛化能力和准确性。
- 安全性评估:GPT-4.5 的安全性评估结果表明,其在不安全内容生成和过度拒绝方面表现与 GPT-4o 相当,但存在一定的风险。
- 风险分类:在说服、化学、生物、放射性、核等风险领域,GPT-4.5 被评为中等风险,但其在网络安全和模型自主性方面风险较低。
关键信息
1. 模型数据和训练
- 无监督学习:扩展无监督学习和思维链推理,提升模型的准确性和降低幻觉率。
- 数据处理:使用严格的数据过滤流程,确保模型在训练过程中不处理个人信息,并结合 API 和安全分类器防止有害内容生成。
- 训练数据来源:包括公开数据、专有数据和定制数据集。
2. 安全评估
- 不允许内容评估:GPT-4.5 在标准拒绝评估和挑战性拒绝评估中表现良好,但存在过度拒绝的问题。
- 越狱评估:GPT-4.5 在越狱稳健性上表现接近 GPT-4o,但仍有改进空间。
- 幻觉评估:GPT-4.5 在幻觉率方面优于 GPT-4o 和 o1,但在某些领域仍需进一步测试。
- 公平与偏见评估:GPT-4.5 在模棱两可的问题上表现与 GPT-4o 相似,但在明确问题上表现略差。
3. 红队评估
- 挑战性红队评估 1:GPT-4.5 在 51% 的情况下生成不安全内容,略高于 GPT-4o 的 50%。
- 挑战性红队评估 2:GPT-4.5 在 46% 的情况下生成不安全内容,低于深度研究和 o1,但高于 GPT-4o。
4. 阿波罗研究
- 计谋推理评估:GPT-4.5 的计谋推理能力低于 o1,但高于 GPT-4o,表明其计谋风险较低。
5. METR 评估
- 代理任务:GPT-4.5 在代理任务中的表现与 o1 和 o3-mini 相似,但未能达到深度研究的水平。
- 时间跨度分数:GPT-4.5 的时间跨度分数约为 30 分钟,表明其在长期任务中表现有限。
6. 准备框架评估
- 模型自主性:GPT-4.5 在自主性评估中表现较弱,未能充分推进自我过滤、自我完善和资源获取能力。
- 网络安全:GPT-4.5 的网络安全能力被评为低风险,但未充分推进漏洞利用能力。
- CBRN(化学、生物、放射性、核)威胁生成:GPT-4.5 被评为中等风险,但其在生物威胁生成方面表现优于 GPT-4o。
7. 多语言性能
- MMLU测试:GPT-4.5 在 14 种语言上的表现优于 GPT-4o,尤其在阿拉伯语、孟加拉语、简体中文等低资源语言上表现更佳。
- 翻译方式:使用人工翻译提高翻译准确性,相比 GPT-4 的机器翻译方法更具可靠性。
附录内容
- 详细安全评估:包含多个安全评估的详细指标,如骚扰/威胁、性/剥削、非法/暴力等,GPT-4.5 在这些方面表现良好,但存在一定的风险。
- 红队评估细节:包括对不同类型的对抗性提示的评估,如越狱攻击和说服策略。
- 其他评估:包括对模型在不同任务中的表现,如编码、代理任务、ML 竞赛等,以衡量其实际应用能力。
结论
GPT-4.5 在能力与安全性方面均有显著提升,但仍存在一定的风险。OpenAI 强调迭代部署的重要性,并持续改进模型的安全性和性能。该模型被评估为中等风险,但具备足够的保障措施,确保其在各种任务中的可靠性和安全性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载