GPT-4_技术报告(中文版)-OpenAI_151页_14mb
报告摘要
GPT-4技术报告总结
核心内容概述
GPT-4是由OpenAI开发的一个大规模多模态模型,能够处理图像和文本输入并生成文本输出。它在多个专业和学术基准测试中表现出接近人类水平的能力,例如在模拟律师考试中排名前10%。尽管如此,GPT-4仍存在一定的局限性,如不完全可靠、可能产生幻觉和错误推理。
主要观点
- 多模态能力:GPT-4能够接受图像和文本输入并生成文本输出,拓展了其应用场景。
- 性能表现:在多个专业和学术考试中,GPT-4表现出色,如统一律师考试、LSAT、SAT、GRE等,均优于GPT-3.5。
- 语言能力:GPT-4在多种语言上的表现优异,尤其在MMLU等基准测试中,其在24种语言中表现超过英语的最先进水平。
- 可预测的扩展:GPT-4的开发强调了可预测的扩展性,通过基础设施和优化方法,实现了对模型性能的准确预测,即使在较小的计算量下也能估计其表现。
- 安全与可靠性:GPT-4通过RLHF(人类反馈强化学习)进行了微调,以提高安全性。尽管如此,模型在某些情况下仍可能产生不准确或不安全的内容,因此需要额外的干预和监控。
- 局限性:GPT-4仍存在一定的不稳定性,如生成不准确信息、幻觉、推理错误等,尤其是在涉及复杂任务时。
- 风险与缓解措施:OpenAI采取了多种措施,包括对抗性测试、模型辅助的安全管道和基于规则的奖励模型(RBRMs),以减轻潜在风险。
关键信息
性能表现
| 考试 | GPT-4 | GPT-4 (无视力) | GPT-3.5 |
|---|---|---|---|
| 统一律师考试 | 298/400 (约90%) | 298/400 (约90%) | 213/400 (第10位) |
| LSAT | 163 (第88位) | 161 (第83位) | 第149位 (第40位) |
| SAT循证读写 | 710/800 (约93%) | 710/800 (约93%) | 670/800 (第87位) |
| SAT数学 | 700/800 (第89位) | 690/800 (第89位) | 590/800 (第70位) |
| GRE定量 | 163/170 (第80位) | 157/170 (~62%) | 147/170 (第25位) |
| GRE口语 | 169/170 (第99位) | 165/170 (第96位) | 154/170 (约63%) |
| GRE写作 | 4/6 (第54位) | 4/6 (第54位) | 4/6 (第54位) |
| USABO半决赛2020 | 87/150 (第99-100位) | 87/150 (第99-100位) | 43/150 (31-33位) |
| 2022年USNCO地方科考试 | 36/60 | 38/60 | 24/60 |
| 医学知识自我评估计划 | 75% | 75% | 53% |
| Codeforces评级 | 392 (低于第5名) | 392 (低于第5名) | 260 (低于第5名) |
| AP艺术史 | 5 (第86-100位) | 5 (第86-100位) | 5 (第86-100位) |
| AP生物学 | 5 (第85-100位) | 5 (第85-100位) | 4 (第62-85位) |
| 微积分 | 第4 (第43-59位) | 第4 (第43-59位) | 1 (第0-7位) |
| AP化学 | 4 (第71-88位) | 4 (第71-88位) | 2 (第22-46位) |
| AP英语语言与写作 | 2 (第14-44位) | 2 (第14-44位) | 2 (第14-44位) |
| AP英语文学与写作 | 2 (第8-22位) | 2 (第8-22位) | 2 (第8-22位) |
| AP环境科学 | 5 (第91-100位) | 5 (第91-100位) | 5 (第91-100位) |
| AP宏观经济学 | 5 (第84-100位) | 5 (第84-100位) | 第2位 (第33-48位) |
| 微观经济学 | 第5位 (第82-100位) | 第4位 (第60-82位) | 第4位 (第60-82位) |
| AP物理2 | 第4位 (第66-84位) | 第4位 (第66-84位) | 第3位 (第30-66位) |
| AP心理学 | 第5位 (第83-100位) | 第5位 (第83-100位) | 第5位 (第83-100位) |
| AP统计 | 第5位 (第85-100位) | 第5位 (第85-100位) | 第3位 (第40-63位) |
| 联邦政府考试 | 第5位 (第88-100位) | 第5位 (第88-100位) | 第4位 (第77-88位) |
| 美国历史考试 | 第5位 (第89-100位) | 第4位 (第74-89位) | 第4位 (第74-89位) |
| 世界历史考试 | 第4位 (第65-87位) | 第4位 (第65-87位) | 第4位 (第65-87位) |
| AMC 10 | 30/150 (第6-12位) | 36/150 (第10-19位) | 36/150 (第10-19位) |
| AMC 12 | 60/150 (第45-66位) | 48/150 (第19-40位) | 30/150 (第4-8位) |
| 品酒师入门(理论知识) | 92% | 92% | 80% |
| 注册侍酒师(理论知识) | 86% | 86% | 58% |
| 高级侍酒师(理论知识) | 77% | 77% | 46% |
| Leetcode(简易) | 31/41 | 31/41 | 12/41 |
| Leetcode(中等) | 21/80 | 21/80 | 8/80 |
| Leetcode(困难) | 3/45 | 3/45 | 0/45 |
性能预测
- 损失预测:通过拟合标度律,OpenAI能够准确预测GPT-4的最终损失,其表现与计算量呈幂律关系。
- HumanEval预测:通过外推,可以预测GPT-4在HumanEval数据集上的通过率,尽管在某些情况下预测结果存在偏差。
视觉输入能力
- GPT-4可以处理图像输入,并在图像与文本结合的提示中生成文本输出。
- 一个示例提示要求模型描述一张包含三个面板的“闪电电缆”适配器图片,GPT-4能够准确解释图像中的幽默。
安全性改进
- 对抗性测试:OpenAI邀请了50多名领域专家进行对抗性测试,以识别和缓解潜在风险。
- 模型辅助安全管道:包括RLHF和基于规则的奖励模型(RBRMs),用于引导模型行为。
- 安全指标提升:GPT-4在RealToxicityPrompts数据集上,产生毒性内容的比例显著下降(从6.48%到0.73%)。
风险与挑战
- GPT-4在某些情况下仍可能产生错误信息或幻觉。
- 模型在面对某些安全或敏感提示时,可能会过度谨慎或产生不期望的输出。
- 模型对训练前数据之后的事件缺乏了解,因此在某些情况下可能不准确。
未来工作
- 开源框架:OpenAI正在开源其评估框架OpenAI Evals,用于创建和运行模型评估基准。
- 扩展和优化:计划进一步优化模型扩展性和性能预测方法。
- 跨语言支持:继续研究模型在低资源语言中的表现。
- 社会和经济影响:与外部研究人员合作,评估人工智能的潜在社会和经济影响,并探索有效监管的必要性。
项目贡献者
- 核心捐助者:Christopher Berner, Greg Brockman, Trevor Cai, David Farhi, Chris Hesse, Shantanu Jain, Kyle Kosic, Jakub Pachocki, Alex Paino, Mikhail Pavlov, Nick Ryder, Szymon Sidor, etc.
- 计算群集扩展:Christopher Berner, Oleg Boiko, Andrew Cann, Ben Chess, Christian Gibson, etc.
- 分布式培训基础设施:Greg Brockman, Trevor Cai, Chris Hesse, Yongjik Kim, etc.
- 硬件正确性:Greg Brockman, Shantanu Jain, Kyle Kosic, Michael Petrov, etc.
- 优化与架构:Igor Babuschkin, Mo Bavarian, Adrien Ecoffet, David Farhi, etc.
- 训练跑保姆:Suchir Balaji, Mo Bavarian, Greg Brockman, Trevor Cai, etc.
- 代码能力:Ilge Akkaya, Mo Bavarian, Jonathan Gordon, Shawn Jain, etc.
- 评估与分析:Lama Ahmad, Tyna Eloundou, Roger Jiang, etc.
- 部署:Steven Adler, Sandhini Agarwal, Derek Chen, etc.
- 产品管理:Jeff Harris, Joanne Jang, Angela Jiang, etc.
- 额外捐款:Sam Altman, Katie Mayer, Bob McGrew, Mira Murati, Ilya Sutskever, etc.
参考文献
- [1] 汤姆·布朗、本杰明·曼、尼克·赖德、梅勒妮·苏比亚、贾里德·D·卡普兰、普拉富拉·达里瓦尔、阿尔温德·尼拉坎坦、普拉纳夫·希亚姆、吉里什·萨斯特里、阿曼达·阿斯克尔等。语言模型是很少尝试的学习者。神经信息处理系统进展,33:1877-1901,2020。
- [2] 乔丹·霍夫曼、塞巴斯蒂安·博格奥德、亚瑟·门施、埃琳娜·布查茨卡娅、特雷弗·蔡、伊莱扎·卢瑟福、迭戈·德拉斯·卡萨斯、丽莎·安妮·亨德里克斯、约翰内斯·韦尔布尔、艾丹·克拉克等。训练计算最优的大型语言模型。arXiv预印本arXiv: 2203.15556, 2022。
- [3] Aakanksha Chowdhery、莎兰·纳朗、Jacob Devlin、Maarten Bosma、Gaurav Mishra、Adam Roberts、Paul Barham、Hyung Won Chung、Charles Sutton、Sebastian Gehrmann等。PaLM:用路径扩展语言建模。arXiv预印本arXiv: 2204.02311, 2022。
- [4] 杰克·W·雷伊、塞巴斯蒂安·博格奥德、特雷弗·蔡、凯蒂·米利肯、乔丹·霍夫曼、弗朗西斯·宋、约翰·阿斯兰尼德斯、莎拉·亨德森、罗曼·林、苏珊娜·杨等。扩展语言模型:训练gopher的方法、分析和见解。arXiv预印本arXiv: 2112.11446, 2021。
- [5] 戴子航、杨志林、杨一鸣、海梅·卡波内尔、Quoc V.Le 和 Ruslan Salakhutdinov。Transformer model-XL:超越固定长度语境的专注语言模型。arXiv 预印本 arXiv: 1901.02860, 2019。
- [6] 刘、迈尔·奥特、纳曼·戈亚尔、杜、曼达尔·乔希、陈丹琪、奥马尔·利维、迈克·路易斯、卢克·泽特莱莫耶和韦塞林·斯托扬诺夫。Roberta:一种稳健优化的bert预训练方法。arXiv预印本arXiv: 1907.11692, 2019。
- [7] 杰森·魏、戴尔·舒尔曼斯、马腾·博斯马、埃德·池、郭乐和丹尼·周。思维链提示引发大型语言模型中的推理。神经IPS,2022。
- [8] 黄家新、顾世祥、吴月新、于洪坤、韩家伟。大型语言模型可以自我完善。arXiv预印本arXiv: 2210.11610, 2022。
- [9] 小岛康誉武、史翔·沙恩·顾、马谢尔·里德、松尾裕太和岩泽佑介。大型语言模型是零镜头推理器。arXiv预印本arXiv: 2205.11916, 2022。
- [10] 贾里德·卡普兰、萨姆·麦坎德利什、汤姆·海尼根、汤姆·B·布朗、本杰明·切斯、雷文·蔡尔德、斯科特·格雷、亚历克·拉德福德、杰弗里·吴和达里奥·阿莫代。神经语言模型的标度律。arXiv预印本arXiv: 2001.08361, 2020。
- [11] 汤姆·海尼根、贾里德·卡普兰、莫尔·卡茨、陈马克、克里斯托弗·黑塞、雅各布·杰克森、希宇俊、汤姆·B·布朗、普拉富拉·达里瓦尔、斯科特·格雷等。自回归生成模型的标度律。arXiv预印本arXiv: 2010.14701, 2020。
- [12] Greg Yang、Edward J.Hu、Igor Babuschkin、Szymon Sidor、David Farhi、Nick Ryder、Jakub Pachocki、高建峰。张量程序v:通过零镜头超参数转移调整大型神经网络。arXiv预印本arXiv: 2203.03466, 2022。
- [13] 诺姆·沙泽尔、阿扎利亚·米尔霍塞尼、克日什托夫·马齐亚尔兹、安迪·戴维斯、国乐、杰弗里·辛顿和杰夫·迪恩。异常庞大的神经网络:稀疏门控的专家混合层。arXiv预印本arXiv: 1701.06538, 2017。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载