2025-06-24-兰德-高效评估大型语言模型两用生物能力的自动评分(英)_55页_761kb
报告摘要
研究报告总结:使用大型语言模型自动评估双用途生物能力
方法
- 本研究开发了一种基于GPT-4的自动生成器,用于评估大型语言模型在生物技术相关实验操作中的知识和协议生成能力。
- 使用了48项“问题与技术(TAQ)”评估,涵盖了28种实验室技术及20个知识性问题,旨在评估模型对创建生物威胁代理(如分泌超抗原细菌)的能力。
主要发现
- 在11种被测大型语言模型中,Claude Opus 3和GPT-4表现最佳,平均每项任务正答率约84%。
- 自动评分系统(autograder)与人工评分在多数情况下趋于一致,特别是在前期人类评分人类似例中表现出极高的平均加权Kappa值,表明其可靠性较高。
- 研究发现表明,自动评分器可以有效评估大型语言模型的潜在危险能力,但仍存在评分标准的局限性,如忽略部分关键细节或任务顺序。
限制与未来方向
- 评估对象局限于制造分泌超抗原细菌的代理模型,需扩展至其他生物安全风险场景。
- 需要进一步优化评分标准,减少人工评分偏差。
- 控制研究对象避免披露过细则是未来研究的重点。
- 着眼于整合基础生物学知识检验,全面分析生物安全风险。
结论
本研究验证了一套基于大型语言模型自动评估双用途生物能力的方法,为减少高成本、长周期的人工评估提供了可行替代方案。研究强调自动评分器的评估能力在改善回答结构和细节性方面逐渐逼近专业人类评分模式,但也受限于任务复杂度和评分标准的局限性。
关键信息附录:
- 被测模型:GPT-4、Claude Opus 3、Llama 2 70B、Claude 2等。
- 评分指标:实现了TAQ每部分最高84的平均精确度,但存在精准细节缺失导致评分偏低的现象。
- 未来方向:开发模块化评分标准、配置自动响应器适配多样生物场景、增强严格测试下的协议能力评估。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载