兰德-高效评估大型语言模型两用生物能力的自动评分(英)-2025_55页_884kb
报告摘要
专业报告内容总结
研究背景
报告探讨了大型语言模型(LLM)在生成生物实验协议方面的能力,重点关注这些模型可能被用于生物安全风险的潜在风险。评估自动化评分系统(autograder)的可行性,以减少对依赖人类评分专家的需求。
自动化评分系统
系统利用OpenAI的GPT-4开发,基于科学家设计的评分标准(rubrics)自动评估LLM生成的实验协议。通过引入“Chain of Thought”(CoT)推理和集成五个独立评分来提高评分准确性。
性能评估
测试了11种LLM,发现GPT-4和Claude Opus 3表现最佳,平均准确率约为84%。对50个技术与问题(TAQs)进行了评估,发现自动化评分与人类专家的评分存在高度一致性(加权Cohen’s kappa平均为0.619),但因人类评分专家之间差异较大(平均κ值为0.444),可靠性方面仍有提升空间。
研究局限
研究仅评估了一种生物威胁模型,且评分标准尚需细化,避免歧义。自动化系统无法涵盖专家风格偏好或识别模型自偏见。此外,报告指出,生物实验评分标准应避免不必要的复杂度以减少人类评分间的不一致。
未来方向
计划扩展TAQ集以防涵盖更多威胁模型,同时改进评分标准的清晰度,目标是实现高度一致且自动化的评估系统。未来工作还包括多维度验证系统准确性,以适应新的LLM模型和技术进步。
研究意义
该项工作为政策制定、学术界和技术专家提供了评估AI生物风险的可规模化方法,推动了高效率、一致性更强的安全评估方法的实用化进程。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载