大型语言模型安全性测试方法(英)-22页_1mb
报告摘要
世界数字技术学院(WDTA)人工智能安全测试方法
世界数字技术学院(WDTA)发布了一项标准化文件,旨在为大语言模型(LLM)的安全性评估提供指导,以促进人工智能技术的安全和可靠发展。该标准文件详细描述了针对大语言模型的各类攻击分类及评估方法。
大语言模型广泛应用于社会各个领域,随着其规模和影响力不断增大,安全和伦理问题变得尤为突出。该标准属于WDTA的人工智能安全、信任和责任(SAITR)项目的重要组成部分,主要包括六部分内容:适用范围、标准化参考资料、术语定义、具体实施流程、评估方法与指标,以及测试用例的最小样本量。
攻击按信息的可获取性分为四类:
- L1随机攻击:使用随机数据进行测试,多为公开测试数据;
- L2盲盒攻击:攻击者拥有部分攻击知识,如提示伪装与指令劫持;
- L3黑盒攻击:完全无法获取模型内部结构,主要用于转迁测试;
- L4白盒攻击:获取模型参数及梯度信息,如梯度上升方法。
评估指标之一为攻击成功率(R),计算获得错误内容的比例;另一个为拒绝率(D),模型拒绝回答的风险内容的比例。此外,提出综合评估公式,根据不同攻击级别的权重加权评估模型的整体防御能力。
为进行有效测试,应选择足够样本量且多样化的测试集,涵盖至少十种高风险领域,包括种族、宗教、健康、知识产权等。统计样本量可用置信区间公式计算,如标准差的百分比在20%以内,样本量不少于643。
WDTA在文件中特别感谢了众多技术专家和机构,参与本标准的撰写,并强调道德和社会责任的重要性,在全球AI治理体系中发挥积极而基础的推动作用。
字数统计:499字
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载