20250307-微软-从100个生成式AI产品中汲取的教训_21页_1mb
报告摘要
从100个生成式AI产品中汲取的教训总结
核心内容
本文由微软AI红队(AIRT)撰写,基于对超过100个生成式人工智能(GenAI)产品的红队测试经验,提出了一个内部威胁模型本体论和八个主要经验教训。文章旨在探讨AI红队测试的实践、挑战与未来方向,并通过案例研究展示了红队测试如何识别和评估AI系统中的安全与责任性风险。
主要观点
- AI红队测试是识别安全性和责任性风险的重要实践,通过模拟现实攻击来评估AI系统在各种场景下的脆弱性。
- AI红队测试并不等同于传统的安全基准测试,其关注点更广泛,包括安全性和RAI(负责任人工智能)影响。
- 红队测试强调系统级视角,不仅关注模型本身,还关注其部署环境和与外部系统的交互。
- 自动化工具(如PyRIT)在红队测试中扮演重要角色,可以加速漏洞发现并覆盖更广泛的风险领域。
- 人为因素在红队测试中不可或缺,包括领域专业知识、文化敏感性和情感判断。
- LLMs(大型语言模型)不仅放大了传统安全风险,还引入了新的风险类别,如提示注入和越狱攻击。
- 确保AI系统的安全性是一个持续的过程,没有终点,需要不断测试和更新防御机制。
- RAI危害普遍存在,但难以量化,这要求红队测试与政策、法规和文化背景相结合。
关键信息
威胁模型本体论
- 系统:被测试的端到端AI模型或应用。
- 演员:模拟攻击者或良性用户,前者可能包含恶意意图,后者可能无意中触发系统漏洞。
- 战术、技术、程序(TTPs):包括攻击策略、技术手段和执行步骤,通常与MITRE ATT&CK®和MITRE ATLAS Matrix相关联。
- 弱点:系统中可能被利用的漏洞或漏洞组合。
- 影响:攻击可能带来的后果,如数据泄露、权限提升或生成非法内容。
八个主要经验教训
- 理解系统的能力和应用场景:这是识别漏洞的关键起点。
- 您不需要计算梯度就能破坏一个AI系统:简单的提示工程可能比复杂的对抗性攻击更有效。
- AI红队测试不是安全基准测试:需要考虑更广泛的安全和责任性风险。
- 自动化是覆盖更多风险领域的重要手段:如PyRIT框架。
- 人为因素至关重要:包括领域专家、文化能力与情感判断。
- RAI危害普遍存在但难以衡量:需要结合政策和文化背景进行评估。
- LLMs放大了现有安全风险并引入了新风险:如提示注入和越狱攻击。
- 确保AI系统安全的工作永远不会完成:需要持续测试和改进。
案例研究
- 破解视觉语言模型以生成有害内容:通过图像叠加恶意文本,模型可能生成非法内容。
- 评估LLMs在自动化诈骗中的应用:结合文本到语音和语音到文本技术,实现端到端诈骗。
- 评估聊天机器人如何回应处于困境的用户:关注心理健康风险,强调系统对用户情绪的理解。
- 探究文本到图像生成器中的性别偏见问题:通过提示分析,发现模型在性别描绘上的偏差。
- SSRF漏洞在视频处理GenAI应用中的案例:系统使用过时的FFmpeg,导致权限提升风险。
实用建议
- 优先考虑系统级攻击策略,以更有效地识别漏洞。
- 利用自动化工具,如PyRIT,来提升红队测试的效率和覆盖范围。
- 结合人类判断与创造力,特别是在处理RAI危害时。
- 开发跨语言和文化背景的红队测试实践,以适应全球部署的AI系统。
- 推动AI红队测试与安全基准测试的互补性,以全面评估AI系统的安全性。
开放性问题
- 如何持续更新红队测试实践,以应对新兴的AI能力与风险?
- 如何在多语言和文化背景下扩展红队测试?
- 如何标准化AI红队实践,以提高透明度和可比性?
结论
AI红队测试是评估生成式AI系统安全性和责任性的重要工具。随着AI技术的不断发展,红队测试需要不断演进,以适应新的风险和挑战。通过结合系统级视角、自动化工具和人为因素,AI红队可以更有效地识别和缓解AI系统的潜在风险。
致谢
感谢Jina Suh、Steph Ballard、Felicity Scott-Milligan、Maggie Engler、Owen Larter、Andrew Berkley、Alex Kessler、Brian Wesolowski和Eric Douglas提供的宝贵反馈。
参考文献
- Ahuja, K., Diddee, H., Hada, R., et al. (2023). Mega: 多语言生成式人工智能评估.
- Apruzzese, G., Anderson, H. S., Dambra, S., et al. (2022). "real attackers don't compute gradients": Bridging the gap between adversarial ml research and Practice.
- Bhatt, M., Chennabasappa, S., Nikolaidis, C., et al. (2023). 紫色 llama 网络安全评估:一种安全编码基准语言模型.
- Birhane, A., Steed, R., Ojewale, V., et al. (2024). AI auditing: The broken bus on the road to AI accountability.
- Blevins, T. & Zettlemoyer, L. (2022). 语言污染有助于解释英语预训练模型在跨语言能力方面的表现.
- Chao, P., Robey, A., Dobriban, E., et al. (2024). 在二十次查询中解锁黑盒大型语言模型.
- Derczynski, L., Galinkin, E., Martin, J., et al. (2024). garak: 用于安全探测大型语言模型的框架.
- Feffer, M., Sinha, A., Deng, W. H., et al. (2024). 红队作战在生成式人工智能中的应用:银弹还是安全戏剧?
- Geiping, J., Stein, A., Shu, M., et al. (2024). Coercing LLMs to do and reveal (almost) anything.
- Glasbrenner, J., Booth, H., Manville, K., et al. (2024). Dioptra测试平台.
- Haider, E., Perez-Becker, D., Portet, T., et al. (2024). Phi-3 安全性后培训:将语言模型与“故障-修复”周期对齐.
- Hartvigsen, T., Gabriel, S., Palangi, H., et al. (2022). Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection.
- Hines, K., Lopez, G., Hall, M., et al. (2024). 使用聚焦技术防御间接提示注入攻击.
- Jain, D., Kumar, P., Gehman, S., et al. (2024). Polyglotoxici-typrompts: Multilingual evaluation of neural toxic degeneration in large language models.
- Jiang, F., Xu, Z., Niu, L., et al. (2024a). Artprompt: 基于 ASCII 艺术的针对对齐 LLMs 的越狱攻击.
- Jiang, L., Rao, K., Han, S., et al. (2024b). 大规模野性团队协作:从野外越狱到(对抗性)更安全的语言模型.
- Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models.
- 李,N.,潘,A.,高帕,A.,岳,S.,贝里奥斯,D.,加蒂,A.,范,L.,尹,X.,马泽伊卡,M.,潘,A.,穆科比,G.,金,R.H.,菲茨,S.,亨德里克斯,D. (2024). 安全洗牌:AI安全基准实际上是否衡量了安全进步?
- 任,R.,巴萨特,S.,科贾,A.,加蒂,A.,范,L.,尹,X.,马泽伊卡,M.,潘,A.,穆科比,G.,金,R.H.,菲茨,S.,亨德里克斯,D. (2024). 安全洗牌:AI安全基准实际上是否衡量了安全进步?
- Russinovich, M., Salem, A., & Eldan, R. (2024). Great, now write an article about that: The crescendo multi-turn LLM jailbreak attack.
- Saghiri, A. M., Vahidipour, S. M., Jabbarpour, M. R., et al. (2022). 人工智能挑战的调查:分析定义、关系和演变.
- Shelby, R., Rismani, S., Henne, K., et al. (2023). 算法系统的社会技术危害:制定一个减少危害的分类法.
- Slattery, P., Saeri, A., Grundy, E., et al. (2024). 人工智能风险库:人工智能风险的综合元审查、数据库和分类法.
- Smith, B., Browne, C., & Gates, B. (2019). 工具与武器:数字时代的承诺与危险.
- Solaiman, I., Talat, Z., Agnew, W., et al. (2024). 在系统和社会中对生成式人工智能系统社会影响的评估.
- Sutskever, I., Gross, D., & Levy, D. (2024). 安全超级智能公司.
- Vassilev, A., Oprea, A., Fordyce, A., & Anderson, H. (2024). 对抗性机器学习:攻击和缓解的分类和术语.
- Verma, A., Krishna, S., Gehrmann, S., et al. (2024). 实施针对大型语言模型(LLMs)的红队威胁模型.
- Wallace, E., Xiao, K., Leike, R., et al. (2024). 指令层次结构:训练LLM优先执行特权指令.
- 王,B.,陈,W.,裴,H.,谢,C.,康,M.,张,C.,徐,C.,熊,Z.,杜塔,R.,薛弗,R.,杜鲁昂,S.T.,阿罗拉,S.,梅泽伊卡,M.,亨德里克斯,D.,林,Z.,程,Y.,科耶约,S.,宋,D.,李,B. (2024). Decodingtrust:对GPT模型中可信度的全面评估.
- Weiss, R., Ayzenshteyn, D., Amit, G., & Mirsky, Y. (2024). What was your prompt? a remote keylogging attack on ai assistants.
- Wolf, Y., Wies, N., Avnery, O., et al. (2024). 大型语言模型中对齐的基本限制.
- 郑丽,江威伦,盛彦,庄思,吴子涵,庄宇,林子涵,李子涵,李丹,星平,张华,冈萨雷斯,J.E.,斯托伊卡,I. (2023). 使用MT-bench和聊天机器人竞赛评估LM-as-as-judge.
- 周俊,卢涛,米什拉,布拉马,巴苏,刘雁,周德,侯磊 (2023). 大型语言模型遵循指令的评估.
- 周,A.,王,Z.,卡里尼,N.,纳斯,M.,科尔特,J.Z.,与 Fredrikson, M. (2023). Universal and transferable adversarial attacks on aligned language models.
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载