【微软】从100个生成式AI产品中汲取的教训_21页_1mb
报告摘要
从100个生成式AI产品中汲取的教训总结
核心内容
本文由微软AI红队撰写,总结了在对超过100个生成式人工智能(GenAI)产品进行红队测试过程中获得的八个主要经验教训。这些教训强调了AI红队测试在识别系统漏洞和潜在风险中的重要性,同时探讨了AI安全威胁模型的构建方法和实践挑战。
主要观点
-
理解系统是关键
AI红队测试的第一步是理解系统的能力及其应用场景。通过从下游影响出发,可以更有效地识别真实世界中的安全风险。 -
您不需要计算梯度就能破坏一个AI系统
真正的攻击者利用简单的提示工程技术,而不是复杂的对抗性机器学习方法。这些技术通常更有效且成本更低。 -
AI红队对抗不是安全基准测试
AI红队测试关注的是系统在实际应用中可能遭遇的复杂攻击和意外故障,而不仅仅是模型级别的安全测试。 -
自动化能够帮助覆盖更多的风险景观
自动化工具如PyRIT可以显著提高红队测试的效率和范围,帮助识别更多潜在漏洞和风险场景。 -
人为因素在AI红队测试中至关重要
尽管自动化工具非常有用,但人类的判断力和创造力在识别和评估新型风险方面仍然不可或缺。 -
AI负责性的危害普遍存在,但难以衡量
负责任AI(RAI)的危害如生成有害内容、性别偏见等,其影响是主观的且难以量化。 -
LLMs放大了现有的安全风险并引入了新的风险
大型语言模型(LLMs)不仅加剧了传统安全漏洞,还引入了新的攻击向量,如越狱、提示注入等。 -
确保人工智能系统安全的工作永远不会完成
AI安全是一个持续的过程,随着技术的发展和攻击手段的演变,安全措施需要不断更新和加强。
关键信息
AI威胁模型本体论
微软AI红队开发了一个威胁模型本体论,用于模拟AI系统中的漏洞和攻击路径。该模型包括以下关键组成部分:
- 系统:被测试的端到端AI模型或应用。
- 演员:模拟攻击者或良性用户的实体。
- 战术、技术、程序(TTPs):用于模拟攻击的策略、技术和步骤。
- 弱点:系统中的漏洞或漏洞组合。
- 影响:攻击可能造成的后果,包括安全和RAI相关危害。
红队行动
- 自2021年以来,微软对超过100个GenAI产品进行了红队测试。
- 产品分为“模型”和“系统”两类,模型通常托管在云端,系统则整合模型到具体应用场景。
- 使用PyRIT等自动化工具可以提升测试效率和覆盖范围。
案例研究
-
破解视觉语言模型以生成有害内容
通过在图像上叠加恶意提示,成功诱导模型生成非法内容。 -
评估LLM在自动化诈骗中的应用
通过结合文本到语音和语音到文本技术,构建了一个端到端的诈骗系统。 -
评估聊天机器人对处于困境中的用户的回应
红队测试揭示了聊天机器人可能对用户造成心理社会危害。 -
探究文本到图像生成器中的性别偏见
通过不指定性别提示,测试生成内容的偏见程度。 -
SSRF漏洞在视频处理应用中的发现与缓解
发现并修复了一个由过时FFmpeg版本引入的SSRF漏洞。
建议与未来方向
- 系统级视角:应考虑AI模型部署的具体场景,以更全面地评估安全风险。
- 多语言与文化背景:随着AI系统在全球部署,红队测试需考虑不同语言和文化环境下的风险。
- 标准化与工具开发:推动AI红队测试的标准化,开发更多工具以支持测试和评估。
- 持续更新与改进:AI安全是一个持续的过程,需不断更新测试方法和工具以应对新威胁。
开放性问题
- 如何探测LLM中的危险能力(如说服、欺骗)?
- 如何将红队测试转化为多语言和文化背景下的实践?
- 如何标准化AI红队测试以提高透明度和可比性?
结论
AI红队测试是一项复杂且不断演进的实践,其目的是识别AI系统在实际应用中可能带来的安全和风险。微软AI红队的经验表明,红队测试不仅是对模型安全性的评估,更是对系统整体安全性的深入探索。通过不断改进测试方法、工具和框架,AI红队能够更有效地应对AI安全挑战。
参考文献
- Ahuja, K., Diddee, H., Hada, R., Ochieng, M., Ramesh, K., Jain, P., Nambi, A., Ganu, T., Segal, S., Axmed, M., Bali, K., & Sitaram, S. (2023). Mega: 多语言生成式人工智能评估.
- Apruzzese, G., Anderson, H. S., Dambra, S., Freeman, D., Pierazzi, F., & Roundy, K. A. (2022). "real attackers don't compute gradients": Bridging the gap between adversarial ml research and Practice.
- Bhatt, M., Chennabasappa, S., Nikolaidis, C., Wan, S., Evtimov, I., Gabi, D., Song, D., Ahmad, F., Aschermann, C., Fontana, L., Frolov, S., Giridhar, R. P., Kapirol, D., Kozarev, Y., Lebrun, J., Strouman, A., Sinnaeve, G., Votim, V., Whitman, S., & Saxe, J. (2023). 紫色 Ilama 网络安全评估:一种安全编码基准语言模型.
- Birhane, A., Steed, R., Ojewale, V., Vecchione, B., & Raji, I. D. (2024). Ai auditing: The broken bus on the road to ai accountability.
- Blevins, T. & Zettlemoyer, L. (2022). 语言污染有助于解释英语预训练模型在跨语言能力方面的表现.
- Chao, P., Robey, A., Dobriban, E., Hassani, H., Pappas, G. J., & Wong, E. (2024). 在二十次查询中解锁黑盒大型语言模型.
- Derczynski, L., Galinkin, E., Martin, J., Majumdar, S., & Inie, N. (2024). garak: 用于安全探测大型语言模型的框架.
- Feffer, M., Sinha, A., Deng, W. H., Lipton, Z. C., & Heidari, H. (2024). 红队作战在生成式人工智能中的应用:银弹还是安全戏剧?
- Geiping, J., Stein, A., Shu, M., Saifullah, K., Wen, Y., & Goldstein, T. (2024). Coercing Ilms to do and reveal (almost) anything.
- Glasbrenner, J., Booth, H., Manville, K., Sexton, J., Chisholm, M. A., Choy, H., Hand, A., Hodges, B., Scemama, P., Cousin, D., Trapnell, E., Trapnell, M., Huang, H., Rowe, P., & Byrne, A. (2024). Dioptra测试平台.
- Haider, E., Perez-Becker, D., Portet, T., Madan, P., Garg, A., Ashfaq, A., Majercak, D., Wen, W., Kim, D., Yang, Z., Zhang, J., Sharma, H., Bullwinkel, B., Pouliot, M., Minnich, A., Chawla, S., Herrera, S., Warreth, S., Engler, M., Lopez, G., Chikanov, N., D. heekonda, R. S. R., Jagdagdorj, B.-E., Lutz, R., Lundeen, R., Westerhoff, T., Bryan, P., Seifert, C., Kumar, R. S. S., & Zunger, Y. (2024). Phi-3 安全性后培训:将语言模型与“故障-修复”周期对齐.
- Hartvigsen, T., Gabriel, S., Palangi, H., Sap, M., Ray, D., & Kamar, E. (2022). Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection.
- Hines, K., Lopez, G., Hall, M., Zarfati, F., Zunger, Y. & Kiciman, E. (2024). 使用聚焦技术防御间接提示注入攻击.
- Jain, D., Kumar, P., Gehman, S., Zhou, X., Hartvigsen, T., & Sap, M. (2024). Polyglotoxici-typrompts: Multilingual evaluation of neural toxic degeneration in large language models.
- Jiang, F., Xu, Z., Niu, L., Xiang, Z., Ramasubramanian, B., Li, B., & Poovendran, R. (2024a). Artprompt: 基于 ASCII 艺术的针对对齐 LLMs 的越狱攻击.
- Jiang, L., Rao, K., Han, S., Ettinger, A., Brahman, F., Kumar, D., 越赫ghallah, N., Lu, X., Sap, M., Choi, Y., & Dziri, N. (2024b). 大规模野性团队协作:从野外越狱到(对抗性)更安全的语言模型.
- Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Ches, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling laws for neural language models.
- 李,N.,潘,A.,高帕,A.,岳,S.,贝里奥斯,D.,加蒂,A.,李,J. D., Dombrowski, A.-K., Goel, S., Phan, L., Mukobi, G., Helm-Burger, N., Lababidi, R., Justen, L., Liu, A. B., Chen, M., Barrass, 张,O.朱,X.塔米里斯,R.巴拉蒂,B.科贾,A.赵 Z.赫伯特-沃斯,A.,布雷乌尔,C.B.,马克斯,S.,帕特尔,O.,邹,A.,Mazeika, M., Wang, Z., Oswal, P., Lin, W., Hunt, A. A., Tienken-Harder, J., Shih, K. Y., Talley, K., Guan, J., Kaplan, R., Steneker, I., Campbell, D., Yookubayist, B., Levenson, A., Wang, J., Qian, W., Kamakar, K. K., Basat, S., Fitch, S., Levin, M., Kumaraguru, P., Tupakula, U., Varadharajan, V., Wang, R., Shoshitaishvili, Y., Ba, J., Esvelt, K. M., Wang, A., & Hendrycks, D. (2024). The wmdp 基准:衡量和减少恶意使用非学习.
- 林,S.,希尔顿,J.,&埃文斯,O.(2022)。Truthfulqa:衡量模型模仿人类虚假陈述的程度。
- 刘毅,姚瑶,唐·弗·托恩,张翔,郭瑞,程赫,克洛科夫,陶菲克·M·法,李晖。(2024). 可信的LLMs:评估大型语言模型的对齐的综述与指南.
- Marchal, N., Xu, R., Elasmar, R., Gabriel, I., Goldberg, B., & Isaac, W. (2024). 生成式AI滥用:策略分类与来自现实世界数据洞察。
- Meek, T., Barham, H., Beltaif, N., Kaadoor, A., & Akhter, T. (2016). 管理人工智能快速进步的伦理和风险影响:文献综述。
- Mehrotra, A., Zampetakis, M., Kassianik, P., Nelson, B., Anderson, H., Singer, Y., & Karbasi, A. (2024). Tree of attacks: 自动破解黑盒LLM的攻击树。
- Microsoft (2022). 微软负责任的AI标准,第2版。
- Moore, T. (2010). 网络安全的经济学:原则和政策选项。
- Munoz, G. D. L., Minnich, A. J., Lutz, R., Lundeen, R., Dheekonda, R. S. R., Chikanov, N., Jagdagdorj, B.-E., Pouliot, M., Chawla, S., Maxwell, W., Bullwinkel, B., Pratt, K., de Gruyter, J., Siska, C., Bryan, P., Westerhoff, T., Kawaguchi, C., Seifert, C., Kumar, R. S. S., & Zunger, Y. (2024). Pyrit: A framework for security risk identification and red teaming in generative ai systems.
- Pantazopoulos, G., Parekh, A., Nikandrou, M., & Suglia, A. (2024). 学习看到但忘记遵循:视觉指令调整使LLMs更容易受到越狱攻击。
- Phuong, M., Aitchison, M., Catt, E., Cogan, S., Kaskasoli, A., Krakovna, V., Lindner, D., Rahtz, M., Assael, Y., Hodkinson, S., Howard, H., Lieberum, T., Kumar, R., Raad, M. A., Webson, A., Ho, L., Lin, S., Farquhar, S., Hutter, M., Deletang, G., Ruoss, A., El-Sayed, S., Brown, S., Dragan, A., Shah, R., Dafoe, A., & Shevlane, T. (2024). 对危险能力前沿模型的评估。
- Raji, I. D., Bender, E. M., Paullada, A., Denton, E., & Hana, A. (2021). AI and the everything in the whole wide world benchmark.
- Raji, I. D., Kumar, I. E., Horowitz, A., & Selfbst, A. (2022). The fallacy of ai functionality. In Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency, FAccT '22 (pp. 959-972).
- Raji, I. D., Smart, A., White, R. N., Mitchell, M., Gebru, T., Hutchinson, B., Smith-Loud, J., Theron, D., & Barnes, P. (2020). 缩小人工智能问责差距:定义端到端算法审计框架。
- 任,R.,巴萨特,S.,科贾,A.,加蒂,A.,范,L.,尹,X.,马泽伊卡,M.,潘,A.,穆科比,G.,金,R.H.,菲茨,S.,亨德里克斯,D.(2024).安全洗牌:AI安全基准实际上是否衡量了安全进步?
- Russinovich, M., Salem, A., & Eldan, R. (2024). Great, now write an article about that: The crescendo multi-turn Ilm jailbreak attack.
- Saghiri, A. M., Vahidipour, S. M., Jabbarpour, M. R., Sookhak, M., & Forestiero, A. (2022). 人工智能挑战的调查:分析定义、关系和演变。
- Shelby, R., Rismani, S., Henne, K., Moon, A., Rostamzadeh, N., Nicholas, P., Yilla-Akbari, N., Gallegos, J., Smart, A., Garcia, E., & Virk, G. (2023). 算法系统的社会技术危害:制定一个减少危害的分类法。
- Slattery, P., Saeri, A., Grundy, E., Graham, J., Noetel, M., Uuk, R., Dao, J., Pour, S., Casper, S., & Thompson, N. (2024). 人工智能风险库:人工智能风险的综合元审查、数据库和分类法。
- Smith, B., Browne, C., & Gates, B. (2019). 工具与武器:数字时代的承诺与危险。
- Solaiman, I., Talat, Z., Agnew, W., Ahmad, L., Baker, D., Blodgett, S. L., Chen, C., au2, H. D. I., Dodge, J., Duan, I., Evans, E., Friedrich, F., Ghosh, A., Gohar, U., Hooker, S., Jernite, Y., Kalluri, R., Lusoli, A., Leidinger, A., Lin, M., Lin, X., Luccioni, S., Mickel, J., Mitchell, M., Newman, J., Ovalle, A., Png, M.-T., Singh, S., Strait, A., Struppek, L., & Subramonian, A. (2024). 在系统和社会中对生成式人工智能系统社会影响的评估。
- Sutskever, I., Gross, D., & Levy, D. (2024). 安全超级智能公司
- Vassilev, A., Oprea, A., Fordyce, A., & Anderson, H. (2024). 对抗性机器学习:攻击和缓解的分类和术语。
- Verma, A., Krishna, S., Gehrmann, S., Seshadri, M., Pradhan, A., Ault, T., Barrett, L., Rabinowitz, D., Doucette, J., & Phan, N. (2024). 实施针对大型语言模型(LLMs)的红队威胁模型。
- Wallace, E., Xiao, K., Leike, R., Weng, L., Heidecke, J. & Beutel, A. (2024). 指令层次结构:训练llm优先执行特权指令。
- 王,B.,陈,W.,裴,H.,谢,C.,康,M.,张,C.,徐,C.,熊,Z.,杜塔,R.,薛弗,R.,杜鲁昂,S.T.,阿罗拉,S.,梅泽伊卡,M.,亨德里克斯,D.,林,Z.,程,Y.,科耶约,S.,宋,D.,李,B.(2024)。Decodingtrust:对GPT模型中可信度的全面评估。
- Weiss, R., Ayzenshteyn, D., Amit, G., & Mirsky, Y. (2024). What was your prompt? a remote keylogging attack on ai assistants.
- Wolf, Y., Wies, N., Avnery, O., Levine, Y., & Shashua, A. (2024). 大型语言模型中对齐的基本限制。
- 郑丽,江威伦,盛彦,庄思,吴子涵,庄宇,林子涵,李子涵,李丹,星平,张华,冈萨雷斯,J.E.,斯托伊卡,I.(2023).使用MT-bench和聊天机器人竞赛评估lm-as-as-judge。
- 周俊,卢涛,米什拉,布拉马,巴苏,刘雁,周德,侯磊.(2023).大型语言模型遵循指令的评估.
- 周,A.,王,Z.,卡里尼,N.,纳斯,M.,科尔特,J.Z.,与 Fredrikson, M. (2023). Universal and transferable adversarial attacks on aligned language models.
微软
©2024 微软公司版权所有。保留所有权利。本文件提供“原样”。本文件中表达的信息和观点,包括URL和其他互联网网站参考,可能会未经通知而更改。您使用本文件承担风险。本文件不向您提供任何关于微软产品中任何知识产权的法律权利。您可以复制和使用本文件用于您内部、参考目的。
试读结束,高清完整版pdf/doc/ppt,请点下载