AI安全跨界的有趣问题集_32页_12mb
报告摘要
nEINEI WHOAMIID:nEINEI|wwwvxjumpnet
作为互联网公司AI安全专家,其研究聚焦AI+安全技术的落地实践,包括AI框架/组件安全、AI赋能安全等领域,并探索保障安全AI的工业化经验。其曾就职IntelSecurity/McAfeeLabs,长期从事安全研究,涵盖AI安全、高级威胁对抗、漏洞利用技术等方向,研究方向包括大模型应用安全、AI代码保护、APT威胁分析、Bootkit/Rootkit检测技术等。
【主要研究内容】
-
模型后门攻击
- 定义:通过构造触发器(如特定颜色、模式)植入模型,使模型在触发条件下输出攻击者预设结果。
- 方法:基于数据投毒的后门攻击(毒样本训练模型,正常数据中表现正常,触发输入时执行恶意逻辑),或通过逆向分析模型参数(如ResNet结构)植入后门逻辑。
- 案例:将恶意逻辑注入ONNX模型,结合恶意软件绕过社区平台检测,导致模型泄露或系统被入侵。
-
返回导向编程(ROP)迁移
- KRPO技术:利用语言模型的“知识片段”(gadgets)组合成攻击链条,通过Prompt构造实现隐蔽攻击。
- 攻击场景:例如将“米老鼠抽烟并放火”的描述转化为代码逻辑,绕过模型对负面内容的过滤机制。
- 案例:通过修改Prompt字符串(如删除“DROP”前内容、替换“students”为“employees”),诱导模型输出恶意SQL语句(如
DROPTABLEemployees),实现数据库破坏。
-
隐写术与模型作为代码
- 模型即代码:部分AI框架(如GGUF)缺乏格式保护机制,模型参数可被编码为执行代码(如shellcode)。
- 攻击方式:
- DataReuse攻击:将shellcode嵌入模型参数的最低有效位(如TextCNN测试),仅修改部分神经元参数即可实现代码执行。
- BitFlip攻击:通过激光或硬件手段翻转模型参数的单比特值,导致预测结果异常或被控制(如ResNet-18模型仅需11-13次翻转即可使Top-1准确率降至0.1%-0.2%)。
- 成果:2021年提出《EvilModel》方法,在1%准确率损失内将369MB恶意软件嵌入AlexNet模型,逃过主流反病毒引擎检测。
-
AI安全问题与传统安全类比
- AI安全风险包括:模型后门、数据投毒、供应链攻击(如第三方库漏洞)、内存级攻击(如位翻转导致权限提升)等。
- 传统安全问题如逻辑漏洞、权限滥用、数据泄露等在AI领域呈现新的形态,需针对性防护。
【安全建议】
- 条件控制:分析计算图拓扑结构,检测可疑条件分支;加密模型哈希值,运行时异常监控。
- KROP防御:限制代码生成场景的输出权限,禁止直接执行高危指令(如SQL注入、API调用)。
- 编码隐藏信息:对部署代码进行运行时监控与分析,防范恶意逻辑注入。
- 神经元防护:通过对抗训练、正则化、合理量化减少参数干扰;加密敏感权重,限制非授权访问;隔离关键权重存储区域。
nEINEI在Blackhat、CanSecWest等顶级会议上发表多项攻防研究成果,并在ICLR、CVPR等人工智能领域会议中发表过AI安全相关论文,推动模型安全攻防技术的工业化应用。其研究揭示了AI模型在参数安全性、供应链风险、逻辑漏洞等方面的脆弱性,为工业界模型部署与防护提供重要参考。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载