nist_-人工智能风险管理框架_生成式人工智能简介_64页_1mb
报告摘要
以下是NIST的《可信与负责任的人工智能》GenAI补充指南的核心内容总结:
一、报告定位
- 法定依据:根据拜登总统2023年行政令,NIST负责开发生成式AI风险管理最佳实践。
- 结构定位:
- 作为《AI风险管理框架》的子集,针对生成式AI的跨行业风险。
- 由NIST生成式AI公共工作组(GAI PWG)结合跨领域反馈起草。
- 适用范围:适用于任何使用生成式AI(GenAI)的企业和个人用户;聚焦当前可量化风险,不包含完全推测性威胁。
二、生成式AI核心风险概览
- 基本类别:
- 技术风险(12类):
- 数据隐私(信息泄露)、内容篡改、推理能力失真
- 可信性与可靠性、环境影响(碳排放)、知识产权侵权
- 偏见放大、人类-AI交互误用、模型崩溃
- 人类误用风险:生成有害内容(如暴力、仇恨言论)、深度伪造攻击、知识产权剽窃
- 生态与社会风险:劳工市场冲击、算力基础设施危机、文化同质化
- 测量挑战:伦理偏见难以量化、环境代价数据缺失
- 技术风险(12类):
三、推荐的治理与防护行动
Govern 部分
- 制度建设:
- 明确GAI系统清单及责任方
- 制定知识产权/数据溯源政策
- 定期评估模型发布安全阈值
- 透明性保障:
- 公开训练数据来源与模型架构
- 建立AI事故上报机制(如NCII/CSAM内容检测)
Map 部分
- 风险测绘:
- 构建分类风险图谱(如数据隐私换取创造力矛盾)
- 实施多层次评价指标(例如:GroupFair算法公平性测试)
Measure 部分
- 量化工具链:
- 水印技术+差分隐私:实现AI生成内容溯源
- 对抗性测试框架:评估模型对偏见/虚假信息的鲁棒性
- 碳足迹分析:监控训练/部署能耗
Manage 部分
- 动态响应策略:
- 建立模型回退机制(如API响应异常时切换至人工审核)
- 实施“影子监控室”持续扫描恶意内容注入
- 设置Ethical Scoreboard实时显示偏见值、响应时延
四、须重点关注的新挑战
- 环境成本:大规模预训练模型的边际碳排放估计需标准化仪器
- 认知差距:模型输出易导致“确认偏误”(Confirmatory Bias)
- 生态依赖:基础模型“单一品种化”(Algorithmic Monoculture)加剧系统脆弱性
五、附录补充
表:NIST 建议监控的六类核心威胁
| 威胁类型 | 范例(危害表现) | 分级建议 |
|---|---|---|
| 偏见放大 | 求职机器人拒绝女性候选者 | 组织级透明审计 |
| 短信来源 | 医疗AI推荐伪科学治疗方案 | 即时内容过滤 |
| 深度伪造 | 政治集会合成暴力视频 | 刑事优先级管控 |
六、结论要求
企业需建立四层防御体系:
- 硬性标准:数据脱敏+入侵检测+输出内容溯源;
- 动态系统:模型漂移监控+伦理评分更新机制;
- 文化规范:设计阶段实施“祛魅”原则(Demystify);
- 紧急备忘录:针对突发监管政策更新保持动态响应能力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载