中国信通院-2020年隐私保护计算技术研究报告-2020.11-61页_9mb
报告摘要
隐私保护计算技术研究报告总结
核心内容
隐私保护计算是一种在保障数据隐私安全的前提下,实现数据价值挖掘的技术体系,涵盖联邦学习、安全多方计算、机密计算、差分隐私、同态加密等关键技术。其目标是实现数据“可用不可见”,在数据流通与协作过程中保护隐私,同时促进数据要素市场的发展。隐私保护计算在金融、政务、医疗等领域具有广泛的应用前景。
主要观点
- 数据作为新的生产要素,其价值挖掘面临数据孤岛、合规监管趋严和信任鸿沟等挑战。
- 隐私保护计算技术通过加密、隔离、不泄露原始数据等方式,有效解决数据流通中的隐私问题。
- 隐私保护计算并非单一技术,而是融合了人工智能、密码学、数据科学等多领域技术的跨学科体系。
- 数据隐私与数据价值挖掘并非零和博弈,隐私保护计算为实现两者的平衡提供了有效手段。
关键信息
一、隐私保护计算概念与架构
- 定义:隐私保护计算是在隐私保护的前提下,实现数据价值挖掘的技术体系。
- 架构:包括数据方、计算方、结果方三类角色,数据始终存储在本地,计算过程和结果受到保护。
- 目标:在完成计算任务的基础上,实现数据计算过程和结果的隐私保护。
二、隐私保护计算关键技术
1. 联邦学习
- 定义:各参与方在本地训练模型,仅共享模型更新结果,实现隐私保护。
- 分类:
- 横向联邦学习(HFL):样本不重合,特征重合。
- 纵向联邦学习(VFL):样本重合,特征不重合。
- 联邦迁移学习(FTL):样本和特征均不重合。
- 安全属性:以原始数据不出本地为原则,保护隐私信息。
- 开放问题:
- 通信效率低,模型收敛速度受影响。
- 数据非独立同分布,存在隐私泄露风险。
- 安全性缺乏统一标准,健壮性仍需研究。
2. 安全多方计算(SMPC)
- 定义:多个互不信任的参与方协作计算一个函数,保证数据隐私。
- 安全属性:
- 输入隐私性:数据仅用于计算,不泄露。
- 正确性:确保计算结果正确。
- 公平性:确保所有参与方公平获取结果。
- 结果传递保证:确保结果正确交付。
- 关键技术:
- 秘密共享(SS):将数据分割,保证隐私。
- 不经意传输(OT):实现数据选择隐私保护。
- 混淆电路(GC):实现安全计算逻辑。
- 部署架构:数据方、计算方、结果方,支持多种角色组合。
- 技术路线:
- 通用SMPC:适用于各类计算。
- 特定问题SMPC:如PSI、PIR等,针对性更强。
3. 机密计算(Confidential Computing)
- 定义:通过硬件可信执行环境(TEE)实现数据应用的隐私保护。
- 核心技术:
- TrustZone:将系统分为安全与普通环境,实现隔离。
- Intel SGX:通过Enclave保护数据和代码,实现安全计算。
- 开源框架:
- Rust SGX SDK:结合Rust语言和SGX技术,提升安全性。
- Asylo:支持多种硬件,便于开发和部署。
- libOS方案:提供轻量级系统支持,便于迁移。
- 问题:依赖硬件,存在侧信道攻击风险,需信任厂商,成本较高。
4. 差分隐私(Differential Privacy)
- 定义:通过在计算结果中添加噪声,实现隐私保护。
- 分类:
- 中心化差分隐私(CDP):由可信第三方添加噪声。
- 本地差分隐私(LDP):在数据上传前即添加噪声。
- 优点:严格定义隐私模型,理论基础扎实。
- 问题:影响计算精度,对模型训练等场景不适用。
5. 同态加密(Homomorphic Encryption)
- 定义:允许在加密数据上进行计算,结果与明文一致。
- 分类:
- 部分同态加密(SHE):支持有限运算,如加法、一次乘法。
- 全同态加密(FHE):理论上支持任意运算,但性能和计算代价高。
- 应用场景:主要用于学术研究,尚未有实际商业应用。
三、隐私保护计算关键技术综合评价
| 技术 | 保护效果 | 计算性能 | 计算精度 | 硬件依赖 | 理论支持场景 | 实际已商用场景 | 计算模式 |
|---|---|---|---|---|---|---|---|
| SMPC | ★★★★★ | ★★☆☆☆ | ★★★★★ | 无 | 任意计算 | 国外:拍卖、薪资统计;国内:密钥管理、联合建模 | 分布式 |
| FL | ★★★☆☆ | ★★★☆☆ | ★★★★★ | 无 | 机器学习建模 | 国外:横向FL;国内:纵向FL(金融风控) | 分布式 |
| CC | ★★★☆☆ | ★★★★★ | ★★★★★ | 有 | 任意计算 | 国外:密钥管理;国内:联合建模、区块链 | 中心化 |
| DP | 无 | ★★★★☆ | ★★☆☆☆ | 无 | 任意计算 | 谷歌Gboard | 中心化 |
| LDP | ★★★★★☆ | ★★★★☆ | ★★☆☆☆ | 无 | 数据统计 | 谷歌Chrome、苹果iPhone | 分布式+中心化 |
| FHE | ★★★★★ | ★☆☆☆☆ | ★★★★☆ | 无 | 任意计算 | 未了解 | 中心化 |
四、隐私保护计算应用案例
1. 金融领域
- 问题:数据孤岛严重,缺乏客户行为数据。
- 解决方案:
- 使用联邦学习进行联合建模,提高反欺诈能力。
- 使用PSI技术解决数据对齐时的隐私泄露问题。
- 案例:反欺诈联邦学习模型示意图(图15)。
2. 政务领域
- 问题:数据孤岛、部门间数据共享困难。
- 解决方案:
- 使用隐私计算技术实现跨部门数据协作,保护公民隐私。
- 利用隐私信息检索(PIR)进行疑犯信息查询,保护隐私。
- 案例:疑犯信息查询示意图(图16)。
3. 医疗领域
- 问题:医疗数据敏感,难以共享。
- 解决方案:
- 使用隐私计算技术实现医疗数据联合分析,提升诊断能力。
- 应用于新冠联合诊断,提升数据协同效率。
- 案例:新冠人工智能联合诊断示意图(图17)。
五、隐私保护计算发展展望
- 隐私保护计算将推动数据要素市场的发展,促进数字经济的繁荣。
- 需要多方协作,包括政府、企业、技术研究机构等。
- 未来将更加注重隐私保护与数据价值挖掘的平衡,探索更高效的隐私保护计算方案。
- 机密计算、联邦学习等技术将更加成熟,应用场景将更加广泛。
- 在合规监管趋严的背景下,隐私保护计算将成为数据流通的重要保障机制。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载