CSP 期末选题 – 数据隐私
目前已经存在一系列不同的数据隐私保护技术,如MPC、TEE、HE等,它们均能够一定程度满足数据在不可信端的计算要求。另一方面,机器学习需要使用大量具备高价值的数据,其已经成为了数据隐私保护技术运用的重点领域之一。
在本项目中,大家需要深入调研不同数据隐私保护技术在机器学习场景下(包括模型识别与模型训练)的效果差异,并尝试给出自己的隐私模型识别或隐私模型训练系统的设计方案。
具体来说,完成本作业包含如下步骤:
- 深入调研、分析当前隐私计算技术运用在机器学习场景下的优劣势,包括但不限于以下几种技术:
- Trusted Execution Environment (TEE)
- Secure Multi-Party Computing (sMPC)
- Differential Privacy (DP)
- Federated Learning (FL)
同学需深入比较不同技术在包括性能、功能性、安全性在内的不同方面的优劣势。(可从相关论文、在线课程、博客等渠道获取参考信息)
- 调研现有的隐私机器学习系统,分析其应用场景及设计思路。比较不同工作在(包括但不限于)目标问题、安全性、性能、算法兼容性等不同方面的优劣势。
- 挑选一种机器学习算法(如CNN),设计自己的隐私模型识别或隐私模型训练系统并分析其安全性与易用性。
- (可选,加分项)实现上述设计的隐私计算系统的基本功能,并验证其性能。
参考文献:
- 隐私计算相关网络课程
- https://www.youtube.com/playlist?list=PLXF_IJaFk-9BFn8M-dsEm5x3-5Cvji3V9,课程内容较多,仅供参考
- BatchCrypt: Efficient Homomorphic Encryption for Cross-Silo Federated Learning (ATC’20)
- CRYPTFLOW: Secure TensorFlow Inference (S&P 20)
- Privacy Accounting and Quality Control in the Sage Differentially Private ML Platform (SOSP’19)
- Evaluating Differentially Private Machine Learning in Practice (USENIX Security’19)