一、隐私计算(Privacy Computing)

隐私计算,广义上是指面向隐私保护的计算系统与技术,涵盖数据的产生、存储、计算、应用、销毁等信息流程全过程,想要达成的效果是使数据在各个环节中 “可用不可见”。目前最先落地于金融、医疗等行业。


二、实现隐私计算的相关技术

从技术角度出发,和隐私计算相关联的概念很多——多方安全计算(MPC)、可信硬件(TEE)、联邦学习、差分隐私、区块链等。目前业内采用的主流技术包括三类:多方安全计算(MPC)、联邦学习和可信执行环境(TEE)。

当前实现隐私计算的技术主要可分为可信计算和密码学两大方向。

  • 可信硬件

  • 可信硬件指可信执行环境,核心思想是构建一个安全的硬件区域,各方数据统一汇聚到该区域内进行计算。

  • 密码学 密码学指用算法实现对计算过程中的数据保护,以多方安全计算、联邦学习等为代表。


1. 多方安全计算(Secure Multi-Party Computation MPC)

多方安全计算(Secure Multi-Party Computation,简称MPC)是指在无可信第三方情况下,通过多方共同参与,安全地完成某种协同计算。即在一个分布式环境中,多个参与者共同完成对某个函数的计算,该函数的输入信息分别由这些参与者提供,且每个参与者的输入信息是保密的,在计算结束后,各参与者获得正确的计算结果,但无法获知其他参与者的输入信息。这种方式主要基于密码学的一些隐私技术,相关概念还包括同态加密(Homomorpgic Encryption)、不经意传输(Oblivious Transfer)、混淆电路(Garbled Circuit)和秘密共享(Secret Sharing)等。

核心在于计算参与方在数据加密状态下进行计算。彼此不知对方数据,却能得到正确的计算结果。

添加图片注释,不超过 140 字(可选)

图1:安全多方计算(Secure Multi-Party Computation)

添加图片注释,不超过 140 字(可选)

图2:安全多方计算的相关概念


2. 联邦学习(Federated machine learning/Federated Learning)

联邦机器学习(Federated machine learning/Federated Learning),又名联邦学习,联合学习、联盟学习。联邦机器学习是一个机器学习框架,能帮助多个机构在满足用户隐私保护、数据安全和政府法规的要求下,进行数据使用和机器学习建模。有观点认为,基于多方数据进行联合建模,各自原始数据不对外输出,由中心方进行协调的建模,都可称为联邦学习。

联邦学习的系统架构大致分为横向联邦学习、纵向联邦学习、迁移学习三类,分别对应不同数据集的差异情况。

核心:“数据不出门,算法满地跑”

添加图片注释,不超过 140 字(可选)

图3:联邦学习(Federated machine learning/Federated Learning)


3. 可信执行环境(Trusted Execution Environment TEE)

以上两种方式主要是在软件和算法层面实现隐私计算。可信执行环境(TEE)则基于硬件实现。

这种方式的思路是在CPU 上构建一块安全区域,这块区域的作用是给数据和代码的执行提供一个更安全的空间,在这个安全区域内进行相关的计算。比较有代表性的是Intel-SGX、ARM-TrustZone等。


三种技术的对比

这三种方式在安全性、工程能力和落地场景等方面存在不同的特点,我们可以通过下文这张对比图,了解不同技术思路的优劣势。

添加图片注释,不超过 140 字(可选)

图4:三大技术对比图


隐私计算的客户与场景

由于多行业均存在数据合规流通的需求,隐私计算的落地场景也分散于各行各业。以下列出了政务、医疗、金融、广告、供应链等行业对隐私计算的具体需求,希望介绍隐私计算的落地方向。

隐私计算 " 客户 " 拓扑图

政务大数据

当数据成为生产要素之一,将政务大数据赋能于新基建下的各行各业也成为一个重要课题。因此,政务大数据机构是隐私计算的重要客户之一,具体包括司法数据、社保数据、公积金数据、税务数据、水电燃气数据、交通数据、违章数据等。

添加图片注释,不超过 140 字(可选)

政务大数据的隐私计算应用场景

举例来说,智慧城市就是一个复杂、错综、协助、共创的业务生态,包括信用、安保、能源、交通、规划、环保、文旅等各个行业,业务数据涉及到跨部门协同。智慧城市中打通以人为中心的数据也是 " 城市数据中台 " 的概念,这需要通过对城市居民的多维度信用评级,授予或者限制更多的权限。要做到对个人联合风控,其中需要横向打通的数据包括交通出行数据、水电燃气数据、公安数据、征信数据等。

医疗科研

在医疗机构中,病例数据作为最需要保护隐私安全的数据,对医疗科研与病情推断具有重要的价值。然而单个医疗机构的数据样本不足以支撑大规模的模型训练,传统的做法是将病例数据汇总、统计、销毁,这种操作是极其不安全的。

而在隐私计算领域,采用多方安全计算的方式,可以保证各家医疗机构数据不出库,加密计算,最终得到统计结果。

添加图片注释,不超过 140 字(可选)

银行金融业务

银行作为传统金融机构的代表,在科技赋能的进化中,必然涉及到与外部数据的联合建模。银行也是隐私计算最可能率先完全落地的领域。

首先,银行找到存量用户需补全画像标签,才能服务于流失召回、交叉营销场景,这非常依赖于银行外部的数据。而隐私计算中的匿踪查询可以保证银行在查询外部数据的时候,避免用户信息被缓存。并且,小微企业贷等对个人或者企业进行信贷评估的场景,也需要依赖外部数据源做联合建模评估。

添加图片注释,不超过 140 字(可选)

保险营销与定价

保险公司从线下发展到线上获客,对精准获取潜客需求极大,这里的精准度直接影响触达的成本。另外," 定价失灵 " 是当前财产险行业经营面临的一个突出问题,主要表现为保费不足和未决赔款准备金不利发展。之所以会有 " 定价失灵 " 的现象,既有数据、模型和精算技术等方面的 " 前定价管理 " 原因,也有风险识别、核保、承保、销售、理赔、费用管控和准备金评估等方面的 " 后定价管理 " 原因。隐私计算可以为保险联合定价提供多维度的数据支撑。

基金管理

在母基金的管理中,我们需要计算每个基金的真实收益情况。而基金的持仓信息是一个非常重要的私密信息,它代表了基金的价值判断和策略导向,也是基金公司的核心机密。这里的矛盾在于,一方面母基金出于管理需要信息共享,另一方面是基金本身却需要保护这些商业信息,传统方法必然导致一方的诉求无法得到满足。使用多方安全计算,不仅能够同时满足双发的利益诉求,甚至可以让基金信息得到有效的政府监管、防止出现市场结构性风险,同时保证商业信息不被泄露。

大数据增值服务

像运营商、SDK 厂商、支付厂商等机构,在开展业务的同时会积累大量的用户数据。它们通常会成立一个大数据子公司来做数据增值业务。传统的 API 直接调用和线下联合建模的方式已经不满足数据安全的相关要求。隐私计算技术也可服务于数据公司的对外服务平台,成为数据合规合法输出价值的一种解决方案。

广告平台联合营销

媒体平台对广告主进行营销投放过程中,需要用甲方的用户数据样本进行联合建模,传统的标签画像筛选更多地是凭领域经验,通过机器学习建模可以提高营销的 ROI。联邦学习可以满足在广告主的数据不出库的前提下,得到营销投放模型。

添加图片注释,不超过 140 字(可选)

供应链金融

对供应链上下游企业而言,如何构建一个信息对称共享、核心企业信用价值可传递、商票可拆分流程是一个挑战。厂商可以基于区块链和密码学算法,提供金融资产数字化验证的方案,使企业能够将企业应收账款进行数字化资产登记,形成不可篡改的数据记录,并实现实时信息共享。

同时通过参与方分布式账本,参与方可以得到资产确认,将企业信用转化成数字资产。此外,审计入口也能方便监管机构审计和查看平台的资产交易情况。最重要的是,在传统区块链只能保证数据的不可修改性,通过多方安全计算和零知识证明等加密技术,可帮助区块链实现智能合约的公开审计确认能力与实际数据保密性的分离,让企业不再担心核心商业信息的泄露。

高校科研

高校的许多研究课题会脱离企业的真实数据实验环境,而联邦学习既能让高校科研使用企业真实数据进行课题研究,又可以保护企业业务数据不对外输出。这对企业和高校联合培养人才、挖掘科研价值具备促进作用。

量化投资模型

除了 leval2 等传统的交易所数据,量化投资领域更大的价值是通过互联网大数据的挖掘得到异类指标,这些指标通常被训练成投资决策模型。传统的私募基金通常将数据采购到本地,或者在数据服务端进行模型训练,这种方式的弊端是会造成投资模型的数据源侧安全性问题。

联邦学习可以将多方有价值的数据进行联合建模,训练出综合的决策模型,而模型实施部署采用分布式加密的方式,任何一侧的合作数据源都无法获得完整的原始数据。


1、同态承诺 同态承诺是一种允许一个人向其他人提交任何选定数值而又不泄露该值的密码协议,承诺提交后不能更改,且事后可公开验证。同态承诺允许在提交的承诺上进行计算而不失去承诺的保密、不可更改及事后可验证的特征。

添加图片注释,不超过 140 字(可选)

2、同态加密 同态加密即为各参与者将自己的输入加密后一起发给某计算服务器,服务器直接在密文上进行计算,计算后将得到的结果的密文发送给指定结果方,结果方再将结果的密文解密,即可得到最终的计算结果。如此一来,计算服务器一直在密文上操作,无法看到任何有效信息,而参与者也只拿到最后的结果,看不到中间结果。

添加图片注释,不超过 140 字(可选)

3、秘密分享 秘密分享的基本思想是将数据切割成多份,并分发给不同的参与者,每个参与者持有其中一份,协作完成计算任务(比如加法、乘法运算)。因为参与者看不到数据全量信息,从而实现数据隐私保护。

添加图片注释,不超过 140 字(可选)

4、混淆电路 混淆电路的基本思想是将计算电路的每个门都加密并打乱,保证计算过程中不会泄露原始输入和中间结果。双方根据各自输入依次进行计算、解密方可得到唯一的正确结果,无法得到结果以外的其他信息,从而实现双方安全计算。

添加图片注释,不超过 140 字(可选)

5、不经意传输 不经意传输是一种可保护隐私的双方通信协议,能使通信双方以一种选择模糊化的方式传送消息。不经意传输协议是密码学的一个基本协议,它使得服务的接收方以不经意的方式得到服务发送方输入的某些消息,这样就可以保护接受者的隐私不被发送者所知道。 S每次发送2个信息m0和m1 ,而R每次输入一个选择b。当协议结束的时候,S无法获得关于b 的任何有价值的信息,而R只能获得mb ,对于m1−b ,R也一无所知。

添加图片注释,不超过 140 字(可选)

6、零知识证明 零知识证明是由S.Goldwasser、S.Micali及C.Rackoff在20世纪80年代初提出的。它指的是证明者能够在不向验证者提供任何有用的信息的情况下,使验证者相信某个论断是正确的。 零知识证明实质上是一种涉及两方或更多方的协议,即两方或更多方完成一项任务所需采取的一系列步骤。证明者向验证者证明并使其相信自己知道或拥有某一消息,但证明过程不能向验证者泄漏任何关于被证明消息的信息。

总结

用户隐私安全是社会生产力发展到一定阶段的必然产物。当前很难回答隐私计算的具体市场规模,但在理想状况中,隐私计算的应用场景存在于几乎所有需要多方使用数据的地方,以上提到的企业和机构都需要数据合规分享的技术来协助业务开展。

参考

  1. 《36氪研究 | BAT都不放过的淘金机会,隐私计算能长出平台吗??

  2. 富数科技官网

  3. 《隐私计算应用场景详解》

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐