隐私保护计算技术研究报告2020年

  • 来源:未来智库
  • 发布时间:2020/11/13
  • 浏览次数:1627
  • 举报

在数字经济发展的大背景下,我们深知数据安全及隐私保护有着丰富的内涵和广泛的外延,不仅包 含法律的修缮,还包含安全技术的迭代升级等诸多方面。如何在保障数据隐私安全的前提下,加快培育数据要素市场,亟待多方共同协作努力。

隐私保护计算技术研究报告

由希捷公司资助,IDC 发布的《数据时代 2025》白皮书显示(2020 年 5 月数据更新),相较于欧洲、中东、非洲、美国、亚太(含日本, 不含中国)以及全球其他区域,在未来 5 年我国的数据量年平均增长 率将达到 26%,预计到 2022 年将拥有全球最大的数据圈(datasphere) 。如何加快培育数据要素市场成型,激发数据要素市场活力,充分 发挥数据生产要素对其他要素的倍增作用,亟待多方协同努力开拓。 数据要素的流通共享和核心价值挖掘是数据要素市场培育的核心内 容,必须在保证隐私安全的前提下实现有效信息共享,在兼顾其它生 产要素实现资源统筹优化、提高资源配置效率的同时,反哺农业经济 和工业经济,实现资源配置最优组合服务社会,孕育更大的数据价值, 为数字经济繁荣创造条件。从当下数据流通的实践来看,传统基于 有权转让的交易模式仍然受困于交易形态、数据确权、数据定价等问 题而无法规模化落地,依托于隐私保护计算的数据协同应用平台的服 务模式更为可行。当前,仍然有三大因素制约数据流通与协作。一是 “数据孤岛”现象普遍存在;二是全球数据合规监管日趋严格;三是 隐私泄露事件频发导致信任鸿沟。

“数据孤岛”现象普遍存在。随着信息化、智能化进程的不断推 进,“数据孤岛”作为一个全球性问题已成为制约数据核心价值挖掘 的瓶颈之一。“数据孤岛”的产生与企业的集团化发展模式和信息化 的“需求优先”建设思路有着必然的联系,各子公司、各部门的数据形成彼此相互“独立”无法互通关联的一座座“孤岛”。“数据孤岛” 的独立性不仅仅体现在物理数据存储和维护方面,更体现在企业间、 部门间由于业务背景不同造成对数据的定义和使用差异化的逻辑性 方面。“数据孤岛”的出现使得数据共享和流通协作受阻,无法保证 数据的一致性和准确性,对于数据的核心价值挖掘造成了一定的阻碍。 此外,由于数据要素的低成本可复制性,使其具有明显的规模经济效 应,导致数据要素在资产化过程中极易发生垄断。如何打破产业链上 下游既有的数据壁垒,有效解决数字市场的竞争与垄断问题,充分激 发数据要素价值、共享数字红利,实现数字经济时代的“耕者有其田”, 已然成为社会各界关注的焦点。

全球合规监管日趋严格。2018 年 5 月 25 日,欧盟《通用数据保 护条例》(General Data Protection Regulation,GDPR)正式生效。为 充分实现个人数据安全,GDPR 围绕个人数据处理行为组织者的义务 主体和个人数据权利主体两方面搭建个人数据保护框架。此外, GDPR 也凭借其极高的域外适用效力,被称为史上“最严格”的数据 保护管理条例备受全球关注。GDPR 的实施不仅向世界宣示了欧盟肩 负重建数字经济时代隐私保护新秩序的雄心和决心,对世界各国关于 隐私保护监管框架的构建与升级产生了深远的影响,也预示着隐私问 题已切实成为悬在头上的“达摩克利斯之剑”。在 GDPR 正式生效 一个月后,美国加利福尼亚州颁布了《2018 加利福尼亚州消费者隐 私法》(California Consumer Privacy Act of 2018,CCPA),并于 2020 年 1 月 1 日正式实施。相较于 GDPR,CCPA 在倡导对个人数据隐私被动防御和主动实施方面有着极大的相似性。但在个人信息概念界定、 个人信息主体权利的丰富程度、个体意愿表达、出于利益平衡的数据 合理应用等方面都体现出了较大的差异性。如 CCPA 对个人信息的收 集使用采取“默示同意”(opt-out)模式,而非 GDPR 的“明示同意” (opt-in)模式。2020 年 6 月 28 日,第十三届全国人大常委会第二十 次会议初次审议了《中华人民共和国数据安全法(草案)》(以下简 称《数据安全法(草案)》)。《数据安全法(草案)》贯彻落实总 体国家安全观,确立了数据安全保护的各项基本制度,坚持安全与发 展并重,鼓励与促进数据依法合规的有效利用,促进以数据为关键生 产要素的数字经济发展。2020 年 10 月 21 日,《中华人民共和国个 人信息保护法(草案)》(以下简称《个人信息保护法(草案)》) 公布并公开征求社会公众意见。《个人信息保护法(草案)》围绕总 则、个人信息处理规则、个人信息跨境提供的规则、个人在个人信息 处理活动中的权利、个人信息处理者的义务、履行个人信息保护职责 的部门、法律责任和附则等多个层面设计和建构个人信息保护的立法 框架。日趋严格的隐私保护监管一方面促进了数据权利主体和数据处 理行为组织者的隐私保护意识的觉醒,但同时也加重了企业对数据流 通与协作合法合规的担忧。

隐私泄露事件频发导致信任鸿沟。2017 年,英国期刊《经济学 人》(《The Economist》)发表封面文章称数据已经取代“石油”成 为当今世界最有价值的资源,将数据的重要性提到了无与伦比的高度。基于对数据经济价值的高度认可,以及快速实现商业变现的盲目追逐, 缺乏隐私保护的数据“野蛮掘金”活动日益猖獗,对于个人隐私的侵 犯无处不在。2018 年 3 月,数据分析公司剑桥分析(Cambridge Analytica)被爆违规窃取 Facebook 用户数据并将之不当应用于政治 广告投放和大选营销,实现了以经济利益为根本的政治目的。“剑桥 分析”事件后,美国联邦贸易委员会(Federal Trade Commission,FTC) 重启了对 Facebook 是否违反“2012 和解令”的调查,而 Facebook 也 因未采取充分的隐私保护机制,与美国联邦贸易委员会达成彼时罚金 最高的 50 亿美元和解协议。随着万物互联愿景的逐步实现,数据作 为人类与设备间的桥梁作用逐步显现,数据间的关联程度日渐增强, 单点数据泄露事件的发生,极易被级联放大,足以引起一场“多米诺 骨牌”效应的连锁危机。在隐私意识逐步觉醒和合规监管日趋严格的 大背景下,频发的隐私泄露事件进一步打击了社会各界对数据流通与 协作的隐私保护信心。

数据价值挖掘和隐私保护并非一场零和博弈,它们有着促进数字 经济发展的共同理想和合作共赢的利益诉求。片面的共享集中及不切 实际的隐私期待极易使得数据价值挖掘陷入“囚徒困境”。如何打破 “数据孤岛”壁垒,建立数据流通与协作的隐私保护信心,以更加弹 性柔软的方式促进法律监管“硬制度”“软着陆”,实现数据价值 挖掘和隐私保护的正和博弈,隐私保护计算为此提供了行之有效的解 决之道。

一、隐私保护计算

(一)隐私保护计算概念

隐私保护计算(Privacy-Preserving Computation)近年来被提出, 是指在提供隐私保护的前提下,实现数据价值挖掘的技术体系8。面 对数据计算的参与方或其他意图窃取信息的攻击者,隐私保护计算技 术能够实现数据处于加密状态或非透明(Opaque)状态下的计算,以 达到各参与方隐私保护的目的 。隐私保护计算并不是一种单一的技 术,它是一套包含人工智能、密码学、数据科学等众多领域交叉融合 的跨学科技术体系。隐私保护计算能够保证满足数据隐私安全的基础 上,实现数据“价值”和“知识”的流动与共享,真正做到“数据可 用不可见”。

(二)隐私保护计算架构

隐私保护计算架构可抽象为图 1。在隐私保护计算参考架构中, 主要有数据方、计算方和结果方三类角色。数据方是指为执行隐私保 护计算过程提供数据的组织或个人;计算方是指为执行隐私保护计算 过程提供算力的组织或个人;结果方是指接收隐私保护计算结果的组 织或个人。为实现数据资源的丰富、升维以及模型的智能化应用,在 实际部署中参与实体至少为 2 个,每个参与实体可以承担数据方、计 算方和结果方中的一个或多个角色。例如在 P2P 的对等网络架构中, 数据方同时承担了计算方和结果方的角色。

隐私保护计算技术研究报告2020年


(三)隐私保护计算目标

根据图 1,隐私保护计算过程中主要存在 7 个隐私风险点 :

1)数据在数据方的静态存储风险;

2)数据从数据方传输至计算方的传输风险;

3)数据在计算方计算时的隐私风险;

4)数据在计算方计算后的隐私风险;

5)计算结果在计算方的静态存储风险;

6)计算结果从计算方传输至结果方的传输风险;

7)计算结果在结果方的静态存储风险。

数据隐私计算技术广义上来说是面向隐私信息全生命周期的隐 私保护计算理论和方法9。但在数据传输和数据存储环节的隐私保护 技术已相对成熟,如 SM2、SM3、SM4、RSA、SHA2、AES 以及 SSL/TLS 等(如图 2 所示)。故本报告提出的隐私保护计算则重点关注数据计 算过程和数据计算结果的隐私安全问题。

隐私保护计算技术研究报告2020年


隐私保护计算的目标是在完成计算任务的基础上,实现数据计算 过程和数据计算结果的隐私保护。数据计算过程的隐私保护指参与方 在整个计算的过程中难以得到除计算结果之外的额外信息。数据计算 结果的隐私保护指参与方难以基于计算结果逆推原始输入数据和隐 私信息。

(四)隐私保护计算价值

在消除“数据孤岛”方面。“数据孤岛”的出现是企业集团化发 展和信息化进程的“必然产物”,但是越来越多的企业和组织需要与 产业上下游的业务伙伴通过数据流通实现深度合作,以此来提升决策 能力,获取竞争优势。物理和逻辑上的孤立性叠加日渐趋严的合规监 管和隐私保护意识的觉醒,使得数据价值释放举步维艰。而以联邦学 习、安全多方计算、机密计算、差分隐私、同态加密等为代表的隐私 保护计算从技术角度实现了原始数据不出库、数据“价值”和“知识” 出库的目标,有效实现跨领域多维度数据的融合,完成了数据流通向 “价值”流通的升级,打破既有数据壁垒,有效实现了数据隐私保护与价值挖掘之间的平衡,构建了一种“数据可用不可见”的合作新模 式。

在合规避险方面。欧盟的数据市场报告显示,2019 年欧盟 27 国及英国的数据经济价值已经突破 4000 亿欧元(4064.68 亿欧元), 年增长率达 7.6%,预计 2020 年达 4439.25 亿欧元,预计年增长率达 9.2%,数据经济对欧盟 2019 年 GDP 贡献比已达 2.6%。在数据隐私 保护合规监管日趋严格的大背景下,欧洲数据经济相当程度的规模化 和商业化发展一定程度上实现了 GDPR 开宗明义所传承的二元立法 目标:保护个人权利并促进个人数据流动。这与欧洲在隐私保护计算 技术合规性研究方面做出的巨大努力密切相关。其中关于隐私保护计 算技术的一个重要范例是爱沙尼亚在 2015 年的私人统计项目,1000 万条可识别纳税记录与 60 万条可识别学历信息关联在一起,通过安 全多方计算技术对其进行统计分析。欧洲的 PRACTICE 项目(欧盟 第七框架计划)付出大量努力分析安全计算技术的合规性 8,报告依 据 GDPR 论证了该爱沙尼亚项目的合规性,为欧洲实现隐私保护合 规的高效数据流通提供了重要范例。

在弥合“信任鸿沟”方面。数字经济时代,我们一方面高度认可 数据所蕴含的巨大价值,但另一方面频发的隐私泄露事件也引发了公 众对数字经济发展中的隐私保护能力的信任危机。对待数字经济时代 的数据价值挖掘,我们应该始终坚持包容审慎的态度,积极探索隐私 保护和数据价值挖掘的平衡点。如何弥合数字经济时代的信任鸿沟,

有效规避隐私侵害,隐私保护计算对于破解公众的信任危机是显而易 见的。以安全多方计算、差分隐私、同态加密等为代表的隐私保护计 算技术凭借其坚实的理论基础和安全性证明,从技术角度实现数据主 体权利和数据使用者义务的平衡,增强数据应用透明度,提升了数据 价值挖掘下的隐私保护信任,对于弥合数字经济时代的信任鸿沟具有 重大意义。

二、隐私保护计算关键技术(略)

隐私保护计算(Privacy-Preserving Computation)的概念虽然是近 年来才被提出,但其涵盖的技术理论研究却有着相当的历史。总体来 说,隐私保护计算技术通常涵盖联邦学习、安全多方计算、机密计算、 差分隐私、同态加密等。

三、隐私保护计算关键技术综合评价

隐私保护计算作为涉及多领域交叉融合的跨学科技术体系,重点 提供了数据计算过程和数据计算结果的隐私安全保护能力。但不同细 分技术在理论基础、技术实施路线等方面有着较大的差异,故本章围 绕保护效果、计算性能、计算精度、硬件依赖、理论支持场景、实际 应用场景、计算模式七个维度对上述的技术进行对比总结(如表 2 所 示)。

安全多方计算:由于 SMPC 其可证明的安全性,除了最终的计 算结果之外严格没有任何信息泄露,因此受到密码学家的青睐。 SMPC 包含复杂的密码学操作,因此实现 SMPC 需要付出很大的性能 代价,但对于一些复杂度较低的场景(如密钥管理、简单统计、线性 模型等),SMPC 已经能够在不少场景中取得可接受的应用效果。在 计算场景较复杂(例如神经网络、GBDT 等)时,SMPC 的性能则仍 然较差。SMPC 的性能瓶颈主要是通信耗时,其性能进步不仅依赖于 底层理论突破,还受到网络带宽、延迟等因素制约。

联邦学习:联邦学习最初是由机器学习领域提出,其核心思想是 各个参与方尽量在本地完成建模所需计算,仅在模型需要迭代更新时进行通信交互。目前学术界对于联邦学习的安全保障效果尚无严格的 定义。事实上现有的各类联邦学习方案也都难以保证模型更新过程中 的零信息泄露。因此使用联邦学习方案进行机器学习建模,实质上是 泄露了比最终模型更多的信息。虽然联邦学习的通信代价比 SMPC 低,但是其性能也很大程度上受到网络带宽、延迟等因素制约。

机密计算:与上述两类去中心化的方案相比,使用机密计算进行 数据协同计算一般是将多方数据集中进行中心化的处理,除了硬件不 同之外,与普通的数据计算并无本质不同,因此其不存在算法和网络 瓶颈,性能更强。基于硬件的可信执行环境方案作为机密计算的核心 技术,它的安全风险首先是来自对基于硬件的可信执行环境的各类侧 信道攻击:基于硬件的可信执行环境空间和操作系统其它非可信执行 环境空间共享了大量的系统资源,因此攻击者可以通过这些共享资源 进行侧信道攻击,并推导基于硬件的可信执行环境内部的机密数据内 容。其次,使用基于硬件的可信执行环境方案必须要相信可信执行环 境厂商是可信的。例如可信执行环境方案中的远程通信需要可信执行 环境厂商参与远程证明。最后,如果要部署基于硬件的可信执行环境 方案,需要购买指定的硬件,这在一些场景会显著提高使用成本。

差分隐私:差分隐私的保护目标是计算结果而不是计算过程,因 此它与上述三种方案有根本不同。以机器学习建模为例,差分隐私可 以在建模结果上加入一定的噪声,保证攻击者难以从建模结果反推出 训练样本的信息;但是差分隐私依然需要计算方显式的访问训练数据, 因此没有保护建模过程。也可以将联邦学习、安全多方计算、机密计算方案和差分隐私进行结合,以达到同时保护计算过程和计算结果的 效果。差分隐私的主要问题在于会对计算结果的准确度形成不可忽略 的影响,针对某些对准确度不敏感的场景可行。但是对于诸如风险识 别、人脸识别这类准确度要求较高的场景是难以接受的。

本地差分隐私:本地差分隐私则将计算方也视为不可信任的,数 据在进入计算过程之前即已加入噪声,因此本地差分隐私能够同时保 护计算过程和计算结果。本地差分隐私引入的误差比差分隐私更大, 而且更大的问题是本地差分隐私处理过的数据目前只能支持有限的 统计计算,难以用于机器学习建模等复杂场景。

同态加密:由于部分同态加密仅能支持有限的密文计算深度,因 此常将部分同态加密方案作为其他方案的组成部分之一进行应用。而 全同态加密方案由于性能瓶颈,目前的研究大多聚焦于学术层面,尚 无商用案例。

隐私保护计算技术研究报告2020年

四、隐私保护计算应用案例

隐私保护计算能够为参与实体提供高效、安全的合作模式,各方 在确保数据合规使用的情况下,实现数据共享和数据价值挖掘。因此 在金融、政务、医疗等领域有着广泛的应用前景。

(一)金融领域

尽管金融数据在体量、维度、价值等方面具有一定优势,但是这 部分数据更多涉及客户金融相关的数据,缺少客户的行为数据、场景 数据等。具体到某一个金融机构时,其数据的丰富程度更大打折扣。 而客户的行为数据和场景数据往往掌握在一些互联网公司和其他数 据源公司手中。在信贷风险评估、供应链金融、保险业、精准营销、 多头借贷等方面,金融机构都需要和这些数据源公司联合建模,提升 模型的精确度。

但是金融数据的安全及风险防范一直是金融机构关注的重点,国 家也相继出台金融安全相关政策,不断强化对金融数据安全的重视程 度。在传统的数据合作中,通常采用数据脱敏的方式将一方数据给到 另一方,并由其进行本地建模。虽然数据脱敏方案实现了一定程度的 隐私保护,但仍然能通过收集到的相关数据,损害数据方的利益,甚 至侵害客户的个人隐私。此外,经过脱敏处理的数据可用性会受到严 重影响。在数据合作之前,传统方案需要通过比较哈希值的方式进行 撞库,这样一方就会留存大量的哈希值造成对方客户名单的泄露。

隐私保护计算为金融机构间,甚至跨行业的数据合作、共享提供 可能。PSI 技术可以解决数据对齐时造成客户名单泄露的问题,联邦 学习可以保证各方数据不出本地的情况下实现联合建模、预测等。

图 15 为金融领域中反欺诈联邦学习建模的落地应用。一般情况 下,单一机构自有数据量小,建模样本数不足,可以联合多家机构的 数据进行联合建模。当一家银行获得和新型欺诈行为相关的数据时, 可以及时更新反欺诈模型,使其他银行也能够快速具备预测和识别新 型欺诈行为的能力,提高整个银行业的反欺诈水平。

(二)政务领域

在国家积极推动政企数据融合、数据生产要素化的大方向下,各 地政府积极建立政务数据开放平台、大数据中心,致力于服务各行各 业。政务数据通常涉及社保数据、公积金数据、税务数据、生活数据、 交通数据等。但是这些数据属于不同部门,“数据孤岛”情况严重, 想要共享这些数据存在协调困难、审批手续繁杂等问题。同时这些数 据涉及大量公民隐私,管控更加严格,进一步阻碍政务数据在部门之 间、政企之间的合作。

通过隐私保护计算和其他技术的结合,可以有效保护各部门的数 据,在一定程度上解决政务“数据孤岛”问题,提高政府治理能力。 例如通过视频、位置、交通等多部门数据对治安防控、突发事件进行 研判,合理调配资源,提高应急处理能力和安全防范能力。此外,还 可以联合多部门的数据对道路交通状况进行预判,实现车辆路线最优 规划,减缓交通拥堵。

以疑犯信息查询为例(如图 16 所示),假设公安机关有一份疑 犯名单,需要到其他部门查询疑犯的相关信息,但是“疑犯”这个身 份信息对个人而言比较敏感。利用隐私查询技术,在查询疑犯相关信 息的同时,公安机关不需要跟其他部门共享疑犯名单,保护疑犯隐私。

(三)医疗领域

随着互联网以及电子病历的大量普及,各家医疗机构积累了大量的医疗数据,这些数据对于病人来说是极其敏感的。随着人工智能和 医疗的紧密结合,越来越多的个人数据被用于临床诊断、医学研究、 公共健康等各个方面,这就增加数据泄露的可能性。

想要使用人工智能对某一疾病进行早期发现或临床诊断,一方面 需要收集不同维度的数据包括临床数据、基因数据、化验数据等,另 一方面也需要收集来自不同群体、不同地区的样本数据,单个医疗机 构无法积累足够的数据来进行模型训练。通过隐私保护计算,可以对 不同的数据源进行横向和纵向的联合建模,保证各方医疗数据安全。 另外,对于 DNA 测试,用户可以通过 PSI 等技术将某段 DNA 序列 和数据库进行匹配,实现遗传疾病诊断。

举例来说。为了应对新冠肺炎疫情带来的医疗挑战,医疗机构 需要在全球范围内共享新冠肺炎疫情数据。如通过人工智能识别肺部 X 光图像来诊断新冠肺炎。各医疗机构先在本地建立模型,再通过 SMPC 等技术联合其他医疗机构更新模型参数,在保护各方数据隐私 安全前提下,提高图像模型诊断能力。

隐私保护计算技术研究报告2020年

五、隐私保护计算发展展望

隐私保护计算作为平衡数据价值挖掘和隐私保护有效解决方式, 为数据流通和价值共享提供了一条重要的技术路径,引起了产业内外 的广泛关注。然而,隐私保护计算在技术实现、公众信任建立、应用 推广等方面仍然存在诸多挑战。因此,隐私保护计算技术的发展,仍 然需要各方协同精诚协作,继续努力。

一是合规驱动,拓展发展空间。当前,隐私保护已成为全球共识, 《中华人民共和国网络安全法》《中华人民共和国密码法》《数据安 全法(草案)》《个人信息保护法(草案)》等系列政策法规陆续出 ,隐私保护的必要性和紧迫性不言而喻。一方面对于促进公众隐私 保护意识觉醒,维护数据权利主体的合法权益提供了有力的法律保障。 另一方面随着顶层设计的不断优化完善,数据安全和隐私保护合规要 求将进一步明确,在数据要素经济价值挖掘和新基建大数据中心建设发展的牵引下,隐私保护计算应用场景将进一步拓展,隐藏的巨大市 场潜能有望被进一步激发。

二是标准引领,凝聚行业共识。虽然隐私保护计算目前尚处在发 展初期,但在当前打破“数据孤岛”,增进数据协同价值挖掘的需求 日益迫切的大背景下,亟待凝聚各方共识。以标准化形式将隐私保护 计算关键技术的探索与实践中积累的宝贵经验进行固化,以此指导隐 私保护计算技术的构建部署,纾解重复投入、建设分散等问题,充分 发挥隐私保护计算技术落地应用的标准引领和支撑作用。

三是需求牵引,提升技术成熟度。虽然针对隐私保护计算的关键 技术研究已开展多年,但在规模化应用时仍然存在多项难点,如应用 性能瓶颈、安全性证明、数据质量规范性差等问题。当前市场对于隐 私计算产品及服务的选择是建立在对于以市场落地实际需求为牵引 的前提下,需产学研用协同,不断夯实关于安全多方计算、联邦学习、 差分隐私等理论研究基础,积极开展面向实际产业需求的工程探索, 不断提升隐私保护计算的技术成熟度和产业化能力。

四是多方协同,弥合信任鸿沟。隐私保护计算技术原理复杂难于 理解、试错成本高,不可避免要经历“质疑”到“追捧”再到“理性” 的这样一个过程。隐私保护计算当前正处在发展期望膨胀期,但迅猛 发展的市场也极易出现解决方案隐私保护水平高低不均、落地效果良 莠不齐的现象。如何提升公众对隐私保护计算技术的认知程度,防止 行业疑虑蔓延,弥合公众对隐私保护计算技术的信任鸿沟,亟待建立 科学、严谨的隐私保护计算技术产品和解决方案的评估机制,开展专业的技术检测和效果评估,提高隐私保护计算技术的公信力,共同保 障隐私保护计算技术产业应用的健康发展。

……

(报告观点属于原作者,仅供参考。报告来源:中国信息通信研究院、阿里巴巴(中国)有限公司、 北京数牍科技有限公司)


如需完整报告请登录【未来智库官网】。

编辑:沃巴查芒
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至