联邦学习应用安全现状与问题有哪些?

联邦学习应用安全现状与问题有哪些?

最佳答案 匿名用户编辑于2024/02/22 13:15

数据泄露类风险是联邦学习产品最易出现的安全风险 。

“活动”针对半诚实敌手环境下的安全风险进行了检测,发现目前的联邦学习产品主要存在未进行数据完整性验证、存储敏感信息未经加密或脱敏、缺乏任务授权机制、泄露用户隐私数据、泄露结果类数据、未对系统内部错误进行容错处理、日志存储未达要求、密码强度未达要求等安全风险。图 5 展示了联邦学习产品各类别安全风险的占比,存储敏感信息未经加密或脱敏、用户隐私数据泄露、结果类数据泄露等数据泄露类风险在各类安全风险中占比最高,其中结果类数据泄露风险占比最为突出,达到了48.2%。

从联邦学习流程的维度,统计了全流程中每个环节的安全风险分布,数据泄露类风险在联邦学习流程中的模型训练环节与模型预测环节占比最高。

从联邦学习的运算过程看,多方交互协议的设计不当是导致数据泄漏风险多发的原因之一。在联邦学习的运算过程中,各参与方仅拥有联合建模所需的“部分”训练数据,这些原始的训练数据在经过本地计算后产生了中间参数,各参与方以交换中间参数的方式进行协作,最终完成整个建模过程。其中,多方交互协议约定了各方参数交互的内容和时序。在内容上,协议规定了参数在各参与方本地的形成过程,形成的参数可能是密钥、随机数,甚至是经过加密的原始数据。若这些参数没有经过一定程度的安全处理,半诚实的参与方往往会借此推导出其他参与方的敏感数据,从而造成数据泄露。在时序上,协议规定了各类参数在各参与方之间交互的时机和顺序。各类参数之间存在着一定的依赖关系,前一个参数往往是后一个参数形成的计算条件,时序的错误一方面可能会造成联邦协作过程无法继续,另一方面,混乱的密钥分配、滞后的安全保护措施等都会带来安全风险。因此,多方交互过程是出现数据泄露安全风险的重灾区,严谨的多方交互协议对确保联邦学习安全起着至关重要的作用。

从联邦学习的结果保护方面看,对结果聚合的疏于防护也是引发数据泄露风险的重要原因。在部分联邦学习应用中,需要由协调方对各参与方在本地产生的中间结果进行聚合运算,中间结果包括每轮迭代的模型参数、各参与方的本地预测结果参数等。这些中间结果属于敏感数据,倘若没有一定措施对其进行保护,中间结果与最终结果等敏感数据会直接暴露给部署了协调方程序的第三方,半诚实的第三方可能会利用中间结果,通过推导的方式获知用户的原始数据。在模型训练和模型预测环节存在着较多的结果聚合场景,这使得结果类数据泄露的风险集中出现在这两个环节中。例如,在FedAvg 算法 4的横向联邦学习的训练环节中,各参与方会将每一轮迭代的梯度或模型参数结果上传到第三方进行加和平均;再如,在纵向联邦学习的模型预测环节中,部分应用将各参与方本地的预测结果汇总至第三方聚合以获得最终预测结果。上述结果聚合过程中,若未采取同态加密等措施,那么便可能出现结果类数据暴露给第三方的问题。因此如何安全地进行结果聚合应是联邦学习应用关注的重点问题之一。

联邦学习应用的安全风险不仅类型多、分布广,而且这些安全风险也具备隐蔽性高的特点,其原因可以从下述两方面分析。一方面,联邦学习应用中多方交互的高复杂性造成了其安全风险不易被发现。联邦学习比集中式机器学习增加了分布式过程,其针对集中式机器学习的各类算法进行了拆分改造,并且将拆分后的计算参数分布到各参与方进行计算,同时通过多方交互的方式来满足各拆分后参数的计算所需条件,从而完成计算。拆分后的计算参数在各参与方之间进行流转,参与方的当前状态亦随时序的变化而变化,在特定时刻下,不易确定参与方是否可根据其自身状态推导出其他参与方的敏感数据,因此其中的安全风险具有很强的隐蔽性。例如,在联邦学习的特征处理过程中,非标签拥有方可通过看似“无害”的 woe/iv 明文结合自身已有数据,推导出标签拥有方的敏感数据,该风险隐藏在复杂的算法逻辑和数学推导之下,使得其难以被发现。因此联邦交互过程的复杂性为安全风险提供了“掩护”。

另一方面,联邦学习应用不易进行安全审计,也是其安全风险隐蔽性高的重要原因。联邦学习应用中大量采用了密码技术,这些加密措施保护了联邦学习应用的多方交互过程的同时,也使流转的参数经历了复杂的数学变形,改变了其原有形态。在这种情况下,使用常规审计手段难以复原联邦学习过程的原貌,从而造成了联邦学习应用安全审计的困难。同时,联邦学习是跨分布式计算、机器学习、密码学等多领域的融合应用,对安全审计人员的知识背景要求极高。目前企业安全部门中,兼具这些知识背景的安全审计人员较少,开展专业的联邦学习审计活动比较困难。因此,联邦学习过程是否按照“原始设计”无误进行、操作人员是否执行了不安全的操作、参与方是否存在恶意攻击的行为等等安全问题,变得不易发现和评估。

中心化架构在当下的众多联邦学习产品中占据较大比例,采用该架构的应用使用协调方(中央服务器)协助完成联邦学习的全过程。协调方的引入为联邦学习应用带来了安全方面的不确定性,体现在如下三个方面。 一是将敏感数据暴露给第三方是潜在的安全隐患。联邦学习过程中,原则上由第三方担任协调方角色。如此,作为协调方的第三方便承担着密钥分发、参数聚合等任务,其在服务的过程中可能会接触到密钥、模型参数等敏感数据。一旦多方交互协议设计不当或第三方存在不诚实行为,极易出现第三方获取敏感数据的情况。同时,也存在着不诚实第三方与某些参与方利用自身参数合谋获取隐私数据的情况。因此,让第三方接触敏感数据是潜在的安全风险。

二是目前现实中难以找到诚实可信的第三方担任协调方角色。绝对诚实的第三方,不会窃取隐私数据,是理想状态下协调方角色的担当。然而,现实中尚无诚实第三方的认定标准,难以对第三方进行有效的可信认定。因此,盲目的引入第三方,一方面可能会出现数据泄漏等安全风险,另一方面也可能会带来安全合规方面的问题。 三是协调方程序的部署易受到机构间合作关系的影响而导致潜在安全风险。在机构间的联邦学习合作中,可能会出现话语权不对等的问题。譬如,机构体量、数据量、数据价值等方面的差异,导致在联邦学习合作中出现优势方。部分优势方为避免引入第三方而产生的安全隐患,而选择将协调方程序部署到自身一侧。如此,优势方同时拥有了参与方程序与协调方程序,若优势方是不诚实或半诚实的,则其可能会结合两种角色程序所产生的中间参数,利用数据推导等手段,窃取其他方的敏感数据。这种部署方式保证了优势方在一定程度上的数据安全,却使其他参与方存在敏感数据泄露的安全风险。因此,机构间的合作关系不对等可能会成为联邦学习应用安全风险出现的诱因。

联邦学习在应用中通常会使用密码等技术手段对多方交互的过程进行保护,而这些保护措施的强度往往与实际中的性能要求存在着相互牵制的关系。 一方面,高强度的安全保护往往制约了联邦学习应用的性能。在通信开销上,大部分联邦学习应用对多方交互中产生的中间参数进行了加密,这使多方交互过程相对于明文交互,增加了密钥分发、加密、解密等过程,从而使联邦学习整体的通信成本增加;同时,在密码体系中,安全参数代表着加密的安全保护强度,安全参数越大,安全保护强度越强,在通常情况下,密文的体量不仅较明文会有明显增加,而且会随着安全参数的增大而增大。以训练DNN(深度神经网络)模型为例,生产环境的 DNN 模型往往拥有数百万个参数,且该类模型在联邦学习中的通信成本会随着迭代伦次的增加而持续增大,因而在此基础上的密文通信将会是巨大的开销。在计算效率上,密码技术带来了加密、解密、密态运算等过程,而这些过程包含了大量的取模和幂等高复杂度计算,开销相对较大,并且安全参数的增大会使此开销进一步增加。因此安全保护强度会对联邦学习应用的性能有一定的影响。

另一方面,可用性要求迫使联邦学习应用在实际应用中降低部分安全配置。某些情况下,高级别的安全配置将使联邦学习应用的性能下降,甚至陷入“不可用”的状态,设计者不得不降低安全配置,以获得安全性与性能的平衡。以纵向联邦学习中的联邦数据对齐环节为例,绝大多数联邦学习应用为避免重复运算,在整体设计上进行了解耦,将数据对齐环节设计成独立的功能模块,使其能够进行独立运算、独立存储。而纵向场景下的联邦数据对齐实质上是对各参与方数据集中样本 ID 的联合求交。如此,在运算结束后,各参与方均可获得样本 ID 的交集,并可根据该ID 交集及自身的已有数据推导出对方的用户群体数据,从而造成用户群体数据的暴露。反之,若将数据对齐环节与模型训练环节集成起来,样本交集以密文中间参数的形式继续加入运算,即可避免上述的数据泄露风险。然而,此举一方面使数据对齐的结果难以被重复利用,另一方面对规模巨大的样本交集进行密态计算,将极大增加计算性能开销,甚至可能使功能陷于瘫痪。因此,在实际应用中,当技术手段无法解决安全与性能的矛盾时,牺牲部分安全性以换取性能上的“可用”便成了无奈之举。安全与性能呈现出相互制约的关系,如何解决二者的矛盾仍是当下联邦学习应用面临的严峻问题。

联邦学习技术多应用于数据生命周期的共享阶段,目前联邦学习应用安全相关的国家/行业标准较少,行业亟需标准化文件的规范和指导。 当下各类联邦学习应用对安全尺度的把控不统一。对于联邦学习应用的设计者和使用者而言,是否可以降低安全尺度以提高性能、在特定场景下该采取何种安全强度,这些均是联邦学习设计和使用过程中的关键问题,这些问题答案的不统一,使目前各类联邦学习产品、系统、平台等形式的应用各自为战,为数据应用带来极大的安全隐患。因此,需要有标准化文件对联邦学习应用的各环节的安全尺度进行规范指导。 同时,当下已发布的安全标准主要集中于产品的安全要求上,联邦学习应用部署、运营阶段的安全标准较少。联邦学习应用的部署、运营不当,会使数据安全风险出现于管理环节。例如,在无身份、权限的管理机制的情况下,操作人员可能会接触到其不应访问到的数据。因此,健全、加速联邦学习应用安全的标准化建设十分必要。

参考报告REPORT

联邦学习应用安全研究报告(2023年).pdf

联邦学习应用安全研究报告(2023年)“数据孤岛”,是数据为“王”的时代的一个不可被忽视的现象,各组织机构的数据如同大洋上的岛屿,隔海相望、孤立无援。这种现象来源于组织机构对敏感数据域外共享的数据安全担忧,随着数据安全法律法规日趋严格,各组织机构难以承担数据泄露所带来的严重后果,使数据既出不去,也进不来。在追求数据要素高效高质流通的当下,“数据孤岛”现象无疑是数据要素市场化建设进程中的障碍,于是“原始数据不出域,数据可用不可见”的新范式被提出,联邦学习也作为能够实现该范式的代表技术之一,得到了快速的...

我来回答
分享至