人工智能通用隐私风险有哪些?

人工智能通用隐私风险有哪些?

最佳答案 匿名用户编辑于2023/12/14 15:04

人工智能的普及与滥用使其面临越来越多的隐私与安全威胁,社会各界也逐渐加大了对隐私风险的分析和隐私保护的关注度。

1.数据采集存储流通阶段隐私风险

数据不正当收集风险。人工智能算法尤其是在深度学习的开发测试过程中,需要大量训练数据作为机器学习资料、进行系统性能测试。在网上公开数据源和商务采购时,由于目前数据共享、交易和流通的市场化机制不健全,存在非法数据、买卖数据、暗网数据等不正当收集行为和一些未经授权的收集行为,这些数据缺乏用户知情同意,实际并没有获得数据的采集权限,很容易泄露用户隐私。

数据过度收集风险。在无人驾驶、智能家居、智慧城市等典型应用场景中,数据主要通过在公开环境中部署各类传感器或终端,并以环境信息为对象进行无差别、不定向的现场实时采集。现场采集由于难以提前预知采集的数据对象和数据类型,因此,在公开环境尤其是公共空间进行现场采集时,将不可避免地因采集范围的扩大化而带来过度采集问题。比如,在智能网联汽车的无人驾驶场景中,自动驾驶汽车的传感器需要采集街景数据来支持智能驾驶系统的决策从而控制汽车行驶,但是这种无差别的街景数据采集必然会采集到行人的个人数据,其中包括行人的人脸数据等个人敏感信息,造成行人的隐私泄露风险,甚至还可能会采集到路边的重要基础设施、地理位置信息、军事营区等重要数据,给国家安全带来风险。

数据存储隐私泄露风险。一方面,在对数据进行保存时,如果没有对数据采取技术手段进行安全防护,容易被非法需求者通过网络攻击等黑客行为进行隐私数据窃取。另一方面,在数据存储过程中,由于对数据没有明确的隐私界定与标注,如果使用者无意中将涉及隐私的数据用于公开的人工智能训练分析中,个人隐私将在不经意间被泄露。再另一方面,在人工智能数据处理使用的过程中,涉及众多数据处理、保存步骤,对于种类多、数据量大的数据集,处理、保存操作难以规范与监管,潜藏被非法使用者利用、拷贝等安全隐患。

数据流通隐私泄露风险。由于大量人工智能企业会委托第三方公司或采用众包的方式实现海量数据的采集、标注、分析和算法优化,数据将会在供应链的各个主体之间形成复杂、实时的交互流通,可能会因为各主体数据安全能力的参差不齐,产生数据泄露或滥用的风险。此外,在全球数字经济发展不均衡的大背景下,大型科技巨头将人工智能的数据资源供给、数据分析能力、算法研发优化、产品设计应用等环节分散在不同的国家,数据跨境流动的场景也会对国家安全和个人信息保护造成不可控的隐私风险。

2.模型训练与推理阶段隐私风险

(1)模型训练阶段数据污染风险

数据污染有失数据真实性。人工智能模型依赖海量数据,相比数据集大小,研发工程师更关注数据质量。知名学者吴恩达提出“80%的数据+20%的模型=更好的机器学习”,而数据污染和错误将降低模型精度,数据偏差和噪声将降低模型的泛化性和可靠性。数据是连接现实空间和虚拟空间的桥梁,如果数据质量出现问题,如数据内容失真、数据标注错误、数据多样性有限,则无法反映现实世界的真实情况,在此基础上建立的人工智能模型便会出现偏差,导致预测结果偏差或错误,甚至导致种族歧视或者性别歧视偏见,出现“垃圾进、垃圾出”的现象。如今的生成式 AI 模型也因静态数据的时效性,导致生成内容存在过时或者错误现象。

数据投毒攻击风险。数据投毒是指通过在训练数据集中故意添加污染数据(如错误样本或恶意样本),导致训练出来的模型在决策时发生偏差,从而影响模型的完整性或可用性。人工智能模型在训练过程中容易受到数据投毒攻击,攻击者可以通过实施标签翻转或添加后门等恶意行为来破坏训练数据的正确性。从而破坏模型决策的正确性。近年来,对人工智能模型的数据投毒问题已使得多个世界知名公司遭受重大负面影响,并造成了十分严重的后果。例如:美国亚马逊公司因其 Alexa 智能音箱学习了网络不良信息,发生了引导用户自杀的恶意行为。因此,训练数据的正确性问题已成为阻碍人工智能发展的重大问题。

(2)模型推理应用阶段隐私风险

隐私被推理风险。人工智能模型推理产生的信息可能会间接暴露用户隐私。一方面,在对数据进行深度挖掘与分析时,所得到的结果数据可能将用户的个人隐私一并挖掘出来,并进一步进行数据应用,从而使数据中隐藏的个人隐私信息进行暴露。另一方面,在对去标识化的个人信息和行为模式进行融合和关联分析时,可能推理出与个人隐私相关的信息,比如政治倾向、财务状况等。成员推理攻击风险。成员推断攻击是一种数据隐私攻击方法,该攻击通过判断输入数据是否是目标模型的训练数据来达到攻击效果。具体来说,攻击者不需要获取模型结构、模型参数、训练方法等,只需要向模型输入数据,从模型输出的置信度即可判断该输入是否为训练集中的数据。尤其对于过拟合模型,训练集数据与非训练集数据的置信度表现会有明显差异,如果目标攻击模型使用了个人敏感信息进行模型训练,成员推理攻击就会造成模型训练集中这部分敏感数据的泄漏。

模型逆向攻击风险。模型逆向攻击是一种通过还原训练数据造成数据隐私泄漏的攻击方法。攻击者可以在没有训练数据的情况下,通过模型输出的置信度不断调整输入数据,最终近似获得训练集中的数据。这一攻击如果使用在人脸识别系统、指纹识别系统等,则会造成用户生物识别信息的泄漏,例如随机构建一张图片,人脸识别模型给出用户名与置信度,结合置信度不断调整图片,最终就有可能将训练集中的人脸恢复出来。 模型提取攻击风险。模型提取攻击是一种可以造成模型保密性被破坏与知识产权被侵犯的攻击方法。该攻击通过模型预测结果反推模型具体参数和结构,以达到训练出一个与目标模型相似度极高的模型的过程。企业训练一个机器学习模型往往要花费大量金钱,投入大量人力,通过模型提取攻击,攻击者可以在对模型不掌握任何信息的前提下,仅通过模型的输入与输出来训练一个替代模型,一定程度上侵犯了企业的知识产权,破坏了企业的商业模式。

对抗样本攻击风险。对抗样本攻击是一种在模型推理阶段破坏模型完整性的攻击方法,其通过对人工智能模型的输入数据加入微小噪声,以欺骗模型做出错误预测。人工智能模型并不总是稳定和可靠的,攻击者对输入数据加入难以察觉的细小扰动,可以使模型产生意想不到的错误。例如,对于一个猫和狗的图像分类器,攻击者可以在猫的照片上进行微调,使分类器错误地将该图分类为狗。对抗样本攻击的出现给人工智能模型的准确性和鲁棒性带来了挑战,这种攻击可能对身份识别系统这类关键应用产生严重影响,因此也对个人隐私产生极大威胁。 提示注入攻击风险。模型面临提示注入攻击,尤其对于语言模型,当模型无法区分系统指令与不受信任的用户输入指令时,用户攻击者就有机会绕过模型限制并违反模型的指导原则来劫持模型输出,注入攻击就有可能发生。这种攻击的思路是,通过注入指令来劫持模型输出,使模型忽略原始指令并执行注入的指令,从而偏离其原始行为,造成信息泄漏或者生成违规内容等问题。提示泄露攻击是提示注入攻击的一种形式,该攻击用于泄露可能包含未经公开的机密或专有信息的提示的攻击。微软公布的 NewBing 对话机器人就被使用提示注入攻击发现了其聊天的初始提示,该提示通常对用户隐藏。

参考报告REPORT

中国联通人工智能隐私保护白皮书.pdf

中国联通人工智能隐私保护白皮。人工智能(ArtificialIntelligence,简称AI)作为战略性新兴产业,作为新的增长引擎,日益成为科技创新、产业升级和生产力提升的重要驱动力量。生成式人工智能工具、人脸识别、智能工厂、智慧城市等人工智能技术现已广泛落地,这些令人难以置信的技术正在快速改变人们的生活,对经济社会发展和人类文明进步产生深远影响。与此同时,人工智能技术也带来难以预知的各种风险和复杂挑战,潜在的滥用对以前被认为是不可侵犯的个人敏感信息构成了前所未有的威胁,技术自身缺陷导致智能决策在多个领域存在不确定性和敏感信息泄露,系统被非法控制导致个人隐私被未授权的第三方获取和推理。因此,...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至