生成式大模型存在哪些数据安全问题?

生成式大模型存在哪些数据安全问题?

最佳答案 匿名用户编辑于2023/06/14 15:18

数据的安全和隐私是 ChatGPT 及 GPT4 等生成式大模型使用过程中一个极 为重要的问题。下面将从两个不同的方面来揭示其中的隐患。

1.生成式大模型使用过程中显式的隐私信息泄露

首先,ChatGPT 是一个有力的自然语言处理工具,在 ChatGPT 训练的过程 中不可避免地利用了用户的 prompt 指令作为训练数据。而 ChatGPT 主要的目的 是生成和人类语言风格相近的语言,训练数据在不经意间被转换成了生成内容,其 中就包括了敏感和隐私的个人信息如银行卡账号,病例信息等。有一些报道表明, ChatGPT 在使用过程中,一些高频用户的敏感和隐私信息成为生成内容出现在其 他用户的对话框中,从而导致了高频用户敏感和隐私信息的泄露。

更进一步地,ChatGPT 的数据安全和隐私隐患还体现在它对于对话框内容的 存储。当用户在和 ChatGPT 互动时,他们的信息会被以某些形式记录和存储下 来。这些记录的内容包括而不限于个人信息如姓名、电子邮箱账户、其他敏感信息 等。2023 年 4 月 10 日,中国清算协会发出关于《关于支付行业从业人员谨慎使用 ChatGPT 等工具的倡议》,指出,ChatGPT 等工具引起各方广泛关注,已有部分 企业员工使用 ChatGPT 等工具开展工作。但是,此类智能化工具已暴露出跨境数 据泄露等风险,如图 1410。因而,ChatGPT 需要对敏感信息的存储和记录,以及 对记录的数据进行访问等进行一些列严格的限制,以达到防止对数据进行未经授 权的访问和数据泄露等安全问题的产生。

2.生成式大模型使用过程中隐式的隐私信息泄露

另一个方面,ChatGPT 体现出的数据安全和隐私的隐患是它可能通过对对话 框数据的收集进行广告推荐,及收集对话框数据进行推荐或者其他的下游机器学 习的任务。而通过机器学习的算法,ChatGPT 可以推断出潜在的敏感信息如用户 偏好、兴趣、行为等,并基于推断出的信息进行精准的广告投放;但推断的过程可 能侵犯用户的隐私。因此,用户应该在使用 ChatGPT 时就被告知数据的收集和使 用范围,并提供随时可以撤销数据的选项。

最后,ChatGPT 体现出潜在的数据安全隐患是它会进行虚假新闻或信息的生成和传播,从而给用户带来诱导性的虚假信息。例如,可以通过 ChatGPT 定制个 性化信息,来诱导和操控用户的观点和行为。因而,ChatGPT 的使用者应该有足 够的受教育程度和经历,本身可以辨别新闻或其他信息的真实准确程度。另一方 面,ChatGPT 本身也应该提供和生成器相匹敌的可信程度辨别器,从而达到对生 成的内容可信负责的社会责任。具体地,2023 年 2 月 16 日下午,杭州某小区业主 群讨论 ChatGPT,一位业主抱着开玩笑的态度用 ChatGPT 写了篇杭州取消限行 的新闻稿,被不明真相的住户当真截图并转发,最后导致错误信息被传播。而杭州 相关政府部门均没有发布此类政策,警方介入调查后,涉事业主也在群里公开道 歉。图 15为业主在事发后的道歉信。新闻来源杨子晚报11。新华报业网于 2023 年 5 月 9 日的报道中,甘肃省平凉市公安局网安大队侦破一起利用 AI 人工智能技术 炮制虚假不实信息的案件,见图 1612。无独有偶,在 Google 新闻中搜索 ChatGPT fake news 的词条,0.32 秒内出现了 18,300 条结果,由此更可见一斑。

参考报告REPORT

生成式大模型安全与隐私白皮书.pdf

生成式大模型安全与隐私白皮书。OpenAI于2022年11月30日开放测试ChatGPT,此后ChatGPT风靡全球,在1月份的访问量约为5.9亿。AI驱动的聊天机器人ChatGPT成为互联网发展二十年来增长速度最快的消费者应用程序。ChatGPT和GPT4的诞生引发了生成式大模型的研发热潮,显示了人类迈向通用人工智能(AGI)的可能性。但在其备受追捧的同时,ChatGPT等生成式大模型也面临AI自身数据和模型方面的安全隐患。我们应该意识到,在生成式大模型带来各种革命性的技术进步的同时,其自身带来的一系列安全与隐私问题也值得我们注意,例如引发的数据泄漏,助长虚假信息传播等。在本白皮书中,我们首...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至