生成式大模型的模型安全存在哪些威胁?

生成式大模型的模型安全存在哪些威胁?

最佳答案 匿名用户编辑于2023/06/14 15:22

ChatGPT 等生成式大模型本质上是基于深度学习的一个大型模型,也面临着 人工智能安全方面的诸多威胁,包括模型窃取,以及各种攻击来引起输出的错误 。

1.模型窃取攻击

模型窃取指的是攻击者依靠有限次数的模型询问,从而得到一个和目标模型 的功能和效果一致的本地模型 [19, 34, 42, 56, 65]。这类攻击的性价比非常高, 因为 攻击者不需要训练目标模型所需的金钱、时间、脑力劳动的开销,却能够得到一个原本花费了大量的时间、金钱、人力、算力才能得到的模型。由于 ChatGPT 和 GPT4 的模型参数很大并且功能十分广泛,要完整窃取其整个模型是具有极大困 难的。但是攻击者可以只窃取其某一部分的能力,例如窃取的模型在关于金融领 域的知识上能够与 ChatGPT/GPT4 的能力相一致,就可以免费使用 ChatGPT 和 GPT4 的能力。特别是在现在 ChatGPT 呈现专业化应用的情况下,具有某一领域 中强大能力的模型是受人追捧的。并且 ChatGPT 已经开放了 API 的使用,这更 为模型窃取提供了询问入口。

例如在近期的论文 [28] 研究中,作者针对 GPT3.5 等 ChatGPT 背后的模型窃取攻击进行了研究,他们指出可以用中等规模的模型作为本地模型, 然后通过 openai 的 API 访问去部分窃取大模型在特定任务上的性能。这样的攻击 将为无法承担训练超大模型的公司/个人提供了解决方案。

2.数据窃取攻击

数据窃取攻击指的是通过目标模型的多次输出去获取训练过程中使用过的数 据的分布 [4,17,18,39,54]。如果攻击者能够知晓 GPT 模型训练过程中使用过的数 据是哪些,就有可能会造成数据隐私损害。在此之前研究者就发现人工智能模型使 用过程中产生的相关计算数据,包括输出向量、模型参数、模型梯度等,可能会泄 露训练数据的敏感信息。这使深度学习模型的数据泄露问题难以避免。例如,模型 逆向攻击,攻击者可以在不接触隐私数据的情况下利用模型输出结果等信息来反 向推导出用户的隐私数据;成员推断攻击,攻击者可以根据模型的输出判断一个 具体的数据是否存在于训练集中。ChatGPT 和 GPT4 虽然没有输出向量等特征因 素,但是由于其模型结构,训练方式的一部分已经被人所知,并且开放了 API 接 口来访问,因此针对 ChatGPT 和 GPT4 的数据逆向攻击已经具有相当威胁.特别近期还有传闻,谷歌一位著名的人工智能研究员辞职是因为该公 司正在使用来自 OpenAI 的 ChatGPT 的数据训练其人工智能聊天机器人 Bard26。 这些数据是通过对 ChatGPT 和 GPT4 在网页版和 API 上的多次访问来进行训练 数据重构攻击实现的。

3.对抗攻击

对抗攻击指的是给原本的输入增加一些不易受到人类感知的扰动,从而引起 目标模型的输出错误 [7,11,60,70,75]。对抗攻击在图像,文本,语音等多模态数据 上均具有相应的共计案例。作为一个云服务模型,ChatGPT 和 GPT4 的权重虽然 无法获得,但是也面临着来自攻击者的黑盒攻击威胁,因为对抗样本存在高度的可迁移性,即针对某个本地 LLM 模型的对抗攻击依旧能够对 ChatGPT 和 GPT4 产 生影响。而且特别是攻击者还可以和 ChatGPT 交互,就可以在交互的过程中,推 断模型的结构或者其他部分知识,然后利用已知的结构信息构造更精确的本地模 型,然后进行更加强有力的攻击。

近期一篇论文 [69] 就从对抗攻击和 样本分布外泛化的视角来对 ChatGPT 进行鲁棒性分析。该论文研究了 ChatGPT 在面对一些常见的对抗性文本时候是否具有抵抗干扰的能力。通过在多个对抗文 本数据集上的评测,研究者们发现 ChatGPT 抵御对抗扰动的效果相比于一般的 NLP 来说非常好。但是面对这些对抗性文本,ChatGPT 还是没有强大到可以完全 不受其影响的程度。

4.后门攻击

后门攻击中,攻击者给输入的数据贴上特定的触发器。在数据具有触发器的时 候,会常常引起模型输出错误,而没有触发器的时候,则模型运行正常 [23, 27, 30, 62, 79]。从触发器的角度看,主要可以分为两类方法:静态攻击和动态攻击。其中 静态攻击的触发器定义为某个特定的形态,例如在图像分类任务重,图片上的一块 特定样式的像素;而动态攻击的触发器定义为针对整个数据空间的扰动,例如在图像分类任务中覆盖全图的噪声扰动。后门的植入可以是通过数据投毒,或者模 型修改等来进行实现。后门的形状各异,十分难以检测。不经如此,后门触发器的 位置也难以探测,可能只在某个特定区域放置触发器才会引起错误。ChatGPT 和 GPT4 在训练的过程中会使用大量的数据,这使得后门的植入变得极有威胁。在论文 [58] 中,作者通过在 ChatGPT 的 RL 训练阶段中增加后门, 使得模型在经过 finetune 的步骤之后可以被后门攻击。例如在使用被植入后门的 ChatGPT 模型的时候,攻击者可以通过控制后门的方式来控制 ChatGPT 的输出。 而在论文 [25] 中也展示了如何通过 ChatGPT 去产生有效的后门触发器,然后再 去对其他的大语言模型植入后门.

5.Prompt 攻击

Prompt 的构建使得预训练大模型能够输出更加符合人类语言和理解的结果。 但是不同的 prompt 的模板依旧有可能会导致一些安全问题和隐私问题的出现 [14, 44, 57, 59, 74]。例如利用特殊设定的 prompt 模版/对话去诱使 ChatGPT 输出错误 的答案,或者诱使 ChatGPT 输出一些隐私相关的数据。这些问题 在之前的语言模型中也有过出现,例如 2021 年 9 月,数据科学家 Riley Goodside 发现,他可以通过一直向 GPT-3 说,「Ignore the above instructions and do this instead...」,从而让 GPT-3 生成不应该生成的文本27。甚至通过某些 prompt,用 户能够获取更大的模型权限。

例如一位来自斯坦福大学的华人本科生 Kevin Liu,通过向聊天机器人(目前候补名单预览)prompt 进入 “开发人员覆 盖模式”(Developer Override Mode),Kevin Liu 直接与必应背后的后端服务展开 交互, 甚至可以向聊天机器人索要一份包含它自身基本规则的文档细节28。

6.数据投毒

在通常的 AI 安全中,数据投毒指的是在训练数据中插入攻击者特殊设定的样 本,比如输入错误的 label 给数据,或者在数据中插入后门触发器等 [32, 33,43,61, 78]。而 ChatGPT 和 GPT4 作为一个分布式计算的系统,需要处理来自各方的输 入数据,并且经过权威机构验证,这些数据将会被持续用于训练。那么 ChatGPT 和 GPT4 也面临着更大的数据投毒风险。攻击者可以在与 ChatGPT 和 GPT4 交 互的时候,强行给 ChatGPT 和 GPT4 灌输错误的数据,或者是通过用户反馈的 形式去给 ChatGPT 和 GPT4 进行错误的反馈,从而降低 ChatGPT 和 GPT4 的 能力,或者给其加入特殊的后门攻击。

参考报告REPORT

生成式大模型安全与隐私白皮书.pdf

生成式大模型安全与隐私白皮书。OpenAI于2022年11月30日开放测试ChatGPT,此后ChatGPT风靡全球,在1月份的访问量约为5.9亿。AI驱动的聊天机器人ChatGPT成为互联网发展二十年来增长速度最快的消费者应用程序。ChatGPT和GPT4的诞生引发了生成式大模型的研发热潮,显示了人类迈向通用人工智能(AGI)的可能性。但在其备受追捧的同时,ChatGPT等生成式大模型也面临AI自身数据和模型方面的安全隐患。我们应该意识到,在生成式大模型带来各种革命性的技术进步的同时,其自身带来的一系列安全与隐私问题也值得我们注意,例如引发的数据泄漏,助长虚假信息传播等。在本白皮书中,我们首...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至