大模型的安全防御技术有哪些?

大模型的安全防御技术有哪些?

最佳答案 匿名用户编辑于2024/07/25 08:49

下面分别针对大模型内生、外生以及衍生风险,梳理相 应的安全防御技术。

一、 内生安全防御技术

重点关注数据层面、模型层面和系统层面的防御技术。其中,数 据层面保护训练数据的安全及对话过程中的交互数据安全,模型安全 包括提高模型对抗恶意攻击的能力,增强模型的解释性以及保护模型 中的隐私信息。其次,系统安全,强调模型运行环境和周边系统的安 全性。讨论部署环境的安全性、通信的安全性、访问控制以及审计和 监控的重要性。

 

(1)数据安全防御技术 大模型数据隐私保护技术。数据脱敏通过数据伪装、数据打码和 数据截断等技术,在不损害数据集整体统计特性的前提下减少数据的 敏感性。数据匿名化通过对数据集进行变换,生成在一定范围内无差 别的新数据集,使攻击者无法推导出个体的敏感信息,从而实现隐私 保护。数据加密技术通过将原始数据转换为无法辨识的格式,保护数 字信息免受未经授权的访问和修改,确保数据的机密性和完整性。 大模型分布式训练技术。主要有联邦学习和区块链技术。联邦学 习是为了在不侵犯数据隐私法律条款的基础上,利用各个商业实体私 人领域的孤立数据进行模型训练,解决了中心化存储带来的隐私和安 全问题,但也面临通信效率和模型聚合优化等挑战。区块链技术通过 加密和共识机制,保障数据安全共享。在大模型训练中,可用于安全 地记录和共享数据或模型更新,提高了训练过程的透明度和数据的完 整性及安全性。二者的结合为大模型训练中的隐私数据共享提供了一 个强大框架,在保护隐私的同时实现高效训练。

(2)模型安全防御技术 大模型越狱防御技术。面对大模型越狱攻击,在大模型推理生成 的不同关键阶段中,采用差异化的防御策略可以显著提升系统整体的 安全性,有效遏制可能产生的越狱威胁。当前的防御方法可以分为, 模型生成优化:通过在模型的训练和部署过程中引入更加复杂的加密 算法和鲁棒性强的深度学习技术,可以有效降低越狱攻击的成功概率; 系统提示优化:指大模型内置的提示词,在用户输入提示词后,系统 提示词和用户输入的提示词进行拼接之后输入到大模型当中;输入输 出检测:通过监测模型输入和输出的内容,系统可以及时发现并拦截 潜在的越狱攻击行为。在实际应用中,通过综合运用这些手段,可以更好地保障大模型在实际应用中的安全性,为技术应用的稳健性提供 可靠支持。

提示语泄露防御技术。提示语主要用于描述任务的需求,通常嵌 入于模型对话中,是产业界的重要知识产权,同时可能包含一些敏感 信息。提示语泄露的防御技术整体有:输入检测,即在模型接收输入 前,评估输入是否为攻击文本,及时发现并拦截具有攻击性的输入; 输入处理,即在不改变用户输入原意的前提下,对输入文本进行添加 或修改,降低提示语泄露的风险;输出处理,即对模型输出进行检测, 避免将模型泄露的提示语返回给用户。提示语泄露防御技术是一个新 兴领域,需要多种技术进行综合防御,未来还需探索更多新方法。

(3)系统防御技术 硬件层面防御技术。大模型在硬件层面上的系统威胁主要体现在 对模型存储介质的威胁。防范技术目前主要有以下三种:漏洞修复防 范技术:包括通过概率相邻行激活和纠错码内存来克服漏洞,以及通 过对抗训练增强模型对漏洞的抵抗能力。然而,上述方法无法消除已 部署模型中的漏洞,且在大型复杂网络上实现成本高。被动检测防范 技术:开发一种低成本的基于权重编码的框架,能实时检测硬件漏洞 并将影响降至最低。它利用硬件漏洞的空间局部性,对敏感权重进行 快速编码,并通过汉明距离测量来区分“恶意”和“良性”比特翻转。 主动防范技术:基于“蜜罐”防御概念,将一些“蜜罐神经元”作为 精心设计的漏洞嵌入模型中,诱使攻击者在其中注入故障,从而实现 高效检测和模型恢复。 软件层面防御技术。大模型在软件层面上的系统威胁主要体现在 对用户及模型数据的威胁。防御手段主要有以下内容:用户数据防范 技术,依赖数据库的安全威胁防护技术,主要包括数据库漏扫、数据 库加密、数据库防火墙、数据脱敏、数据库安全审计系统等。此外,对于数据库漏洞,还可以采用自研架构以避免通用漏洞。模型数据防 范技术,寻求对利用上述漏洞进行代码注入威胁的防御技术。防御代 码注入漏洞的检测分类模型首先收集组件集合的数据集(由良性 URL 和恶意 URL 组成)用于训练和测试。然后,防御模型将良性和恶意链 接混合在一起,并使用防御框架根据特征模式来区分数据集中的良性 代码和恶意代码。

框架层面防御技术。大模型在框架层面上的系统威胁主要体现在 对深度学习框架及相关底层依赖库的威胁。具体的防御手段有:深度 学习框架防范技术,对于深度学习框架威胁的防范主要通过挖掘现有 深度学习框架中的漏洞并进行修复。底层依赖库防范技术,对于底层 依赖库威胁的防范主要通过挖掘深度学习常用底层依赖库中的功能 性算法漏洞并进行修复或替换。 操作系统层面防御技术。大模型在操作系统层面上的系统威胁主 要体现在对操作系统管理和调度计算机的硬件资源时所产生的物理 信息的威胁。在操作系统的设计和实现方式上可以引入以下多种安全 机制,使得系统的物理信息更加难以被侧信道攻击者捕获或分析,从 而防范生成式人工智能在操作系统层面上的威胁,具体有:访问控制 防范技术,指通过对系统资源进行访问控制,来保证系统的安全性, 包括身份认证、授权、审计等。加密防范技术,对操作系统中的数据、 文件以及运行机制加密是保护生成式人工智能系统的核心防御机制, 即机密性加密技术。机密性加密技术是指通过对数据进行加密,来保 证数据的机密性。

网络传输层面防御技术。大模型在网络传输层面上的系统威胁主 要体现在对端设备地址、传输路径、网络服务的威胁。针对网络传输 层面的防御技术也往往围绕这三个方面展开,具体为:端设备地址防范技术,大量研究从源地址安全的角度改进互联网开放接入带来的各 类安全问题,从提升 IP 地址真实可信能力和保护隐私等方面提升安 全性。传输路径防范技术,确保数据传输链路从源地址到目的地址全 链路生命周期安全是网络安全的重要组成部分,对应地有数据面及控 制面的解决方案。网络服务防范技术,网络服务安全主要包括数据访 问和网络应用安全,以及支撑大量互联网应用的PKI等基础设施安全。 主要有漏洞修复防范技术、被动检测防范技术、主动防范技术、传输 路径防范技术、网络服务防范技术、应用安全防范技术等。

二、 外生安全防御技术

重点应对来自大模型外部的各种攻击威胁,保护模型及数据的完 整性、可用性和隐私性。主要防御技术包括:面向隐私安全攻击的防 御技术,旨在保护用户隐私数据和模型训练数据不被泄露或滥用。针 对毒化数据的防御技术,旨在识别和过滤掉恶意注入的毒化数据,防 止模型被误导或产生偏见。面向恶意后门的防御技术,旨在检测和清 除模型中可能存在的恶意后门,确保模型在各种输入下的行为符合预 期。针对提示注入攻击的防御技术,旨在通抵御攻击者通过精心构造 的提示语来操纵模型输出的行为,增强模型对提示注入攻击的鲁棒性。

面向隐私安全攻击的防御技术。大模型存在无意识隐私数据泄露 的风险。对抗训练和提示工程是两种有效的防御策略。对抗训练通过 在模型训练中引入对抗性示例,提高模型在对抗性攻击时的鲁棒性。 提示工程则通过调整提示位置和标识,增强指令的鲁棒性,缓解大模 型遗忘基线问题导致的隐私泄露。此外,成员推理攻击利用模型输出 来推测训练数据,正则化、Dropout 和数据增强等技术可以防止过拟 合,从而降低隐私泄露风险。引入差分隐私通过添加噪声来限制模型 对单个数据点的敏感性,进一步保护隐私。在实际应用中,还可以采用隐私风险检测技术,基于关键词匹配、语境和语义分析,监控输入 提示和生成内容,并通过过滤或拒绝响应机制,在隐私保护和信息传 递之间取得平衡。另外,生成内容过滤审查模型可以检测敏感信息, 并进行屏蔽、过滤或修改,持续优化隐私保护策略。 针对毒化数据的防御技术。毒化数据攻击是指恶意行为者故意将 有害数据注入模型的训练集中,从而影响模型的输出和行为。为了对 抗这类攻击,首先应保证数据安全,采取有效的数据溯源和对齐技术, 确保所有训练数据的安全性和可靠性。发展高级的对抗算法来识别和 处理包含毒化数据的输入至关重要。这包括使用复杂的数据分析技术 来识别异常模式,以及开发能够自动排除或修正这些数据的机制。特 别是在处理多模态数据时,如文本、图像和声音,需要构建统一的安 全风险防御策略,以保障数据的完整性和模型的安全运行。

面向恶意后门的防御技术。攻击者通过在训练数据中隐藏恶意指 令或模式,使模型在特定输入下产生预设的恶意行为。通过检查模型 中的神经元激活特征,以识别那些可能被恶意操纵的神经元,可以有 效地识别和消除这些后门;通过模型的微调和再训练来清除这些后门, 有助于提高模型对这类攻击的鲁棒性。持续的监控和定期的安全评估 对于维护模型的长期安全至关重要。 针对提示注入攻击的防御技术。针对提示注入攻击,通过控制模 型的提示指令可以进行有效的防御,保护模型免受对抗攻击。最直观 和简单的方法就是明确地指示模型成为负责任的模型,不要生成有害 内容,这在一定程度上能够降低指令攻击的成功率。然而,攻击者会 在提示注入攻击中,诱导模型绕过预设的安全机制,实现恶意攻击。 通过对抗训练进行防御是常用的方法,通过迭代的收集这些攻击样本, 使用指令微调等方法对模型进行迭代的优化,使模型面对不断出现的新型恶意提示输入时能通过拒绝等方式正确应对,提高对抗攻击场景 下的鲁棒性。值得注意的是,面对指令攻击时,过于保守的防御策略 会影响模型生成内容的多样性和趣味性,在安全性和生成质量之间的 权衡需要更深入的研究。

三、 衍生安全防御技术

在内生、外生安全防御技术的基础上,进一步讨论如何保护训练 数据的安全、提高模型对抗恶意攻击的能力、增强模型的解释性、保 护模型中的隐私信息,以及如何确保模型运行环境和周边系统的安全 性,包括讨论部署环境的安全性、通信的安全性、AIGC安全的重要性。 (1)偏见和毒性内容生成风险防范技术 预训练数据排毒。在大模型的预训练阶段,关键任务之一是确保 训练数据的安全性和质量。这一过程涉及两个主要策略:数据清洗和 偏见调节。为了保障模型输出的安全性,预处理阶段需移除潜在的不 当数据,同时添加高质量、安全的训练语料。针对大模型预训练数据 中的偏见问题,除了删除有问题的数据外,数据增广是另一种促进模 型公平性的方法。通过加入多样化的数据集,可以在预训练阶段帮助 模型形成更全面的视角。

基于强化学习的对齐。在实现方式上,基于人类偏好的强化学习 技术通过人类的偏好反馈,以强化学习方式优化语言模型,引导模型 在生成时更接近人类价值观。基于 AI 反馈的强化学习技术使用 LLM 代替人类标记偏好,通过自我提升的方式,利用自动生成的评论和修 正来训练 AI,避免了依赖大量人工标签识别有害输出。此外,基于强 化学习的大模型对齐技术已逐渐成为当下大模型安全研究的主流技 术。

推理阶段的安全风险防控。具体为,基于提示的安全控制,其经 过指令微调的大模型具有指令遵从的能力,相关研究证明,通过在指 令中添加安全相关的规则和限制可以有效降低不当言论的生成。安全 回复策略,为提升语言模型的安全性,让模型学会在面对有害输入时 生成安全回复是一种常用的安全策略。这通常涉及到结合安全风险检 测器的使用,以识别用户输入以及模型输出中的偏见或歧视内容。

(2)虚假新闻防范技术 基于大模型的虚假新闻检测。大模型可直接用于虚假新闻检测, 无需微调即可检测自身或其他类似模型的输出。基于微调的 AIGC 文 本检测模型通过识别 AI 生成的特定痕迹,判断新闻是否由 AI 生成, 作为判断虚假信息的辅助特征。此外,困惑度与可信度也是衡量文本 是否由语言模型生成的指标。基于事实核查的虚假新闻检测。事实核查作为一种评估陈述、主 张或者信息真实性和准确性的过程,它在识别和防止虚假新闻的传播 中起着至关重要的作用。其中的关键技术有,声明检测,旨在判断某 个声明是真实或虚假的,这项任务的研究对象通常是可验证或值得验 证的新闻,通常被视为一项分类任务。证据检索,目标是找到支持或 反驳某一声明的证据,这些证据可以是文本、表格、知识库内容或图 像。依赖声明或新闻的表面特征而不考虑现实世界的信息,通常难以 准确的判断其是否是真实或虚假的,因此提供有效的证据对于产生有 说服力的判决理由在事实核查过程中是必不可少的。声明核查,目的 是根据检索的证据评估声明的真实性,以判断其是否为虚假新闻,通 常分为分别式判决预测和理由生成两个阶段。

(3)版权侵犯风险防范技术 面向AI训练数据安全的水印技术。在训练数据中嵌入数字水印, 主要目的是保护数据版权,防止数据在未经授权场景下的使用。后门 攻击是数据集版权保护中水印环节的重要技术,数据版权拥有者通过 在训练数据中嵌入水印作为隐藏的后门,当攻击者未经授权使用这些 数据训练模型时,后门被植入模型中。通过检查可疑模型是否包含特 定的隐藏后门,数据版权拥有者可以判定数据是否被窃取使用,从而 进行版权保护。面向 AI 生成内容溯源的水印技术。数字水印技术在 AIGC 版权 保护领域显示出巨大的潜力,特别是结合快速微调和有效的水印提取 技术,可以为版权保护提供一种更为高效和实用的解决方案。在 AIGC 技术日益普及的今天,开发和应用这些先进的数字水印技术对于维护 内容创作者的权益和保护知识产权至关重要。

(4)电信诈骗风险防范技术 深度伪造检测技术。主要研究基于特定的伪造痕迹或数据驱动等 方法,以识别视频、图像和语音等信息是否是深度伪造内容。具体的 方法有:基于空间域信号的深伪检测,侧重于分析图像或视频在像素 级的差异,通过观察可见或不可见的伪影来区分真实内容和伪造内容。 基于频域的深伪检测,从频域角度出发,探索真实和合成图像之间的 微妙差异。不同于依赖空间域的可视特征,频率域分析揭示了深度伪 造技术在光谱层面引入的隐蔽伪影,这些伪影在视觉上不易察觉,但 在频域分析中变得明显,为深度伪造检测提供了新的视角。基于生物 信号的深伪检测,真实的面部图像和视频通常是使用摄像头等设备拍 摄,与合成的伪造内容相比更自然,因此使用生物信号有助于更清晰的辨别真伪内容。生物信号,如面部表情、眼睛运动、皮肤色泽变化 以及心跳节律等,都是判断视频真伪的重要线索。

深度伪造主动防御技术。主要研究防止恶意行为者利用个人的面 部图像或视频进行虚假制作。其核心思想是在将含有人脸的图像或视 频上传至公共网络平台之前,对其进行细微的修改,比如加入特定的 扰动或水印。这些改动对日常观察者几乎不可察觉,不会影响正常使 用。具体的方法有:基于主动干扰的防御技术,通过向源数据中注入 精心设计的扰动,使其面对深度伪造时,能够破坏深伪模型的生成效 果,使得伪造失败,或使伪造出来的图像或视频在视觉上与真实内容 存在明显差异。基于主动取证的防御方法,核心在于对伪造图像的溯 源分析或在复杂情况下的身份验证。这种方法的优势在于,提供了在 深度伪造成功发生后,追踪其来源和确认真伪的手段。

参考报告REPORT

大模型安全实践白皮书.pdf

大模型安全实践白皮书。《生成式人工智能服务管理暂行办法》《科技伦理审查办法(试行)》等政策相继发布,提出要坚持发展与安全并重原则,强化科技伦理风险防控,并从技术发展与治理、服务规范、监督检查与法律责任等层面对大模型安全发展提出了要求。大模型作为AI领域的一个重要分支,日益成为推动社会进步和创新的关键力量。依托于庞大的参数规模、海量的训练数据、强大的算力资源,大模型在多个领域的能力已超越人类。而纵观历史,每一轮新技术革命都会带来社会的变革与不确定性,随着大模型能力的不断增强,大模型的安全性、可靠性、可控性正面临前所未有的挑战。伴随大模型的深度应用,产学研用各方也加强了大模型安全威胁和防御技术体系...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至