2025年AI智能体安全治理分析:风险识别与防护体系构建

  • 来源:其他
  • 发布时间:2025/09/25
  • 浏览次数:260
  • 举报
相关深度报告REPORTS

中国电信:2025年AI智能体安全治理白皮书.pdf

中国电信:2025年AI智能体安全治理白皮书。当前,人工智能技术正经历从“对话智能”向“决策智能”跃迁的关键发展阶段。基于大语言模型的AI智能体已实现质的突破,其功能定位已从基础指令执行单元转型升级为具备复杂认知推理与战略决策能力的智能系统,最终发展为能够自主感知环境态势、独立制定行动方案并高效执行任务的"数字协作伙伴"。这一技术范式的革新显著拓展了人工智能的应用疆域,在金融风险管控、智慧医疗体系、先进制造产业及社会化公共服务等诸多领域,AI智能体正持续推动生产模式与服务形态的深度变革。然而,技术能力的显著提升亦伴随着潜在风险...

人工智能技术正经历从“对话智能”向“决策智能”跃迁的关键发展阶段。基于大语言模型的AI智能体已实现质的突破,其功能定位从基础指令执行单元转型升级为具备复杂认知推理与战略决策能力的智能系统,能够自主感知环境态势、独立制定行动方案并高效执行任务。这一技术范式的革新显著拓展了人工智能的应用疆域,在金融风险管控、智慧医疗体系、先进制造产业及社会化公共服务等诸多领域,AI智能体正持续推动生产模式与服务形态的深度变革。

一、AI智能体安全风险呈现多层次、链式传导特征

AI智能体与传统大语言模型存在本质差异,其借助大语言模型强大的通用推理能力,通过耦合知识库引入、工作流编排、跨工具协同等模块,具备了自主感知、决策与执行能力。这一特性极大地丰富了AI智能体的应用场景,同时也带来了风险边界的拓展,从数据泄露、算法偏见等传统大语言模型安全问题,演变为覆盖“感知-记忆-决策-执行”全链路的系统性风险。

2025年,ITU-T标准组织发布了《基于预训练大模型的AI智能体要求与评估方法(F.748.46)》标准,从技术能力评估角度将AI智能体划分为感知与认知能力、计划能力、记忆能力、执行能力四类。基于这一研究框架,学术界进一步提出将AI智能体细化为感知层、决策层、记忆层、执行层的思路,形成了完整的风险分析框架。

感知层作为外部环境多源信息的入口,易受到指令劫持、传感器干扰及协议漏洞等攻击,导致输入环节的不可信性。具体表现为指令劫持攻击,即攻击者在智能体可读取的网页、文档、图片中嵌入隐藏指令,使AI智能体执行攻击者意图。AI智能体能够主动从环境中获取信息,这使其比被动接收提示词查询的大语言模型更易遭受此类攻击。例如在检索增强生成系统的文档中嵌入“发送数据至攻击者邮箱”指令,或通过图像像素、音频嵌入“删除系统日志”的跨模态指令。环境干扰是另一重要风险,攻击者通过操纵物理或数字环境,干扰AI智能体的感知模块,使其接收错误输入信号。其技术实现依赖AI智能体的传感器漏洞与多模态融合缺陷,例如攻击者向自动驾驶AI智能体的激光雷达发射强光或虚假反射信号,生成虚拟障碍物或掩盖真实物体。

决策层依托复杂的推理链条与多次模型调用,风险主要表现为逻辑错误的放大和模型幻觉。与传统大语言模型的一次性输出不同,智能体的决策是一个动态、多步的循环过程,这使其面临错误推理的累积与放大、多步推理产生逻辑陷阱两类独有的系统性风险。AI智能体依赖对大语言模型的多次调用与复杂算法进行规划与决策,单一步骤中的微小偏差或幻觉会在后续的推理链条中被多次重复引用、依赖和放大,导致最终决策与初始目标的严重偏离。为实现复杂目标,智能体需进行多步推理,推理链条关键节点中的逻辑陷阱或语义歧义,常诱导其得出错误结论并执行危险操作。

记忆层在长期存储与调用历史信息过程中,存在内容篡改、恶意植入及隐私数据泄露等隐患。AI智能体的记忆主要来源于由会话、交互和用户数据构成的“外挂记忆库”,用于记录个性化状态、隐私信息与操作历史,以实现持续服务能力。这种记忆高度依赖具体用户、任务与环境,并能够通过持续交互、标注和修正不断学习和调整,因此更易受到定向攻击与恶意干预。隐私泄露风险尤为突出,AI智能体的记忆库是一个持续增长的、高价值的隐私数据金库,可能包含用户的个人信息、偏好、行为习惯、商业机密甚至凭证。一旦记忆库被攻破,会导致大规模、高浓度的隐私泄露。

执行层因链条脆弱和缺乏约束,可能将错误决策转化为失控行为,造成严重后果。执行层是AI智能体从“认知决策”到“物理操作”的关键转化层,负责调用工具、执行指令并输出结果。其风险源于第三方工具滥用、权限妥协和AI智能体内部执行的不可控性,导致AI智能体在行动阶段被劫持或偏离预期目标。恶意操纵和行为失控是两类核心风险,攻击者利用供应链漏洞与权限边界模糊,通过污染输入、篡改配置或劫持通信,操控AI智能体的执行逻辑,将其转化为攻击媒介。

尤为突出的是,AI智能体风险具有显著的层级传导特性,单一环节的漏洞即可沿“感知失真-决策误判-执行失控”的路径放大危害。已有案例表明,攻击者通过提示注入诱导智能体调用高权限工具,最终导致大规模数据泄露与系统篡改。这一现象充分说明,全面认识并防范AI智能体各层级风险是保障其安全运行的关键前提。

二、AI智能体安全治理需要构建分层防护体系

为应对AI智能体安全挑战,全球各国和标准化组织正在积极推动AI智能体安全标准的制定与治理体系的构建,逐步将安全要求从相关规定落地到可操作的实践框架。在国际层面,多个组织开展AI智能体相关标准研究。联合国世界数字技术科学院(WDTA)发布了《AI智能体运行时安全测试标准》(AI-STR-04),这是全球首个聚焦自主智能体运行安全的标准,提出了“双层测试框架”,既包括对系统内部架构(如记忆、规划、工具调用等)的安全性评估,也涵盖生命周期安全测试,从研发、部署到运维实现全过程防护。

国际电联电信标准化部门(ITU-T)制定了《AI智能体安全需求与指南》和《基于预训练大模型的AI智能体要求与评估方法(F.748.46)》,从能力需求、技术框架、安全评估和实施指南等多个维度,为基于大语言模型的AI智能体提供了系统化的评估与监管方法。中国通信标准化协会(CCSA)启动编制《智能体通用技术能力要求》与《智能体安全要求》两项行业标准。中国信息通信研究院与人工智能产业联盟联合发布了《智能体安全通用技术要求》,人工智能标委会开展《人工智能安全治理智能体安全通用技术要求》研究。这些标准共同构成了覆盖通用要求、运行测试与特定应用场景的多层次国内标准体系。

在标准体系的引领下,AI智能体的安全治理思路愈发清晰。其核心目标围绕“安全、可控、可信”三大维度展开:安全性是基础,强调有效防范潜在风险与威胁;可控性是底线,确保智能体的自主行为始终处于人类监督与干预范围内;可信性则是保障,要求运行过程符合既定规范和价值准则,并实现结果的可验证、可追溯与可审计。围绕这一核心目标,AI智能体的安全治理应分层推进,形成多维度的治理体系。

感知层安全是防护体系的第一道防线,需要重点关注工具调用安全、输入输出安全和AI智能体通信安全。完整记录AI工具交互日志并确保可追溯性,监控与阻止工具滥用,检测规避安全策略的命令链式调用;涉及金融、医疗或行政功能的AI工具操作需强制人工审批;维护详细的执行日志,记录AI工具调用以供安全审计与异常检测;包含提权操作的AI生成代码必须人工验证后方可执行。实施严格的工具访问控制策略,限定AI可执行工具范围;AI调用工具前需完成函数级身份验证;采用沙箱隔离执行环境,防止AI工具滥用影响生产系统。

决策层安全需要实施决策验证,为反思过程设置边界管理机制,并建立动态保护措施,确保目标一致性。部署AI行为审计系统,通过另一模型检查AI智能体行为,标记可能遭到操控的重大目标偏离情况。降低模型幻觉风险,采用可信度评分机制,根据风险等级优先处理人工审核队列;低风险自动化审批,高风险任务保留人工监督;限制AI通知频率,避免认知过载,防止过多AI生成的通知导致决策疲劳;AI修改自身操作目标需经过双重的智能体验证。

记忆层安全需要构建长期记忆向量数据库时,运用先进的自然语言处理技术和机器学习算法,对多模态数据进行自动化识别和分类,依据分类分级构建安全向量数据库,对敏感数据进行重点管控,保证向量数据库中数据集的安全性,防止敏感数据违规外泄和共享。采用沙箱化技术隔离不同智能体的记忆模块,防止A智能体的敏感数据通过共享缓存或工具调用泄露至B智能体。采用内核级内存加密技术,防止调试工具攻击窃取内存中的未加密会话数据。

执行层安全需要对高风险操作要求人工确认,并建立日志记录和监控机制;同时采用欺骗检测策略,包括行为一致性分析、真实性验证模型以及对抗性红队测试,以评估AI输出与预期推理路径之间的不一致性。监控AI智能体行为以确保其符合预设角色与预期行动:通过限制工具访问权限来缩小攻击面,约束AI智能体生成链接的能力,并采用验证机制(防护栏、审核API或备用模型)来检测和过滤被篡改的响应。

三、行业实践表明安全治理需要技术与标准协同推进

当前,业界已经在智能体平台、端侧智能体以及模型上下文协议(MCP)等关键环节开展了探索与试点,形成了具有代表性的治理实践。中国电信自主研发星辰智能体平台,以自主研发的星辰大模型为技术底座,深度融合语义、语音、视觉和多模态能力,支持零代码快速创建智能体与全流程应用生成,大幅降低开发门槛。平台内置了超过300种场景化AI算法能力,官方集成工具80+,自上线以来,发展迅猛,公有云累计注册用户9000+,已创建2.7w+智能体。在公安、教育、政务等10+行业实现深度落地。50+POC项目交付。

星辰智能体平台作为支撑AI智能体开发、部署、运行的核心载体,其安全性直接决定AI智能体全生命周期的可靠运行。平台支持用户自主进行工具流编排、上传知识库、精调模型、运行脚本等,也由此面临数据污染、第三方组件风险、内容违规、代码漏洞、外部攻击等多维度安全挑战。为有效控制风险,平台在处理用户上传的知识库前,首先依托非结构化数据识别能力开展全面的安全审查和数据毒性评估。在长期记忆知识库向量化处理前,平台嵌入内容安全检测节点,通过关键词匹配、语句结构分析及恶意代码扫描等技术,精准识别其中的有害信息、虚假数据或潜在恶意代码,确保知识来源纯净可靠。

工作流编排功能支持用户通过添加多种节点(如大模型能力、条件分支等)、配置参数与变量、集成外部工具与注释等方式,快速构建适应复杂场景的AI智能体。这一高度自定义能力在提升灵活性的同时,也增加了内容安全、流程错用、恶意逻辑注入与越权操作的风险。为合理保障性能、减少风险,在输入输出节点强制性调用安全围栏,依托包含深层语义意图识别、多尺度视觉特征解析、图文一致性校验等30余个专业检测引擎,对用户提示词及大模型生成内容进行毫秒级动态分析,精准识别违规信息及恶意攻击。

构建覆盖运维全流程的安全监测与风险评估机制,具备风险行为一站检测、告警自动研判分级、响应信息精准推送、攻击事件深度溯源的态势感知能力,实现“风险感知→行为分析→告警响应→溯源处置”的闭环防御链。智能体平台动态维护在运智能体台账,包含智能体名称、简介、调用基模、发布方式、调用量等关键数据,同时依托该台账,平台还可实现告警关联、溯源处置等安全运营功能,进一步提升智能体管理的规范性与响应效率。

随着AI智能体的快速发展,智能体之间的高效通信逐渐成为推动应用落地的核心环节。AI智能体通信协议旨在为不同智能体、工具与外部环境之间的交互提供统一的规则与接口规范,从而实现跨平台、跨系统的互操作性。MCP作为AI智能体通信协议的代表协议,自推出起就获得了大量热度,随着MCP工具和MCP社区的大幅度增长,MCP的安全问题也逐步暴露。比如,CVE-2025-6514中揭示了攻击者可以通过注入可执行软件的方式注入mcp-remote服务,从而获得受害者电脑的全部权限。又比如,大量MCP服务在读取外部信息时不做处理直接返回给模型,产生间接提示词注入的风险。

蚂蚁集团针对MCP存在的安全风险,自主研发轻量级MCP安全扫描工具MCPScan,是业界首个结合静态污点分析和智能动态代码关联的多阶段扫描器。通过将两套技术的结合,首次实现了扫描速度和扫描准确率的平衡,快准全地扫描MCP疑似风险问题。具体来说,MCPScan通过规则锁定可疑代码并提取元数据,再追踪代码在整体中的流转过程,最后由风险判断器综合评估,快速识别并标记潜在风险。

端侧智能体是指在智能手机、IoT设备、嵌入式系统、智能终端等边缘设备上运行的AI智能体,它融合了人工智能技术与终端设备的本地计算能力,具备自主决策、执行任务的能力。随着端侧AI智能体承担越来越多的关键任务,其在交互、感知、决策与执行链条上的复杂性也带来了独特的安全风险。端侧智能体直接控制移动设备的操作,包括应用调度、触控操作、网络请求及系统资源管理,一旦存在漏洞,可能引发设备功能异常、隐私信息泄露或用户操作误导等问题。

为了全面识别端侧智能体在移动设备实际运行中的潜在安全隐患,需建立覆盖多场景、多风险的评测框架,并结合端侧特有的约束与特性。信通院从智能体的实际应用场景出发,设计涵盖邮件管理、金融交易、社交媒体、网页导航、智能问答、恶意软件、隐私信息、设备管理、工具调用、数据管理、权限控制等15余种任务,形成多维度、多场景的评测覆盖,以验证端侧智能体在受限移动端环境下的安全表现。

端侧智能体安全评测依托自动化技术,突破传统人工评测瓶颈,实现移动端智能体全流程安全分析。测试环境初始化在隔离沙箱内模拟真实移动设备环境,精准加载测试参数,涵盖智能体运行所需的系统配置、网络环境、资源限额等关键数据,为评测构建稳定基准。测试用例输入环节需高效驱动指令注入,借助API或移动端自动化交互工具读取安全测试数据集输入到智能体中,模拟真实用户交互流程。

在端侧智能体执行过程中,需实时监测运行状态,对其界面输出、日志文件进行全量采集,利用截屏工具捕获可视化交互结果,并通过日志解析脚本提取后台运行参数、错误码等信息。该多维度数据采集体系能够完整记录智能体的执行轨迹,为风险分析提供依据,精准定位安全隐患触发节点。OCR处理聚焦智能体输出内容的文本化转化与解析,对执行过程界面截图、日志中的非结构化文本,运用OCR技术进行识别,涵盖复杂字体、特殊符号场景优化,确保文本提取准确率。

基于多模态大语言模型(Multimodal Large Language Model, MLLM)的评估环节,利用MLLM强大的视觉、语言理解能力对采集数据进行智能分析、风险研判。将OCR处理后的结构化文本、过程截屏、智能体相关输出、运行日志等输入到MLLM中,匹配安全风险类别规则,如歧视偏见、违法违规判定逻辑。模型对智能体输出内容以及行为进行意图识别、合规性校验,模拟人工专家逻辑,对复杂场景风险进行深度研判,输出风险概率、违规等级等评估结果,弥补传统规则检测的局限性,提升安全风险识别的智能化与精准度。

以上就是关于2025年AI智能体安全治理的分析。AI智能体的发展正在深刻改变生产生活方式,也伴随前所未有的风险与挑战。唯有在安全可信的前提下,智能体才能真正释放价值,推动技术进步与社会福祉。通过构建覆盖全链路的治理体系,凝聚产业、学界与监管合力,我们才能确保AI智能体在可控、可依赖的轨道上前行。未来需要从完善AI智能体安全治理顶层设计、夯实AI智能体安全技术能力、强化AI智能体前沿场景安全布局三个方面持续开展工作,共同推动AI智能体技术沿着安全、可控、可信的发展路径实现健康可持续发展。

编辑:666知识控
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至