2025年AI安全指数分析:全球领先AI公司安全治理能力全景透视
- 来源:其他
- 发布时间:2025/12/08
- 浏览次数:306
- 举报
未来生命研究所:2025年冬季全球AI安全指数报告(英文版).pdf
生命未来研究所的人工智能安全指数对八家知名人工智能企业在应对先进人工智能系统所带来的即时危害及灾难性风险方面所做出的努力进行了独立评估。这项由一群杰出的人工智能研究专家与治理专家组成的评审团队共同完成的第三次评估显示,整个行业在应对自身技术发展的快速进步方面仍面临诸多挑战:在风险管理与安全规划方面存在严重缺陷,这些缺陷正在威胁我们控制那些日益强大的人工智能系统的能力。
随着人工智能技术的飞速发展,AI安全已成为全球关注的焦点。2025年冬季版的AI安全指数对全球8家领先AI公司进行了全面评估,涵盖风险识别、当前危害、安全框架、治理问责、信息共享和存在性安全等六大维度。本报告基于详细的评估数据,深入分析各公司在AI安全治理方面的表现差异、行业发展趋势以及未来面临的挑战。
从评估结果来看,AI安全领域呈现出明显的梯队分化。Anthropic、OpenAI和Google DeepMind组成第一梯队,在多个维度表现领先;Meta、xAI处于中间位置;而中国的DeepSeek、Z.ai和阿里巴巴云则在安全框架和治理体系方面相对滞后。这种分化不仅反映了各公司对AI安全重视程度的差异,也揭示了全球AI治理发展的不均衡态势。
一、风险识别与评估能力呈现显著差异
在风险识别领域,各公司的表现差异最为明显。Anthropic、OpenAI和Google DeepMind建立了相对完善的风险评估体系,而其他公司则存在明显短板。
Anthropic在风险评估方面表现最为突出,其负责任扩展政策(RSP)定义了明确的能力阈值和风险建模机制。公司对CBRN(化学、生物、放射性和核武器)风险和自主AI研发风险进行了系统评估,采用多层次的威胁建模策略,包括能力评估、部署保障和安全保障三个层面。特别是在生物风险领域,Anthropic进行了长形式病毒学任务、多模态病毒学、DNA合成筛选规避等全面测试,评估范围覆盖从低专业度行为者执行生物威胁工作流程到高级或国家层面生物研发加速等不同风险等级。
OpenAI的风险评估体系同样值得关注。该公司使用结构化风险评估流程来评估前沿AI能力是否会导致严重伤害,将已识别风险分为跟踪类别(目前包括生物和化学、网络安全、AI自我改进)和研究类别(包括远程自主性、核与放射性)。评估范围涵盖Capture-the-Flag挑战、网络靶场、规避和网络攻击模拟等多个方面,采用自动化测试、人工审查和用户反馈机制相结合的方法论。
Google DeepMind的风险评估框架最近更新至3.0版本,将误用风险扩展到有害操纵领域,并对齐风险增加了欺骗性对齐测试。其评估范围包括现有的Capture-the-Flag挑战、关键技能基准测试等,采用思维链推理和反思循环等支架来增强上下文利用能力。
相比之下,中国公司的风险评估透明度明显不足。DeepSeek、Z.ai和阿里巴巴云均未公开详细的安全框架或风险评估流程。虽然这些公司参与了国家AI安全标准的制定,但在具体风险评估方法论和结果披露方面较为有限。这种差异部分源于中美不同的监管环境,但也反映了公司在安全治理理念和实践成熟度上的差距。
从行业整体来看,风险评估仍面临诸多挑战。即使是最领先的公司,在气候相关或环境相关风险评估方面也存在空白,没有公司对AI失控或对齐失败的概率进行定量估计。在生物安全等重点领域,多数公司仍停留在任务特定测试层面,缺乏对潜在知识启发、对抗条件或真实世界部署环境的深入评估。
二、当前危害控制能力普遍不足,基准测试表现参差不齐
在当前危害控制方面,所有公司都表现出明显的不足。评估显示,即使是最先进的AI模型,在安全性基准测试中也频繁出现故障,在真实性、公平性和有害内容生成等方面的稳健性表现不佳。
斯坦福HELM安全基准测试结果揭示了各公司的安全性能差异。Anthropic的Claude Sonnet 4.5以0.97的平均分领先,OpenAI的GPT-5以0.98紧随其后,Google DeepMind的Gemini 2.5 Pro和Meta的Llama 4 Maverick均为0.91,xAI的Grok-4仅为0.84。在HarmBench(越狱抵抗)子测试中,分数差异更加明显:Anthropic为0.92,OpenAI为0.98,而Google DeepMind和Meta均为0.66左右,xAI低至0.40。这些数据表明,即使是顶级模型在面对针对性攻击时也存在明显脆弱性。

隐私保护方面的问题尤为突出。评估发现所有模型默认使用用户交互数据进行训练,这种做法使用户面临重大风险,因为交互过程中共享的敏感信息可能被后续检索。值得关注的是,Anthropic原本是唯一默认不使用交互数据进行训练的公司,但在2025年8月改变了政策,导致其得分降低。
水印技术实施情况呈现出地域特点。中国公司遵守要求显性和隐性水印的强制性国家标准,评审专家称赞这种基础保障措施。Google的水印实践也受到好评,尽管有评审专家对其"决定不向用户提供水印功能"表示担忧。相比之下,其他公司在水印技术应用方面相对滞后。
在安全框架透明度方面,Anthropic、Google DeepMind和OpenAI提供了最结构化的方法,概述了风险领域、定性阈值和缓解措施。特别是Google DeepMind的框架因扩展至包括有害操纵和错位风险,并引入早期预警评估以保持安全缓冲而受到评审专家称赞。Meta的框架以基于结果的阈值和更清晰的风险建模细节而著称,但其风险覆盖范围仍然较窄,暂停开发的治理路径未定义。
中国公司中,除Z.ai外,DeepSeek和阿里巴巴云没有发布任何安全框架。评审专家承认Z.ai在安全团队建设方面的投入,承诺在安全测试确定模型超过"不可接受风险"阈值时向监管机构披露系统提示。这表明中国公司正在建立安全体系,但整体成熟度与欧美领先企业存在差距。
三、治理问责机制成为安全体系的关键短板
治理与问责是AI安全的核心环节,但评估显示各公司在此领域的表现差异最大,且整体水平不容乐观。
公司结构与使命承诺方面,Anthropic和OpenAI采用了非常规的治理结构。Anthropic是特拉华州公益公司,其"长期利益信托"有权在4年内选择和罢免大部分董事会成员,逐步根据时间和资金里程碑增加权力。OpenAI最初作为非营利组织成立,后纳入有利润上限的营利性子公司,非营利组织控制营利实体并合法追求"确保人工通用智能造福全人类"的使命。这种结构旨在平衡使命与商业成功,但OpenAI在2025年有争议的重组虽保留了非营利部分作为OpenAI基金会,营利性部分成为公益公司,仍引发了对治理有效性的质疑。
举报人保护政策的实施情况参差不齐。OpenAI是唯一拥有面向公众的举报政策的企业,Anthropic表示计划很快发布相关政策。Google DeepMind虽然没有公开的举报政策,但基于调查回应中的详细披露获得了最高的治理质量评估。Meta没有公开的举报政策,其《行为准则》在内部实践方面透明度有限,但提到了第三方运营的Integrity Line。中国公司普遍没有公开的举报政策,但阿里巴巴云的《道德规范》表明员工有 established 的渠道报告问题。
决策权威的集中度引发评审专家担忧。在OpenAI,开发和部署决策最终由公司领导层决定,尽管安全咨询小组提供建议,董事会的安全与安全委员会提供监督。对于Google DeepMind,框架引用了几个在达到警报阈值时审查和批准行动的内部机构,但仍不清楚这些小组各自具有什么专业知识、如何做出决策以及是否有任何机构具有独立于执行领导层停止部署的权力。
在安全框架执行方面,各公司的透明度差异明显。Anthropic、OpenAI和Google DeepMind在治理和问责方面领先行业,而其他营利性公司明显落后。xAI在2024年5月悄悄修改了公司章程,终止了其公益公司地位,但在2024年11月向法院提起诉讼时仍自称"内华达州公益公司",这对公司治理的稳定性和透明度提出了疑问。
从行业整体来看,治理问责机制的建设仍处于初级阶段。即使是最领先的公司,在独立监督、决策透明度、问责机制等方面都存在明显不足。这表明AI行业的治理体系尚未成熟,需要进一步加强内部控制和外部监督。
四、信息共享与公共讯息策略呈现多元化特征
在信息共享和公共讯息传递方面,各公司表现出不同的策略取向,从高度透明到相对封闭不等。
Anthropic和OpenAI在信息共享方面领先。Anthropic在透明度方面表现尤为突出,发布了系统提示,提交了HAIP合规报告,签署了行为准则,并公开支持加州的SB 53法案。OpenAI同样定期更新详细的模型规范,并积极参与国际自愿性透明度和安全努力,不过因其直接和间接反对SB 1047等立法提案以及支持联邦先占州AI法案而得分降低。
Meta在此领域得分最低,其领导层公开驳斥AI存在性风险的记录,并积极游说反对关键监管倡议,包括SB 1047、欧盟AI法案和纽约RAISE法案。这种对抗性立场与行业整体向更多监管和透明度发展的趋势形成鲜明对比。
中国公司的得分相对较低,主要原因是公司领导层和企业渠道的公共沟通有限。不过评审专家承认Z.ai领导层对FLI超智能声明的公开认可,赞扬DeepSeek和阿里巴巴云对国家AI安全标准的贡献,并承认中国法规规定了强制性事件报告义务,加强了基线透明度。
技术规范披露方面,系统提示透明度成为重要指标。Anthropic自2024年8月起公开分享Claude.ai网络界面和移动应用程序的系统提示,并承诺在线记录对这些提示的更改。xAI通过其公开的Github存储库定期发布其Grok产品套件使用的系统提示全文,在GNU Affero通用公共许可证v3.0下可公开检查和重用。相比之下,其他公司没有公开其前沿模型的系统提示。
在自愿承诺方面,各公司的参与程度也不相同。Anthropic、OpenAI、Google DeepMind和Meta签署了2024年5月AI首尔峰会的前沿AI安全承诺,xAI和Z.ai也随后签署,而DeepSeek和阿里巴巴云未签署。在欧盟AI法案行为准则方面,Anthropic、OpenAI、Google DeepMind和xAI(仅安全与安全章节)已签署,Meta拒绝签署,中国公司没有公开立场。
重大事件报告和政府通知机制逐步建立。Anthropic承诺如果模型需要比ASL-2标准更强的保护,将通知相关美国政府机构。Google DeepMind致力于与适当的政府机构分享相关信息。中国公司则必须遵守《生成式人工智能服务管理暂行办法》第十四条,建立面向政府的事件报告系统以进行信息完整性合规。
以上就是关于2025年全球AI安全指数评估的全面分析。从评估结果可以看出,AI安全治理领域呈现出美中两极分化的格局,美国公司在安全框架成熟度、透明度等方面整体领先,中国公司则在国家标准合规方面表现较好但自主安全体系建设相对滞后。
行业面临的核心挑战在于,即使是最领先的公司,在风险评估完整性、危害控制有效性、治理问责机制等方面仍存在明显不足。随着AI技术向更强大方向发展,安全治理体系的建设需要跟上技术发展的步伐,这需要企业、监管机构、学术界和社会各界的共同努力。
未来AI安全治理的发展趋势将更加注重实际效果而非形式承诺,强调可验证的安全措施而非抽象原则,加强国际合作与标准协调。只有建立真正有效、透明、可信的安全治理体系,才能确保人工智能技术真正造福人类。
编辑:666知识控-
标签
- AI安全
- 相关标签
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 中国2026年展望:探索新动能.pdf
- 9 2026年政府工作报告.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 6 房地产行业专题报告:城市更新推动高质量发展.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 9 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 2026年中期医药生物行业投资策略:AI新药加速推进
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年7月A股回调归因与底部布局策略分析
- 2 2026年上半年小红书六大热门行业消费趋势洞察
- 3 2026上半年小红书六大热门行业消费数据洞察
- 4 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026年8月投资组合报告:从极致抱团到均衡修复
- 9 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
- 10 2026上半年国内AI剧漫剧行业数据报告
