2026年人工智能行业:Anthropic最强模型Mythos推出,重点推荐谷歌链

  • 来源:中信建投证券
  • 发布时间:2026/04/16
  • 浏览次数:71
  • 举报
相关深度报告REPORTS

人工智能行业:Anthropic最强模型Mythos推出,重点推荐谷歌链.pdf

人工智能行业:Anthropic最强模型Mythos推出,重点推荐谷歌链。核心观点:Mythos是Anthropic迄今最强模型,能力出现跃迁式增强,代码、推理与研究辅助全面领先前代。其在真实网络安全场景中优势最突出,不仅在Firefox漏洞利用任务中远超Opus4.6,还可发现并利用零日漏洞。此外,Mythos在生化研发及金融、AI训练、机器人等行业研发流程中也具备明显加速作用。虽然其总体对齐水平最好,但因能力过强,低频出错的风险半径更大,因此仅对核心客户开放。Anthropic背后由亚马逊、谷歌投资与算力供给,并在近期加强合作,2027年起TPU需求量达到3.5GW,谷歌TPU产业链有望持...

Claude Mythos:迄今最强大AI模型

Claude Mythos是Anthropic公司于2026年4月7日发布的最新旗舰模型,被公司称为“ 迄今最强大AI模型”,在软件工程、推理、计算机使用、知识工 作和协助研究等多个领域拥有远超以往训练过的任何模型的能力。特别的是,它展现了强大的网络安全技能,既可用于防御(发现并修复软件代码 中的漏洞)也可用于进攻(设计复杂的漏洞利用方法)。因此,与以往的公开发布策略不同,Mythos采取了受限访问模式,仅通过" Project Glasswing(玻璃翼计划)"向精选的12家科技巨头和40余家关键基础设施组织提供,而非面向公众开放。

Mythos在多项benchmark上大幅领先 Claude Opus 4.6:SWE-bench Verified在真实GitHub仓库里修复bug的能力93.9%(Opus 4.6为80.8%);SWEbench Pro更接近资深工程师日常面对的场景77.8%(Opus 4.6仅53.4%);SWE-bench Multilingual跨编程语言的代码修复能力87.3%(Opus 4.6为 77.8%)。

高价值定价:Mythos的API定价为$25/百万输入词元和$125/百万输出词元,是Claude Opus 4.6的5倍。

Mythos:后训练泛化能力大幅增强,“全能型模型”或成为未来趋势

强大的泛化能力:该模型并非专门为网络安全场景定制训练的专用垂直模型,在未接受专项代码安全训练的前提下,其通用智能的自然溢出使其在漏 洞挖掘、代码推理等核心安全场景中实现了跨代级提升。当模型参数规模和基础推理能力达到10万亿级别的阈值后,AI能够将底层的逻辑推演能力无 缝迁移至高度专业化的垂直领域,这颠覆了以往依赖海量垂直领域数据进行微调的传统技术路径,证明了AGI在解决极度专业化问题上的巨大潜力。

漏洞发现能力:1)历史深水区漏洞的精准挖掘。模型自主发现了隐藏极深的零日漏洞,包括OpenBSD中存在27年之久的远程崩溃漏洞、FFmpeg中存在 16年且曾躲过500万次自动化测试的越界写入漏洞。2)复杂攻击链的自主构造。在Mozilla Firefox 147 JavaScript引擎漏洞测试中,前代模型Opus 4.6在 数百次尝试中仅成功2次,而Mythos不仅成功开发出可用漏洞利用程序181次,还能稳定地将4个不同漏洞串联起来实现复杂的代码执行。3)真实环境 的深度渗透。Mythos成为首个能端到端打通私有网络靶场的模型,并成功完成了一项人类专家预计需耗时10小时以上的企业网络攻击模拟,具备对小 规模、弱防御企业网络执行自主端到端网络攻击的实战能力。

智能体自主性:Mythos在测试中展现出了初步的自主意识和极强的智能体能力,彻底改变了人机交互的范式。Anthropic的红队测试表明,该模型能够 在没有人类引导和干预的情况下,自主开发出可用的概念验证漏洞利用程序,但总体来说其安全性仍高于其他模型。

Claude Mythos:能力跃迁式增长,现有benchmark已逐步失效

能力增长曲线斜率拐点:Mythos不只是单项 benchmark 分数继续提升,而是能力曲线本身出现了明显“跃迁式”上移。右图显示,按 Anthropic 自身的 AECI 统一能力刻度测算,Mythos 相比此前几代模型的能力增长斜率明显更陡,已经不是线性外推可以解释的常规迭代。这意味着模型进步正在从“逐 步优化”走向“阶段性跳升”,其能力增量已开始超出传统经验框架。

benchmark正在逐步失效:现有 benchmark 对前沿模型的区分能力正在快速减弱。在AECI 评测框架下,多数 benchmark 的有效难度区间已落在 Mythos 当前能力水平以下,导致现有测试更多只能证明模型很强,却越来越难精确刻画其到底强到什么程度。这意味着前沿模型评估正在从“题目不够做” 转向“题目不够难”,benchmark 供给本身开始成为能力测量的瓶颈。

从产业视角看,这一变化的意义在于,未来模型竞争的重点将不再只是公开榜单上的分数差距,而是更贴近真实世界复杂任务的能力差异,包括长链 条推理、agent 执行、真实软件环境下的问题解决,以及对高风险场景的泛化能力。换言之,随着Mythos 这类模型把静态 benchmark 逐步刷完,行业评 估体系也将被迫升级,从标准化题库转向更开放、更动态、也更接近真实生产环境的评测方法。

Claude Mythos:Cyber能力极为强大,尤其是在真实场景中

发现27年的尘封漏洞: Claude Mythos 的网络安全能力已不再只是传统安全 benchmark 上的领先,而是在真实漏洞研究与利用场景中出现了明显跃迁。 Mythos 已能够在用户指示下识别并利用各大主流操作系统与主流浏览器中的zero-day漏洞,且发现的很多漏洞都极为隐蔽、难以检测。其中一个最有代 表性的案例,是其挖出了一个 已存在 27 年、且已被修复的 OpenBSD 漏洞;而 OpenBSD 本身恰恰以安全性著称,这说明 Mythos 的漏洞发现能力已不 只是“会做安全题”,而是真正触及到高隐蔽性、长周期沉积漏洞的真实研究层面。

真实场景能力一骑绝尘: 从图表看,Cybench这类公开网络安全 benchmark 已基本被前沿模型刷满,传统评测已越来越难刻画其真实上限;另一个真 实世界案例:Firefox 147 JavaScript shell 漏洞任务中Mythos和其他模型差距便迅速拉开。Mythos 的总成功率达到 84.0%,其中 72.4% 为完整漏洞利用成 功,远高于 Opus 4.6 的 15.2% 和 Sonnet 4.6 的 4.4%。即使去掉最关键的两个漏洞,Mythos 仍维持 85.2% 的总成功率,说明其优势并非依赖单点特例, 而是在更广泛的真实漏洞利用任务上均具备显著领先。

双用途属性过强,引发安全性担忧: Anthropic 还在 blog 中给出多个更强的漏洞利用例子,例如 Mythos 曾将 4 个浏览器漏洞串联,构造复杂的 JIT 堆 喷洒,成功逃逸渲染器与操作系统沙箱;也曾自主写出 FreeBSD NFS server 的远程代码执行利用程序,使未认证用户直接获得 root 权限。甚至没有正 式安全训练的工程师,也可以让 Mythos overnight 自动找出远程代码执行漏洞并生成可运行的利用程序。也正因为这种能力既可用于防御性漏洞挖掘, 也可能被用于进攻性网络攻击,Anthropic 最终没有选择向公众开放 Mythos,而是仅向少数核心防御伙伴提供访问。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至