跳到正文

目录

Claude Mythos 挖出 27 年老漏洞,AI 安全研究正在被重新定义

2026 年 4 月,Anthropic 发布了一份 244 页的系统卡,附一个 7 分钟宣传视频。视频里 Nicholas Carlini 说出一句话,让安全圈炸锅:「过去几周发现的漏洞,比我这一辈子之前发现的加起来还多。」

他说的是用 Claude Mythos Preview 做的安全研究。这个模型没有专门训练网络安全,训练的是编程——能力到了某个量级,安全研究就自然跟了上来。

模型在 OpenBSD 里找到一个藏了 27 年的远程崩溃漏洞,在 Linux 内核里找到多条可串联的提权路径,还把 Firefox 的漏洞利用成功率从前代的不到 1% 拉到 72.4%。能力太强,Anthropic 不公开模型,只通过 Project Glasswing(玻璃翼计划)向 12 家合作机构提供受限访问。

本文把 Anthropic 官方系统卡、视频披露和第三方验证放在一起,看 AI 安全研究走到了哪一步。


模型能力为什么突然够用了

Dario Amodei 在视频里把 Mythos Preview 定位为「指数曲线上一个特别大的跃升」。下表的差距能说明为什么值得这么评价。

基准测试Mythos PreviewOpus 4.6差距
SWE-bench Verified93.9%80.8%+13.1%
SWE-bench Pro77.8%53.4%+24.4%
CyberGym(漏洞复现)83.1%66.6%+16.5%
USAMO 2026 数学竞赛97.6%42.3%+55.3%
Firefox JS exploit 成功率72.4%<1%~80 倍

表格里最值得看的是最后一行。Anthropic 红队报告显示,在 Firefox JavaScript Shell 的漏洞利用测试中,Mythos Preview 在 250 次尝试里成功生成了 181 个可运行的 exploit(漏洞利用程序),另有 29 次拿到了寄存器控制。同样是这个任务,Opus 4.6 做了几百次尝试,只成功了 2 次。

Anthropic 没有专门训练 Mythos 做网络安全。Dario 在视频里说:「我们训练它擅长编程,但擅长编程的副产品是,它在网络安全方面也非常出色。」代码理解能力到了足够深的程度,漏洞识别和安全研究就成了自然延伸。


三个已确认的漏洞案例

官方披露了三个具体案例,都有第三方验证或 CVE 编号。

OpenBSD 27 年远程崩溃漏洞

OpenBSD 以安全著称,广泛用于防火墙和关键基础设施。Mythos 在它的 TCP 协议栈里找到一个漏洞,攻击者只需向任意 OpenBSD 服务器发送几段数据就能让它崩溃。这个漏洞在代码里藏了 27 年,从 OpenBSD 项目早期就一直存在。

FFmpeg 16 年隐藏 bug

FFmpeg 被几乎所有视频相关软件使用。Mythos 在其中找到一行逻辑漏洞代码,此前自动化测试工具曾对该行代码扫描超过 500 万次,全部无功而返。这个 bug 存在了 16 年。

FreeBSD 远程代码执行(CVE-2026-4747)

这个案例细节最丰富。FreeBSD 的 NFS 内核模块里有一个栈缓冲区溢出漏洞,Mythos 完全自主走完了从漏洞发现到 exploit 开发的完整流程——搭建测试环境、设计 15 轮数据包分片攻击方案、用 De Bruijn 序列精确计算栈偏移量、从内核上下文创建新进程并过渡到用户空间。整个过程约 4 小时,没有人类干预。

CVE-2026-4747 的安全公告里,致谢栏写着「Nicholas Carlini using Claude, Anthropic」。


漏洞链构建:从单点到串联

传统安全研究靠人工逐个发现漏洞,再凭经验判断能否串联。Mythos 的不同在于,它能自动识别多个漏洞之间的关联,构建攻击链。

Nicholas Carlini 在视频里解释了这一点:「你发现了两个漏洞,单独看都不算什么。但这个模型能够利用三、四个甚至五个漏洞组合出攻击链,按顺序执行后达成某种非常复杂的最终效果。」

Linux 内核上的提权就是典型案例。Mythos 自主发现多个竞态条件漏洞,把它们串联起来,从一个没有任何权限的普通用户,一路提升到管理员。这种能力在传统安全测试里需要资深研究员数周甚至数月。


为什么不公开发布模型

Anthropic 的做法是:不公开模型,只通过 Project Glasswing 向合作伙伴提供受限访问。

理由很直接。Mythos 在所有主流操作系统和所有主流浏览器中都发现了数千个零日漏洞,Firefox 的 exploit 成功率是 72.4%。如果模型落入恶意行为者手中,这些漏洞的武器化速度会远超防御方的修复能力。

Anthropic 研究员在视频里的原话:「显然,这样的模型如果落入不当之手,其能力可能造成危害,因此我们不会大范围发布这个模型。」

Project Glasswing 的合作方包括苹果、亚马逊、微软、谷歌、Linux 基金会等 12 家核心机构,以及约 40 家扩展组织。Anthropic 为此投入了 1 亿美元模型使用额度,并拿出 400 万美元支持开源安全项目。

OpenSSF(开源安全基金会)代表在视频里说:「通过让这些软件开发者率先获得先进工具,这为我们所有人赢得了集体性的先发优势。」


防御端的压力在变大

Mythos 的能力提升,意味着攻防两侧的时间窗口被剧烈压缩。

传统安全流程里,从漏洞发现到补丁部署,行业惯例是给企业 60 天缓冲期。这个假设的基础是:攻击者也是人,人的速度有极限。但 AI 可以在 4 小时内完成从漏洞公告到可运行 exploit 的完整流程。

Anthropic 在 2026 年 5 月的进展通报中披露,Project Glasswing 首月已在合作方提交的软件中标记出超过 1 万个高危和严重级别漏洞。瓶颈已经从「发现漏洞」转向「验证、披露与修补漏洞」。Cloudflare 报告称,其关键路径系统里发现了 2000 个缺陷,其中 400 个属于高危或严重级别,Mythos 的误报率甚至优于人类测试人员。Mozilla 在 Firefox 150 中修复了 271 个漏洞,是使用 Opus 4.6 测试时的 10 倍以上。

Dario 在视频里说:「这不是几周的项目就能完成的事,这将是几个月、甚至可能几年的工作。但我希望最终我们能达到这样一个状态:世界的软件、客户数据、金融交易和关键基础设施,都比以前更加安全。」


争议与边界

视频评论区的质疑集中在三处。

第一个是「不公开模型就是不透明」。这个批评有一定道理,但 Anthropic 的回应逻辑是:不公开的是模型权重,而不是漏洞信息。所有发现的漏洞都走负责任披露流程,修复后再分批公开技术细节。目前已有 1094 个高危或严重漏洞完成人工复核确认,其中 62.4% 被确认为真实漏洞。

第二个是「AI 挖漏洞是不是让黑客更危险了」。Project Glasswing 的设计恰恰是让防御方先拿到能力。Dario 的判断是攻防天平会往防御倾斜——前提是,防御方必须跑得比攻击方快。

第三个是「27 年老漏洞被挖出来,是不是说明开源不安全」。恰好相反。老漏洞一直都在,只是以前没有工具能系统性排查。能被批量揪出并修复,反而是开源可审计性的胜利。


还没答案的问题

围绕这次披露,有几件事目前没人能给出确定答案。

一是透明度边界。漏洞细节公开到什么程度、何时公开、社区响应机制怎么建,都还在摸索中。

二是访问控制。「有限发布」的边界在哪,合作伙伴怎么筛选,退出机制有没有,这些会影响 Project Glasswing 的长期可信度。

三是能力不对称。白帽和黑帽的 AI 能力差距会怎么演变,小型组织怎么获得防护,全球安全格局会不会因此加速分化。

Anthropic 前沿红队负责人 Logan Graham 在系统卡里写了一句:「在未来 6 至 24 个月内,这类能力将变得随处可见。」


读者判断

  • 想了解 AI 安全研究整体的研究者,读本文就够了:事实、引语、第三方验证都已在文中核对过。
  • 想知道具体漏洞细节、复现步骤,或评估 Project Glasswing 的可信度,建议回到 Anthropic 官方系统卡和视频原文,那里有案例的技术细节和完整披露时间线。
  • 想看 Carlini 和 Dario 的原话、演示画面和采访完整节奏,去官方 7 分钟视频,本文只保留了其中的核心引语和结论。
  • 本文只整理了公开信息,能确认的是「模型能力、漏洞数、项目形态」这些事实;系统卡里涉及的模型内部机制和未披露环节,超出本文范围。

参考资料

本文基于 Anthropic 官方系统卡、Project Glasswing 官方页面及公开报道整理。Claude Mythos Preview 与 Project Glasswing 均为 Anthropic 2026 年 4 月公开发布的计划与模型。

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。