在拉斯维加斯举行的 Black Hat 安全大会上,资深 Web 安全研究员 James Kettle 展示了历时数月的实验结果:当 AI 被推向极限时,它到底能在多大程度上独立发明全新的攻击方法?答案比”能”或”不能”都要微妙得多。

实验设计
Kettle 从 2025 年 9 月开始,使用 Anthropic 和 OpenAI 当时最新的模型进行实验。他最初希望探索 AI 的理论安全研究能力,但很快发现一个障碍:系统倾向于把已有研究包装成原创发现,返回的内容极其冷门、难以核实。于是他将测试范围收窄到自己精通的 Web 安全领域——这样他对材料有完全掌控,AI 无法糊弄他。他还将自己的研究方法论整理成训练数据喂给模型,以探测系统到底能在多大程度上自行外推。
意外发现:共享解析器混淆
实验中最具长期价值的发现是一种被命名为”共享解析器混淆”(Shared-Parser Confusion)的全新漏洞类别。其核心逻辑是:Web 服务器通常用同一套代码同时处理请求和响应,而请求是完全不可信的(可能包含任何内容),响应则是可信的。这意味着如果攻击者能让服务器把响应解析逻辑误用到请求上,就打开了一个巨大的攻击面。
这个假设并非 AI 独立证明的——它分析了若干已确认的真实漏洞后提出,由 Kettle 本人评估并确认。但他强调,即使给他文档中的单行提示,他自己也不会注意到这个模式;是人与 AI 的协作让这一发现成为可能。
人机协作的真实效率
随着实验推进和更强模型的发布,AI 产出研究线索的速度远超 Kettle 自己,形成了一个高效的研究反馈循环。”大概每两天就会有一个值得注意的新发现,甚至我都不用登录系统去看,”Kettle 说,”线索多到让我产生 FOMO(错失恐惧),迫使我把更多分析工作自动化。”
他在几个月内发现的已确认漏洞数量,靠自己可能需要数年才能达到。
结论
Kettle 的最终判断是:AI 在完全自主地构思新攻击路径方面的能力”或许刚刚起步,但极其有限”。然而,在关键节点配合人类指导和洞察力时,AI 是概念化和发掘新黑客策略的极强搭档。对于防御方而言,同样的逻辑同样适用——完全自动化的攻击循环要求真正全自动化的防御体系,而整个行业尚未到达那一步。
来源:WIRED / James Kettle(Black Hat 2026)







