谷歌到底还算不算拥有前沿模型?这个问题在 9 月 10 日引发了一场隔空交锋。
AI 研究员伊森·莫利克(Ethan Mollick)当天在 X 平台发文称,谷歌已经不再拥有前沿模型,这意味着谷歌将错失数学领域以及网络安全领域。面对这一判断,谷歌 DeepMind 工程师洛根·基尔帕特里克(Logan Kilpatrick)直接下场反驳,给出的理由集中在网络安全这一具体赛道上。

一张嘴说不过数据:Cyber 版本的正面回应
基尔帕特里克表示,Gemini 3.8 Cyber 在许多网络安全测试、实际应用能力上已经超过了 Anthropic 的 Mythos。他同时透露,谷歌内部的 Chrome、Wiz 和 Cloud 团队已经广泛使用这款模型。
在后续表态中,基尔帕特里克进一步说明了谷歌的重心所在:让越来越多的网络安全防御人员拥有更强能力,而 Gemini 4 系列模型将继续推动前沿网络安全模型的发展。
这番回应的潜台词不难理解——”前沿”这个词本身涵盖面太宽,笼统下结论容易失真。在通用推理、数学等维度上,各家的排位随时在变;但在网络安全这种垂直能力上,谷歌认为自己手握明确的领先证据。
时间线:9 月密集发布的”安全双子”
这场争论的背景,是 9 月初模型厂商的一次密集出牌。
谷歌在 9 月 2 日发布了 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个版本。其中 Flash Cyber 是面向防御方的专用变体,主打自动发现漏洞和自动打补丁,仅在经过验证的安全团队和企业客户范围内开放使用,并针对威胁情报语料做了微调,同时训练了拒绝攻击性请求的行为。
据公开资料,Gemini 3.8 Flash 定价为每百万输入 Token 0.75 美元、输出 3.75 美元,价格与上一代持平;在 14 组基准评测中拿下 8 个第一;长程软件工程测试 DeepSWE v1.1 的得分从 Gemini 3.7 Flash 的 65.3% 提升到 71.0%;生成速度达到每秒 305 个 Token。在行业标准网络安全测试 CyberGym 上,谷歌称其展现出”前沿水平”。
Anthropic 方面则在 9 月 1 日推出了 Mythos 5.1,作为 Fable 5.1 的”可信访问”孪生版本。OpenAI 也预告过名为 Astra 的模型,称其将触发公司设定的关键网络安全阈值,但尚未正式发布。

通用模型 + 安全变体,正在成为行业套路
三家头部厂商在同一时间窗口内把动作集中在”安全专用模型”上,指向的是同一种产品思路:不再单独发布一个能力无差别的通用模型,而是同步推出通用版与安全专用版,用访问权限和安全策略把高能力变体圈在受控范围内。
对安全运营团队而言,这类变体的价值在于把威胁狩猎、日志关联、事件响应、从自然语言描述生成检测规则等过去依赖定制工具链的活儿,压缩成一次模型调用。而对厂商来说,这是一个更现实的平衡方案——不限制底层能力的外溢,而是在行为层做拦截,既回应了模型双用途风险的质疑,又保住了能力上限。
当然,各家目前都还没有给出 Cyber 变体的公开完整基准成绩,理由是不想给攻击者递上路线图。这也意味着外界很难像比较通用模型那样,用一张榜单直接判定谁更强——争论大概率还会继续。
回到最初的问题:谷歌有没有前沿模型?在网络安全这个细分战场上,DeepMind 显然认为自己有话要说。而真正的答案,或许要等到 Gemini 4 系列落地、几家的安全变体在同一套公开评测里正面对齐之后,才会清晰。







