六周第三款,谷歌押注”便宜够用”
美东时间 9 月 2 日,谷歌发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两款模型。这是谷歌在六周之内第三次推出 Flash 系列模型:3.6 Flash 于 7 月 21 日亮相,3.7 Flash 在 8 月 13 日跟进,3.8 Flash 则在 9 月 2 日到来,节奏稳定在约每三周一更。
两款模型共享同一底层智能,差异不在架构,而在用途与安全边界。标准版 3.8 Flash 被谷歌定位为通用”主力”模型,面向智能体任务、软件开发和多步推理;3.8 Flash Cyber 则在相同底座上针对漏洞发现与修复做了专门调优,替代了此前的 3.5 Cyber 版本,目前仅向可信测试者与政府机构开放(Fairwind 计划)。
价格维持不变,单位成本更低
在价格上,谷歌将 3.8 Flash 的引导价维持在与 3.7 Flash 相同的水平:每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,优惠持续至 2026 年底;届时常规价将翻倍至 1.5 美元与 7.5 美元。相较之下,Claude Opus 5 的输入、输出单价分别为 5 美元与 25 美元,GPT-5.6 Sol 为 4 美元与 20 美元。
规格方面,3.8 Flash 的上下文窗口为 1,048,576 token,与前代一致;最大输出 65,536 token;支持文本、图像、音频、视频输入与文本输出;思考档位为 LOW、MEDIUM、HIGH,默认 MEDIUM,且不再支持 MINIMAL 档位(设置会触发 API 校验错误)。
编程跑分逼近旗舰
谷歌给出的官方基准显示,3.8 Flash 在多数测试上较 3.7 Flash 略有提升,在编程类评测上提升更明显。在长程软件工程基准 DeepSWE v1.1 上,3.8 Flash 取得 73.7%,高于 3.7 Flash 的 65.3%,也超过 GPT-5.6 Sol 的 72.7% 与 GPT-5.6 Terra 的 69.6%,仅略低于 Claude Opus 5 的 74.0%;在 Terminal-Bench 2.1 编程任务上约为 90.8%,高于 GPT-5.6 Terra 的 87.4% 与 Claude Sonnet 5 的 80.4%;在多学科测试 HLE-Verified 上取得 54.9%。该模型已登上 DeepSWE 榜单首位,且以当前折扣单价计算成本更低。
不过在”电脑操作”这类任务上,3.8 Flash 虽然在 OSWorld-2.0 测试中较 3.7 Flash 有改善,仍远落后于市场领先的 Claude Opus。
安全版瞄准自动修复
3.8 Flash Cyber 面向网络安全防御:谷歌称其在 CyberGym 基准上达到前沿水平,跨 20 种编程语言的内部漏洞发现率超过 70%;在 CWE-Bench 自动修复基准上 pass@1 为 47.2%,与某前沿模型的 47.8% 接近持平。Chrome 安全团队借助该模型将补丁准确率提升 2.6 倍;谷歌云漏洞研究团队曾在两小时内借助它发现一个严重漏洞;安全厂商 Wiz 的测试显示其召回率高 7.5 至 9.7 个百分点,而成本仅为对照的 1/2.3 至 1/5.2。
可用范围与背景
3.8 Flash 即日起登陆 Gemini API、AI Studio、Antigravity、Android Studio 与 Gemini Enterprise;在 Gemini App 中需 Pro 或 Ultra 订阅,AI Studio 可免费试用。3.8 Flash Cyber 则仅限可信测试者与政府使用。
值得注意的背景是,谷歌自 2026 年初便未再发布前沿级的 Gemini 3.5 Pro,转而用高速、低价的 Flash 系列抢占开发者默认模型的位置。据第三方评测机构 Artificial Analysis,3.8 Flash 综合智能指数约 59 分,与智谱 GLM、月之暗面 Kimi 等中国模型处在同一档位——这也折射出”小模型加高性价比”路线正在全球范围内升温。








