
2026 年 9 月 1 日至 3 日,OpenAI、Anthropic、Google、Meta 四家实验室在不到三天内接连发布新模型,摆明了是同一场军备竞赛的四个选手。没有一款全能,但每一款都有一项”碾压级”的主场。本文基于四家官方发布数据与 Artificial Analysis 等第三方基准,对比 GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash 与 Meta Muse Spark 1.3,并给出选型建议。
GPT-6 Astra:通用智能断层领先,但盲测反差明显
OpenAI 于 9 月 3 日发布 GPT-6 Astra。在最考验通用智能的测试上,它近乎满分:ARC-AGI-3 得分 99.9%,FrontierMath Tier 4 达 97.6%,ExploitBench 100%。操作电脑方面,OSWorld 2.0 拿到 72.6%,完成任务时间比上代减少 47%。
但它的盲测表现出现明显反差:在 LMArena 文本盲测中,gpt-6-astra-max 仅 1441.83 分,比上一代 GPT-5.5 high 的 1470.85 还低,公司榜上甚至挤不进前十。这说明盲测偏好”聊得舒不舒服”,而 Astra 的强项在”活干没干完”。其 API 标准定价为每百万输入 token 10 美元、输出 50 美元,是四款中最贵的;网络安全等高级能力受限,仅向受信任组织开放(Daybreak Access 计划)。它还是 OpenAI 首个达到”关键”级网络安全阈值的模型。
Claude Fable 5.1:编程与长程 Agent 最能打
Anthropic 在 9 月 1 日率先开场。Fable 5.1 主打长程、高风险的智能体任务,在衡量 Agent 式编程的 Terminal-Bench 4.0 上拿到 55.8%,其”安全版”Mythos 5.1 高达 60.9%;在 Agentic 科研(Terminal-Bench-Science)上,52.6% 是上一代(24.7%)的两倍多。有案例显示它能连续自主跑 38 小时处理机器学习任务,中途自己发现数据标签问题并修正方案。
LMArena 公司榜上,Fable 5.1 Max 以 1510.46 分守住第一,领先第二名约 16 分。Anthropic 将缓存读取价格下调 75%,典型工作负载成本约降 25%、重度 Agent 场景最高降 45%。它与 Claude Code、Claude Cowork 配合,是开发者上手最直接的选项。
Gemini 3.8 Flash:性价比之王
Google 在 9 月 2 日推出 Gemini 3.8 Flash,是六周内第三个 Flash 版本。它主打软件工程与智能体,Terminal-Bench 2.1 达 90.8%。定价极具杀伤力:每百万输入 token 0.75 美元、输出 3.75 美元(该优惠价有效期至 2026 年 12 月 31 日,此后翻倍),并支持 100 万 token 上下文。Google 同时发布 Gemini 3.8 Flash Cyber,专用于检测软件漏洞与生成补丁,仅通过 Fairwind Program 向”可信防御者”开放。
Meta Muse Spark 1.3:开源潜力股
Meta 超级智能实验室(MSL)于 9 月 2 日发布 Muse Spark 1.3,支持文本、图像、视频、文件输入,上下文窗口超过 100 万 token。相比 1.2,同样任务约少用 20% 工具调用与 25% token。标准定价为每百万输入 1.25 美元、输出 4.25 美元;同意将提示用于训练的开发者可享 0.10/0.20 美元的”贡献者”低价。Meta 同步开源 30B 的 Muse Glimmer 权重(Apache-2.0),并把个人智能体 Muse 推向市场,可自主开浏览器、填表单、替用户砍价。
四强横向对比
| 维度 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash | Meta Muse Spark 1.3 |
|---|---|---|---|---|
| — | — | — | — | — |
| 发布 | 9 月 3 日 | 9 月 1 日 | 9 月 2 日 | 9 月 2 日 |
| 编程/Agent 强项 | OSWorld 72.6% | Terminal-Bench 55.8% | Terminal-Bench 2.1 90.8% | 轻量多模态 Agent |
| 通用智能 | ARC-AGI-3 99.9% | 综合指数领先 | 轻量快跑 | 开源可本地 |
| 输入价(美元/百万) | 10 | 10(缓存读降 75%) | 0.75 | 1.25 |
| 输出价(美元/百万) | 50 | 50 | 3.75 | 4.25 |
| 可得性 | 灰度+受限 | 全面开放 | Google 生态 | 等开源权重 |
怎么选:直接对号入座
要通用智能的极限、预算不敏感、做企业级高价值任务,选 GPT-6 Astra,但要接受灰度与 2.5 倍定价。写代码、跑 Agent、做知识工作,选 Claude Fable 5.1,长程执行能力本轮最强且现在就能用。预算有限、要量大管饱的日常推理与 Agent,选 Gemini 3.8 Flash,0.75 美元的输入价太能打。想白嫖、能等,选 Meta Muse Spark 1.3,等开源权重落地后本地跑近乎零成本。
本轮发布本质上是”旗舰性能开始下放”——编程与 Agent 不再是顶配专属,便宜的 Flash 也能干,开源的 Spark 也快来了。真正受益的是普通用户。
本文基于 OpenAI、Anthropic、Google、Meta 官方发布信息及 Artificial Analysis、Dutch Startup 等第三方基准整理。







