9 月 1 日,Anthropic 发布了 Claude Fable 5.1 与 Claude Mythos 5.1。价格表上的数字没有变化,输入仍是每百万 token 10 美元、输出 50 美元,但这家公司把缓存读取的价格砍掉了 75%,由此带来的实际支出下降在典型场景约为 25%,在高度智能体化的任务里最高可达 45%。

省下来的钱来自缓存读取
在 Anthropic 的模型阵列中,Haiku、Sonnet、Opus 分别对应小、中、大三档,Fable 位于最上层,是 Claude 目前最强的模型。Fable 5 于今年 6 月上线,三个月后迎来这次 5.1 版本升级。
降价的机制值得单独说明。当模型重新读取此前已经处理并存储过的内容时,这一步被称为缓存读取,计费与处理全新输入是分开的。Fable 5 的缓存读取价格为每百万 token 1 美元,Fable 5.1 降至 0.25 美元。在智能体类任务中,一段代码库或一轮长对话会被反复读取,缓存读取往往占据总成本的大部分,因此这一项降价对账单的影响相当直接。Anthropic 分析了 8 月四周的真实使用数据后给出的结论是:常规工作负载整体成本下降约 25%,大量依赖缓存读取的自动化任务可省约 45%。
Anthropic 还表示,Fable 5.1 在低档或中档推理力度下,就能达到或超过 Fable 5 在更高档位时的表现,整体消耗的 token 也更少。推理力度共有 low、med、high、xhigh、max 五档,Claude Code 中默认使用 high,Claude Cowork 与 Claude.ai 中默认 medium。
科研类基准的跨度最大
按 Anthropic 公布的评测数据,涨幅最明显的是科研方向。在测试命令行环境下代理式科学调研能力的 Terminal-Bench-Science 0.1 上,Fable 5.1 得分 52.6%,Fable 5 为 24.7%,Opus 5 为 29.0%,OpenAI 的 GPT-5.6 Sol 为 22.4%。在代理式编码基准 Terminal-Bench 4.0 上,Fable 5.1 为 55.8%,Mythos 5.1 为 60.9%,Fable 5 为 42.0%,Opus 5 为 52.3%,GPT-5.6 Sol 为 37.3%。衡量业务工作流的 AutomationBench 从 17.1% 提升到 31.4%。
其余项目的提升幅度普遍在 2 到 4 个百分点区间:知识工作基准 GDPval-AA v2 由 1723 升至 1853;计算机使用基准 OSWorld 2.0 在宽松判定下由 72.9% 升至 77.9%,严格判定下由 36.1% 升至 41.7%;多学科推理基准 Humanity’s Last Exam 在不使用工具时由 57.8% 升至 60.9%,使用工具时由 63.8% 升至 65.0%;代理式编码基准 CursorBench 3.2.0 由 70.5% 升至 73.4%。
规格方面,100 万 token 的上下文窗口与 12.8 万 token 的输出上限保持不变,知识截止时间推进到 2026 年 6 月,比 Fable 5 晚了五个月。API 模型名为 claude-fable-5-1,Claude.ai、API、Amazon Web Services、Google Cloud 与 Microsoft 的云平台同步上线。
护栏放松了,但没全放
Fable 5 此前一个被反复提及的问题是过于谨慎:一旦察觉用户可能触碰安全边界,就把请求转交给 Opus 模型处理。Anthropic 称这次把护栏做得更精确,目标是减少对良性内容的误判,同时保持对真实威胁的拦截强度。
对使用 Claude Code 的开发者来说,最直接的变化是网络安全护栏在单次会话中的介入频率下降约 60%,并且模型现在被允许识别代码中的漏洞——这属于安全工作中的防御一侧。渗透测试、漏洞利用代码生成、扫描二进制文件寻找漏洞仍然不在允许范围内,这类请求继续转交 Opus 模型。生物方向的护栏也做了同样调整,对基础生物学和常见医疗问题的误触发减少了 85%,但生命科学研究类请求依旧走 Opus 5。Anthropic 称两家外部机构与测试公司 Gray Swan 对新护栏发起攻击,未发现关键性越狱。
Fable 5.1 与 Mythos 5.1 底层是同一个模型,区别只在护栏配置。Fable 5.1 面向所有付费计划与 API 账户开放;Mythos 5.1 仅通过受信任访问计划提供给经过审核的网络安全防御方与生命科学研究者,目前限于部分美国机构,Anthropic 未给出扩大开放的时间表。
两处容易被忽略的改动
一是反蒸馏限制。新建的 API 账户不能在保留模型思考记录的前提下手动修改 Claude 的历史消息,此举意在防止通过蒸馏方式把模型能力复制到竞争模型上。
二是水印。按照欧盟《人工智能法案》的要求,2026 年 8 月 2 日之后发布的模型输出会加入统计学水印,这是一个不可见的数值标记,用于判断某段文本由 Claude 生成的可能性,不改变文本内容,也不包含用户、组织或对话信息。随这次发布,Anthropic 向监管机构、执法部门、媒体、事实核查机构、独立研究者、教育机构等符合条件的组织开放了检测 API 的私有测试。
数据保留方面,两个模型均要求强制 30 天数据保留,零数据保留需要 Anthropic 的明确授权。
一份需要打折看的成绩单
Anthropic 一并放出了 22 家早期合作方的使用反馈。投资机构 Millennium 表示,Fable 5.1 定位到了一处百万分之一概率才触发的崩溃,原因是外部库的一个 bug,此前数年无人能解释。Cognition 称已将 Devin 中原本走 Opus 5 的流量转向 Fable 5.1,缓存读取降价让 Fable 级别的模型第一次显得经济。Browserbase 给出的数字是 10 分钟内完成 82% 的浏览器任务,Opus 5 为 74%,Fable 5 为 57%。Rogo 称在金融基准上保持与 Fable 5 相同的准确度,但少用 20% 的 token。
需要说明的是,这些案例由 Anthropic 挑选并发布,并非独立第三方测评。Anthropic 自己给出的使用建议也偏保守:先从 Opus 5 开始,只有当自有评测在更高推理力度下仍不达标时,再考虑升级到 Fable 5.1——毕竟后者的单 token 价格是 Opus 5 的两倍,运行速度也更慢。







