先给预算结论:按 Anthropic 直接 Claude API 的标准费率,Opus 5 的新鲜输入、输出和缓存写入价格都是 Fable 5.1 的一半;Fable 5.1 只有缓存读取这一项更便宜,价格是 Opus 5 的一半。因此,普通对话、一次性分析或缓存命中不高的任务,Opus 5 通常账单更低。Fable 5.1 只有在重复读取的上下文足够多,或者它确实用更少 token、更少重试完成同一项工作时,才可能降低每个合格结果的成本。
截至 2026 年 9 月 4 日,Anthropic 也把 Opus 5 作为多数工作负载的起点。Fable 5.1 更适合高难推理和长时间 Agent,尤其是 Opus 5 提高 effort 后仍达不到你的验收线时。这个顺序比“直接上最强模型”更容易控制预算。
四款当前模型先按任务缩小范围
Anthropic 当前模型总览列出的主阵容是 Fable 5.1、Opus 5、Sonnet 5 与 Haiku 4.5。四款都支持文本与图片输入、文本输出、多语言、视觉和工具调用,但速度、上下文和费率不同。
| 模型 | Claude API ID | 标准输入 / 输出 | Context / 最大输出 | 官方相对速度 |
|---|---|---|---|---|
| Haiku 4.5 | claude-haiku-4-5-20251001 | $1 / $5 | 200K / 64K | 最快 |
| Sonnet 5 | claude-sonnet-5 | $2 / $10 | 1M / 128K | 快 |
| Opus 5 | claude-opus-5 | $5 / $25 | 1M / 128K | 中等 |
| Fable 5.1 | claude-fable-5-1 | $10 / $50 | 1M / 128K | 较慢 |
表内单位是每百万 token 的美元标准价。它不是 Claude Pro、Max 或 Claude Code 的订阅额度,也不代表 Amazon Bedrock、Google Cloud、Microsoft Foundry 或第三方网关的最终价格。
如果任务边界清楚、失败能被自动发现,Haiku 4.5 适合高吞吐分类、抽取和短摘要。Sonnet 5 给日常编码、数据处理、内容和工具任务留出更宽的性能与价格区间。错误代价高或任务需要长期自主运行时,可以先用 Opus 5 建立能力基线。只有这个基线仍不足,才值得把 Fable 5.1 加入同条件对照。
Fable 5.1 与 Opus 5 的价格差在缓存读取
Claude API 当前价格表把缓存写入和读取分开计费:
| 每百万 token,USD | Fable 5.1 | Opus 5 | 更低的一方 |
|---|---|---|---|
| 新鲜输入 | $10 | $5 | Opus 5 |
| 输出 | $50 | $25 | Opus 5 |
| 5 分钟缓存写入 | $12.50 | $6.25 | Opus 5 |
| 1 小时缓存写入 | $20 | $10 | Opus 5 |
| 缓存读取 | $0.25 | $0.50 | Fable 5.1 |
| Batch 输入 / 输出 | $5 / $25 | $2.50 / $12.50 | Opus 5 |
Prompt caching 不是把所有输入自动变成 $0.25。根据 Anthropic 的缓存说明,第一次处理稳定前缀时会产生缓存写入;后续请求只有在前缀保持一致且缓存仍有效时才按读取价计费。默认有效期是 5 分钟,也可以付更高写入价使用 1 小时缓存。工具定义、system 和 messages 的前缀发生变化,都可能让预期的缓存命中消失。
另一个容易混淆的价格是 Opus 5 fast mode。它是 Claude API 的 research preview,输入/输出为 $10/$50,换取更低延迟;这不是标准 Opus 5 的 $5/$25,也不能与 Fable 5.1 标准模式混成同一组比较。
用一个临界式判断缓存是否足够多
如果两款模型消耗的各类 token 数完全相同,可以直接算出缓存读取要多到什么程度,Fable 5.1 的 token 账单才会更低。
设以下数值都以“百万 token”为单位:
I:没有命中缓存的新鲜输入;O:输出;W5:写入 5 分钟缓存;W1:写入 1 小时缓存;C:从缓存读取的输入。
两款模型的标准费用分别是:
Fable = 10I + 50O + 12.5W5 + 20W1 + 0.25C
Opus = 5I + 25O + 6.25W5 + 10W1 + 0.50C
把两式相减,Fable 更便宜的条件是:
C > 20I + 100O + 25W5 + 40W1
这条线很高。假设一项任务产生 10 万新鲜输入和 2 万输出,没有新的缓存写入,那么缓存读取要超过 400 万 token,Fable 的纯 token 账单才可能低于 Opus。若只读取 150 万缓存 token,Fable 约为 $2.38,Opus 约为 $1.75;若读取 600 万,Fable 约为 $3.50,Opus 约为 $4.00。加入缓存写入后,Fable 需要更多后续读取才能摊薄首次写入成本。
这个例子只解释价格表,不预测模型行为。Fable 与 Opus 可能生成不同长度的答案、调用不同次数的工具,甚至以不同重试次数完成任务。真正的账单要使用各自 response usage 中的实际数量。

为什么 Devin 会测到 Fable 单任务更便宜
Cognition 在 Devin 的 Fable 5.1 报告中公布了一个看似相反的结果:在 FrontierCode 1.1 Extended、thinking level 为 medium 的环境里,Fable 5.1 的平均任务成本是 $2.68,Opus 5 是 $3.51。该团队还称 Fable 5.1 完成同类任务使用的 token 少 33%,两款模型超过 95% 的 token 都是缓存读取。
这组数字与官方价格表并不冲突。它同时满足了两个可能让 Fable 受益的条件:缓存读取占绝大多数,而且两款模型消耗的 token 总量并不相同。Cognition 的典型任务约让 Fable 读取 300 万缓存 token,而 Opus 读取 450 万;更低的缓存读取单价与更少的实际 token 叠加,足以覆盖 Fable 更高的新鲜输入和输出费率。
但它仍然只是 Devin 与 FrontierCode 这套环境中的厂商报告。thinking 设置、工具、缓存布局、任务集合和“完成”的判断都会改变结果。它能证明“高标价不必然等于高单任务成本”,不能证明任何代码库、研究任务或文档处理都应改用 Fable。
同样,Anthropic 的 Fable 5.1 发布说明所说的典型工作负载约省 25%、高度 Agent 化工作最高约省 45%,比较对象是 Fable 5,不是 Opus 5。该估算基于 2026 年 8 月四周、默认 effort 的实际 Fable 用量,不能改写成 Fable 5.1 对 Opus 5 的固定折扣。
用“每个合格任务成本”做一次公平试跑
先从真实业务抽取一小批任务,至少覆盖常见任务、困难任务和最容易失败的边缘情况。每项任务要有可观察的通过标准,例如测试全部通过、JSON 能被 schema 验证、数字与来源对得上,或页面流程确实完成。两款候选使用相同输入、工具、权限、超时和停止条件。
每次运行至少保留:
| 记录 | 为什么需要 |
|---|---|
| 各类 token | 分开记录新鲜输入、缓存写入、缓存读取、thinking 与输出 |
| 任务结果 | 记录首次通过、重试后通过和最终失败,而不是只看 HTTP 200 |
| 时间 | 关注首次合格结果的墙钟时间及 P50/P95 |
| 运行摩擦 | 超时、拒绝、无效循环、工具错误、fallback 与重启 |
| 人工投入 | 澄清、审核、修改和恢复上下文所花时间 |
| 返工 | 合并或交付后被撤回、修补或重做的成本 |
然后计算:
每个合格任务成本 =(token 与工具费用 + 人工检查 + 重试与返工)÷ 合格任务数
如果 Opus 5 已经稳定一次通过,Fable 5.1 较低的缓存读取价很难单独抵消两倍输入输出费率。反过来,如果一个长时间 Agent 反复读取相同代码库,Opus 又需要更多轮次或人工修复,Fable 就值得保留为升级路线。最稳的结果通常不是“全量换模”,而是一条清楚的条件:多数请求从 Opus、Sonnet 或 Haiku 起步,只有达到已记录的失败或复杂度门槛才升级。

上线前再核对利用面
这套价格计算只适用于标准、按 token 计费的直接 Claude API。Batch、Opus fast mode、美国限定推理的价格系数、合作云平台区域价和第三方网关会改变账单。Claude 应用与 Claude Code 的订阅限额也不是把 API 单价简单乘上 token。
准备切换时,先确认模型 ID、effort、thinking、max_tokens、缓存命中和 usage 字段都按预期工作。Fable 5.1 采用始终开启的 adaptive thinking,并有自己的工具选择与 preserved-thinking 兼容要求;完整的规格和迁移注意事项可查看 Claude Fable 5.1 独立指南。
如果读者任务只是成本可控的日常调用,先测 Opus 5,甚至先比较 Sonnet 5。只有真实样本显示能力缺口或总任务成本反转时,再让 Fable 5.1 承担那部分工作。



