AIFreeAPI Logo

Claude 模型怎么选:Fable 5.1 与 Opus 5 成本拆解

A
10 分钟阅读AI 模型对比

Opus 5 的标准输入输出单价只有 Fable 5.1 的一半,但 Fable 的缓存读取又便宜一半。真正的分界线取决于上下文复用、实际 token 消耗和任务通过率。

Fable 5.1 与 Opus 5 成本拆解,含 Claude 四档选型、API 价格、缓存临界式和合格任务成本指标

先给预算结论:按 Anthropic 直接 Claude API 的标准费率,Opus 5 的新鲜输入、输出和缓存写入价格都是 Fable 5.1 的一半;Fable 5.1 只有缓存读取这一项更便宜,价格是 Opus 5 的一半。因此,普通对话、一次性分析或缓存命中不高的任务,Opus 5 通常账单更低。Fable 5.1 只有在重复读取的上下文足够多,或者它确实用更少 token、更少重试完成同一项工作时,才可能降低每个合格结果的成本。

截至 2026 年 9 月 4 日,Anthropic 也把 Opus 5 作为多数工作负载的起点。Fable 5.1 更适合高难推理和长时间 Agent,尤其是 Opus 5 提高 effort 后仍达不到你的验收线时。这个顺序比“直接上最强模型”更容易控制预算。

四款当前模型先按任务缩小范围

Anthropic 当前模型总览列出的主阵容是 Fable 5.1、Opus 5、Sonnet 5 与 Haiku 4.5。四款都支持文本与图片输入、文本输出、多语言、视觉和工具调用,但速度、上下文和费率不同。

模型Claude API ID标准输入 / 输出Context / 最大输出官方相对速度
Haiku 4.5claude-haiku-4-5-20251001$1 / $5200K / 64K最快
Sonnet 5claude-sonnet-5$2 / $101M / 128K
Opus 5claude-opus-5$5 / $251M / 128K中等
Fable 5.1claude-fable-5-1$10 / $501M / 128K较慢

表内单位是每百万 token 的美元标准价。它不是 Claude Pro、Max 或 Claude Code 的订阅额度,也不代表 Amazon Bedrock、Google Cloud、Microsoft Foundry 或第三方网关的最终价格。

如果任务边界清楚、失败能被自动发现,Haiku 4.5 适合高吞吐分类、抽取和短摘要。Sonnet 5 给日常编码、数据处理、内容和工具任务留出更宽的性能与价格区间。错误代价高或任务需要长期自主运行时,可以先用 Opus 5 建立能力基线。只有这个基线仍不足,才值得把 Fable 5.1 加入同条件对照。

Fable 5.1 与 Opus 5 的价格差在缓存读取

Claude API 当前价格表把缓存写入和读取分开计费:

每百万 token,USDFable 5.1Opus 5更低的一方
新鲜输入$10$5Opus 5
输出$50$25Opus 5
5 分钟缓存写入$12.50$6.25Opus 5
1 小时缓存写入$20$10Opus 5
缓存读取$0.25$0.50Fable 5.1
Batch 输入 / 输出$5 / $25$2.50 / $12.50Opus 5

Prompt caching 不是把所有输入自动变成 $0.25。根据 Anthropic 的缓存说明,第一次处理稳定前缀时会产生缓存写入;后续请求只有在前缀保持一致且缓存仍有效时才按读取价计费。默认有效期是 5 分钟,也可以付更高写入价使用 1 小时缓存。工具定义、system 和 messages 的前缀发生变化,都可能让预期的缓存命中消失。

另一个容易混淆的价格是 Opus 5 fast mode。它是 Claude API 的 research preview,输入/输出为 $10/$50,换取更低延迟;这不是标准 Opus 5 的 $5/$25,也不能与 Fable 5.1 标准模式混成同一组比较。

用一个临界式判断缓存是否足够多

如果两款模型消耗的各类 token 数完全相同,可以直接算出缓存读取要多到什么程度,Fable 5.1 的 token 账单才会更低。

设以下数值都以“百万 token”为单位:

  • I:没有命中缓存的新鲜输入;
  • O:输出;
  • W5:写入 5 分钟缓存;
  • W1:写入 1 小时缓存;
  • C:从缓存读取的输入。

两款模型的标准费用分别是:

Fable = 10I + 50O + 12.5W5 + 20W1 + 0.25C

Opus = 5I + 25O + 6.25W5 + 10W1 + 0.50C

把两式相减,Fable 更便宜的条件是:

C > 20I + 100O + 25W5 + 40W1

这条线很高。假设一项任务产生 10 万新鲜输入和 2 万输出,没有新的缓存写入,那么缓存读取要超过 400 万 token,Fable 的纯 token 账单才可能低于 Opus。若只读取 150 万缓存 token,Fable 约为 $2.38,Opus 约为 $1.75;若读取 600 万,Fable 约为 $3.50,Opus 约为 $4.00。加入缓存写入后,Fable 需要更多后续读取才能摊薄首次写入成本。

这个例子只解释价格表,不预测模型行为。Fable 与 Opus 可能生成不同长度的答案、调用不同次数的工具,甚至以不同重试次数完成任务。真正的账单要使用各自 response usage 中的实际数量。

Fable 5.1 与 Opus 5 API 费率、缓存临界式、不同缓存读取量示例和 Devin 单任务成本对比
Fable 5.1 与 Opus 5 API 费率、缓存临界式、不同缓存读取量示例和 Devin 单任务成本对比

为什么 Devin 会测到 Fable 单任务更便宜

Cognition 在 Devin 的 Fable 5.1 报告中公布了一个看似相反的结果:在 FrontierCode 1.1 Extended、thinking level 为 medium 的环境里,Fable 5.1 的平均任务成本是 $2.68,Opus 5 是 $3.51。该团队还称 Fable 5.1 完成同类任务使用的 token 少 33%,两款模型超过 95% 的 token 都是缓存读取。

这组数字与官方价格表并不冲突。它同时满足了两个可能让 Fable 受益的条件:缓存读取占绝大多数,而且两款模型消耗的 token 总量并不相同。Cognition 的典型任务约让 Fable 读取 300 万缓存 token,而 Opus 读取 450 万;更低的缓存读取单价与更少的实际 token 叠加,足以覆盖 Fable 更高的新鲜输入和输出费率。

但它仍然只是 Devin 与 FrontierCode 这套环境中的厂商报告。thinking 设置、工具、缓存布局、任务集合和“完成”的判断都会改变结果。它能证明“高标价不必然等于高单任务成本”,不能证明任何代码库、研究任务或文档处理都应改用 Fable。

同样,Anthropic 的 Fable 5.1 发布说明所说的典型工作负载约省 25%、高度 Agent 化工作最高约省 45%,比较对象是 Fable 5,不是 Opus 5。该估算基于 2026 年 8 月四周、默认 effort 的实际 Fable 用量,不能改写成 Fable 5.1 对 Opus 5 的固定折扣。

用“每个合格任务成本”做一次公平试跑

先从真实业务抽取一小批任务,至少覆盖常见任务、困难任务和最容易失败的边缘情况。每项任务要有可观察的通过标准,例如测试全部通过、JSON 能被 schema 验证、数字与来源对得上,或页面流程确实完成。两款候选使用相同输入、工具、权限、超时和停止条件。

每次运行至少保留:

记录为什么需要
各类 token分开记录新鲜输入、缓存写入、缓存读取、thinking 与输出
任务结果记录首次通过、重试后通过和最终失败,而不是只看 HTTP 200
时间关注首次合格结果的墙钟时间及 P50/P95
运行摩擦超时、拒绝、无效循环、工具错误、fallback 与重启
人工投入澄清、审核、修改和恢复上下文所花时间
返工合并或交付后被撤回、修补或重做的成本

然后计算:

每个合格任务成本 =(token 与工具费用 + 人工检查 + 重试与返工)÷ 合格任务数

如果 Opus 5 已经稳定一次通过,Fable 5.1 较低的缓存读取价很难单独抵消两倍输入输出费率。反过来,如果一个长时间 Agent 反复读取相同代码库,Opus 又需要更多轮次或人工修复,Fable 就值得保留为升级路线。最稳的结果通常不是“全量换模”,而是一条清楚的条件:多数请求从 Opus、Sonnet 或 Haiku 起步,只有达到已记录的失败或复杂度门槛才升级。

Fable 5.1 与 Opus 5 成本比较的四步信息图,涵盖标准价格、缓存临界线、Devin 报告和公平试跑
Fable 5.1 与 Opus 5 成本比较的四步信息图,涵盖标准价格、缓存临界线、Devin 报告和公平试跑

上线前再核对利用面

这套价格计算只适用于标准、按 token 计费的直接 Claude API。Batch、Opus fast mode、美国限定推理的价格系数、合作云平台区域价和第三方网关会改变账单。Claude 应用与 Claude Code 的订阅限额也不是把 API 单价简单乘上 token。

准备切换时,先确认模型 ID、effort、thinking、max_tokens、缓存命中和 usage 字段都按预期工作。Fable 5.1 采用始终开启的 adaptive thinking,并有自己的工具选择与 preserved-thinking 兼容要求;完整的规格和迁移注意事项可查看 Claude Fable 5.1 独立指南

如果读者任务只是成本可控的日常调用,先测 Opus 5,甚至先比较 Sonnet 5。只有真实样本显示能力缺口或总任务成本反转时,再让 Fable 5.1 承担那部分工作。