没有一个适合所有仓库的固定赢家。直接调用 API 且输入不超过 272K token 时,GPT-5.6 Sol 的公开单价更低;真正选择 Codex 还是 Claude Code 时,还要看账号能否使用对应模型、费用从哪个池扣除、现有工具配置,以及谁能用更少的人工介入交付通过验收的代码。
下文价格、计划和可用性核验于 2026 年 8 月 12 日,之后可能变化。
先用四个问题缩小选择范围
不要先问“哪个模型更强”,先确认这四件事:
- 模型是否真的可用? 打开 Codex 或 Claude Code 的模型选择器,确认组织权限、客户端版本和地区条件,而不是根据宣传页推断。
- 实际扣哪种费用? API 美元、Codex credits、Claude 周期限额和 usage credits 是不同口径,不能直接换算。
- 哪套代理配置已经成熟? 项目说明、权限、hooks、skills、MCP、测试命令和团队习惯都会改变最终代码。
- 同一任务的验收结果是什么? 只比较通过测试和审查的改动,并把重试、返工与人工介入计入成本。
如果其中一方在账号里不可用,或计费池没有获批,它就不是当前候选。若两边都可用,先保留团队已经配置成熟的一方作为基线,只在基线表现不好的代表任务上测试另一方。这样得到的是可执行的购买或切换决定,而不是抽象的模型排名。
Sol、Fable、Codex 和 Claude Code 不是同一层
gpt-5.6-sol 与 claude-fable-5 是模型 ID;Codex 与 Claude Code 是会选择文件、组织上下文、请求权限、调用工具并反复修改代码的完整编程代理。一次 Codex Ultra 多代理运行与一次普通 Claude Code 会话,比较的是两套产品配置,而不是两个裸模型。
| 层级 | GPT-5.6 Sol 一侧 | Claude Fable 5 一侧 | 为什么要分开 |
|---|---|---|---|
| 模型 | gpt-5.6-sol;gpt-5.6 是其别名 | claude-fable-5 | 最接近直接 API 对比 |
| API | 1.05M 上下文、128K 最大输出 | 1M 上下文、最高 128K 输出 | 规格接近,但请求和拒绝语义不同 |
| 代理运行层 | Codex 的工具、权限审批、skills 与代理模式 | Claude Code 的权限、hooks、skills 与工具 | 可能比模型本身更影响最终改动 |
| 计费口径 | OpenAI API 美元或适用场景下的 Codex credits | Claude 计划限额、usage credits 或 API 美元 | 数字不能跨口径直接比较 |

OpenAI 的 GPT-5.6 发布说明显示,Codex 的 Plus、Pro、Business 和 Enterprise 用户可选 Sol、Terra、Luna,Free 与 Go 使用 Terra。只有当用量按 Codex token-based rate card结算时,Sol 才按每 MTok 125 input credits、12.5 cached-input credits、750 output credits计算;这不是所有订阅会话都能直接套用的美元账单。Ultra 也不是另一行模型价格,额外代理产生的 token 仍会消耗 credits。
Anthropic 的 Fable 计划说明明确写明 Free 不可用。自 2026 年 7 月 20 日起,Max、Team premium seat 和旧版 seat-based Enterprise 的 premium seat 最多可把 50% 周限额用于 Fable;Pro、Team standard seat 与旧版 Enterprise standard seat 从一开始使用按量 usage credits。使用 Claude Code 还需满足 2.1.170 或更高版本及账号配置,再通过 /model 或 claude --model claude-fable-5 选择模型。
API 价格在 272K 输入前后如何变化
GPT-5.6 Sol 模型页和 Claude Fable 模型文档给出的标准 API 价格如下:
| 每 1M token | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|
| 未缓存输入 | $5 | $10 |
| 缓存写入 | $6.25(输入价 1.25 倍) | $12.50 |
| 缓存读取 | $0.50 | $1 |
| 输出 | $30 | $50 |
| 上下文 / 最大输出 | 1.05M / 128K | 1M / 最高 128K |
计算时要把三类输入拆开:
总成本 = 未缓存输入 × 输入价 + 缓存写入 × 写入价 + 缓存读取 × 读取价 + 输出 × 输出价 + 工具、重试与额外代理成本
例如,无缓存任务使用 100K 输入和 20K 输出,Sol 的模型调用成本是 $1.10,Fable 是 $2.00。这只是 API 算例,不是 Codex 或 Claude Code 订阅会话的报价,也没有包含工具费、税费、重试和人工成本。
Sol 还有一条容易漏掉的边界:单次输入 超过 272K token 后,整次请求的输入按 2 倍、输出按 1.5 倍计价,有效标准价变为 $10 input / $45 output。此时 Sol 与 Fable 的输入价相同,输出价只略低。拥有约 1M 上下文不代表应该塞入整个仓库;先删除无关文件、旧日志和重复说明,通常比换模型更省钱。
基准测试为何不能替你做决定
OpenAI 7 月 9 日发布页同时列出两组方向不同的结果:Artificial Analysis Coding Agent Index 为 Sol 80、Fable 77.2;SWE-Bench Pro 则为 Sol 64.6%、Fable 80%。它们来自同一提供方页面,任务集和运行配置也不同,不能当成第三方一致结论。
真正会改变仓库结果的至少还有:推理强度和代理数量、文件与上下文选择、shell 和 MCP 权限、压缩与重试策略,以及团队的验收标准。基准测试可以提示需要验证的问题,但不能直接把某类任务路由到某个模型。
怎样在同一仓库公平比较 Codex 和 Claude Code
选择一项可重复、又足以代表真实工作的任务。玩具函数太简单,整周迁移又不适合作为第一次试验;多文件 bugfix、带测试的有限功能或能在数小时内验收的重构更容易控制变量。
固定起点、权限和完成条件
两边从同一个 clean worktree 和 commit 开始,获得同一份需求、允许修改范围、命令、权限、时间盒与完成条件。不要让一边读取成熟的项目说明,另一边只拿到一句 prompt。记录模型、推理或代理模式、产品版本和实际计费池;配置不等价时,要把结果标为“产品配置对比”。
只比较通过验收的代码
运行团队在 merge 前真的会要求的检查,包括编译、单元与集成测试、lint、类型检查、必要的迁移或安全检查、界面任务的浏览器验证,以及对改动范围和可维护性的审查。双方可以获得同类纠错机会,但人工澄清、批准、手动修改和重启都要记录,不能替其中一边大量救场。
计算每次通过验收改动的总成本
| 记录项 | 记录内容 |
|---|---|
| 验收结果 | 通过或未通过,以及失败的具体检查 |
| 人工介入 | 澄清、批准、手改和重启次数 |
| 墙钟时间 | 从开始到通过验收,而不是首个回答时间 |
| 计费 | API token、Codex credits 或 Claude usage credits,分别记录 |
| 返工 | 审查后撤回或重写的改动 |
| 运行摩擦 | 拒绝、权限阻塞、上下文丢失和工具失败 |

费用低但未通过的运行并不便宜;费用更高却能稳定减少监督和返工,反而可能降低总成本。若差异小于正常运行波动,或小于迁移项目说明、hooks、MCP 与权限设置的成本,就应该停止切换实验。
Fable 5 的拒绝和 fallback 要单独记录
Anthropic 的 Fable 文档说明,safety classifier 的拒绝可能以 HTTP 200 返回,并将 stop_reason 设为 refusal;在产生输出前拒绝不计费,并提供 server-side、SDK 和手动 fallback 路线。
自建 API 调用时,应先检查停止原因再解析正文。若 fallback 换了模型,结果就不能继续记为纯 Fable 输出。Claude Code 中的安全阻塞属于产品政策结果,不应伪装成推理能力不足。Sol 同样有安全与访问控制;安全任务要先限定已授权环境、允许工具和防御性产出,模型比较不能成为绕过政策的办法。
最终怎么选
直接 API、输入不超过 272K 时,可以把 Sol 的较低公开单价作为成本基线。选择编程代理时,不存在通用的“先试 Sol”或“长任务先用 Fable”:
- 先排除账号不可用、权限未开放或计费池未获批的选项;
- 保留团队现有且成熟的代理配置作为基线;
- 只在基线完成不好的代表任务上,用相同条件测试另一套配置;
- 只有替代方案在多次样本中降低每次通过验收改动的总成本,才值得切换;
- 若更小的模型能通过同一套验收,就不必默认使用旗舰模型。
Fable 多花费用但显著减少返工,或 Sol 以更低计费得到同等结果,都是有效结论。单凭任务长短、一次 benchmark 或 token 单价给出固定赢家,都超出了现有证据。
购买或接入前,请重新核对 Sol 模型页、Codex rate card、Fable 计划说明和 Claude Code 模型配置。如果你比较的是本地监督、云端委派、权限与团队交接,而非这两个模型,请看工作流层面的 Claude Code vs Codex 对比。



