直接结论:如果任务边界清楚、tests 和验收条件明确,而且你在意每次迭代的成本,先试 Codex + GPT-5.6 Sol。如果是复杂迁移、长周期实现或需求仍有较多模糊地带,可以试 Claude Code + Fable 5;但只有它在同一个仓库样本里明显减少人工介入和返工,才值得承担当前的访问与计费成本。
不要先问“哪个模型吊打另一个”。更有用的问题是:哪套配置用更低的总成本,交付了能通过验收、可以合并的改动?
下文价格、计划和可用性核验于 2026 年 8 月 5 日,之后都可能变化。
GPT-5.6 Sol 与 Claude Fable 5 有什么区别?
“Sol vs Fable”本来可以是两个 API model ID 的比较;“Codex vs Claude Code”却是两套完整编程代理。它们各自决定读哪些文件、怎样压缩上下文、何时请求权限、怎么调用 shell 和工具、是否启用额外 agent。把两种问题混在一起,最后就无法解释差异来自哪里。
| 层级 | GPT-5.6 Sol 一侧 | Claude Fable 5 一侧 | 对选择的影响 |
|---|---|---|---|
| 模型 | gpt-5.6-sol,gpt-5.6 alias 指向 Sol | claude-fable-5 | 最接近纯模型/API 对比 |
| API | 1.05M context、128K 最大输出 | 1M context、最高 128K 输出 | 纸面上下文接近,请求与拒绝语义不同 |
| harness | Codex 的工具、approvals、skills、agent 模式和上下文机制 | Claude Code 的权限、hooks、skills、工具和上下文机制 | 真实代码结果可能主要由这一层改变 |
| 计费 | Codex credits 或 OpenAI API 美元计费 | Claude 周期限额、usage credits 或 API 美元计费 | 三种 meter 不能互相换算 |

OpenAI 当前说明中,Codex 的 Plus、Pro、Business、Enterprise 用户可选 Sol、Terra、Luna,Free 和 Go 用户使用 Terra。Sol 的当前 Codex rate card 是每 MTok 125 input credits、12.5 cached-input credits、750 output credits。Ultra 不是另一行模型价格;额外 agent 产生的 token 同样会消耗 credits。
Anthropic 当前价格页显示,Claude Code 包含在付费计划中,并与 Claude 其他产品界面共用 usage pool。Fable 的具体路径因计划不同:当前表格显示 Pro 使用 usage credits,Max 5x 和 Max 20x 可让 Fable 占用最多 50% weekly limits。账号有权限时,可以在 Claude Code 中用 /model,或启动时使用 claude --model claude-fable-5。
所以,比较开始前先看双方的 model picker 或 status:模型是否真的可选,团队管理员是否开放,扣的是哪一个池。没有确认这一步,“同价对比”只是想象。
API 价格对比:272K 输入如何改变成本
在直接 API、单次输入不超过 272K token 的条件下,两边标准价格如下:
| 每 1M token 的标准 API 价 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|
| 输入 | $5 | $10 |
| 缓存输入读取 | $0.50 | $1 |
| 输出 | $30 | $50 |
| Context / 最大输出 | 1.05M / 128K | 1M / 最高 128K |
真正可用的公式是:
总成本 = 输入 MTok × 输入价 + 缓存 MTok × 缓存价 + 输出 MTok × 输出价 + 工具、重试和额外 agent 成本
例如,一个无缓存任务用了 100K 输入 + 20K 输出:
- Sol:
0.1 × \$5 + 0.02 × \$30 = \$1.10 - Fable:
0.1 × \$10 + 0.02 × \$50 = \$2.00
这只是 API 算例,不是一次 Codex 或 Claude Code 会话的账单。它没有包含工具费、cache write、区域推理、重试、税费和额外 agent。
最容易漏掉的是 Sol 的长输入加价。OpenAI 的 GPT-5.6 Sol model page 规定:输入超过 272K 后,整次请求的 input 按 2 倍、output 按 1.5 倍计价,也就是有效价变成 $10 input / $45 output。此时 Sol 的输入价与 Fable $10 持平,输出只比 Fable $50 略低,原先醒目的价差明显缩小。
拥有 1M context 不等于应该塞满 1M。先删掉无关文件、历史日志和重复说明,往往比换模型更省钱,也更容易得到稳定结果。
编程基准为什么没有一致的赢家?
OpenAI 7 月 9 日发布页给出的表格中,Artificial Analysis Coding Agent Index 是 Sol 80、Fable 77.2;但同一页的 SWE-Bench Pro 又是 Sol 64.6%、Fable 80%。
这不是一张表“自相矛盾”,而是任务集、harness、reasoning effort 和验收条件不同。它至少说明:不能拿一个分数替代自己的仓库。
真实结果还会被三类配置改变:
- effort 与 agent 数量:Sol max 或 Ultra 多 agent,与单 Claude Code session 不是纯模型对比;
- 工具与权限:文件选择、MCP、shell、compaction、approval 都会改变最终 diff;
- 验收标准:页面看起来漂亮,不代表 migration 安全、测试通过或改动容易维护。
benchmark 适合提出“先试谁”的假设;只有仓库验收能决定谁成为主力。
如何公平测试 Codex 与 Claude Code
选一个可重复、但又代表付费工作的任务。单函数小题太简单,整周迁移又太贵。更合适的是多文件 bugfix、带测试的边界明确功能,或一段能在半天内验收的重构。
固定相同任务、代码版本和权限
两边从同一个 clean worktree 和 commit 开始,使用相同需求、允许修改范围、命令、权限、时间盒与 definition of done。不要让一边拥有成熟的项目说明,另一边只得到一句 prompt。
同时记录 model、effort/agent mode、产品版本和计费池。如果一边开 Ultra,另一边只有单 session,就把结果标成“产品配置对比”,不要叫“模型对比”。
只比较通过测试和审核的代码改动
运行团队真的会在 merge 前要求的检查:
- compile、unit/integration tests;
- lint、type check、migration 与必要的安全检查;
- UI 任务的浏览器和视觉验收;
- diff scope、可维护性与隐藏行为审查;
- 本任务自己的业务成功条件。
若第一次未通过,可以给双方同类纠错机会,但必须把人工澄清、批准、手动修改和 restart 计为 intervention。不能替一边大量救场,再把另一边判输。
计算每个合格改动的真实成本
| 记录项 | 应记录什么 |
|---|---|
| Accepted diff | 通过/未通过,以及具体失败检查 |
| 人工介入 | 澄清、approval、手改、重启次数 |
| 墙钟时间 | 从开始到通过验收,不是首个回答时间 |
| Meter | token、Codex credits 或 Claude usage credits |
| 返工 | review 后被撤回或重写的改动 |
| 运行摩擦 | refusal、权限阻塞、上下文丢失、工具失败 |

最便宜但未通过的 run 并不便宜;费用更高的 run 如果稳定减少监督和返工,反而可能是更好的购买。若差异小于正常波动,或小于团队迁移 instructions、hooks、MCP 与权限配置的成本,就应该停止“换工具”实验。
Claude Fable 5 的 refusal 和 fallback 如何处理
Fable 5 带有 safety classifier。Anthropic 文档说明,classifier 拒绝可能以 HTTP 200 返回,并把 stop_reason 设为 refusal,而不是抛出网络错误;在尚未产生输出前发生的拒绝不计费,官方也提供 server-side、SDK 和手动 fallback 路线。
因此,自建 API harness 时要先判断 stop reason,再按正常内容解析。fallback 是否可以接受,应由任务风险和团队政策决定,不能偷偷换模型后仍把结果记为 Fable。Claude Code 中的安全阻塞同样属于产品政策结果,不应被伪装成“模型不会做”。
Sol 也有 safeguard 和访问控制。安全任务应先写清授权环境、允许的工具和防御性输出,任何比较都不应用来绕过账号或平台政策。
不同编程任务该选 Sol 还是 Fable 5?
先试 Codex + Sol:
- 任务有明确 tests,适合快速实现—验证循环;
- API 单价或 Codex credit 效率是主要约束;
- 团队能观察多 agent 的额外消耗,而不是只看完成速度;
- 已经有成熟的 Codex instructions、approval 和验证路径。
先试 Claude Code + Fable:
- 是复杂、长周期的迁移或实现,减少中途介入很有价值;
- 仓库已有成熟的 Claude Code instructions、hooks、skills 和权限习惯;
- Fable 在账号中确实可用,usage credits 或周限额已得到批准;
- 样本显示的是更少返工,而不仅是更好看的解释。
两边旗舰都不该默认用:
- 任务例行、批量或极度在意 latency;
- 更小的 tier 已能通过同一套验收;
- 大量无关上下文把输入推过加价线,却没有提升 accepted work;
- 团队无法限制 credits、重试和 agent 数量。
OpenAI 把 Terra、Luna 定位为更低成本的 GPT-5.6 tier,Anthropic 也有其他 Claude tier。不要先假定旗舰必需,仍用同一验收样本验证。
结论:先用 Sol 还是 Fable 5?
对今天刚开始比较的多数团队,Codex + Sol 更适合拿到第一次正式 work sample:低于 272K 输入时标准 API 单价更低,符合条件的付费 Codex 用户也能直接选择。但这只让 Sol 赢得“先试资格”,不是永久冠军。
当 Fable + Claude Code 在第二个代表性任务里仍能交付更干净的合格改动,并显著减少介入与返工,它才真正赢得主力位置;否则,把它留作复杂任务 specialist 或 fallback 更合理。
购买或接入前,用官方 GPT-5.6 Sol 模型页、Codex rate card、Claude Fable 页面 和 Claude 价格页 复核当天的价格与权限。如果你的问题其实是本地监督、云端委派、权限和团队 handoff,而不是这两个模型本身,请看工作流级的 Claude Code vs Codex 对比。
