跳到正文

GPT-6.1 Sol 对比 Opus 5.5:标价差 2 倍,任务成本差 6 倍

标价差 2 倍,第三方实测的单任务成本差 6 到 8 倍,因为 Opus 5.5 每个任务的输出约为 3 倍。代入自己的通过率和复核成本,就能算出默认模型该不该换。

A
••24 分钟阅读•AI 模型对比
等距底座上两摞叠片:每百万 token 输出价 GPT-6.1 Sol 为 $10,Opus 5.5 为 $20,标价差 2 倍

截至 2026 年 10 月 1 日,GPT-6.1 Sol(API 模型 ID gpt-6.1-sol)的标价是每百万 token 输入 $2、输出 $10,Claude Opus 5.5(claude-opus-5-5)是 $4 和 $20,刚好差一倍。真实账单的差距比这大得多:在 Artificial Analysis 的评测里,两者都用 medium 推理强度时,GPT-6.1 Sol 每个任务花 $0.21,Opus 5.5 花 $1.34,约 6.4 倍;都开到 max 时是 $0.72 对 $5.98,约 8.3 倍。原因是 Opus 5.5 完成同一个任务写出的 token 大约是 Sol 的 3 倍。

分数方向相反。同一份评测里 Opus 5.5 的综合指数高 3 分(medium)到 6 分(max),Vals Index 上高 5.8 个百分点。所以可以这样起步:量大、能自动验收、失败了可以重跑的任务,默认先试 GPT-6.1 Sol;一次做错要花很多人工去发现和返工的难题,留给 Opus 5.5。两者之间的分界线不是一个固定答案,取决于你自己任务上的通过率和每次复核的成本,后面有一条可以直接代入的规则。

下面的数字来自两家厂商的公告、文档和第三方评测,测试方与设置随每条给出。

批量任务先试 GPT-6.1 Sol,高难度任务先试 Opus 5.5

任务形态先试依据会改变结论的条件
批量、可自动验收、可重试(分类、抽取、常规代码修改、工单处理)GPT-6.1 Sol标价一半;Artificial Analysis 的单任务成本约为 Opus 5.5 的 1/6 到 1/8Sol 在你的任务上通过率低到要反复重跑
难度高、每次结果都要人看、返工代价大(跨模块重构、长时间 Agent、科研类终端任务)Claude Opus 5.5第三方指数高 3 到 6 分;OpenAI 自己的发布图表里,max 档 Opus 5.5 在两项基准上也高 6 分以上你的复核成本很低,或 Sol 的通过率已经接近 Opus 5.5
单次输入超过 272K token 的长文档两个都测超过 272K 后 Sol 的输入单价翻倍到 $4,与 Opus 5.5 持平,token 数相同时的价差从 50% 缩到 1% 到 7%能把输入切到 272K 以内;两家实际输出的 token 数
已经在用 GPT-6 SolGPT-6.1 Sol价格不变,缓存输入从 $0.20 降到 $0.10代码里把推理强度设成了 none,6.1 不接受

GPT-6.1 Sol 是什么:与 Opus 5.5 不同档,同价的是 Sonnet 5.5

"GPT 6.1"目前只有一款:GPT-6.1 Sol。没有 GPT-6.1 Astra 或 GPT-6.1 Luna,也没有不带后缀的 GPT-6.1。OpenAI 的发布公告把它定位成 GPT-6 Sol 的升级版,在高难度任务上向 GPT-6 Astra 靠拢,标准输入和输出价格是 Astra 的五分之一;公告同时写明 Astra 仍是 OpenAI 综合能力最强的模型。公告正文没有写具体日期,它出现在 2026 年 9 月底的 DevDay 期间,多家报道记为 9 月 29 日。

Claude Opus 5.5 是 Anthropic 在 2026 年 9 月 22 日发布的模型,面向长时间运行的智能体编程和知识工作。在 Anthropic 的价格表里,它上面还有 Fable 5.1(每百万 token 输入 $10、输出 $50),下面是 Sonnet 5.5($2、$10)。也就是说,两边都不是各家最贵的那一档,但也不在同一层:按价格,和 GPT-6.1 Sol 同价的是 Sonnet 5.5,Opus 5.5 高一档。价格差一倍、分数有差距,都要放在这个前提下看。

项目GPT-6.1 SolClaude Opus 5.5
API 模型 IDgpt-6.1-solclaude-opus-5-5
上下文窗口1,050,000 token(最大输入 922,000)1,000,000 token
最大输出128,000 token128,000 token(Message Batches 加 beta 请求头可到 300,000)
推理强度low、medium(默认)、high、xhigh、max;不支持 none 和 minimal自适应思考始终开启,effort 默认 medium,不能关闭思考
知识截止2026 年 4 月 30 日2026 年 6 月(可靠知识截止)
订阅入口ChatGPT 工作模式与 Codex:Plus、Pro、Business、Enterprise、Edu;公告写明尚未在聊天中提供Claude Pro、Max 等套餐

规格来自 OpenAI 的 GPT-6.1 Sol 模型页和 Anthropic 的 Opus 5.5 模型概览。GPT-6.1 Sol 是否面向 Free 和 Go 用户,公告里没有说明。

标价差 2 倍:逐项对照

以下是两家直连 API 的 Standard 档价格,单位为美元每百万 token,不含税、数据驻留加价和工具费用,截至 2026 年 10 月 1 日。

计费项GPT-6.1 SolClaude Opus 5.5
输入$2$4
输出$10$20
缓存读取(缓存输入)$0.10$0.20
缓存写入$2.50$5(5 分钟档);$8(1 小时档)
单次输入超过 272K token整次请求改按输入 $4、缓存读取 $0.20、缓存写入 $5、输出 $15不变,1M 上下文内同价
Batch输入 $1、输出 $5输入 $2、输出 $10
Fast mode输入 $4、输出 $20输入 $8、输出 $40(研究预览,仅 Claude API,不能与 Batch 叠加)
指定区域推理加 10%仅美国推理乘 1.1

出处是 OpenAI 定价页和 Anthropic 定价页。在 272K 以内,Sol 的每一项都正好是 Opus 5.5 的一半。OpenAI 定价页上"促销价至少持续到 2026 年 11 月 21 日"的说明针对的是 GPT-5.6 Sol,GPT-6.1 Sol 的价格没有标注为促销价。公告提到的 GPT-6.1 Sol Ultrafast 在定价表里没有对应价格行。

短上下文:$0.30 对 $0.60

假设两家处理的 token 数相同,10 万输入加 1 万输出,不用缓存:

  • GPT-6.1 Sol:0.1 × $2 + 0.01 × $10 = $0.30
  • Opus 5.5:0.1 × $4 + 0.01 × $20 = $0.60

大量复用缓存时比例不变。20 万缓存读取加 2 万新输入加 5 千输出:Sol 是 0.2 × $0.10 + 0.02 × $2 + 0.005 × $10 = $0.11,Opus 5.5 是 0.2 × $0.20 + 0.02 × $4 + 0.005 × $20 = $0.22。这个算例没有计入此前的缓存写入费用,命中率也取决于提示词结构;两家缓存怎么计费、写入多久回本,见 OpenAI 与 Claude 缓存计费:缓存输入、写入成本与回本计算。

272K 这条线:多 1,000 个 token,Sol 的账单涨 87%

GPT-6.1 Sol 的规则是"单次输入超过 272K token,整次请求按更高单价计费",正好 272,000 仍算低档。Opus 5.5 没有这条阶梯价,Anthropic 定价页的原话是 90 万 token 的请求与 9 千 token 的请求按同一单价计费。把边界两侧都算一遍(均不用缓存,输出 2 万 token):

输入 tokenGPT-6.1 SolClaude Opus 5.5Sol 便宜多少
272,0000.272 × $2 + 0.02 × $10 = $0.7440.272 × $4 + 0.02 × $20 = $1.48850%
273,0000.273 × $4 + 0.02 × $15 = $1.3920.273 × $4 + 0.02 × $20 = $1.492约 7%
300,0000.3 × $4 + 0.02 × $15 = $1.500.3 × $4 + 0.02 × $20 = $1.60约 6%
900,000(输出 1 万)0.9 × $4 + 0.01 × $15 = $3.750.9 × $4 + 0.01 × $20 = $3.80约 1%

输入从 272,000 增加到 273,000,Sol 这次请求多花 $0.648,涨了 87%;Opus 5.5 只多 $0.004。过线之后两家输入同价,只剩输出还差 $5,所以 token 数相同的前提下 Sol 仍然略便宜,但优势几乎消失。如果你的文档刚好在 272K 上下,把输入裁到线内比换模型省得多。

这些算例都假设两家的 token 数相同,而这恰恰是不成立的地方。

为什么实测单任务成本差 6 到 8 倍

Artificial Analysis 的对比页按相同推理强度把两款模型配了两组:

指标GPT-6.1 Sol mediumOpus 5.5 mediumGPT-6.1 Sol maxOpus 5.5 max
Intelligence Index48515258
每任务成本$0.21$1.34$0.72$5.98
跑完整套指数的成本$361$1,627$1,082$8,708
每任务输出 token8k26k38k119k
其中推理 token3k12k25k84k

Opus 5.5 两行的完整名称带有"Adaptive Reasoning"和"Default Fallback",后者的含义见下一节;max 组的数据在另一张对比页。

条形图:Artificial Analysis 每任务成本,medium 档 GPT-6.1 Sol $0.21、Opus 5.5 $1.34,max 档 $0.72 对 $5.98

引用倍数时要说清是哪个指标。按"每任务成本",Opus 5.5 是 Sol 的 1.34 ÷ 0.21 ≈ 6.4 倍(medium)和 5.98 ÷ 0.72 ≈ 8.3 倍(max);按"跑完整套指数的成本"是 4.5 倍和 8.0 倍。两个口径都远高于标价的 2 倍,多出来的部分主要来自输出量:Opus 5.5 每个任务输出的 token 是 Sol 的 3.1 到 3.3 倍,而输出正是最贵的那一项。单价贵一倍,再乘以三倍多的输出,就到了六倍上下。

另一份独立数据方向一致。Vals Index v2.1(2026 年 9 月 30 日更新)里,Opus 5.5 每个测试的成本是 $32.14,GPT-6.1 Sol 是 $3.24,约 9.9 倍。

还有一层没法靠标价估出来:两家的分词器不同。Anthropic 在定价页说明,Claude 4.7 及之后的模型使用的分词器,对同一段文本产生的 token 比它上一代分词器多约 30%;同一段文本在两家各算多少 token,没有公开的换算比例。"每 token 贵一倍"不等于"每份文档贵一倍",要估自己的账单,最可靠的做法是拿二三十个真实任务在两边各跑一遍,读各自 API 返回的 usage 字段。

Opus 5.5 的推理强度本身就是最大的成本旋钮,五档各自适合什么任务,见 Claude Opus 5.5 的 effort 怎么选?五档设置与任务成本比较。

谁的基准分数更高:看哪一档、谁测的

独立评测:Opus 5.5 分数更高

上表里,同档比较 Opus 5.5 领先 3 分(medium,51 对 48)和 6 分(max,58 对 52)。Vals Index v2.1 上是 66.97% 对 61.15%,差 5.8 个百分点,Opus 5.5 的分数带 ±0.9 的误差范围。顺带一提,同一张榜上 Claude Sonnet 5.5 是 67.04%,每个测试 $21.34,与 Opus 5.5 基本持平而更便宜。

把档位错开看,结论会变:GPT-6.1 Sol 开到 max 得 52 分,每任务 $0.72;Opus 5.5 用 medium 得 51 分,每任务 $1.34。也就是在这套评测里,把 Sol 的推理强度拉满,能以大约一半的单任务成本拿到与中档 Opus 5.5 相当的分数。想超过这个水平,才需要为 max 档的 Opus 5.5 付每任务近 $6。

这些都是发布当周的快照,只代表各家评测自己的题目,数值可能修订。

OpenAI 的发布数据:medium 档 Sol 领先,max 档 Opus 5.5 领先

OpenAI 公告里点名 Opus 5.5 的有三项,正文原意是:

  • GDP.pdf:所测的各档推理强度下,GPT-6.1 Sol 的得分都高于"带回退机制的 Opus 5.5",单任务成本不到其一半。
  • AutomationBench 1.0.6:medium 档 Sol 比 Opus 5.5 高 2.2 个百分点,成本约为三分之一。
  • Terminal-Bench Science 0.1:最高推理强度下,Sol 的平均单任务成本 $5.47,Opus 5.5 是 $23.21。

公告正文没有给出最后一项的得分。发布图表里的具体数值,按 Kingy AI 的逐项转录是这样的:

基准与档位(OpenAI 发布图表)GPT-6.1 SolClaude Opus 5.5
GDP.pdf,medium30.0%,$0.34/任务25.6%,$0.80/任务
GDP.pdf,high32.0%,$0.35/任务28.8%,$0.83/任务
AutomationBench 1.0.6,medium31.7%,$0.19/任务29.5%,$0.65/任务
AutomationBench 1.0.6,max36.1%,$0.30/任务42.5%,$1.44/任务
Terminal-Bench Science 0.1,max57.0%,$5.47/任务63.3%,$23.21/任务

即使在 OpenAI 自己挑选的基准里,max 档 Opus 5.5 在 AutomationBench 上也高 6.4 个百分点,在 Terminal-Bench Science 上高 6.3 个百分点,代价是每任务约 4.8 倍和 4.2 倍的成本。读这张表要记住两点:基准、设置和测试环境是 OpenAI 选的;公告脚注写明,GPT 的结果在 OpenAI 的研究环境或 API 中测得,Opus 5.5 的结果取自公开报告,并非 OpenAI 自己跑的。

Anthropic 发布 Opus 5.5 时公布的成绩(Terminal-Bench 4.0 66.4%、GDPval-AA v2.1 1846 Elo 等,见 Anthropic 的发布页)早于 GPT-6.1 Sol,表里没有它的行。两家的发布数据里,找不到一项版本完全相同、同时包含两款模型的基准。

早期用户反馈两个方向都有:有人说换成 Sol 后完成率更高、更便宜,也有人说 Opus 5.5 明显更好。这些是个例,不能当作质量或额度的证据。

榜单里的"Default Fallback"是什么

Artificial Analysis 给 Opus 5.5 标了"Default Fallback",Vals 在脚注里写"部分子任务在供应商拒绝后由回退模型完成",OpenAI 公告写的是"带回退机制的 Opus 5.5"。三处说的是同一件事。

按 Anthropic 的拒绝与回退文档,Opus 5.5 的安全分类器可能拒绝某些请求,响应仍是 HTTP 200,但 stop_reason 为 "refusal"。调用方可以开启服务端回退(fallbacks: "default",需要 beta 请求头 server-side-fallback-2026-07-01),这时 API 会改用 Anthropic 为该拒绝类别推荐的模型重试,文档示例里是 Claude Opus 4.8,响应会注明实际作答的模型。Anthropic 的发布页说,网络安全类任务多数会路由到 Opus 4.8。

对你有三点实际影响:

  1. 回退不是默认开启的,由调用方配置。没有配置时,拒绝就是最终结果,榜单上那个带回退的分数你拿不到。
  2. 榜单里 Opus 5.5 的分数和成本,有一部分其实来自另一款模型。
  3. 计费按实际运行的模型分别算。请求在产生任何输出之前被拒绝时,截至 2026 年 9 月只有 bio、frontier_llm、reasoning_extraction 三个类别会收费,但都计入速率限制。

回退多久触发一次取决于任务类型。安全、生物这类容易触发分类器的领域,上线前要单独测拒绝率。GPT-6.1 Sol 一侧的拒绝行为,公开资料里没有可比的数据。

用自己的通过率算:每个可用结果的成本

单任务成本低,不代表拿到一个能用的结果更便宜。如果便宜的模型要多跑几次、每次还要人看一眼,账就得重算。一条够用的规则:

每个可用结果的成本 = (单次尝试的 token 成本 c + 每次复核的人工成本 R)÷ 通过率 p

Opus 5.5 更划算的条件是:

Opus 5.5 通过率 ÷ Sol 通过率 > (c_Opus + R)÷(c_Sol + R)

c 可以先借用 Artificial Analysis medium 档的每任务成本(Sol $0.21,Opus 5.5 $1.34),之后换成你自己任务的实测值。R 和通过率是你的输入,没有任何公开数据能替你填。代入几种复核成本:

每次复核成本 R相当于所需通过率之比若 Sol 通过率 70%,Opus 5.5 需要超过
$0全自动验收1.34 ÷ 0.21 ≈ 6.38做不到(需要 447%)
$1时薪 $60 的人看 1 分钟2.34 ÷ 1.21 ≈ 1.93做不到(需要 135%)
$5时薪 $60 的人看 5 分钟6.34 ÷ 5.21 ≈ 1.21785.2%
$20时薪 $60 的人看 20 分钟21.34 ÷ 20.21 ≈ 1.05673.9%

以 R = $5、Sol 通过率 70% 为例验算边界两侧。Sol 每个可用结果的成本是 5.21 ÷ 0.7 ≈ $7.44。Opus 5.5 通过率 90% 时是 6.34 ÷ 0.9 ≈ $7.04,比 Sol 便宜;通过率 80% 时是 6.34 ÷ 0.8 ≈ $7.93,比 Sol 贵。分界点就在 85.2%。

算例:每次复核 $5、Sol 通过率 70% 时每个可用结果 $7.44,Opus 5.5 通过率 90% 为 $7.04、80% 为 $7.93,分界点 85.2%

这张表可以读出两条结论:

  • 能自动验收的任务,token 成本说了算。只算 token 时,即便 Opus 5.5 次次通过,Sol 的通过率也要低于 1 ÷ 6.38 ≈ 15.7% 才会输。这类任务几乎总是 Sol 更省。
  • 复核越贵,模型单价越不重要。每次要人看 20 分钟时,Opus 5.5 的通过率只要比 Sol 高 4 个百分点左右就回本了。

这条规则假设每次重试相互独立、每次复核耗时相同,并且没有计入"错误结果没被发现"的损失。如果你的任务里漏掉一个错误代价很高,应当更偏向通过率高的一方。

速度:Sol 先开口,Opus 5.5 吐字快

Artificial Analysis 测得的输出速度是 Opus 5.5 更快:medium 档 72 对 59 token/秒,max 档 92 对 65 token/秒。但首个回答 token 的等待时间是 Sol 短得多:medium 档 5.29 秒对 22.18 秒,max 档约 282 秒对 703 秒。Vals 记录的每个测试端到端耗时是 Sol 43 分 10 秒,Opus 5.5 1 小时 19 分。

每秒 token 数更高不等于任务更早完成,因为 Opus 5.5 要写的 token 是三倍左右。交互式场景更在意首字延迟,Sol 占优;这些数字都随推理强度、负载和线路变化。

20 美元套餐:两家没法按数字比

OpenAI 的 ChatGPT 工作模式与 Codex 定价页写明,Plus 和标准 Business 每 5 小时窗口内,GPT-6.1 Sol 的本地消息数是 15 到 160 条(GPT-6 Sol 15 到 150,GPT-6 Astra 5 到 45,GPT-6 Luna 350 到 3,000),并注明实际数量取决于模型、任务大小和复杂度。这是区间,不是保证值。Codex credits 的消耗是每百万 token 输入 50、缓存输入 2.5、输出 250;GPT-6 Sol 是 50、5、250,Astra 是 250、25、1,250。GPT-6 家族内部的 credits 怎么折算,见 GPT-6 Luna 与 Sol 价格对比:API 和 Codex 分别怎么算。

Anthropic 一侧,Opus 5.5 包含在 Claude Pro 和 Max 里,发布页说 Pro、Max、Team 和按席位计费的 Enterprise 的五小时用量上限随这次发布提高了,但没有公布数值。

所以两个 20 美元档套餐没法用一个数字比谁更耐用,也不能拿月费除以 API 单价去推算额度。只打算留一家的话,更实际的判断是:你常用的工具在哪一边(Codex 还是 Claude Code),以及按上面的任务分类,你的活儿更像哪一类。还要注意,GPT-6.1 Sol 目前在 ChatGPT 的工作模式和 Codex 里提供,公告写明尚未在聊天中提供。

切换前要改什么:模型 ID、推理强度和 thinking 参数

从 GPT-6 Sol 换到 GPT-6.1 Sol

  • 把模型 ID 从 gpt-6-sol 改成 gpt-6.1-sol。输入 $2、输出 $10 不变,272K 规则不变,缓存输入从 $0.20 降到 $0.10。
  • gpt-6.1-sol 不接受 none 和 minimal 两档推理强度,而 GPT-6 Sol 接受 none。如果你用 none 关闭推理来压延迟,要改成 low 或更高,并重新测延迟和输出 token 数。
  • 质量变化以 OpenAI 的说法为准:公告称 6.1 在 AutomationBench 同设置下比 GPT-6 Sol 高 4.8 个百分点。换之前仍建议用自己的回归用例跑一遍。

从 OpenAI 换到 Claude Opus 5.5

  • 思考不能关闭:传 thinking: {"type":"disabled"} 或手动指定预算会返回 400。
  • tool_choice 只接受 auto 和 none,传 any 或指定某个工具会返回 400。
  • 工具调用之间的文字会放进 thinking 块,默认显示设置下这些块是空的,依赖中间文字的日志和界面要调整。
  • 同一档 effort 下,它每轮的思考量往往比 Opus 5 更多,xhigh 和 max 最明显,预算要按新的输出量重估。
  • 如果任务涉及容易触发拒绝的领域,决定是否配置服务端回退,并在日志里记录实际作答的模型。

以上限制出自 Opus 5.5 的更新说明,完整的迁移检查项见 Claude Opus 5.5 已发布:API 价格、能力与从 Opus 5 迁移的检查项。

常见问题

GPT-6.1 Sol 比 Claude Opus 5.5 便宜多少?

按标价是一半:输入 $2 对 $4,输出 $10 对 $20,缓存读取 $0.10 对 $0.20。按第三方实测的单任务成本,差距是 6 到 10 倍:Artificial Analysis 的每任务成本为 $0.21 对 $1.34(medium)和 $0.72 对 $5.98(max),Vals 的每测试成本为 $3.24 对 $32.14。例外是单次输入超过 272K token 的请求,这时 Sol 的输入单价升到 $4,token 数相同的情况下只比 Opus 5.5 便宜 1% 到 7%。

GPT-6.1 Sol 比 Opus 5.5 强吗?

独立评测里没有。Artificial Analysis 的指数是 48 对 51(medium)、52 对 58(max),Vals Index 是 61.15% 对 66.97%。OpenAI 自己的发布数据里,Sol 在 GDP.pdf 和 medium 档的 AutomationBench 上领先,max 档的 AutomationBench 和 Terminal-Bench Science 则是 Opus 5.5 更高。Sol 的优势在每一分花的钱更少。

写代码该用 GPT-6.1 Sol 还是 Opus 5.5?

常规修改、能靠测试自动验收的任务先用 GPT-6.1 Sol,推理强度不够时先往上调档,max 档的 Sol 在 Artificial Analysis 的指数上与 medium 档的 Opus 5.5 相当,成本约为一半。跨模块的大改动、长时间运行的 Agent、每次都要资深工程师审查的结果,用 Opus 5.5 更可能回本,具体用"每个可用结果的成本"那条规则代入自己的通过率判断。

有 GPT-6.1 Astra 或 GPT-6.1 Luna 吗?

没有。截至 2026 年 10 月 1 日,6.1 这个版本号只有 Sol。OpenAI 能力最强的模型仍是 GPT-6 Astra,价格是 GPT-6.1 Sol 的 5 倍。

GPT-6.1 Sol 和 Opus 5.5 现在的价格会保持多久?

两家都没有公开承诺。OpenAI 定价页上的促销期说明只针对 GPT-5.6 Sol,GPT-6.1 Sol 和 Opus 5.5 的价格都没有标注为促销价,也都没有写有效期。上面的金额以两家定价页当日显示为准。