截至 2026 年 10 月 1 日,三款模型里能实际调用的只有 Claude Opus 5.5 和 Claude Sonnet 5.5。Google 在 9 月 30 日公布的 Gemini 4 Argon 目前仅向参与 Fairwind 计划的安全防御团队开放,没有公开的型号 ID,也没有开放日期,发布公告只说会“尽快”提供给开发者、企业和消费者,付费 API 客户和 Google AI Ultra 订阅者排在最前。
所以今天要做的决定只有一个:在两款 Claude 之间选。范围明确的日常任务先用 Sonnet 5.5,多小时的自主编码、大规模重构和复杂系统工程用 Opus 5.5。Argon 的公开数字值得记下来,但它们全部来自厂商和榜单,等它能调用之后,再用你自己的任务重测一次。
Opus 5.5 和 Sonnet 5.5 今天能调用,Argon 还不能
| Gemini 4 Argon | Claude Opus 5.5 | Claude Sonnet 5.5 | |
|---|---|---|---|
| 发布日期 | 2026 年 9 月 30 日公布 | 2026 年 9 月 22 日 | 2026 年 9 月 28 日 |
| 开发者能否调用 | 不能,仅限 Fairwind 计划的安全防御团队 | 能,所有 Claude API 客户 | 能,所有 Claude API 客户 |
| 型号 ID | 未公布 | claude-opus-5-5 | claude-sonnet-5-5 |
| 云平台 | 未公布 | Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS | 同左 |
| 上下文窗口 | 未公布 | 1M token | 1M token |
| 最大输出 | 1M token | 128K token(同步请求) | 128K token(同步请求) |
| 官方延迟标注 | 未公布 | Moderate | Fast |
| 默认 effort | 未公布 | medium | high |
Argon 一列的“未公布”不是省略:Gemini API 模型页和定价页都还没有列出它。Gemini API 上今天能调用的最新模型是 gemini-3.8-flash,型号、价格和迁移细节见 Gemini 3.8 Flash API 指南:型号、价格、规格与迁移。
Argon 已经确定的规格只有一项:输出上限从此前 Gemini 模型的 64K 提高到 1M token。Google 的长上下文评测跑到了 1M token 的输入,但公告没有给出上下文窗口的数字,不能据此当成规格。
两款 Claude 的规格来自 Anthropic 的模型总览。两者都是文本和图片输入、文本输出,可靠知识截止到 2026 年 6 月。云平台上的区域开通情况因账号而异。
价格:Argon 的两档标价正好对上两款 Claude
下表是官方美元标价,单位为每百万 token,不含税。Claude 的价格来自 Claude API 定价页,Argon 的价格来自发布公告及其脚注。
| 输入 | 输出 | 缓存读取 / 缓存输入 | Batch | |
|---|---|---|---|---|
| Gemini 4 Argon(入门价) | $2 | $10 | $0.10(输入价减 95%) | 未公布 |
| Gemini 4 Argon(入门期后) | $4 | $20 | 未写明 | 未公布 |
| Claude Sonnet 5.5 | $2 | $10 | $0.20 | $1 / $5 |
| Claude Opus 5.5 | $4 | $20 | $0.20 | $2 / $10 |
三个关系值得记住:
- Argon 的入门价 $2/$10 等于 Sonnet 5.5 的标价,入门期后的 $4/$20 等于 Opus 5.5 的标价。入门期哪天结束,公告没有写。
- 两款 Claude 的缓存读取同为 $0.20,相当于 Opus 5.5 输入价的 0.05 倍、Sonnet 5.5 输入价的 0.1 倍。缓存占比越高,两者的实际差距越小于一半。
- Argon 入门价下的缓存输入是 $0.10,为两款 Claude 的一半。入门期后如果仍按减 95% 计算会是 $0.20,但这一点公告没有写明。
Argon 的价格目前只有 Fairwind 计划内的团队用得上。Batch、按上下文长度分档、工具费用和 Vertex AI 价格都没有公布。Claude 一侧,Opus 5.5 另有 fast mode(研究预览,仅 Claude API)$8/$40,Sonnet 5.5 没有;指定仅美国推理时价格乘 1.1;Bedrock 和 Google Cloud 各自定价。
算例 A:10 万输入、2 万输出,不用缓存
费用 = 输入 token(百万)× 输入单价 + 输出 token(百万)× 输出单价。
| 模型 | 算式 | 合计 |
|---|---|---|
| Sonnet 5.5 | 0.1 × $2 + 0.02 × $10 | $0.40 |
| Opus 5.5 | 0.1 × $4 + 0.02 × $20 | $0.80 |
| Argon 入门价 | 0.1 × $2 + 0.02 × $10 | $0.40 |
| Argon 入门期后 | 0.1 × $4 + 0.02 × $20 | $0.80 |
token 数相同且不用缓存时,结果就是单价关系本身:Sonnet 5.5 是 Opus 5.5 的一半。
算例 B:缓存占大头的一轮代理调用
假设一轮调用读取 20 万缓存 token,新增 2 万输入、5,000 输出。
| 模型 | 缓存读取 | 新输入 | 输出 | 合计 |
|---|---|---|---|---|
| Sonnet 5.5 | 0.2 × $0.20 = $0.04 | 0.02 × $2 = $0.04 | 0.005 × $10 = $0.05 | $0.13 |
| Opus 5.5 | 0.2 × $0.20 = $0.04 | 0.02 × $4 = $0.08 | 0.005 × $20 = $0.10 | $0.22 |
| Argon 入门价 | 0.2 × $0.10 = $0.02 | 0.02 × $2 = $0.04 | 0.005 × $10 = $0.05 | $0.11 |

这一轮里 Sonnet 5.5 比 Opus 5.5 便宜 ($0.22 − $0.13) ÷ $0.22 ≈ 41%,而不是 50%,原因就是缓存读取两边同价。Argon 入门价再低 $0.02,全部来自缓存输入那一项。
两个算例都假设三款模型消耗的 token 数完全相同,并且没有计入缓存写入、工具费用和税。Argon 的两行在它能调用之前只是按公告价格做的推算。
单价相同不等于单任务成本相同
真实任务里,不同模型的分词方式、effort 档位和思考量都不一样,同一道题消耗的 token 数可以差出很多。Vals Index 公布了每道测试题的实际花费,可以看到这个偏差有多大:Sonnet 5.5 每题 $21.34,Opus 5.5 每题 $32.14,前者约为后者的三分之二(21.34 ÷ 32.14 ≈ 0.66),而不是单价表上的一半。
换成你自己的任务,这个比例还会变。思考 token 怎么进账单、怎么和用量报表对上,见推理 Token 到底怎么计费?Gemini、OpenAI、Claude 的去重对账方法。
基准数字是谁测的,能说明什么
下面的数字都来自厂商或榜单的公布,条件随每条给出。Argon 目前不对外开放,Fairwind 计划之外没有人能复测它的成绩。
Vals Index:三款同场的唯一一份数据
Google 的对比表里没有 Sonnet 5.5,Anthropic 的对比里没有 Argon。把三款放在同一把尺子上的公开来源只有 Vals Index。它是第三方榜单,按 GDP 权重汇总金融、编程、法律和税务任务,下面是 2026 年 9 月 30 日更新的 v2.1:
| 模型 | 得分 | 每题成本 | 用时 |
|---|---|---|---|
| Gemini 4 Argon | 68.90% | $15.68 | 46 分 33 秒 |
| Claude Sonnet 5.5 | 67.04% | $21.34 | 1 小时 18 分 |
| Claude Opus 5.5 | 66.97% | $32.14 | 1 小时 19 分 |
能支持的结论有两条。其一,Argon 领先两款 Claude 约 1.9 个百分点,每题成本约为 Opus 5.5 的一半(15.68 ÷ 32.14 ≈ 0.49),用时也更短。其二,Sonnet 5.5 和 Opus 5.5 只差 0.07 个百分点,Vals 自己的说法是两者基本打平。
不能支持的结论也有两条。Vals 没有说明 Argon 的每题成本按哪一档价格计算;如果用的是入门价,入门期结束后单价翻倍,这个成本优势会明显收窄。另外榜单会随重跑变动,Sonnet 5.5 和 Opus 5.5 之间 0.07 个百分点的差距,重跑一次就可能换位,引用时要带上日期。1 到 2 个百分点的差距不足以替你的任务做决定。
Google 的对比表:Argon 对 Opus 5.5
Google 的模型页列出了 Argon 和 Opus 5.5 的逐项成绩,单位都是 %。18 项里 Argon 领先 14 项,Opus 5.5 领先 4 项。“数字来源”一列取自 Google 的评测方法说明。
| 基准 | Argon | Opus 5.5 | 数字来源 |
|---|---|---|---|
| Vals Index | 68.9 | 67.0 | Vals AI |
| AutomationBench | 51.3 | 42.5 | Zapier 公开榜单 |
| Vals Finance Agent v2 | 65.4 | 58.6 | Vals AI |
| Harvey Legal Agent Benchmark | 19.6 | 3.8 | Vals AI |
| DeepSWE v1.1 | 77.9 | 74.2 | Argon 为 Google 自测,Opus 5.5 取自其 system card |
| Vibe Code Bench | 91.9 | 90.3 | Vals AI 公开榜单 |
| LABBench 2 | 88.8 | 73.1 | 两款均为 Google 自测 |
| RiemannBench | 76.0 | 69.6 | Surge 公开榜单 |
| GraphWalks(≤128k) | 99.7 | 90.6 | 两款均为 Google 自测 |
| GraphWalks(256k–1M) | 84.2 | 66.8 | 两款均为 Google 自测 |
| Agent's Last Exam | 39.5 | 38.2 | Argon 为 Google 自测,Opus 5.5 取自公开榜单 |
| Chartography | 71.6 | 66.3 | Surge 公开榜单,不带工具 |
| LVBench | 91.7 | 83.7 | 两款均为 Google 自测,抽帧数不同 |
| CWE-bench v1 | 68.0 | 67.0 | 公开榜单 |
| FrontierSWE v2 | 55.0 | 62.3 | Proximal 公开榜单 |
| Terminal-Bench 4.0 | 57.4 | 66.4 | Argon 为 Google 自测,Opus 5.5 取自公开榜单 |
| PostTrainBench | 45.3 | 49.3 | 两款均为 Google 自测 |
| Terminal-Bench Science 0.1 | 57.6 | 63.3 | Argon 为 Google 自测,Opus 5.5 取自公开榜单 |
读这张表要带上三个条件:
- 基准是 Google 挑的。Argon 用最高思考档;竞品数字默认取最高推理档,没有公布时取已有的最好成绩。
- 差距最大的几项里,LABBench 2、GraphWalks 和 LVBench 是 Google 自己跑的两边成绩。LVBench 上 Gemini 按每秒 1 帧取帧,Opus 5.5 只用 600 帧,Google 的解释是 API 限制,两边的输入并不对等。
- Opus 5.5 领先的 4 项集中在终端操作和长程工程任务:FrontierSWE v2、Terminal-Bench 4.0、PostTrainBench、Terminal-Bench Science。
可以带走的判断是方向而不是幅度:Argon 在长上下文、法律和金融代理、科研和长视频理解上公布的数字更高,Opus 5.5 在终端和长程工程任务上更高。这张表不能说明 Argon 相对 Sonnet 5.5 的位置。
Anthropic 的数字:Sonnet 5.5 对 Opus 5.5
Sonnet 5.5 的发布页给出了它和 Opus 5.5 的对比,同样是厂商自测:
| 基准 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4%(xhigh,其最好成绩) |
| FrontierCode 1.1 | 46.2%(max;xhigh 为 52.1%) | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
| AA-Briefcase v1.1 | 1811 | 1822 |
| Humanity's Last Exam(带工具) | 64.5% | 67.7% |
| OSWorld 2.1 | 80.1% | 81.8% |
| Chartography(不带工具) | 61.6% | 64.4% |
8 项里 Sonnet 5.5 只在 Terminal-Bench 4.0 上领先,其余 7 项 Opus 5.5 更高,但差距都不大:按百分比计分的几项相差 1.7 到 3.2 个百分点(FrontierCode 1.1 取 Sonnet 5.5 在 xhigh 下的 52.1%)。Anthropic 的结论是:Sonnet 5.5 适合范围明确的日常任务,复杂、开放式的工作上 Opus 5.5“仍然明显更强”。
两处容易读错:
- 发布页说 Sonnet 5.5 输出速度快 30% 以上、单任务成本最多降 30%,比较对象都是上一代 Sonnet 5,不是 Opus 5.5,也不是 Gemini。
- Opus 5.5 的 Chartography 在这里是 64.4,在 Google 的表里是 66.3。两个数字出自不同的运行,各自留在各自的表里看,不要拿 Sonnet 5.5 的 61.6 去和 Argon 的 71.6 直接相减。
现在用哪款 Claude
Anthropic 的选型文档说“多数工作负载从 Opus 5.5 开始”,Vals 的数据则显示两者在综合任务上基本打平、Sonnet 5.5 每题便宜三分之一。两种说法并不矛盾,区别在任务类型:

| 你的任务 | 先用 | 依据 |
|---|---|---|
| 代码生成、数据分析、内容创作、常规工具调用,范围明确 | Sonnet 5.5 | Anthropic 的推荐用途;Vals Index 上与 Opus 5.5 相差 0.07 个百分点,每题成本约三分之二 |
| 多小时的自主编码代理、大规模重构、复杂系统工程 | Opus 5.5 | Anthropic 的推荐用途;FrontierCode 1.1 上 54.4% 对 52.1%(Sonnet 5.5 的 xhigh 成绩) |
| 视觉密集的流程、computer use | Opus 5.5 | Anthropic 的推荐用途;OSWorld 2.1 上 81.8% 对 80.1% |
| 对响应速度敏感的交互场景 | Sonnet 5.5 | 官方延迟标注为 Fast,Opus 5.5 为 Moderate |
| 需要 fast mode | Opus 5.5 | 只有 Opus 5.5 提供(研究预览,仅 Claude API) |
| 缓存占比很高、已经在用 Opus 5.5 | 先别急着换 | 缓存读取同价,按算例 B 的结构只省约 41%,要用自己的 token 分布重算 |
两条补充。第一,Anthropic 明确写了调 effort“往往比换模型更有效”:Opus 5.5 默认 medium,Sonnet 5.5 默认 high,同一任务换档后的成本和质量都会变,档位怎么选见 Claude Opus 5.5 的 effort 怎么选?五档设置与任务成本比较。第二,两款 5.5 的接口行为和旧版不同,例如都会拒绝强制工具调用(tool_choice 设为 any 或 tool 会返回 400),从旧模型切过来之前先看 Claude Opus 5.5 已发布:API 价格、能力与从 Opus 5 迁移的检查项。
如果你的候选里还有 Fable 5.1 或更小的 Claude 模型,各档之间的边界见 Opus 5.5 和 Fable 5.1 怎么选?Claude 四档模型的价格与能力边界。
Argon 开放后要不要重测
不需要为了等 Argon 而暂停手上的选型。它没有开放日期,今天的决定按今天能调用的模型做。等它出现在 Gemini API 模型页之后,是否值得花时间重测,取决于你的任务落在哪一类:
- 值得优先重测:超长上下文里做检索和推理(GraphWalks 256k–1M 上 84.2 对 66.8)、法律和金融类代理、科研工具链、长视频理解,或者单次输出需要超过 128K token(Argon 的输出上限是 1M,两款 Claude 同步请求是 128K)。
- 不必着急:以终端操作和长程工程任务为主。Google 自己的表里,这几项是 Opus 5.5 领先。
- 主要看价格:如果你在用 Sonnet 5.5,Argon 入门价与它相同,换不换只取决于质量和速度;如果你在用 Opus 5.5,入门期内 Argon 的单价是一半,但长期预算要按 $4/$20 来做,那时两者单价相同。
开放当天先确认五件公告没写的事,再开始测:型号 ID、上下文窗口、限速、Batch 与缓存的正式价格、入门价的截止日期。重测时用自己的真实任务,同时记录质量和每个任务的实际花费,而不是只比单价。
常见问题
Gemini 4 Argon 现在能通过 API 调用吗?
不能。截至 2026 年 10 月 1 日,它只向参与 Fairwind 计划的安全防御团队开放,Gemini API 的模型页和定价页都没有列出它,型号 ID 和开放日期也没有公布。Google 说开放时付费 API 客户和 Google AI Ultra 订阅者优先。
“Gemini 4 Pro”和 Gemini 4 Argon 是同一个模型吗?
发布前的泄露消息用过“Gemini 4 Pro”这个名字,Google 正式公布的名称是 Gemini 4 Argon。泄露稿里的价格和“实测”数字不是官方信息,以 9 月 30 日的公告为准。
Gemini 4 Argon 比 Opus 5.5 强吗?
在 Google 公布的 18 项基准里,Argon 领先 14 项,Opus 5.5 领先 4 项(终端和长程工程类)。第三方的 Vals Index v2.1 上 Argon 是 68.90%,Opus 5.5 是 66.97%。这些都不是在你的任务上测的,而且 Argon 目前无法由外部复测。
Gemini 4 Argon 比 Sonnet 5.5 便宜吗?
入门期内输入、输出单价相同,都是 $2/$10,Argon 的缓存输入更低($0.10 对 $0.20)。入门期结束后 Argon 涨到 $4/$20,是 Sonnet 5.5 的两倍。入门期哪天结束没有公布。
Sonnet 5.5 的价格是 Opus 5.5 的一半,用它就能省一半吗?
只有在 token 数相同且不用缓存时才是一半。缓存读取两者同为 $0.20,缓存占比高时差距会缩小(上面的算例 B 是 41%);Vals Index 上 Sonnet 5.5 的每题成本约为 Opus 5.5 的三分之二。



