# Gemini 4 Argon 对比 Opus 5.5、Sonnet 5.5：怎么选

> 截至 2026 年 10 月 1 日，Gemini 4 Argon 还不对开发者开放，能调用的只有 Opus 5.5 和 Sonnet 5.5。Argon 入门价与 Sonnet 5.5 相同，入门期后与 Opus 5.5 相同。

- Source: https://www.aifreeapi.com/zh/posts/gemini-4-argon-vs-claude-opus-5-5-vs-sonnet-5-5
- Language: zh
- Published: 2026-10-01
- Updated: 2026-10-01
- Publisher: AI Free API (https://www.aifreeapi.com)

**截至 2026 年 10 月 1 日**，三款模型里能实际调用的只有 Claude Opus 5.5 和 Claude Sonnet 5.5。Google 在 9 月 30 日公布的 Gemini 4 Argon 目前仅向参与 Fairwind 计划的安全防御团队开放，没有公开的型号 ID，也没有开放日期，[发布公告](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/)只说会“尽快”提供给开发者、企业和消费者，付费 API 客户和 Google AI Ultra 订阅者排在最前。

所以今天要做的决定只有一个：在两款 Claude 之间选。范围明确的日常任务先用 Sonnet 5.5，多小时的自主编码、大规模重构和复杂系统工程用 Opus 5.5。Argon 的公开数字值得记下来，但它们全部来自厂商和榜单，等它能调用之后，再用你自己的任务重测一次。

## Opus 5.5 和 Sonnet 5.5 今天能调用，Argon 还不能

| | Gemini 4 Argon | Claude Opus 5.5 | Claude Sonnet 5.5 |
| --- | --- | --- | --- |
| 发布日期 | 2026 年 9 月 30 日公布 | 2026 年 9 月 22 日 | 2026 年 9 月 28 日 |
| 开发者能否调用 | 不能，仅限 Fairwind 计划的安全防御团队 | 能，所有 Claude API 客户 | 能，所有 Claude API 客户 |
| 型号 ID | 未公布 | `claude-opus-5-5` | `claude-sonnet-5-5` |
| 云平台 | 未公布 | Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS | 同左 |
| 上下文窗口 | 未公布 | 1M token | 1M token |
| 最大输出 | 1M token | 128K token（同步请求） | 128K token（同步请求） |
| 官方延迟标注 | 未公布 | Moderate | Fast |
| 默认 effort | 未公布 | `medium` | `high` |

Argon 一列的“未公布”不是省略：[Gemini API 模型页](https://ai.google.dev/gemini-api/docs/models)和[定价页](https://ai.google.dev/gemini-api/docs/pricing)都还没有列出它。Gemini API 上今天能调用的最新模型是 `gemini-3.8-flash`，型号、价格和迁移细节见 [Gemini 3.8 Flash API 指南：型号、价格、规格与迁移](/zh/posts/gemini-3-8-flash)。

Argon 已经确定的规格只有一项：输出上限从此前 Gemini 模型的 64K 提高到 1M token。Google 的长上下文评测跑到了 1M token 的输入，但公告没有给出上下文窗口的数字，不能据此当成规格。

两款 Claude 的规格来自 Anthropic 的[模型总览](https://platform.claude.com/docs/en/about-claude/models/overview)。两者都是文本和图片输入、文本输出，可靠知识截止到 2026 年 6 月。云平台上的区域开通情况因账号而异。

## 价格：Argon 的两档标价正好对上两款 Claude

下表是官方美元标价，单位为每百万 token，不含税。Claude 的价格来自 [Claude API 定价页](https://platform.claude.com/docs/en/about-claude/pricing)，Argon 的价格来自发布公告及其脚注。

| | 输入 | 输出 | 缓存读取 / 缓存输入 | Batch |
| --- | --- | --- | --- | --- |
| Gemini 4 Argon（入门价） | $2 | $10 | $0.10（输入价减 95%） | 未公布 |
| Gemini 4 Argon（入门期后） | $4 | $20 | 未写明 | 未公布 |
| Claude Sonnet 5.5 | $2 | $10 | $0.20 | $1 / $5 |
| Claude Opus 5.5 | $4 | $20 | $0.20 | $2 / $10 |

三个关系值得记住：

- Argon 的入门价 $2/$10 等于 Sonnet 5.5 的标价，入门期后的 $4/$20 等于 Opus 5.5 的标价。入门期哪天结束，公告没有写。
- 两款 Claude 的缓存读取同为 $0.20，相当于 Opus 5.5 输入价的 0.05 倍、Sonnet 5.5 输入价的 0.1 倍。缓存占比越高，两者的实际差距越小于一半。
- Argon 入门价下的缓存输入是 $0.10，为两款 Claude 的一半。入门期后如果仍按减 95% 计算会是 $0.20，但这一点公告没有写明。

Argon 的价格目前只有 Fairwind 计划内的团队用得上。Batch、按上下文长度分档、工具费用和 Vertex AI 价格都没有公布。Claude 一侧，Opus 5.5 另有 fast mode（研究预览，仅 Claude API）$8/$40，Sonnet 5.5 没有；指定仅美国推理时价格乘 1.1；Bedrock 和 Google Cloud 各自定价。

### 算例 A：10 万输入、2 万输出，不用缓存

费用 = 输入 token（百万）× 输入单价 + 输出 token（百万）× 输出单价。

| 模型 | 算式 | 合计 |
| --- | --- | --- |
| Sonnet 5.5 | 0.1 × $2 + 0.02 × $10 | $0.40 |
| Opus 5.5 | 0.1 × $4 + 0.02 × $20 | $0.80 |
| Argon 入门价 | 0.1 × $2 + 0.02 × $10 | $0.40 |
| Argon 入门期后 | 0.1 × $4 + 0.02 × $20 | $0.80 |

token 数相同且不用缓存时，结果就是单价关系本身：Sonnet 5.5 是 Opus 5.5 的一半。

### 算例 B：缓存占大头的一轮代理调用

假设一轮调用读取 20 万缓存 token，新增 2 万输入、5,000 输出。

| 模型 | 缓存读取 | 新输入 | 输出 | 合计 |
| --- | --- | --- | --- | --- |
| Sonnet 5.5 | 0.2 × $0.20 = $0.04 | 0.02 × $2 = $0.04 | 0.005 × $10 = $0.05 | $0.13 |
| Opus 5.5 | 0.2 × $0.20 = $0.04 | 0.02 × $4 = $0.08 | 0.005 × $20 = $0.10 | $0.22 |
| Argon 入门价 | 0.2 × $0.10 = $0.02 | 0.02 × $2 = $0.04 | 0.005 × $10 = $0.05 | $0.11 |

![算例 B 的逐项算式：读取 20 万缓存 token、2 万新输入、5,000 输出时，Opus 5.5 合计 $0.22，Sonnet 5.5 合计 $0.13，Gemini 4 Argon 入门价合计 $0.11](https://www.aifreeapi.com/posts/zh/gemini-4-argon-vs-claude-opus-5-5-vs-sonnet-5-5/img/cache-heavy-cost-example.webp)

这一轮里 Sonnet 5.5 比 Opus 5.5 便宜 ($0.22 − $0.13) ÷ $0.22 ≈ 41%，而不是 50%，原因就是缓存读取两边同价。Argon 入门价再低 $0.02，全部来自缓存输入那一项。

两个算例都假设三款模型消耗的 token 数完全相同，并且没有计入缓存写入、工具费用和税。Argon 的两行在它能调用之前只是按公告价格做的推算。

### 单价相同不等于单任务成本相同

真实任务里，不同模型的分词方式、effort 档位和思考量都不一样，同一道题消耗的 token 数可以差出很多。[Vals Index](https://www.vals.ai/benchmarks/vals_index) 公布了每道测试题的实际花费，可以看到这个偏差有多大：Sonnet 5.5 每题 $21.34，Opus 5.5 每题 $32.14，前者约为后者的三分之二（21.34 ÷ 32.14 ≈ 0.66），而不是单价表上的一半。

换成你自己的任务，这个比例还会变。思考 token 怎么进账单、怎么和用量报表对上，见[推理 Token 到底怎么计费？Gemini、OpenAI、Claude 的去重对账方法](/zh/posts/reasoning-token-billing)。

## 基准数字是谁测的，能说明什么

下面的数字都来自厂商或榜单的公布，条件随每条给出。Argon 目前不对外开放，Fairwind 计划之外没有人能复测它的成绩。

### Vals Index：三款同场的唯一一份数据

Google 的对比表里没有 Sonnet 5.5，Anthropic 的对比里没有 Argon。把三款放在同一把尺子上的公开来源只有 Vals Index。它是第三方榜单，按 GDP 权重汇总金融、编程、法律和税务任务，下面是 2026 年 9 月 30 日更新的 v2.1：

| 模型 | 得分 | 每题成本 | 用时 |
| --- | --- | --- | --- |
| Gemini 4 Argon | 68.90% | $15.68 | 46 分 33 秒 |
| Claude Sonnet 5.5 | 67.04% | $21.34 | 1 小时 18 分 |
| Claude Opus 5.5 | 66.97% | $32.14 | 1 小时 19 分 |

能支持的结论有两条。其一，Argon 领先两款 Claude 约 1.9 个百分点，每题成本约为 Opus 5.5 的一半（15.68 ÷ 32.14 ≈ 0.49），用时也更短。其二，Sonnet 5.5 和 Opus 5.5 只差 0.07 个百分点，Vals 自己的说法是两者基本打平。

不能支持的结论也有两条。Vals 没有说明 Argon 的每题成本按哪一档价格计算；如果用的是入门价，入门期结束后单价翻倍，这个成本优势会明显收窄。另外榜单会随重跑变动，Sonnet 5.5 和 Opus 5.5 之间 0.07 个百分点的差距，重跑一次就可能换位，引用时要带上日期。1 到 2 个百分点的差距不足以替你的任务做决定。

### Google 的对比表：Argon 对 Opus 5.5

[Google 的模型页](https://deepmind.google/models/gemini/)列出了 Argon 和 Opus 5.5 的逐项成绩，单位都是 %。18 项里 Argon 领先 14 项，Opus 5.5 领先 4 项。“数字来源”一列取自 Google 的[评测方法说明](https://deepmind.google/models/evals-methodology/gemini-4-argon)。

| 基准 | Argon | Opus 5.5 | 数字来源 |
| --- | --- | --- | --- |
| Vals Index | 68.9 | 67.0 | Vals AI |
| AutomationBench | 51.3 | 42.5 | Zapier 公开榜单 |
| Vals Finance Agent v2 | 65.4 | 58.6 | Vals AI |
| Harvey Legal Agent Benchmark | 19.6 | 3.8 | Vals AI |
| DeepSWE v1.1 | 77.9 | 74.2 | Argon 为 Google 自测，Opus 5.5 取自其 system card |
| Vibe Code Bench | 91.9 | 90.3 | Vals AI 公开榜单 |
| LABBench 2 | 88.8 | 73.1 | 两款均为 Google 自测 |
| RiemannBench | 76.0 | 69.6 | Surge 公开榜单 |
| GraphWalks（≤128k） | 99.7 | 90.6 | 两款均为 Google 自测 |
| GraphWalks（256k–1M） | 84.2 | 66.8 | 两款均为 Google 自测 |
| Agent's Last Exam | 39.5 | 38.2 | Argon 为 Google 自测，Opus 5.5 取自公开榜单 |
| Chartography | 71.6 | 66.3 | Surge 公开榜单，不带工具 |
| LVBench | 91.7 | 83.7 | 两款均为 Google 自测，抽帧数不同 |
| CWE-bench v1 | 68.0 | 67.0 | 公开榜单 |
| FrontierSWE v2 | 55.0 | **62.3** | Proximal 公开榜单 |
| Terminal-Bench 4.0 | 57.4 | **66.4** | Argon 为 Google 自测，Opus 5.5 取自公开榜单 |
| PostTrainBench | 45.3 | **49.3** | 两款均为 Google 自测 |
| Terminal-Bench Science 0.1 | 57.6 | **63.3** | Argon 为 Google 自测，Opus 5.5 取自公开榜单 |

读这张表要带上三个条件：

- 基准是 Google 挑的。Argon 用最高思考档；竞品数字默认取最高推理档，没有公布时取已有的最好成绩。
- 差距最大的几项里，LABBench 2、GraphWalks 和 LVBench 是 Google 自己跑的两边成绩。LVBench 上 Gemini 按每秒 1 帧取帧，Opus 5.5 只用 600 帧，Google 的解释是 API 限制，两边的输入并不对等。
- Opus 5.5 领先的 4 项集中在终端操作和长程工程任务：FrontierSWE v2、Terminal-Bench 4.0、PostTrainBench、Terminal-Bench Science。

可以带走的判断是方向而不是幅度：Argon 在长上下文、法律和金融代理、科研和长视频理解上公布的数字更高，Opus 5.5 在终端和长程工程任务上更高。这张表不能说明 Argon 相对 Sonnet 5.5 的位置。

### Anthropic 的数字：Sonnet 5.5 对 Opus 5.5

[Sonnet 5.5 的发布页](https://www.anthropic.com/claude-sonnet-5-5)给出了它和 Opus 5.5 的对比，同样是厂商自测：

| 基准 | Sonnet 5.5 | Opus 5.5 |
| --- | --- | --- |
| Terminal-Bench 4.0 | 70.6% | 66.4%（xhigh，其最好成绩） |
| FrontierCode 1.1 | 46.2%（max；xhigh 为 52.1%） | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
| AA-Briefcase v1.1 | 1811 | 1822 |
| Humanity's Last Exam（带工具） | 64.5% | 67.7% |
| OSWorld 2.1 | 80.1% | 81.8% |
| Chartography（不带工具） | 61.6% | 64.4% |

8 项里 Sonnet 5.5 只在 Terminal-Bench 4.0 上领先，其余 7 项 Opus 5.5 更高，但差距都不大：按百分比计分的几项相差 1.7 到 3.2 个百分点（FrontierCode 1.1 取 Sonnet 5.5 在 xhigh 下的 52.1%）。Anthropic 的结论是：Sonnet 5.5 适合范围明确的日常任务，复杂、开放式的工作上 Opus 5.5“仍然明显更强”。

两处容易读错：

- 发布页说 Sonnet 5.5 输出速度快 30% 以上、单任务成本最多降 30%，比较对象都是上一代 Sonnet 5，不是 Opus 5.5，也不是 Gemini。
- Opus 5.5 的 Chartography 在这里是 64.4，在 Google 的表里是 66.3。两个数字出自不同的运行，各自留在各自的表里看，不要拿 Sonnet 5.5 的 61.6 去和 Argon 的 71.6 直接相减。

## 现在用哪款 Claude

Anthropic 的[选型文档](https://platform.claude.com/docs/en/about-claude/models/choosing-a-model)说“多数工作负载从 Opus 5.5 开始”，Vals 的数据则显示两者在综合任务上基本打平、Sonnet 5.5 每题便宜三分之一。两种说法并不矛盾，区别在任务类型：

![选型流程：Gemini 4 Argon 暂不能调用；任务范围明确先用 Sonnet 5.5，否则先用 Opus 5.5；Argon 开放后优先重测长上下文、法律金融代理和超长输出任务](https://www.aifreeapi.com/posts/zh/gemini-4-argon-vs-claude-opus-5-5-vs-sonnet-5-5/img/model-choice-flow.webp)

| 你的任务 | 先用 | 依据 |
| --- | --- | --- |
| 代码生成、数据分析、内容创作、常规工具调用，范围明确 | Sonnet 5.5 | Anthropic 的推荐用途；Vals Index 上与 Opus 5.5 相差 0.07 个百分点，每题成本约三分之二 |
| 多小时的自主编码代理、大规模重构、复杂系统工程 | Opus 5.5 | Anthropic 的推荐用途；FrontierCode 1.1 上 54.4% 对 52.1%（Sonnet 5.5 的 xhigh 成绩） |
| 视觉密集的流程、computer use | Opus 5.5 | Anthropic 的推荐用途；OSWorld 2.1 上 81.8% 对 80.1% |
| 对响应速度敏感的交互场景 | Sonnet 5.5 | 官方延迟标注为 Fast，Opus 5.5 为 Moderate |
| 需要 fast mode | Opus 5.5 | 只有 Opus 5.5 提供（研究预览，仅 Claude API） |
| 缓存占比很高、已经在用 Opus 5.5 | 先别急着换 | 缓存读取同价，按算例 B 的结构只省约 41%，要用自己的 token 分布重算 |

两条补充。第一，Anthropic 明确写了调 effort“往往比换模型更有效”：Opus 5.5 默认 `medium`，Sonnet 5.5 默认 `high`，同一任务换档后的成本和质量都会变，档位怎么选见 [Claude Opus 5.5 的 effort 怎么选？五档设置与任务成本比较](/zh/posts/claude-opus-5-5-effort)。第二，两款 5.5 的接口行为和旧版不同，例如都会拒绝强制工具调用（`tool_choice` 设为 `any` 或 `tool` 会返回 400），从旧模型切过来之前先看 [Claude Opus 5.5 已发布：API 价格、能力与从 Opus 5 迁移的检查项](/zh/posts/claude-opus-5-5)。

如果你的候选里还有 Fable 5.1 或更小的 Claude 模型，各档之间的边界见 [Opus 5.5 和 Fable 5.1 怎么选？Claude 四档模型的价格与能力边界](/zh/posts/claude-sonnet-vs-opus-vs-haiku-vs-fable)。

## Argon 开放后要不要重测

不需要为了等 Argon 而暂停手上的选型。它没有开放日期，今天的决定按今天能调用的模型做。等它出现在 Gemini API 模型页之后，是否值得花时间重测，取决于你的任务落在哪一类：

- **值得优先重测**：超长上下文里做检索和推理（GraphWalks 256k–1M 上 84.2 对 66.8）、法律和金融类代理、科研工具链、长视频理解，或者单次输出需要超过 128K token（Argon 的输出上限是 1M，两款 Claude 同步请求是 128K）。
- **不必着急**：以终端操作和长程工程任务为主。Google 自己的表里，这几项是 Opus 5.5 领先。
- **主要看价格**：如果你在用 Sonnet 5.5，Argon 入门价与它相同，换不换只取决于质量和速度；如果你在用 Opus 5.5，入门期内 Argon 的单价是一半，但长期预算要按 $4/$20 来做，那时两者单价相同。

开放当天先确认五件公告没写的事，再开始测：型号 ID、上下文窗口、限速、Batch 与缓存的正式价格、入门价的截止日期。重测时用自己的真实任务，同时记录质量和每个任务的实际花费，而不是只比单价。

## 常见问题

### Gemini 4 Argon 现在能通过 API 调用吗？

不能。截至 2026 年 10 月 1 日，它只向参与 Fairwind 计划的安全防御团队开放，Gemini API 的模型页和定价页都没有列出它，型号 ID 和开放日期也没有公布。Google 说开放时付费 API 客户和 Google AI Ultra 订阅者优先。

### “Gemini 4 Pro”和 Gemini 4 Argon 是同一个模型吗？

发布前的泄露消息用过“Gemini 4 Pro”这个名字，Google 正式公布的名称是 Gemini 4 Argon。泄露稿里的价格和“实测”数字不是官方信息，以 9 月 30 日的公告为准。

### Gemini 4 Argon 比 Opus 5.5 强吗？

在 Google 公布的 18 项基准里，Argon 领先 14 项，Opus 5.5 领先 4 项（终端和长程工程类）。第三方的 Vals Index v2.1 上 Argon 是 68.90%，Opus 5.5 是 66.97%。这些都不是在你的任务上测的，而且 Argon 目前无法由外部复测。

### Gemini 4 Argon 比 Sonnet 5.5 便宜吗？

入门期内输入、输出单价相同，都是 $2/$10，Argon 的缓存输入更低（$0.10 对 $0.20）。入门期结束后 Argon 涨到 $4/$20，是 Sonnet 5.5 的两倍。入门期哪天结束没有公布。

### Sonnet 5.5 的价格是 Opus 5.5 的一半，用它就能省一半吗？

只有在 token 数相同且不用缓存时才是一半。缓存读取两者同为 $0.20，缓存占比高时差距会缩小（上面的算例 B 是 41%）；Vals Index 上 Sonnet 5.5 的每题成本约为 Opus 5.5 的三分之二。
