跳到正文

Gemini 4 Argon 对比 Opus 5.5、Sonnet 5.5:怎么选

日常任务先用 Sonnet 5.5,长时间自主编码和复杂工程用 Opus 5.5;Gemini 4 Argon 入门价 $2/$10,等它开放后再用自己的任务重测。

A
••18 分钟阅读•AI模型
底座上三组叠片按每百万 token 输出价比较:Gemini 4 Argon 入门价 $10、Opus 5.5 $20、Sonnet 5.5 $10

截至 2026 年 10 月 1 日,三款模型里能实际调用的只有 Claude Opus 5.5 和 Claude Sonnet 5.5。Google 在 9 月 30 日公布的 Gemini 4 Argon 目前仅向参与 Fairwind 计划的安全防御团队开放,没有公开的型号 ID,也没有开放日期,发布公告只说会“尽快”提供给开发者、企业和消费者,付费 API 客户和 Google AI Ultra 订阅者排在最前。

所以今天要做的决定只有一个:在两款 Claude 之间选。范围明确的日常任务先用 Sonnet 5.5,多小时的自主编码、大规模重构和复杂系统工程用 Opus 5.5。Argon 的公开数字值得记下来,但它们全部来自厂商和榜单,等它能调用之后,再用你自己的任务重测一次。

Opus 5.5 和 Sonnet 5.5 今天能调用,Argon 还不能

Gemini 4 ArgonClaude Opus 5.5Claude Sonnet 5.5
发布日期2026 年 9 月 30 日公布2026 年 9 月 22 日2026 年 9 月 28 日
开发者能否调用不能,仅限 Fairwind 计划的安全防御团队能,所有 Claude API 客户能,所有 Claude API 客户
型号 ID未公布claude-opus-5-5claude-sonnet-5-5
云平台未公布Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS同左
上下文窗口未公布1M token1M token
最大输出1M token128K token(同步请求)128K token(同步请求)
官方延迟标注未公布ModerateFast
默认 effort未公布mediumhigh

Argon 一列的“未公布”不是省略:Gemini API 模型页和定价页都还没有列出它。Gemini API 上今天能调用的最新模型是 gemini-3.8-flash,型号、价格和迁移细节见 Gemini 3.8 Flash API 指南:型号、价格、规格与迁移。

Argon 已经确定的规格只有一项:输出上限从此前 Gemini 模型的 64K 提高到 1M token。Google 的长上下文评测跑到了 1M token 的输入,但公告没有给出上下文窗口的数字,不能据此当成规格。

两款 Claude 的规格来自 Anthropic 的模型总览。两者都是文本和图片输入、文本输出,可靠知识截止到 2026 年 6 月。云平台上的区域开通情况因账号而异。

价格:Argon 的两档标价正好对上两款 Claude

下表是官方美元标价,单位为每百万 token,不含税。Claude 的价格来自 Claude API 定价页,Argon 的价格来自发布公告及其脚注。

输入输出缓存读取 / 缓存输入Batch
Gemini 4 Argon(入门价)$2$10$0.10(输入价减 95%)未公布
Gemini 4 Argon(入门期后)$4$20未写明未公布
Claude Sonnet 5.5$2$10$0.20$1 / $5
Claude Opus 5.5$4$20$0.20$2 / $10

三个关系值得记住:

  • Argon 的入门价 $2/$10 等于 Sonnet 5.5 的标价,入门期后的 $4/$20 等于 Opus 5.5 的标价。入门期哪天结束,公告没有写。
  • 两款 Claude 的缓存读取同为 $0.20,相当于 Opus 5.5 输入价的 0.05 倍、Sonnet 5.5 输入价的 0.1 倍。缓存占比越高,两者的实际差距越小于一半。
  • Argon 入门价下的缓存输入是 $0.10,为两款 Claude 的一半。入门期后如果仍按减 95% 计算会是 $0.20,但这一点公告没有写明。

Argon 的价格目前只有 Fairwind 计划内的团队用得上。Batch、按上下文长度分档、工具费用和 Vertex AI 价格都没有公布。Claude 一侧,Opus 5.5 另有 fast mode(研究预览,仅 Claude API)$8/$40,Sonnet 5.5 没有;指定仅美国推理时价格乘 1.1;Bedrock 和 Google Cloud 各自定价。

算例 A:10 万输入、2 万输出,不用缓存

费用 = 输入 token(百万)× 输入单价 + 输出 token(百万)× 输出单价。

模型算式合计
Sonnet 5.50.1 × $2 + 0.02 × $10$0.40
Opus 5.50.1 × $4 + 0.02 × $20$0.80
Argon 入门价0.1 × $2 + 0.02 × $10$0.40
Argon 入门期后0.1 × $4 + 0.02 × $20$0.80

token 数相同且不用缓存时,结果就是单价关系本身:Sonnet 5.5 是 Opus 5.5 的一半。

算例 B:缓存占大头的一轮代理调用

假设一轮调用读取 20 万缓存 token,新增 2 万输入、5,000 输出。

模型缓存读取新输入输出合计
Sonnet 5.50.2 × $0.20 = $0.040.02 × $2 = $0.040.005 × $10 = $0.05$0.13
Opus 5.50.2 × $0.20 = $0.040.02 × $4 = $0.080.005 × $20 = $0.10$0.22
Argon 入门价0.2 × $0.10 = $0.020.02 × $2 = $0.040.005 × $10 = $0.05$0.11
算例 B 的逐项算式:读取 20 万缓存 token、2 万新输入、5,000 输出时,Opus 5.5 合计 $0.22,Sonnet 5.5 合计 $0.13,Gemini 4 Argon 入门价合计 $0.11

这一轮里 Sonnet 5.5 比 Opus 5.5 便宜 ($0.22 − $0.13) ÷ $0.22 ≈ 41%,而不是 50%,原因就是缓存读取两边同价。Argon 入门价再低 $0.02,全部来自缓存输入那一项。

两个算例都假设三款模型消耗的 token 数完全相同,并且没有计入缓存写入、工具费用和税。Argon 的两行在它能调用之前只是按公告价格做的推算。

单价相同不等于单任务成本相同

真实任务里,不同模型的分词方式、effort 档位和思考量都不一样,同一道题消耗的 token 数可以差出很多。Vals Index 公布了每道测试题的实际花费,可以看到这个偏差有多大:Sonnet 5.5 每题 $21.34,Opus 5.5 每题 $32.14,前者约为后者的三分之二(21.34 ÷ 32.14 ≈ 0.66),而不是单价表上的一半。

换成你自己的任务,这个比例还会变。思考 token 怎么进账单、怎么和用量报表对上,见推理 Token 到底怎么计费?Gemini、OpenAI、Claude 的去重对账方法。

基准数字是谁测的,能说明什么

下面的数字都来自厂商或榜单的公布,条件随每条给出。Argon 目前不对外开放,Fairwind 计划之外没有人能复测它的成绩。

Vals Index:三款同场的唯一一份数据

Google 的对比表里没有 Sonnet 5.5,Anthropic 的对比里没有 Argon。把三款放在同一把尺子上的公开来源只有 Vals Index。它是第三方榜单,按 GDP 权重汇总金融、编程、法律和税务任务,下面是 2026 年 9 月 30 日更新的 v2.1:

模型得分每题成本用时
Gemini 4 Argon68.90%$15.6846 分 33 秒
Claude Sonnet 5.567.04%$21.341 小时 18 分
Claude Opus 5.566.97%$32.141 小时 19 分

能支持的结论有两条。其一,Argon 领先两款 Claude 约 1.9 个百分点,每题成本约为 Opus 5.5 的一半(15.68 ÷ 32.14 ≈ 0.49),用时也更短。其二,Sonnet 5.5 和 Opus 5.5 只差 0.07 个百分点,Vals 自己的说法是两者基本打平。

不能支持的结论也有两条。Vals 没有说明 Argon 的每题成本按哪一档价格计算;如果用的是入门价,入门期结束后单价翻倍,这个成本优势会明显收窄。另外榜单会随重跑变动,Sonnet 5.5 和 Opus 5.5 之间 0.07 个百分点的差距,重跑一次就可能换位,引用时要带上日期。1 到 2 个百分点的差距不足以替你的任务做决定。

Google 的对比表:Argon 对 Opus 5.5

Google 的模型页列出了 Argon 和 Opus 5.5 的逐项成绩,单位都是 %。18 项里 Argon 领先 14 项,Opus 5.5 领先 4 项。“数字来源”一列取自 Google 的评测方法说明。

基准ArgonOpus 5.5数字来源
Vals Index68.967.0Vals AI
AutomationBench51.342.5Zapier 公开榜单
Vals Finance Agent v265.458.6Vals AI
Harvey Legal Agent Benchmark19.63.8Vals AI
DeepSWE v1.177.974.2Argon 为 Google 自测,Opus 5.5 取自其 system card
Vibe Code Bench91.990.3Vals AI 公开榜单
LABBench 288.873.1两款均为 Google 自测
RiemannBench76.069.6Surge 公开榜单
GraphWalks(≤128k)99.790.6两款均为 Google 自测
GraphWalks(256k–1M)84.266.8两款均为 Google 自测
Agent's Last Exam39.538.2Argon 为 Google 自测,Opus 5.5 取自公开榜单
Chartography71.666.3Surge 公开榜单,不带工具
LVBench91.783.7两款均为 Google 自测,抽帧数不同
CWE-bench v168.067.0公开榜单
FrontierSWE v255.062.3Proximal 公开榜单
Terminal-Bench 4.057.466.4Argon 为 Google 自测,Opus 5.5 取自公开榜单
PostTrainBench45.349.3两款均为 Google 自测
Terminal-Bench Science 0.157.663.3Argon 为 Google 自测,Opus 5.5 取自公开榜单

读这张表要带上三个条件:

  • 基准是 Google 挑的。Argon 用最高思考档;竞品数字默认取最高推理档,没有公布时取已有的最好成绩。
  • 差距最大的几项里,LABBench 2、GraphWalks 和 LVBench 是 Google 自己跑的两边成绩。LVBench 上 Gemini 按每秒 1 帧取帧,Opus 5.5 只用 600 帧,Google 的解释是 API 限制,两边的输入并不对等。
  • Opus 5.5 领先的 4 项集中在终端操作和长程工程任务:FrontierSWE v2、Terminal-Bench 4.0、PostTrainBench、Terminal-Bench Science。

可以带走的判断是方向而不是幅度:Argon 在长上下文、法律和金融代理、科研和长视频理解上公布的数字更高,Opus 5.5 在终端和长程工程任务上更高。这张表不能说明 Argon 相对 Sonnet 5.5 的位置。

Anthropic 的数字:Sonnet 5.5 对 Opus 5.5

Sonnet 5.5 的发布页给出了它和 Opus 5.5 的对比,同样是厂商自测:

基准Sonnet 5.5Opus 5.5
Terminal-Bench 4.070.6%66.4%(xhigh,其最好成绩)
FrontierCode 1.146.2%(max;xhigh 为 52.1%)54.4%
CursorBench 4.055.5%57.8%
GDPval-AA v2.118441846
AA-Briefcase v1.118111822
Humanity's Last Exam(带工具)64.5%67.7%
OSWorld 2.180.1%81.8%
Chartography(不带工具)61.6%64.4%

8 项里 Sonnet 5.5 只在 Terminal-Bench 4.0 上领先,其余 7 项 Opus 5.5 更高,但差距都不大:按百分比计分的几项相差 1.7 到 3.2 个百分点(FrontierCode 1.1 取 Sonnet 5.5 在 xhigh 下的 52.1%)。Anthropic 的结论是:Sonnet 5.5 适合范围明确的日常任务,复杂、开放式的工作上 Opus 5.5“仍然明显更强”。

两处容易读错:

  • 发布页说 Sonnet 5.5 输出速度快 30% 以上、单任务成本最多降 30%,比较对象都是上一代 Sonnet 5,不是 Opus 5.5,也不是 Gemini。
  • Opus 5.5 的 Chartography 在这里是 64.4,在 Google 的表里是 66.3。两个数字出自不同的运行,各自留在各自的表里看,不要拿 Sonnet 5.5 的 61.6 去和 Argon 的 71.6 直接相减。

现在用哪款 Claude

Anthropic 的选型文档说“多数工作负载从 Opus 5.5 开始”,Vals 的数据则显示两者在综合任务上基本打平、Sonnet 5.5 每题便宜三分之一。两种说法并不矛盾,区别在任务类型:

选型流程:Gemini 4 Argon 暂不能调用;任务范围明确先用 Sonnet 5.5,否则先用 Opus 5.5;Argon 开放后优先重测长上下文、法律金融代理和超长输出任务
你的任务先用依据
代码生成、数据分析、内容创作、常规工具调用,范围明确Sonnet 5.5Anthropic 的推荐用途;Vals Index 上与 Opus 5.5 相差 0.07 个百分点,每题成本约三分之二
多小时的自主编码代理、大规模重构、复杂系统工程Opus 5.5Anthropic 的推荐用途;FrontierCode 1.1 上 54.4% 对 52.1%(Sonnet 5.5 的 xhigh 成绩)
视觉密集的流程、computer useOpus 5.5Anthropic 的推荐用途;OSWorld 2.1 上 81.8% 对 80.1%
对响应速度敏感的交互场景Sonnet 5.5官方延迟标注为 Fast,Opus 5.5 为 Moderate
需要 fast modeOpus 5.5只有 Opus 5.5 提供(研究预览,仅 Claude API)
缓存占比很高、已经在用 Opus 5.5先别急着换缓存读取同价,按算例 B 的结构只省约 41%,要用自己的 token 分布重算

两条补充。第一,Anthropic 明确写了调 effort“往往比换模型更有效”:Opus 5.5 默认 medium,Sonnet 5.5 默认 high,同一任务换档后的成本和质量都会变,档位怎么选见 Claude Opus 5.5 的 effort 怎么选?五档设置与任务成本比较。第二,两款 5.5 的接口行为和旧版不同,例如都会拒绝强制工具调用(tool_choice 设为 any 或 tool 会返回 400),从旧模型切过来之前先看 Claude Opus 5.5 已发布:API 价格、能力与从 Opus 5 迁移的检查项。

如果你的候选里还有 Fable 5.1 或更小的 Claude 模型,各档之间的边界见 Opus 5.5 和 Fable 5.1 怎么选?Claude 四档模型的价格与能力边界。

Argon 开放后要不要重测

不需要为了等 Argon 而暂停手上的选型。它没有开放日期,今天的决定按今天能调用的模型做。等它出现在 Gemini API 模型页之后,是否值得花时间重测,取决于你的任务落在哪一类:

  • 值得优先重测:超长上下文里做检索和推理(GraphWalks 256k–1M 上 84.2 对 66.8)、法律和金融类代理、科研工具链、长视频理解,或者单次输出需要超过 128K token(Argon 的输出上限是 1M,两款 Claude 同步请求是 128K)。
  • 不必着急:以终端操作和长程工程任务为主。Google 自己的表里,这几项是 Opus 5.5 领先。
  • 主要看价格:如果你在用 Sonnet 5.5,Argon 入门价与它相同,换不换只取决于质量和速度;如果你在用 Opus 5.5,入门期内 Argon 的单价是一半,但长期预算要按 $4/$20 来做,那时两者单价相同。

开放当天先确认五件公告没写的事,再开始测:型号 ID、上下文窗口、限速、Batch 与缓存的正式价格、入门价的截止日期。重测时用自己的真实任务,同时记录质量和每个任务的实际花费,而不是只比单价。

常见问题

Gemini 4 Argon 现在能通过 API 调用吗?

不能。截至 2026 年 10 月 1 日,它只向参与 Fairwind 计划的安全防御团队开放,Gemini API 的模型页和定价页都没有列出它,型号 ID 和开放日期也没有公布。Google 说开放时付费 API 客户和 Google AI Ultra 订阅者优先。

“Gemini 4 Pro”和 Gemini 4 Argon 是同一个模型吗?

发布前的泄露消息用过“Gemini 4 Pro”这个名字,Google 正式公布的名称是 Gemini 4 Argon。泄露稿里的价格和“实测”数字不是官方信息,以 9 月 30 日的公告为准。

Gemini 4 Argon 比 Opus 5.5 强吗?

在 Google 公布的 18 项基准里,Argon 领先 14 项,Opus 5.5 领先 4 项(终端和长程工程类)。第三方的 Vals Index v2.1 上 Argon 是 68.90%,Opus 5.5 是 66.97%。这些都不是在你的任务上测的,而且 Argon 目前无法由外部复测。

Gemini 4 Argon 比 Sonnet 5.5 便宜吗?

入门期内输入、输出单价相同,都是 $2/$10,Argon 的缓存输入更低($0.10 对 $0.20)。入门期结束后 Argon 涨到 $4/$20,是 Sonnet 5.5 的两倍。入门期哪天结束没有公布。

Sonnet 5.5 的价格是 Opus 5.5 的一半,用它就能省一半吗?

只有在 token 数相同且不用缓存时才是一半。缓存读取两者同为 $0.20,缓存占比高时差距会缩小(上面的算例 B 是 41%);Vals Index 上 Sonnet 5.5 的每题成本约为 Opus 5.5 的三分之二。