2026年10月1日時点で、3モデルのうち開発者がAPIで呼び出せるのはClaude Opus 5.5とClaude Sonnet 5.5の2つです。Googleが9月30日に発表したGemini 4 Argonは、Fairwind Programに参加するセキュリティ防御の組織にだけ提供されており、Gemini APIのモデル一覧にも料金ページにもまだ載っていません。Googleの発表
そのため、今日の選択は「Sonnet 5.5かOpus 5.5か」です。範囲のはっきりした日常的な作業はSonnet 5.5、数時間続く自律的なコーディングや大規模なリファクタリングはOpus 5.5から始めるのが、Anthropicの指針と公表値に沿った選び方です。Argonは発表された価格とベンチマークを把握しておき、APIで使えるようになった時点で自分のタスクで比べ直します。
| 項目 | Gemini 4 Argon | Claude Opus 5.5 | Claude Sonnet 5.5 |
|---|---|---|---|
| 開発者の利用 | 不可(Fairwind Program参加組織のみ) | 可 | 可 |
| 公開日 | 2026年9月30日発表 | 2026年9月22日 | 2026年9月28日 |
| APIのモデルID | 未公表 | claude-opus-5-5 | claude-sonnet-5-5 |
| 入力/出力の単価 | 導入価格 $2/$10、その後 $4/$20 | $4/$20 | $2/$10 |
| コンテキストウィンドウ | 未公表 | 100万トークン | 100万トークン |
| 最大出力 | 100万トークン | 128Kトークン | 128Kトークン |
単価は米ドル・100万トークンあたり・税抜の公式価格です。Claudeの最大出力は通常の同期リクエストの値です。
いまAPIで呼び出せるのはどのモデルか
Gemini 4 Argonは限定提供の段階
Googleは発表の中で、Argonを開発者・企業・一般ユーザーへ「できるだけ早く」提供するとし、その順番を「有料のAPI利用者とGoogle AI Ultraの契約者から」と説明しています。一般提供の日付、モデルID、コンテキストウィンドウ、レート制限は公開情報に記載がありません。発表前のリーク記事では「Gemini 4 Pro」と呼ばれていましたが、正式名称はGemini 4 Argonです。
Gemini APIのモデル一覧で開発者が呼び出せる最新モデルはGemini 3.8 Flash(gemini-3.8-flash)です。有料枠の単価は2026年12月31日まで入力$0.75/出力$3.75、2027年1月1日から$1.50/$7.50で、無料枠もあります。Gemini APIの料金ページ いまGemini側で開発を進めるなら、Gemini 3.8 Flash APIガイド:モデルID・料金・仕様・移行が出発点になります。
Argonの仕様で明示されているのは出力上限です。従来のGeminiの64Kトークンから100万トークンへ引き上げられました。入力側の上限は発表に書かれていないため、Claudeの100万トークンと並べて優劣を言える段階ではありません。
Claude Opus 5.5とSonnet 5.5は提供中
2モデルはClaude APIの全利用者に提供されており、Amazon Bedrock(anthropic.claude-opus-5-5/anthropic.claude-sonnet-5-5)、Google Cloud、Microsoft Foundry、Claude Platform on AWSでも使えます。クラウド側のリージョンや利用権限はアカウントごとに異なります。Anthropicのモデル一覧
共通する仕様は、100万トークンのコンテキスト、同期リクエストで128Kトークンの最大出力、2026年6月までの知識、テキストと画像の入力・テキストの出力です。違いは次の3点に出ます。
| 違い | Opus 5.5 | Sonnet 5.5 |
|---|---|---|
| 応答速度の区分 | Moderate | Fast |
| 既定のeffort | medium | high |
| 思考の設定 | adaptive thinkingが常時有効 | adaptive。thinking: {"type":"between_tools"}で冒頭の思考を省ける(effortがlow・medium・highのとき) |
既定のeffortが違うため、設定を何も変えずに2モデルを比べると、Sonnet 5.5のほうが高いeffortで動いた結果を見ることになります。比較するときはeffortをそろえるか、それぞれ明示してください。
既存のコードを5.5系へ移す場合、両モデルともtool_choiceのanyとtool(ツールの強制指定)は400エラーになり、旧computer_20251124ツールも受け付けません。Opus 5.5はthinking: {"type":"disabled"}も拒否します。Sonnet 5.5の変更点 エラーになる設定の全体はClaude Opus 5.5の料金と使い方:Opus 5からの移行で確認することにまとめてあります。
料金:Argonの価格はClaudeの2モデルにそのまま重なる
Argonの発表価格は、導入価格が入力$2/出力$10、導入期間が終わると入力$4/出力$20です。前者はSonnet 5.5の標準価格、後者はOpus 5.5の標準価格とちょうど同額です。導入期間がいつ終わるかは発表されていません。
| 課金対象(100万トークンあたり) | Argon 導入価格 | Argon 導入期間後 | Opus 5.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 入力 | $2 | $4 | $4 | $2 |
| 出力 | $10 | $20 | $20 | $10 |
| キャッシュ済み入力(読み取り) | $0.10 | 未公表 | $0.20 | $0.20 |
| 5分キャッシュ書き込み | 未公表 | 未公表 | $5 | $2.50 |
| 1時間キャッシュ書き込み | 未公表 | 未公表 | $8 | $4 |
| Batch(入力/出力) | 未公表 | 未公表 | $2/$10 | $1/$5 |
Argonのキャッシュ済み入力は「入力単価の95%引き」と発表されており、導入価格の$2に当てはめると$0.10です。導入期間後も95%引きが続くかどうかは書かれていません。Claude側はAnthropicの料金表の値で、キャッシュ読み取りはOpus 5.5とSonnet 5.5のどちらも$0.20です。Opus 5.5にはClaude API限定の研究プレビューとしてfast mode(入力$8/出力$40)があり、Sonnet 5.5にはありません。米国内に限定した推論は1.1倍になります。BedrockやGoogle Cloudの価格は各社が別に定めています。
同じトークン数で計算した場合
入力10万トークン、出力2万トークン、キャッシュなしの1回の処理で比べます。
- Sonnet 5.5:
0.1 × $2 + 0.02 × $10 = $0.40 - Opus 5.5:
0.1 × $4 + 0.02 × $20 = $0.80 - Argon(導入価格):
0.1 × $2 + 0.02 × $10 = $0.40 - Argon(導入期間後):
0.1 × $4 + 0.02 × $20 = $0.80
Opus 5.5はSonnet 5.5のちょうど2倍、Argonは時期によってそのどちらかと同額になります。
キャッシュを多く使うエージェントの1ターン
キャッシュ読み取り20万トークン、新規の入力2万トークン、出力5,000トークンの場合です。
- Sonnet 5.5:
0.2 × $0.20 + 0.02 × $2 + 0.005 × $10 = $0.13 - Opus 5.5:
0.2 × $0.20 + 0.02 × $4 + 0.005 × $20 = $0.22 - Argon(導入価格):
0.2 × $0.10 + 0.02 × $2 + 0.005 × $10 = $0.11

キャッシュ読み取りの単価が2モデルで同じなので、Sonnet 5.5とOpus 5.5の差は50%ではなく約41%に縮まります。キャッシュの比率が高いほど、モデルを下げても節約幅は小さくなります。
どちらの計算も、3モデルが同じトークン数を使うという仮定に基づく例で、キャッシュ書き込み、ツール料金、税金は含めていません。実際には、トークナイザー、effort、思考の量によってモデルごとにトークン数が変わるため、単価が同じでもタスクあたりの費用は同じになりません。Argonの行は、APIが開放されるまでは誰も支払えない仮の金額です。思考に使われたトークンが請求にどう現れるかは、推論トークンを二重計上しない:Gemini・OpenAI・Claudeのusage検算で3社分を確認できます。
ベンチマーク:誰が測った数字かで分けて読む
以下の数値はすべてベンダーまたはVals AIの公表値です。3モデルが同じ尺度に並ぶのはVals Indexだけで、Googleの比較表にSonnet 5.5はなく、AnthropicもArgonとの比較は出していません。
3モデルが並ぶVals Index
Vals Indexは、金融・コーディング・法務・税務のタスクを重み付けして集計する第三者のリーダーボードです。2026年9月30日更新のバージョン2.1では次のとおりです。
| モデル | スコア | 1テストあたりの費用 | 所要時間 |
|---|---|---|---|
| Gemini 4 Argon | 68.90% | $15.68 | 46分33秒 |
| Claude Sonnet 5.5 | 67.04% | $21.34 | 1時間18分 |
| Claude Opus 5.5 | 66.97% | $32.14 | 1時間19分 |
ここから読み取れるのは2点です。Argonは約1.9ポイント差で先頭にあり、費用と時間も最も少ない値になっています。Sonnet 5.5とOpus 5.5の差は0.07ポイントで、Vals自身が実質的に同点と説明しており、Sonnet 5.5の費用はOpus 5.5の約3分の2です。
読むときの注意も2点あります。Argonの費用が導入価格と導入期間後の価格のどちらで計算されたかは、ページに明記されていません。また、このリーダーボードは再実行や構成の変更で値が動きます。バージョン2.1は9月25日にTerminal-Bench 4.0への入れ替えと税務タスクの追加を行ったもので、それ以前の値とは直接比べられません。数字を引用するときは、日付とバージョンを添えてください。
Googleの比較表はArgon対Opus 5.5
Googleのモデルページの表から、ArgonとOpus 5.5の列を抜き出します。単位はすべて%です。
| 分野 | ベンチマーク | Gemini 4 Argon | Claude Opus 5.5 |
|---|---|---|---|
| 知識労働 | Vals Index | 68.9 | 67.0 |
| 知識労働 | AutomationBench | 51.3 | 42.5 |
| 知識労働 | Vals Finance Agent v2 | 65.4 | 58.6 |
| 知識労働 | Harvey Legal Agent Benchmark | 19.6 | 3.8 |
| コーディング | DeepSWE v1.1 | 77.9 | 74.2 |
| コーディング | Vibe Code Bench | 91.9 | 90.3 |
| コーディング | FrontierSWE v2 | 55.0 | 62.3 |
| コーディング | Terminal-Bench 4.0 | 57.4 | 66.4 |
| 機械学習エンジニアリング | PostTrainBench | 45.3 | 49.3 |
| 科学・数学 | Terminal-Bench Science 0.1 | 57.6 | 63.3 |
| 科学・数学 | LABBench 2 | 88.8 | 73.1 |
| 科学・数学 | RiemannBench | 76.0 | 69.6 |
| 長文脈 | GraphWalks(128kまで) | 99.7 | 90.6 |
| 長文脈 | GraphWalks(256k〜1M) | 84.2 | 66.8 |
| コンピュータ操作 | Agent's Last Exam | 39.5 | 38.2 |
| マルチモーダル | Chartography | 71.6 | 66.3 |
| マルチモーダル | LVBench | 91.7 | 83.7 |
| サイバーセキュリティ | CWE-bench v1 | 68.0 | 67.0 |
太字はOpus 5.5が上回る4項目です。残りの14行ではArgonが上で、差が大きいのは法務エージェント、長文脈のGraphWalks、LABBench 2、動画理解のLVBenchです。Opus 5.5が上回るのは、FrontierSWE、ターミナル操作を伴う2つのベンチマーク、モデルの追加学習を行うPostTrainBenchで、長時間のエンジニアリング作業に偏っています。
この表はベンダーが項目を選んだものです。Googleの評価方法の説明によると、条件は次のとおりです。
- Argonは最も高い思考設定で実行。他社モデルは原則として各社の自己申告値か公開リーダーボードの値で、最大の推論設定、なければ最良の公表値を採用
- PostTrainBench、LABBench 2、GraphWalks、LVBenchは全モデルをGoogleが自社で実行
- LVBenchは「APIの制約」を理由に入力フレーム数がモデルごとに異なる(Geminiは1FPS、Opus 5.5は600フレーム)
- DeepSWE、Terminal-Bench 4.0、Terminal-Bench Science、Agent's Last ExamのArgonの値はGoogleの自社実行で、他社の値は公開リーダーボードなどから引用
つまり、実行者や実行環境がモデルごとに違う行が混ざっています。1〜2ポイントの差(Vibe Code Bench、Agent's Last Exam、CWE-bench)を優劣の根拠にするのは無理があり、傾向として読むのが妥当です。
Anthropicが公表するSonnet 5.5とOpus 5.5の差
AnthropicのSonnet 5.5発表には、2モデルを並べた数値があります。
| ベンチマーク | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% |
| FrontierCode 1.1 | 46.2%(max)/52.1%(xhigh) | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
| AA-Briefcase v1.1 | 1811 | 1822 |
| Humanity's Last Exam(ツールあり) | 64.5% | 67.7% |
| OSWorld 2.1 | 80.1% | 81.8% |
| Chartography(ツールなし) | 61.6% | 64.4% |
Terminal-Bench 4.0のOpus 5.5は、最も良い結果が出たxhighでの値です。この項目だけSonnet 5.5が上回り、残りはOpus 5.5が上か、ほぼ同じです。差が開くのはFrontierCodeとHumanity's Last Examで、GDPval-AAのような業務タスクの指標では2ポイント差しかありません。
Anthropicはこの結果を踏まえ、Sonnet 5.5を「範囲のはっきりした日常的なタスク」向けとし、複雑で終わりの決まっていない作業ではOpus 5.5が「明確に強い」と説明しています。同じ発表にある「出力が30%以上速い」「タスクあたりの費用が最大30%低い」はSonnet 5との比較で、Opus 5.5やGeminiとの比較ではありません。
なお、Opus 5.5のChartographyはこの表で64.4%、Googleの表で66.3%と一致しません。実行や設定が異なる値なので、2つの表の列を混ぜて順位を付けないでください。
いま使うならSonnet 5.5とOpus 5.5のどちらが良いか
Anthropicのモデル選択ガイドは「ほとんどのワークロードはOpus 5.5から始める」としたうえで、用途を次のように分けています。
| 作業の性質 | 先に試すモデル | 根拠 |
|---|---|---|
| コード生成、データ分析、文章作成、画像の読み取り、ツールを使う定型的なエージェント | Sonnet 5.5 | Anthropicの推奨用途。Vals IndexでOpus 5.5と実質同点、1テストあたりの費用は約3分の2 |
| 数時間続く自律的なコーディング、大規模なリファクタリング、複雑なシステム設計 | Opus 5.5 | Anthropicの推奨用途。FrontierCodeで54.4%対46.2〜52.1% |
| コンピュータ操作、画像を多用するワークフロー | Opus 5.5 | Anthropicの推奨用途。OSWorld 2.1は81.8%対80.1%で差は小さい |
| 応答の速さを優先する対話や大量処理 | Sonnet 5.5 | 速度区分がFast。Batchは入力$1/出力$5 |

迷う場合は、失敗したときのやり直しの費用で決めます。1回の失敗が数十分の再実行や人手の確認につながる作業では、単価が2倍でもOpus 5.5のほうが総額で安くなる余地があります。短く区切れて結果をすぐ検証できる作業は、Sonnet 5.5で始めて不足が出た部分だけOpus 5.5に回すほうが無駄がありません。
モデルを切り替える前に試す価値があるのがeffortです。Anthropicは、effortの調整はモデルの切り替えより有効な手段であることが多いと案内しています。Opus 5.5の5段階の選び方はClaude Opus 5.5のeffort設定:5段階の選び方と費用・キャッシュへの影響、Claudeのほかのモデルを含めた比較はClaude Opus 5.5とFable 5.1を比較:料金と使い分けを参照してください。
Gemini 4 Argonが開放されたら何を確かめるか
Argonを再評価する合図は、Gemini APIのモデル一覧にモデルIDが載ることです。その時点で、次の順に確かめれば判断できます。
- 料金ページの記載 導入価格の終了日、Batchやツールの料金、コンテキスト長による価格の段階があるか。数か月以上運用する予定なら、導入期間後の$4/$20でも計算しておきます。その条件ではOpus 5.5と同じ単価になります。
- 自分のタスクでのトークン数 同じ入力を3モデルに渡し、入力・出力・思考のトークン数と完了までの費用を記録します。単価が同じでも、ここが違えば費用は変わります。
- 結果の差が出やすい作業 Googleの表でArgonが大きく上回るのは長文脈の探索、動画理解、法務・金融のエージェント作業です。逆にターミナル操作を伴う長いエンジニアリング作業ではOpus 5.5が上でした。自分の用途がどちらに近いかで、試す優先度が決まります。
- 出力の長さ 1回の応答で128Kトークンを超える出力が必要な用途は、Claudeの同期リクエストでは収まりません。Argonの100万トークンの出力上限が効くのはこの場合です。
- APIの挙動 ツール呼び出しの指定方法、思考の設定、レート制限は未公表です。既存のコードがそのまま動く前提では計画しないでください。
これらが公開されるまでは、Argonを前提に設計を止める理由はありません。Claudeの2モデルで進め、モデル名と単価を設定値として切り出しておけば、後から比べ直す作業は小さく済みます。
よくある質問
Gemini 4 Argonはいつから使えますか?
日付は発表されていません。Googleは、有料のAPI利用者とGoogle AI Ultraの契約者から順に提供すると述べています。2026年10月1日時点で使えるのは、Fairwind Programに参加するセキュリティ防御の組織だけです。
Gemini 4 Argonは結局Opus 5.5より高性能ですか?
Googleの比較表では18行中14行でArgonが上、4行でOpus 5.5が上です。第三者のVals IndexでもArgonが68.90%、Opus 5.5が66.97%です。ただし、Googleの表は項目の選定も一部の実行もGoogleによるもので、開発者が自分のタスクで確かめる手段はまだありません。「長文脈・動画・法務や金融のエージェント作業ではArgon、ターミナル中心の長いエンジニアリング作業ではOpus 5.5」という傾向までが、公表値から言える範囲です。
Sonnet 5.5はOpus 5.5の半額で同じ性能ですか?
単価は半額ですが、性能が同じとは言えません。Vals Indexでは0.07ポイント差の実質同点で、1テストあたりの費用は半分ではなく約3分の2でした。Anthropicの数値では、FrontierCodeやHumanity's Last ExamでOpus 5.5が上回ります。範囲の決まった作業なら差は出にくく、複雑で長い作業ほど差が出やすいと読むのが妥当です。
Argonの導入価格ならSonnet 5.5より安くなりますか?
入力と出力の単価は同額です。差が出るのはキャッシュ済み入力で、Argonは$0.10、Sonnet 5.5は$0.20です。上のキャッシュ中心の計算例では$0.11対$0.13でした。ただし、これは同じトークン数を使うと仮定した場合で、導入期間が終われば入力$4/出力$20に上がります。



