# GPT-6.1 SolとOpus 5.5比較：定価2倍、タスク単価は6倍差

> GPT-6.1 SolのAPI定価はClaude Opus 5.5の半額で、計測されたタスク単価は6〜8倍差。スコアはOpus 5.5が上です。量の多い作業はSolから試します。

- Source: https://www.aifreeapi.com/ja/posts/gpt-6-1-sol-vs-claude-opus-5-5
- Language: ja
- Published: 2026-10-01
- Updated: 2026-10-01
- Publisher: AI Free API (https://www.aifreeapi.com)

2026年10月1日時点で、GPT-6.1 Sol（`gpt-6.1-sol`）の直販APIの標準単価は100万トークンあたり入力$2・出力$10、Claude Opus 5.5（`claude-opus-5-5`）は入力$4・出力$20です。定価はちょうど2倍の差ですが、第三者が同じ課題を解かせて計測したタスクあたりの費用は、Opus 5.5のほうが6〜8倍高く出ています。一方でスコアは、第三者の計測で同じ推論強度どうしを比べるとOpus 5.5が上です。

そこで出発点は次のようになります。

- テストや自動チェックで合否が決まり、量をこなす作業は、GPT-6.1 Solを先に試します。
- 失敗したときのやり直しや人の確認に時間がかかる難しい作業は、Opus 5.5を残したまま、Solの合格率を自分の課題で測ってから判断します。
- 入力が272Kトークンを超える処理では費用差が1〜7%程度まで縮むので、品質だけで選べます。

以下の数字はベンダーの公表値と第三者の計測値で、どちらなのかと計測条件はそれぞれの箇所に付けています。料金はすべて米ドル建て・税別で、クラウド事業者や再販経由の価格は含みません。

## どちらを先に試すか：定型処理はSol、難しい実装はOpus 5.5

| 作業 | 先に試すモデル | 判断の根拠 |
| --- | --- | --- |
| テストで合否が決まる定型的なコード修正、大量の文書処理、バッチ処理 | GPT-6.1 Sol | 定価が半額で、計測されたタスク単価は6分の1以下。失敗しても再実行が安い |
| 長時間のエージェント作業、設計判断を含む難しい実装 | Opus 5.5を残し、Solを並行で試す | 最大の推論強度ではOpus 5.5のスコアが高い。Solの合格率が十分なら移す |
| 人のレビューが毎回必要な成果物 | 合格率で決める | 確認の手間が費用の大半を占めると、合格率の差が効いてくる |
| 入力が272Kトークンを超える長文・大規模リポジトリ | 品質で選ぶ | 入力単価が同じ$4になり、費用差は1〜7%程度 |
| セキュリティ関連の作業 | 拒否と代替モデルの扱いを先に確認 | Opus 5.5は分類器がリクエストを断ることがあり、設定次第で別モデルが応答する |
| すでに`gpt-6-sol`を使っている処理 | GPT-6.1 Sol | 入出力単価は同じで、キャッシュ入力が半額になる |

OpenAI自身の位置づけでは、GPT-6.1 SolはGPT-6 Solの改良版で、同社で最も能力が高いモデルは引き続きGPT-6 Astraです。GPT-6.1 AstraやGPT-6.1 Lunaというモデルはありません（[OpenAIの発表](https://openai.com/index/introducing-gpt-6-1-sol/)）。

## 仕様と料金の違い：272K以下ならGPT-6.1 SolがOpus 5.5の半額

GPT-6.1 Solは2026年9月末のDevDayに合わせて発表されました（報道では9月29日）。Opus 5.5は2026年9月22日のリリースです。

| 項目 | GPT-6.1 Sol | Claude Opus 5.5 |
| --- | --- | --- |
| モデルID | `gpt-6.1-sol` | `claude-opus-5-5` |
| コンテキストウィンドウ | 1,050,000トークン（最大入力922,000） | 1Mトークン |
| 最大出力 | 128,000トークン | 128Kトークン |
| 推論強度 | `low`〜`max`の5段階、既定は`medium`。`none`と`minimal`は不可 | 既定は`medium`。適応型の思考は常に有効で、無効化できない |
| 入力（100万トークン） | $2 | $4 |
| 出力 | $10 | $20 |
| キャッシュ読み取り | $0.10 | $0.20 |
| キャッシュ書き込み | $2.50 | $5（5分）、$8（1時間） |
| Batch | $1 / $5 | $2 / $10 |
| 高速モード | Fast：$4 / $20 | Fast mode（研究プレビュー、Claude APIのみ）：$8 / $40 |
| 長い入力の割増 | 入力が272Kトークンを超えるリクエストは入力とキャッシュが2倍、出力が1.5倍（$4 / $15） | なし。1Mトークンまで同じ単価 |
| 知識のカットオフ | 2026年4月30日 | 2026年6月（信頼できる範囲） |

出典は、OpenAIの[モデルページ](https://developers.openai.com/api/docs/models/gpt-6.1-sol)と[料金表](https://developers.openai.com/api/docs/pricing)、Anthropicの[モデル概要](https://platform.claude.com/docs/en/models/opus-5-5/overview)と[料金ページ](https://platform.claude.com/docs/en/about-claude/pricing)です。どちらもデータ所在地を指定するエンドポイントでは10%上乗せになります。

272Kトークン以下なら、Standardの各項目はGPT-6.1 SolがOpus 5.5のちょうど半額です。キャッシュ読み取りはどちらも入力単価の95%引きで、割引率に差はありません。Opus 5.5側の料金と移行時の注意は[Claude Opus 5.5の料金と使い方：Opus 5からの移行で確認すること](/ja/posts/claude-opus-5-5)にまとまっています。

## 同じトークン数なら請求は2倍差

入力100,000トークン、出力10,000トークン、キャッシュとツールなしの1リクエストで計算します。

- GPT-6.1 Sol：0.1 × $2 + 0.01 × $10 = $0.30
- Opus 5.5：0.1 × $4 + 0.01 × $20 = $0.60

キャッシュが効いている場合も比率は同じです。キャッシュ読み取り200,000トークン、新規入力20,000トークン、出力5,000トークンなら次のとおりです（最初のキャッシュ書き込みは含みません）。

- GPT-6.1 Sol：0.2 × $0.10 + 0.02 × $2 + 0.005 × $10 = $0.11
- Opus 5.5：0.2 × $0.20 + 0.02 × $4 + 0.005 × $20 = $0.22

ただし「同じトークン数」は仮定です。2社はトークナイザーが違い、同じ文章でもトークン数が一致しません。Anthropicは、Claude 4.7以降のトークナイザーが以前のものより同じテキストで約30%多くトークンを生成すると説明していますが、OpenAIとの比率は公開されていません。トークン単価が2対1でも、文書1件あたりが2対1になるとは限らないので、実際の比率は各APIの`usage`フィールドで測ってください。キャッシュの書き込みと読み取りの課金の違いは[OpenAI vs Claude キャッシュ料金：cached input と cache write/read の損益分岐](/ja/posts/openai-vs-claude-prompt-caching-cost)で扱っています。

### 272Kトークンを超えると差はほぼ消える

GPT-6.1 Solは、入力が272Kトークンを超えたリクエスト全体に長文用の単価（入力$4・出力$15）がかかります。Opus 5.5は900Kトークンのリクエストでも9Kトークンのリクエストと同じ単価です。キャッシュなしで計算すると、境界の前後でこう変わります。

| 入力 / 出力 | GPT-6.1 Sol | Opus 5.5 | Solが安い割合 |
| --- | --- | --- | --- |
| 272,000 / 20,000 | 0.272 × $2 + 0.02 × $10 = $0.744 | 0.272 × $4 + 0.02 × $20 = $1.488 | 50% |
| 273,000 / 20,000 | 0.273 × $4 + 0.02 × $15 = $1.392 | 0.273 × $4 + 0.02 × $20 = $1.492 | 約7% |
| 300,000 / 20,000 | 0.3 × $4 + 0.02 × $15 = $1.50 | 0.3 × $4 + 0.02 × $20 = $1.60 | 約6% |
| 900,000 / 10,000 | 0.9 × $4 + 0.01 × $15 = $3.75 | 0.9 × $4 + 0.01 × $20 = $3.80 | 約1% |

入力が1,000トークン増えて272Kを超えただけで、Solのリクエストは$0.744から$1.392へ、$0.648（87%）上がります。Opus 5.5の増加は$0.004です。ちょうど272,000トークンまでは短い側の単価のままなので、境界付近で動く処理は、不要な履歴やファイルを削って272K以下に収める価値があります。

境界を超えてもSolのほうが合計は安いままですが、差は出力単価（$15対$20）だけになります。この領域では価格を理由に選ぶ意味は薄く、長い入力をどちらが正確に扱えるかで決めることになります。

## 計測されたタスク単価が6〜8倍開く理由

定価の差が2倍なのにタスク単価の差が大きくなるのは、Opus 5.5が同じ課題に対して多くのトークンを出力するからです。Artificial Analysisが自社の評価課題一式（Intelligence Index）を両モデルに解かせた結果は次のとおりです（[medium同士](https://artificialanalysis.ai/models/comparisons/gpt-6-1-sol-medium-vs-claude-opus-5-5-medium)、[max同士](https://artificialanalysis.ai/models/comparisons/gpt-6-1-sol-vs-claude-opus-5-5)、2026年10月1日時点）。

| 指標 | Sol（medium） | Opus 5.5（medium） | Sol（max） | Opus 5.5（max） |
| --- | --- | --- | --- | --- |
| Intelligence Index | 48 | 51 | 52 | 58 |
| タスクあたりの費用（cost per task） | $0.21 | $1.34 | $0.72 | $5.98 |
| インデックス全体の実行費用 | $361 | $1,627 | $1,082 | $8,708 |
| タスクあたりの出力トークン | 8k | 26k | 38k | 119k |
| うち推論トークン | 3k | 12k | 25k | 84k |

タスクあたりの費用の比は、mediumで1.34 ÷ 0.21 ≒ 6.4倍、maxで5.98 ÷ 0.72 ≒ 8.3倍です。インデックス全体の実行費用で見ると4.5倍と8.0倍で、指標によって倍率が違う点に注意してください。

タスクあたりの出力トークンは、どちらの組でもOpus 5.5が約3.1〜3.3倍です。出力単価の2倍に出力量の約3倍を掛けるとおよそ6倍になり、mediumの6.4倍とほぼ合います。maxの8.3倍はそれより大きく、残りの差の内訳はこの表の数字だけでは説明できません。

![Artificial Analysisの計測によるタスクあたりの費用の棒グラフ。mediumはGPT-6.1 Solが$0.21でOpus 5.5が$1.34、maxは$0.72と$5.98](https://www.aifreeapi.com/posts/ja/gpt-6-1-sol-vs-claude-opus-5-5/img/cost-per-task-bars.webp)

別の評価元でも方向は同じです。[Vals Index](https://www.vals.ai/benchmarks/vals_index) v2.1（2026年9月30日更新）では、テスト1件あたりの費用がGPT-6.1 Solで$3.24、Opus 5.5で$32.14でした。約9.9倍の費用で、スコアは5.8ポイント高いという結果です。

どちらも評価元の課題一式での計測で、発表直後の値です。自分の作業での倍率は、出力がどれだけ長くなるかで変わります。出力の長さを左右する推論強度の選び方は[Claude Opus 5.5のeffort設定：5段階の選び方と費用・キャッシュへの影響](/ja/posts/claude-opus-5-5-effort)が参考になります。

### 速度は指標で逆になる

Artificial Analysisの計測では、出力速度はOpus 5.5が速く（mediumで72対59トークン/秒、maxで92対65トークン/秒）、最初の回答トークンが届くまでの時間はGPT-6.1 Solが短くなっています（mediumで5.29秒対22.18秒、maxで約282秒対約703秒）。Valsのテスト1件あたりの所要時間はSolが43分10秒、Opus 5.5が1時間19分でした。1秒あたりのトークン数が多くても、書く量が約3倍なら作業が先に終わるとは限りません。

## 性能はどちらが上か：同じ推論強度の第三者計測ではOpus 5.5

同じ推論強度どうしの第三者計測では、Opus 5.5が上です。ただし差の大きさは設定で変わり、OpenAIの発表資料には中程度の設定でSolが上回る課題もあります。

| 評価 | 設定 | GPT-6.1 Sol | Opus 5.5 | 数字の出どころ |
| --- | --- | --- | --- | --- |
| Artificial Analysis Intelligence Index | medium | 48 | 51 | 第三者の計測 |
| 同上 | max | 52 | 58 | 第三者の計測 |
| Vals Index v2.1 | 行ごとの設定は未記載 | 61.15% | 66.97%（±0.9） | 第三者の計測 |
| GDP.pdf | medium | 30.0% | 25.6% | OpenAIの発表グラフ |
| GDP.pdf | high | 32.0% | 28.8% | OpenAIの発表グラフ |
| AutomationBench 1.0.6 | medium | 31.7% | 29.5% | OpenAIの発表グラフ |
| AutomationBench 1.0.6 | max | 36.1% | 42.5% | OpenAIの発表グラフ |
| Terminal-Bench Science 0.1 | max | 57.0% | 63.3% | OpenAIの発表グラフ |

読み方は3点あります。

- 第三者の2つの指標では、mediumで3ポイント、maxで6ポイント、Valsで5.8ポイント、Opus 5.5が上です。推論強度を上げるほど差が広がっています。
- OpenAIの発表では、GDP.pdfでテストしたすべての推論設定でSolが「fallbackありの」Opus 5.5を上回り、タスクあたりの費用は半分以下とされています。AutomationBenchのmediumでも2.2ポイント上で、費用は約3分の1です。
- 同じOpenAIのグラフでも、maxではOpus 5.5がAutomationBenchで6.4ポイント、Terminal-Bench Scienceで6.3ポイント上です。そのときのタスクあたりの費用はOpus 5.5が$1.44対$0.30（約4.8倍）、$23.21対$5.47（約4.2倍）でした。

OpenAIのグラフの数値は、[Kingy AIが発表グラフから書き起こしたもの](https://kingy.ai/blog/gpt-6-1-sol-vs-claude-opus-5-5)で、発表本文に書かれている2.2ポイント差と$5.47・$23.21とは一致しています。課題と設定を選んだのはOpenAIで、Opus 5.5側の結果は同社が自分で走らせたものではなく公開されている報告から取った、と発表の脚注にあります。独立した検証としては扱えません。

Anthropicの発表値（Terminal-Bench 4.0で66.4%、FrontierCode v1.1で54.4%など、[発表ページ](https://www.anthropic.com/claude-opus-5-5)）はGPT-6.1 Solの登場前のもので、Solの行がありません。両社の発表表には、同じ版のベンチマークで2モデルが並ぶものがないため、発表値どうしを直接比べることはできません。

なお、Vals IndexではClaude Sonnet 5.5が67.04%で、Opus 5.5と誤差の範囲で並び、テスト1件あたりの費用は$21.34と低くなっています。Opus 5.5を残す理由がスコアだけなら、Sonnet 5.5も候補に入ります。

発表直後の利用者の評判は割れています。社内評価でSolが上回ったので既定にしたという投稿も、Opus 5.5のほうがずっと良いという投稿もあり、どちらも個人の報告です。

### Opus 5.5の行に付く「fallback」の意味

Artificial AnalysisはOpus 5.5の行に「Default Fallback」と付け、Valsは「一部の課題は、提供元の拒否のあと代替モデルが応答したものを含む」と注記しています。Opus 5.5のスコアと費用の一部は、別のモデルが出した結果だということです。

仕組みはこうです。Opus 5.5には安全分類器があり、リクエストを断ることがあります。そのときAPIはエラーではなくHTTP 200を返し、`stop_reason`が`"refusal"`になります。呼び出し側がベータヘッダー`server-side-fallback-2026-07-01`を付けて`fallbacks: "default"`を指定していれば、APIはその拒否カテゴリ向けにAnthropicが推奨するモデルで同じリクエストを再実行し、応答の`model`フィールドに実際に答えたモデル名が入ります（[Refusals and fallback](https://platform.claude.com/docs/en/build-with-claude/refusals-and-fallback)）。Anthropicの発表では、サイバーセキュリティ関連の大半のタスクはOpus 4.8に回るとされています。

実務で押さえる点は次のとおりです。

- 代替モデルでの再実行は呼び出し側が設定するものです。設定しなければ拒否のまま返ります。
- サーバー側のfallbackはClaude APIのベータ機能で、Message BatchesやAmazon Bedrock、Google Cloud、Microsoft Foundryでは使えません。そちらではSDKのミドルウェアか自前の再試行になります。
- 費用は、各試行を実際に動かしたモデルの単価で計算されます。出力前の拒否が課金されるのは`bio`、`frontier_llm`、`reasoning_extraction`の3カテゴリだけです（2026年9月時点）。課金されない拒否もレート制限には数えられます。
- 拒否はHTTP 200なので、エラー率の監視には現れません。`stop_reason`を見て件数を記録する必要があります。

どのくらいの頻度で起きるかは作業内容によります。セキュリティ寄りの作業が多いなら、Opus 5.5の比較結果には別モデルの出力が混ざっている前提で読み、自分の処理では`model`フィールドを記録しておくと、どのモデルの品質を見ているのかを取り違えずに済みます。

## 合格1件あたりの費用で決める

スコアと単価を別々に眺めても結論は出ません。自分の作業で試した数字を1つの式に入れます。

1回の試行にかかるAPI費用をc、1回ごとに人が確認する費用をR、合格率をpとし、合格するまでやり直すとすると、合格1件あたりの費用は次の式になります。

```text
合格1件あたりの費用 = (c + R) ÷ p
```

Opus 5.5のほうが安くなるのは、次の条件を満たすときだけです。

```text
p_opus ÷ p_sol > (c_opus + R) ÷ (c_sol + R)
```

cの例としてArtificial Analysisのmediumでのタスクあたりの費用（Sol $0.21、Opus 5.5 $1.34）を使うと、2つの場合で結論がまったく違ってきます。

**確認が自動で、人の手間がゼロの場合**（R = 0）

必要な合格率の比は1.34 ÷ 0.21 ≒ 6.38です。Opus 5.5が必ず合格する（p = 1）としても、Solの合格率が1 ÷ 6.38 ≒ 15.7%を下回らない限り、Solのほうが安くなります。テストで合否が自動判定できる作業でSolを先に試す理由はここにあります。

**1回の確認に$5かかる場合**（たとえば時給$60の人が5分見る）

必要な比は(1.34 + 5) ÷ (0.21 + 5) = 6.34 ÷ 5.21 ≒ 1.217です。Solの合格率が70%なら、Opus 5.5は85.2%を超えれば安くなります。両側で確かめます。

- Opus 5.5が90%：6.34 ÷ 0.9 = $7.04、Solは5.21 ÷ 0.7 = $7.44。Opus 5.5が安い
- Opus 5.5が80%：6.34 ÷ 0.8 = $7.93、Solは$7.44。Solが安い

![合格1件あたりの費用の計算例。確認に1回$5かかる場合、合格率70%のGPT-6.1 Solは$7.44、Opus 5.5は合格率90%で$7.04、80%で$7.93](https://www.aifreeapi.com/posts/ja/gpt-6-1-sol-vs-claude-opus-5-5/img/cost-per-accepted-result.webp)

人の確認が費用の大半を占める作業では、API料金の6倍差はほとんど効かなくなり、合格率の十数ポイントの差で結論が入れ替わります。

この式に入れるcとR、合格率は読む人自身の値で、ここでの70%や$5は計算例です。各試行が独立で、確認時間が毎回同じという単純化もしています。手順としては、代表的な課題をいくつか選び、両モデルに同じ推論強度で解かせ、`usage`から1件あたりの費用を、結果から合格率を出して上の式に入れます。

## 月額20ドルのプランで選ぶ場合

回数を数字で比べることは、公開情報からはできません。

OpenAI側は、GPT-6.1 SolをPlus、Pro、Business、Enterprise、Eduの各プランに提供しており、使える場所はChatGPT WorkとCodexです。通常のチャットにはまだ提供されていません。無料プランとGoで使えるかどうかは発表に書かれていません。[料金ページ](https://learn.chatgpt.com/docs/pricing)によると、Plusと標準のBusinessでのローカルメッセージ数は5時間あたり15〜160で、GPT-6 Sol（15〜150）よりわずかに多い幅です。この数は使うモデルとタスクの大きさ・複雑さで変わると明記されており、保証値ではありません。

Claude側は、Opus 5.5がProとMaxで使えます。Anthropicはリリースに合わせてPro、Max、Team、シート制Enterpriseの5時間あたりの上限を引き上げたと発表していますが、数値は出していません。

したがって、月額料金をAPI単価で割って「何回分」と見積もる方法は成り立ちません。選ぶ基準は使う場所と作業の種類になります。Codexでコーディングエージェントを回したい、通常のチャットではなく作業用の画面で使う、という人はChatGPT側が合います。上限に当たったときの影響は、小さな作業を数多く回すのか、大きな作業を数件こなすのかで変わるので、どちらも1か月試して、自分の使い方で5時間の枠がどこまで持つかを見るのが確実です。GPT-6系のCodexクレジットの数え方は[GPT-6 SolとLunaの料金比較：APIとCodexでどう違う？](/ja/posts/gpt-6-luna-vs-sol-price)にあります。

## 既存のコードを切り替えるときの変更点

### GPT-6 SolからGPT-6.1 Solへ

モデルIDを`gpt-6-sol`から`gpt-6.1-sol`に替えます。入力$2・出力$10と272Kの割増ルールは同じで、キャッシュ入力が$0.20から$0.10に下がります。Codexのクレジットも、キャッシュ入力だけが100万トークンあたり5から2.5になり、入力50・出力250は変わりません。

気をつけるのは推論強度です。`gpt-6.1-sol`は`none`と`minimal`を受け付けません。GPT-6 Solで`none`を指定して推論を切っていた呼び出しは、`low`以上に変える必要があり、そのぶん出力トークンと応答時間が増える可能性があります。

### OpenAIのモデルからOpus 5.5へ

Opus 5.5へ移す、または併用する場合は、APIの振る舞いの違いでエラーになる箇所があります（[Opus 5.5の変更点](https://platform.claude.com/docs/en/models/opus-5-5/whats-new-opus-5-5)）。

- 思考は無効にできません。`thinking: {"type": "disabled"}`や手動の予算指定は400エラーになります。
- `tool_choice`は`auto`と`none`だけです。`any`や特定ツールの指定は400エラーになります。
- ツール呼び出しの合間の文章は思考ブロックで届き、既定の表示設定では中身が空です。途中経過を画面に出していた実装は見直しが要ります。
- 同じ推論強度でもOpus 5より1ターンあたりの思考量が多くなる傾向があり、`xhigh`と`max`で特に顕著です。

旧世代のSolと比べた場合の費用の分かれ方は[Claude Opus 5.5とGPT-5.6 Sol比較：費用が分かれる条件](/ja/posts/claude-opus-5-5-vs-gpt-5-6-sol)にあります。

## よくある質問

### GPT-6.1 Solの料金は期間限定のプロモーション価格ですか

OpenAIの料金表で、GPT-6.1 Solの単価にプロモーションの表示はありません。「少なくとも2026年11月21日まで」という注記はGPT-5.6 Solに付いているもので、GPT-6.1 Solのものではありません。現在の単価がいつまで続くかは公表されていません。

### GPT-6.1 Sol Ultrafastはいくらですか

OpenAIの発表はGPT-6.1 Sol Ultrafastに触れていますが、料金表に単価の行は見当たりません。料金表にあるFastモードは標準の2倍（入力$4・出力$20）で、Ultrafastとは別のものです。

### Opus 5.5のほうが賢いなら、常にOpus 5.5を使うべきですか

スコアの差は、同じ推論強度で3〜6ポイントです。その差が自分の作業の合格率にどれだけ現れるかで決まります。自動で合否が判定できる作業では、Solの合格率が約16%を下回らない限りSolのほうが安く、人の確認に時間がかかる作業では合格率の差が十数ポイントあればOpus 5.5が安くなります。

### GPT-6.1 Solをmaxにすれば、Opus 5.5のmediumの代わりになりますか

Artificial Analysisの指標では、Solのmaxが52、Opus 5.5のmediumが51でほぼ並び、タスクあたりの費用は$0.72対$1.34でSolが安くなっています。ただしmaxのSolは最初の回答トークンまで約282秒かかっており、Opus 5.5のmediumの22.18秒よりずっと長くなります。待ち時間が問題にならないバッチ的な処理なら、試す価値のある組み合わせです。

### GPT-6.1 SolとOpus 5.5のAPI料金は日本円でいくらになりますか

両社のAPI料金は米ドル建てで公表されています。円での請求額は為替と決済方法、税の扱いで変わるため、各社のコンソールの請求画面で確認してください。
