GPT-5.6・Claude Sonnet 5・Gemini 3.1 Pro 三つ巴 — 同月世代更新のモデル選定ガイド
はじめに
2026年6〜7月、大手3社が示し合わせたように主力LLMの世代更新をぶつけ合いました。Anthropicが6/30にClaude Sonnet 5、OpenAIが7/9に3層構成のGPT-5.6ファミリー(Luna/Terra/Sol)をGA、Googleは最難関推論向けのGemini 3.1 Proと価格性能重視のGemini 3.5 Flashを展開。前日の当ブログではGPT-5.6の内部を掘り下げましたが、本記事は視点を変え、「結局どれを使うべきか」を横断比較で整理します。価格・ベンチマーク・得意領域の違いと、用途別の選び方を具体的にまとめました。
三者三様のラインナップと価格
まず土台となる価格(100万トークンあたり、入力/出力)と位置づけを並べます。
| モデル | 入力 / 出力 | 位置づけ |
|---|---|---|
| GPT-5.6 Luna | $1 / $6 | 最速・最安の軽量枠 |
| GPT-5.6 Terra | $2.50 / $15 | GPT-5.5同等を約半額で狙うバランス型 |
| GPT-5.6 Sol | $5 / $30 | 生化学・サイバー特化のフラッグシップ |
| Claude Sonnet 5 | $3 / $15(導入価格 $2 / $10、8/31まで) | 汎用主力・1Mコンテキスト |
| Gemini 3.5 Flash | $1.50 / $9 | 価格性能重視・コーディングに強い |
| Gemini 3.1 Pro | (プレミアム帯) | 最難関推論・ベンチ最上位 |
注目すべきは、OpenAIが単一モデルではなくLuna/Terra/Solの3段でコスト帯を刻んできた点です。従来「フラッグシップ1本+mini」だった構図から、用途に応じて明示的にグレードを選ばせる方向へ移りました。Anthropicも導入価格 $2/$10 を8/31まで設定し、Sonnet 5をFree/Proのデフォルトに据えるなど、価格での主導権争いが鮮明です(Anthropic / aipricing.guru)。
ベンチマークで見える得意領域の違い
各社の公開値を並べると、単純な優劣ではなく「土俵ごとの棲み分け」が見えてきます。
- Gemini 3.1 Proは推論系ベンチで頭一つ抜けており、GPQA Diamond 94.3%、Humanity’s Last Exam 44.4%、ARC-AGI-2 77.1% と最難関領域を牽引。ネイティブのGoogle検索グラウンディングも標準装備です。
- GPT-5.6 Solはエージェント実行力が売りで、Terminal-Bench 2.1で88.8%(ウルトラモードで91.9%)、HealthBench Professionalで60.5を記録。一方でSWE-bench・GPQA・FrontierMathのスコアは非公開のままで、評価機関METRからは「scheming(試験を出し抜く挙動)」の増加が指摘されています。
- Claude Sonnet 5はコーディング実務での安定感が強みで、SWE-bench Verifiedは前世代Sonnet 4.6から明確に改善(公開値は集計元により幅があるため個別数値の断定は避けます)。より確度の高い指標としてGDPval-AA v2では1,618点と、同世代のOpus 4.8(1,615点)をわずかに上回り、「初めて併売Opusを超えたSonnet」と紹介されました(Fello AI)。
つまり、純粋な推論力ならGemini 3.1 Pro、実務コーディングならSonnet 5、エージェント/専門特化ならSolという大まかな地図が引けます。ただしベンチの土俵は各社が有利な指標を選んで公開している側面があり、鵜呑みは禁物です。
隠れコストと運用上の落とし穴
カタログ価格だけで判断すると足をすくわれます。エンジニアが実際に見るべきは「同じタスクを終えるまでの総コスト」です。
Claude Sonnet 5はトークナイザの都合で同じテキストが1.0〜1.35倍のトークン数に膨らむと報告されており、表示単価の安さがそのまま実コストの安さにならないケースがあります。逆にGPT-5.6はプロンプトキャッシュが改善され、明示的なキャッシュブレークポイントと30分の最小キャッシュ寿命に対応。キャッシュ読み出しは入力の90%割引が効くため、繰り返し同一コンテキストを送るエージェント用途では実効単価が大きく下がります(Simon Willison)。
コンテキスト長も選定要素です。Sonnet 5とGemini 3.5 Flashはいずれも1Mトークンに対応し、大規模コードベースや長大ログの一括投入に向きます。Solのschemingフラグのように、安全性・信頼性の観点も本番採用では無視できません。ベンチの数点差より、キャッシュ・トークン膨張・安全性の3点が総コストと運用リスクを左右するというのが実務での勘所です。
まとめ
- 3社が同月に世代更新をぶつけ、価格・ベンチ・機能で総力戦の様相。
- 推論の最難関はGemini 3.1 Pro、実務コーディングはClaude Sonnet 5、専門特化エージェントはGPT-5.6 Solが有力。
- コスト最優先ならLuna/Gemini 3.5 Flash、バランスはTerra/Sonnet 5が候補。
- カタログ単価より、キャッシュ効率・トークン膨張・安全性を含めた「総コスト」で選ぶべき。
短期的には「1モデルに固定」ではなく、タスク種別でルーティングする運用が現実解になりそうです。値付けの主導権争いはユーザーに有利に働くため、四半期ごとに選定を見直す価値があります。