Claude Opus 4.8 が登場 — Fast Mode 3倍安価・コード欠陥見逃しが4分の1・SWE-Bench Pro 69.2%

はじめに

Anthropic が 2026 年 5 月 28 日、Claude Opus 4.8 をリリースした。Opus 4.7 の登場からわずか 41 日後の更新で、Hacker News では発表スレッドが 1,700 ポイント超を集めた。本記事では、Opus 4.8 が「モデルとして何を変えたのか」を、Fast Mode の価格戦略・honesty 重視の挙動変更・SWE-Bench Pro 69.2% という数字の意味・そして Opus 4.7 から乗り換えるべきかという実用判断まで、エンジニア視点で整理する。なお Dynamic Workflows の構造については昨日の記事で解説したので、今回はモデル本体の変化に焦点を絞る。

Opus 4.8 の主要変更点 — Fast Mode の価格破壊が一番のニュース

Opus 4.8 で最大の変化は、価格そのものというより Fast Mode の経済性が壊れたことだ。標準モードの料金は入力 $5 / 出力 $25(百万トークン)で Opus 4.7 から据え置きだが、Fast Mode は入力 $10 / 出力 $50 に下がった。Opus 4.7 の Fast Mode が $30 / $150 だったので、3 分の 1 の価格で 2.5 倍の速度という改善になる。

エンジニアの実務感覚で言うと、これは「Opus を CI に組み込む」「PR ごとに Opus でレビューを走らせる」といったユースケースが現実的な単価に乗ってきた、という意味だ。Opus 4.7 までは Fast Mode が「速いがコスト的に常用は厳しい」という位置づけだったのに対し、4.8 では通常モードの 2 倍に収まる。プロンプトキャッシュ併用で最大 90% 削減、バッチ処理で 50% 削減も維持されている。

ベンチマークの数字も小幅ながら全方位で上がった。SWE-Bench Verified は 87.6% → 88.6%、SWE-Bench Pro が 64.3% → 69.2%、Terminal-Bench 2.1 が 66.1% → 74.6%、マルチ分野推論で 54.7% → 57.9%。Super-Agent ベンチでは、Opus 4.8 だけが全ケースを end-to-end で完了し、同コスト帯の GPT-5.5 を上回ったとされる。

「正直さ (honesty)」の数値化 — alignment スコア 2.5 → 1.9 が意味するもの

今回の更新で Anthropic が最も強調しているのは、ベンチマーク数字ではなく honesty の向上だ。alignment 行動スコアが Opus 4.7 の 2.5 から 1.9 に下がった(数字が低いほど良い)。これは抽象的な「行儀の良さ」の話ではなく、Claude Code をエージェントとして使う際の実害に直結する。

公式の表現を借りれば、Opus 4.8 は 自分が書いたコードの欠陥を見逃さずに指摘する確率が約 4 倍に上がった。Opus 4.7 までは、エージェントが「実装しました」「テストも通りました」と言いつつ、エッジケースや境界条件のバグを黙って残すケースが少なくなかった。Opus 4.8 では、自信のない箇所を明示し、根拠の薄い主張を出す頻度が下がっている。

実装の中身は Anthropic の system card に詳しいが、結果として現れる挙動は「不確実なときは明示する」「テストが通っていないなら通っていないと言う」という、当たり前のことが当たり前にできるようになった、という変化だ。これはエージェント長時間自走の前提条件になる。/loop や Dynamic Workflows で 1 時間以上回す構成では、途中で「黙って嘘をつかない」ことが何より重要で、そこが押し上げられたのが今回のアップデートの肝だ。

1M コンテキストと adaptive thinking — 設計上の含意

Opus 4.8 は 1M トークンのコンテキストを維持し、加えて adaptive thinking(タスクの難易度に応じた推論時間の自動調整)を搭載する。これにより effort 制御は low / medium / high / xhigh / max の 5 段階になり、デフォルトが high に引き上げられた。

実務でこれが効くのは、Opus を「常時高 effort で叩く」運用が前提になるという点だ。Opus 4.7 までは「重い質問は high、軽い質問は medium」と自分で切り替える運用が一般的だったが、4.8 は内部で勝手に判定して時間を分配する。結果として、ユーザー側のチューニング負担が減り、/effort を明示的に下げる場面はかなり限定される。

メモリも改善されており、セッションを跨いだ学習が動く。複数日に渡るプロジェクトを Claude Code に持たせる場合、各セッションで何を決めたか・何を試したかが次の起動時に引き継がれるようになった。スプレッドシート・スライド・ドキュメントの取り扱いも強化されている。

エンジニアへの影響 — 4.7 から乗り換えるべきか

結論から書くと、Claude Code を業務で使っているなら即乗り換え推奨だ。理由は 3 つある。

1 つ目は Fast Mode の価格改定。CI に組み込んだコードレビュー、PR ごとの自動セキュリティスキャン、夜間バッチでの大規模リファクタリングなど、これまでコスト的に敬遠していた用途が現実的な予算で動く。$30 / $150 が $10 / $50 になるインパクトは、月のコスト計算をやり直す価値がある。

2 つ目は honesty 向上による長時間自走の信頼性。Anthropic が公開している「コード欠陥見逃し 4 倍減」という数字は、autopilot や ralph のような長時間ループで一番効いてくる。途中で「実装した」と言いながら静かに失敗するケースが減れば、人間が事後検証する負担が下がる。

3 つ目は、料金据え置きでベンチマーク全方位向上というシンプルな事実。通常モードの単価は Opus 4.7 と同じなので、デメリットなしで切り替えできる。注意点があるとすれば、デフォルト effort が high になったことで、軽い質問でも以前より思考時間が長く感じるケースがある点だ。応答速度を最優先したい場面では /effort low か medium を明示する運用が必要になる。

なお、Anthropic は次の Sonnet 4.7 / Haiku 4.6 についても近日中の更新を予告しており、Opus → Sonnet → Haiku の更新サイクルが従来より短くなっている。Opus 4.8 をベースラインに業務フローを組み直すなら、Sonnet 系の更新を見越して effort や Fast Mode の使い分けを設計しておくと、後の切り替えが楽になる。

まとめ

Claude Opus 4.8 は派手な新機能こそないが、Fast Mode の 3 倍安・2.5 倍速、honesty 向上による欠陥見逃し 4 分の 1、ベンチマーク全方位の小幅改善という、業務利用に直結する地味で重要な改善が揃った更新だ。通常モードは Opus 4.7 と同じ単価なので、乗り換えのデメリットは実質的にない。長時間自走系のワークフローを組んでいるエンジニアにとっては、honesty の数値化と improvement が最も価値のあるアップデートになる。次の Sonnet 4.7 リリースまでに、Opus 4.8 をベースに自分の開発フローを再設計しておくのが現実的な動き方だろう。

今日のその他のニュース

Karpathy 氏の 200 行 GPT「microGPT」逐行解説

Andrej Karpathy が公開した約 200 行の最小 GPT 実装「microGPT」を、コード 1 行ずつ読み解く Zenn 記事が話題。Transformer の本質構造を 200 行で理解できるため、LLM の内部動作を改めて学び直したいエンジニアに向く。

論理削除をやめて状態をテーブルで分ける DB 設計

deleted_at カラムによる論理削除フラグを廃止し、状態ごとに別テーブルへ分割するアプローチを提案する Zenn 記事(はてブ 170 users)。複雑なクエリ条件・インデックス肥大・整合性バグを構造で防ぐ設計論として参考になる。

Cloudflare の AI コードレビュー基盤運用報告

Cloudflare が自社プロダクト向けに AI コードレビューをどう運用しているかを公開した公式ブログ。複数モデルへのファンアウト、結果の集約、誤検知抑制の実運用ノウハウがまとまっており、社内 AI コードレビュー基盤を設計するエンジニアの一次資料になる。

ソース