Claude Opus 5 で「検証して」が逆効果に — 新モデルでプロンプト作法が変わった理由
はじめに
Anthropic は 2026/7/24 に Claude Opus 5 をリリースした。Artificial Analysis の Intelligence Index で 61、Agentic Index で 55.3 を記録して首位に立ち、価格は入力 $5 / 出力 $25(per 1M tokens)と Fable 5 の半額。ここまでは順当な「強くて安い新モデル」の話だ。
だが今週、日本のエンジニア界隈で本当に刺さったのは別のポイントだった。「これまで積み上げてきたプロンプトやルールが、Opus 5 では逆効果になる」という現象だ。関連 Zenn 記事は 265 users・55 users とはてブで大きく伸びた。本記事では、なぜ従来のプロンプト資産が足を引っ張るのか、その仕組みと具体的な対処法を、CLAUDE.md やシステムプロンプトを運用する実務目線で整理する。
何が起きているか — 「思考が浅い」「勝手に長い」の正体
報告されている症状は大きく2系統ある。
一つは「思考が浅く感じる」系。原因説明が1層で止まる、複数案を出すのに評価軸がない、報告がフラットな散文で構造化されない、ユーザーの発話に答える前に作業を始めてしまう——といった振る舞いだ。もう一つは「勝手に冗長・過剰」系。デフォルトの応答が前モデルより長くなり、サブエージェントへ委任しすぎ、検証を指示していないのに自分で何度も検証してトークンを消費する。
一見矛盾する2つの症状だが、根っこは同じ「モデルの設計思想が変わった」ことにある。Anthropic は公式に、Opus 5 の特徴として顧客事例での「より明確で簡潔な回答」を挙げている。つまり簡潔さと自律性がモデル側に組み込まれた。その結果、旧世代向けに書いた細かい指示が、モデルの新しいデフォルト挙動と衝突するようになった。
技術的な背景 — システムプロンプトが約8割削られた
より踏み込んだ分析(Zenn の解説記事)によれば、Claude 5 世代のクライアントに配布されるシステムプロンプトが、旧世代から約80%削減されたことが根本原因だという。削られたのは主に応答形式の規定——構造化、見出しの付け方、評価軸の使い方といった「出力の作法」に関する指示だ。
なぜ削るのか。新世代モデルはこうした振る舞いを訓練の中で内在化しているため、外から細かく指示するとかえって摩擦になる、という設計判断による。実際、新しいシステムプロンプトには「十分な情報があれば行動せよ(When you have enough information to act, act)」「網羅的な調査ではなく推奨を返せ(give a recommendation, not an exhaustive survey)」といった、簡潔・即断を促す方針が入っている。
ここで問題になるのが、ユーザーが会話履歴の先頭に置いた旧来のルールとの矛盾だ。「必ず検証して」「全案を評価軸付きで比較して」といった従来の指示は、モデル本体の「簡潔に・即断で」という新方針と真っ向からぶつかる。そして往々にして、一般的な言い回しのユーザールールは本体方針に負ける。これが「浅く見える」の正体である。
なお同じ Claude 5 系でも Fable 5 は応答形式規定を含む別プロンプトを配布するため症状が出にくく、Opus 4.7 は lean prompt 非適用で旧規定のまま——とされる。世代とモデルで挙動が割れる点も混乱を助長している。
エンジニアへの影響 — プロンプト資産を「棚卸し」する
実務でまずやるべきは、既存の CLAUDE.md やシステムプロンプトの棚卸しだ。ポイントは3つ。
1. 削るべきものを削る。 「検証して」「ダブルチェックして」「再確認して」の類は、Opus 5 では品質を上げずトークンだけ増やす。Anthropic 自身が削除を推奨している領域だ。過度に手順書化されたプロンプトも同様に見直す。
2. 簡潔さを明示する。 デフォルトが長くなった以上、「応答は焦点を絞り、手短かつ簡潔に」といった簡潔さ指示を CLAUDE.md の基本セットに入れておくと効きやすい。逆説的だが、簡潔さは「書いて指示する」時代になった。
3. 残したいルールは強く・肯定形で書く。 どうしても構造化した出力が欲しいなら、本体システムプロンプトの文言を名指しで引用し優先権を宣言するくらいの強さが要る。加えて「〜するな」という禁止形は代替行動を示さないため弱い。「commit 提案時は動作結果を本文に記載する」のように望ましい動きを肯定形で書く。行動の直前に短く毎回届ける注入(UserPromptSubmit フック等)は、履歴先頭のルールより確実に効く。
effort 設定の勘所も変わった。従来 xhigh 推奨だったところを high から始め、品質を保てるなら low/medium を積極活用する。effort は思考量を制御するもので文章量ではない点に注意。サブエージェント委任も、大規模で独立した作業に限定し、小タスクや検証目的の委任は明示的に絞るとコストが締まる。
まとめ
- Claude Opus 5 は Intelligence Index 61 で首位、価格は Fable 5 の半額($5/$25)。
- 一方で、簡潔さと自律性がモデルに内在化され、システムプロンプトが約8割削減。従来の「検証して」「網羅比較して」系の指示が逆効果になった。
- 対策は資産の棚卸し——検証指示を削る/簡潔さを明示する/残すルールは肯定形で強く書く/effort は
high起点。
新モデルへの乗り換えは、単なる型番の差し替えではなくプロンプト運用の再設計を伴う。強く安くなった Opus 5 を活かせるかは、手元の CLAUDE.md をどれだけ潔く削れるかにかかっている。
今日のその他のニュース
Ruff v0.16.0 — デフォルトルールが 59→413 に大幅増(Hacker News 313pt)。Python の高速リンター Ruff がメジャーアップデートし、デフォルト有効ルールが 59 から 413 へ一気に拡大した。既存 CI にそのまま乗せると大量の指摘が出る可能性が高く、アップグレード時は差分の確認と段階的な適用が必須になる。
Firebase SDK for Flutter v4.17.0 リリース(WebSearch)。Firestore / Firebase AI Logic / Core の更新とバグ修正に加え、Android 17 以降では Crashlytics がメモリ起因の終了(Low Memory Kill / OOM)を個別 issue にグルーピングするようになった。Gemini 3.6 Flash と 3.5 Flash-Lite も追加され、低トークンで高品質な選択肢が増えている。
シェルの :(コロン)は何もしないが使え(Hacker News 354pt)。何もしないビルトインである : を、変数のデフォルト設定やコメント代わり、無限ループの条件などに使う実用テクニックが話題に。地味だが読みやすいシェルスクリプトを書くうえで覚えておきたいイディオムだ。