DeepSeek V4-Flash-0731が正式リリース ── 13Bアクティブの小型MoEが1.6Tの兄貴分をエージェント性能で抜いた理由

はじめに

2026年7月31日、DeepSeekが DeepSeek-V4-Flash-0731 を正式リリースし、APIをパブリックベータとして公開した。Hacker Newsで597ptを集めた今回のニュースが興味深いのは、単なる「安いモデルが出た」という話ではない点にある。

DeepSeekの公式チェンジログは、このビルドについて次のように明言している。

DeepSeek-V4-Flash-0731 keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained. (出典: DeepSeek API Docs / Change Log)

アーキテクチャもパラメータ数も変えていない。事後学習をやり直しただけで、総パラメータ1.6Tの上位モデルであるV4-Proをエージェント系ベンチマークで上回ってしまった。本記事では、この「事後学習だけで何が起きたのか」を分解し、実務でどう扱うべきかを整理する。

何が起きたか ── 事後学習だけでスコアが跳ねた

V4-Flashのスペックは、上位のV4-Proと比べると明らかに小さい。

項目V4-FlashV4-Pro
総パラメータ284B1.6T
アクティブパラメータ13B—
コンテキスト長1M トークン1M トークン
入力(キャッシュヒット)$0.0028 / 1M$0.003625 / 1M
入力(キャッシュミス)$0.14 / 1M$0.435 / 1M
出力$0.28 / 1M$0.87 / 1M

推論時に動くのはわずか13Bである。にもかかわらず、0731ビルドが公開したエージェント系スコアは以下の通りだ。

ベンチマークPreview0731
DeepSWE7.354.4
Toolathlon-Verified49.770.3
Terminal Bench 2.1—82.7
Cybergym—76.7
NL2Repo—54.2

DeepSWEの 7.3 → 54.4 は、桁が変わったと言っていい。重みの器は同じままなので、この差分はすべて事後学習(post-training)が生んだものになる。エージェント性能とは「巨大なパラメータに宿る知識量」ではなく、ツール呼び出し・長い試行錯誤・失敗からの復帰といった振る舞いの学習で決まる、という仮説を強く裏付ける結果だ。

比較対象として、Terminal Bench 2.1 の 82.7 は Z.AIのGLM-5.2(81.0)を上回り、Claude Opus 4.8(85.0)に肉薄する水準にある。単体知能では、Artificial Analysisの Intelligence Index で 50 ポイント、オープンウェイトモデル101本中3位という位置づけだ。

技術的背景 ── 1Mコンテキストを13Bで回すための設計

なぜ13Bアクティブで1Mトークンを扱えるのか。V4系のモデルカードが挙げているのは主に3つの仕掛けだ。

1. ハイブリッドアテンション(CSA + HCA) Compressed Sparse Attention と Heavily Compressed Attention を組み合わせ、長コンテキストの計算量とKVキャッシュを圧縮する。DeepSeekの公表値では、1Mコンテキスト時に前世代V3.2比で**推論FLOPsが27%、KVキャッシュが10%**まで削減されている。KVキャッシュはコンテキストが伸びるほどGPUメモリを線形に食い潰す最大のボトルネックなので、ここが1/10になる意味は大きい。

2. mHC(Manifold-Constrained Hyper-Connections) 通常の残差接続を強化する接続機構で、深いMoEでの学習安定性に効く。

3. FP4/FP8の混在量子化 MoEのエキスパート部分をFP4、それ以外の大半をFP8で保持する。重みの大半を占めるエキスパートを最も粗い精度に寄せることで、284Bという規模でもフットプリントを抑えている。

推論モードは Non-think / Think High / Think Max の3段構成で、タスクに応じて思考予算を切り替える設計だ。MMLU-Pro 86.2、LiveCodeBench 91.6 といった高スコアはいずれも Think Max モードのもので、ライセンスはMITである。

エンジニアへの影響 ── 「Codex対応」と、見落としがちな落とし穴

実務面で今回いちばん効くのは、ベンチスコアよりもResponses APIのネイティブ対応とCodex向けの適合かもしれない。公式ドキュメントは「natively supports the Responses API format and is specifically adapted for Codex」と書いている。つまり既存のコーディングエージェントのバックエンドを、クライアント側の書き換えを最小限にして差し替えられる。オープンウェイト(MIT)なので、自前ホスティングという逃げ道も残る。

ただし、素直に「出力$0.28だから3分の1のコスト」とは計算しないほうがいい。Artificial Analysisの評価では、このモデルは評価全体で 210Mトークンを出力しており、同種モデルの中央値100Mに対して「very verbose」と注記されている。単価は安いが、同じタスクで2倍前後喋るわけだ。実効コストで見ると、V4-Proとの差は名目の3倍ではなく2倍弱に縮む可能性がある。加えて、冗長な出力はエージェントのループ内でコンテキストを食い潰し、レイテンシにも直結する。

導入を検討するなら、次の順で見るのが現実的だ。

  1. 自分のワークロードでトークン数まで含めた実測を取る(単価だけで判断しない)
  2. Non-think / Think High / Think Max の切り替えをタスク種別に紐づけ、思考予算を無駄打ちしない
  3. キャッシュヒット時 $0.0028 という極端な安さを活かすため、システムプロンプトや共有コンテキストの前方一致を設計する

なお今回の更新は V4-Flash APIのみが対象で、V4-Pro APIとアプリ/Web版は既存ビルドのまま据え置かれている。V4-Proの正式版は「近日中」とアナウンスされており、そちらでも同様の事後学習の恩恵が乗るのかが次の焦点になる。

まとめ

  • DeepSeekがV4-Flash-0731を正式リリース。アーキテクチャ・パラメータ数は据え置き、事後学習のみ刷新
  • それでもDeepSWEは 7.3 → 54.4、Toolathlon-Verifiedは 49.7 → 70.3 と跳ね、Terminal Bench 2.1で82.7を記録
  • 284B総/13BアクティブのMoEで1Mコンテキスト。CSA+HCAでKVキャッシュはV3.2比10%
  • 出力$0.28/1Mと安価だが、出力が中央値の約2倍と冗長なため実効コストは要実測
  • Responses APIネイティブ対応+Codex適合で、既存エージェントからの差し替え障壁が低い

「モデルを大きくする」フェーズから「同じ器で振る舞いを鍛える」フェーズへ、エージェント性能の伸びしろが移りつつあることを示す一例と言える。近日公開予定のV4-Pro正式版が同じ事後学習を取り込んだとき、価格帯ごとの序列がどう組み替わるかを見ておきたい。

ソース