DeepSeek V4-Flash-0731が正式リリース ── 13Bアクティブの小型MoEが1.6Tの兄貴分をエージェント性能で抜いた理由
はじめに
2026年7月31日、DeepSeekが DeepSeek-V4-Flash-0731 を正式リリースし、APIをパブリックベータとして公開した。Hacker Newsで597ptを集めた今回のニュースが興味深いのは、単なる「安いモデルが出た」という話ではない点にある。
DeepSeekの公式チェンジログは、このビルドについて次のように明言している。
DeepSeek-V4-Flash-0731 keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained. (出典: DeepSeek API Docs / Change Log)
アーキテクチャもパラメータ数も変えていない。事後学習をやり直しただけで、総パラメータ1.6Tの上位モデルであるV4-Proをエージェント系ベンチマークで上回ってしまった。本記事では、この「事後学習だけで何が起きたのか」を分解し、実務でどう扱うべきかを整理する。
何が起きたか ── 事後学習だけでスコアが跳ねた
V4-Flashのスペックは、上位のV4-Proと比べると明らかに小さい。
| 項目 | V4-Flash | V4-Pro |
|---|---|---|
| 総パラメータ | 284B | 1.6T |
| アクティブパラメータ | 13B | — |
| コンテキスト長 | 1M トークン | 1M トークン |
| 入力(キャッシュヒット) | $0.0028 / 1M | $0.003625 / 1M |
| 入力(キャッシュミス) | $0.14 / 1M | $0.435 / 1M |
| 出力 | $0.28 / 1M | $0.87 / 1M |
推論時に動くのはわずか13Bである。にもかかわらず、0731ビルドが公開したエージェント系スコアは以下の通りだ。
| ベンチマーク | Preview | 0731 |
|---|---|---|
| DeepSWE | 7.3 | 54.4 |
| Toolathlon-Verified | 49.7 | 70.3 |
| Terminal Bench 2.1 | — | 82.7 |
| Cybergym | — | 76.7 |
| NL2Repo | — | 54.2 |
DeepSWEの 7.3 → 54.4 は、桁が変わったと言っていい。重みの器は同じままなので、この差分はすべて事後学習(post-training)が生んだものになる。エージェント性能とは「巨大なパラメータに宿る知識量」ではなく、ツール呼び出し・長い試行錯誤・失敗からの復帰といった振る舞いの学習で決まる、という仮説を強く裏付ける結果だ。
比較対象として、Terminal Bench 2.1 の 82.7 は Z.AIのGLM-5.2(81.0)を上回り、Claude Opus 4.8(85.0)に肉薄する水準にある。単体知能では、Artificial Analysisの Intelligence Index で 50 ポイント、オープンウェイトモデル101本中3位という位置づけだ。
技術的背景 ── 1Mコンテキストを13Bで回すための設計
なぜ13Bアクティブで1Mトークンを扱えるのか。V4系のモデルカードが挙げているのは主に3つの仕掛けだ。
1. ハイブリッドアテンション(CSA + HCA) Compressed Sparse Attention と Heavily Compressed Attention を組み合わせ、長コンテキストの計算量とKVキャッシュを圧縮する。DeepSeekの公表値では、1Mコンテキスト時に前世代V3.2比で**推論FLOPsが27%、KVキャッシュが10%**まで削減されている。KVキャッシュはコンテキストが伸びるほどGPUメモリを線形に食い潰す最大のボトルネックなので、ここが1/10になる意味は大きい。
2. mHC(Manifold-Constrained Hyper-Connections) 通常の残差接続を強化する接続機構で、深いMoEでの学習安定性に効く。
3. FP4/FP8の混在量子化 MoEのエキスパート部分をFP4、それ以外の大半をFP8で保持する。重みの大半を占めるエキスパートを最も粗い精度に寄せることで、284Bという規模でもフットプリントを抑えている。
推論モードは Non-think / Think High / Think Max の3段構成で、タスクに応じて思考予算を切り替える設計だ。MMLU-Pro 86.2、LiveCodeBench 91.6 といった高スコアはいずれも Think Max モードのもので、ライセンスはMITである。
エンジニアへの影響 ── 「Codex対応」と、見落としがちな落とし穴
実務面で今回いちばん効くのは、ベンチスコアよりもResponses APIのネイティブ対応とCodex向けの適合かもしれない。公式ドキュメントは「natively supports the Responses API format and is specifically adapted for Codex」と書いている。つまり既存のコーディングエージェントのバックエンドを、クライアント側の書き換えを最小限にして差し替えられる。オープンウェイト(MIT)なので、自前ホスティングという逃げ道も残る。
ただし、素直に「出力$0.28だから3分の1のコスト」とは計算しないほうがいい。Artificial Analysisの評価では、このモデルは評価全体で 210Mトークンを出力しており、同種モデルの中央値100Mに対して「very verbose」と注記されている。単価は安いが、同じタスクで2倍前後喋るわけだ。実効コストで見ると、V4-Proとの差は名目の3倍ではなく2倍弱に縮む可能性がある。加えて、冗長な出力はエージェントのループ内でコンテキストを食い潰し、レイテンシにも直結する。
導入を検討するなら、次の順で見るのが現実的だ。
- 自分のワークロードでトークン数まで含めた実測を取る(単価だけで判断しない)
- Non-think / Think High / Think Max の切り替えをタスク種別に紐づけ、思考予算を無駄打ちしない
- キャッシュヒット時 $0.0028 という極端な安さを活かすため、システムプロンプトや共有コンテキストの前方一致を設計する
なお今回の更新は V4-Flash APIのみが対象で、V4-Pro APIとアプリ/Web版は既存ビルドのまま据え置かれている。V4-Proの正式版は「近日中」とアナウンスされており、そちらでも同様の事後学習の恩恵が乗るのかが次の焦点になる。
まとめ
- DeepSeekがV4-Flash-0731を正式リリース。アーキテクチャ・パラメータ数は据え置き、事後学習のみ刷新
- それでもDeepSWEは 7.3 → 54.4、Toolathlon-Verifiedは 49.7 → 70.3 と跳ね、Terminal Bench 2.1で82.7を記録
- 284B総/13BアクティブのMoEで1Mコンテキスト。CSA+HCAでKVキャッシュはV3.2比10%
- 出力$0.28/1Mと安価だが、出力が中央値の約2倍と冗長なため実効コストは要実測
- Responses APIネイティブ対応+Codex適合で、既存エージェントからの差し替え障壁が低い
「モデルを大きくする」フェーズから「同じ器で振る舞いを鍛える」フェーズへ、エージェント性能の伸びしろが移りつつあることを示す一例と言える。近日公開予定のV4-Pro正式版が同じ事後学習を取り込んだとき、価格帯ごとの序列がどう組み替わるかを見ておきたい。
ソース
- Change Log | DeepSeek API Docs
- DeepSeek V4 Flash 0731: Intelligence, Performance and Price Analysis(Artificial Analysis)
- deepseek-ai/DeepSeek-V4-Flash(Hugging Face)
- Models & Pricing | DeepSeek API Docs
- DeepSeek’s V4-Flash Now Beats Its Bigger Sibling on Agent Benchmarks(AlphaSignal)
- DeepSeek puts V4-Flash API into public beta(TechNode)