アクティブパラメータ5%の時代 — GLM-5.3-Flash と Qwen3.8-Flash-Next が同じ日に示したMoEの経済学
はじめに
2026年8月26日から27日にかけて、オープンウェイトの大規模モデルが立て続けに2本落ちた。Z.ai の GLM-5.3-Flash と、Alibaba の Qwen3.8-Flash-Next だ。Hacker News では前者が 604pt、後者が 485pt を集め、同じ日のトップ2を占めた。
どちらも「フロンティア級の性能を、Flash 価格帯で」と主張している。そして両方とも、その主張の根拠を同じ場所に置いている — アクティブパラメータだ。GLM-5.3-Flash は総パラメータ 320B に対してトークンあたり 18B、Qwen3.8-Flash-Next は 125B に対して 6B しか動かさない。
この記事では、この2モデルの実数を整理したうえで、「アクティブパラメータが少ない = 手元で軽く動く」という広く流通している読み方がどこまで正しくて、どこから間違っているのかを分解する。結論を先に言うと、この読み方は計算量については正しく、メモリについては完全に間違っている。そしてローカル運用でボトルネックになるのは、ほぼ常に後者だ。
320B で 18B、125B で 6B — 同じ日に出た2つの数字
まず事実を並べる。
GLM-5.3-Flash(Z.ai)
| 項目 | 値 |
|---|---|
| 総パラメータ / アクティブ | 320B / 18B(5.6%) |
| コンテキスト長 | 1,000,000 トークン |
| モダリティ | ネイティブマルチモーダル(テキスト + 画像入力) |
| ライセンス | MIT |
| 重み配布 | Hugging Face(SGLang / vLLM / TokenSpeed 対応) |
| 価格(Z.ai API) | $0.15 / 1M input, $0.50 / 1M output |
Qwen3.8-Flash-Next(Hugging Face モデルカード)
| 項目 | 値 |
|---|---|
| 総パラメータ / アクティブ | 125B / 6B(4.8%)+ n-gram 埋め込み 51B + MTP 4B |
| エキスパート | 512(ルーティング 10 + 共有 1) |
| レイヤ構成 | 全 48 層。12 ブロック ×(Gated DeltaNet 3層 → Qwen Sparse Attention 1層) |
| コンテキスト長 | 262,144(ネイティブ)/ 1,000,000 まで拡張可 |
| ライセンス | qwen-community-1.0 |
| 価格(QwenCloud、本番版) | $0.16 / 1M input, $0.47 / 1M output |
価格が偶然のように揃っている。入力 $0.15〜0.16、出力 $0.47〜0.50。これは示し合わせた結果というより、同程度のアクティブパラメータ数は同程度の推論コストに収束するという構造がそのまま値札に出たと読むのが自然だ。18B と 6B で価格がほぼ同じなのは引っかかるが、価格は計算コストだけでなくメモリ帯域・バッチ効率・戦略的な値付けの合成なので、アクティブパラメータと単価が線形に対応するわけではない。
なぜ「総パラメータ」を見ても意味がなくなったのか
MoE(Mixture of Experts)は、フィードフォワード層を多数の「エキスパート」に分割し、トークンごとにごく一部だけを発火させる構成だ。Qwen3.8-Flash-Next なら 512 個のエキスパートのうち、ルーティングで選ばれた 10 個と、常時発火する共有エキスパート 1 個。つまり 1 トークンを処理するのに、エキスパート群の約 2% しか触らない。
2026年のオープンウェイトは、ほぼ例外なくこの構成に寄っている。そして注目すべきは、スパース度そのものが年々深くなっていることだ。
| モデル | 総パラメータ | アクティブ | 比率 |
|---|---|---|---|
| Mixtral 8x22B(旧世代) | 141B | 39B | 27.7% |
| Llama 4 Maverick | 400B | 17B | 4.3% |
| DeepSeek V3.2 Speciale | 685B | 37B | 5.4% |
| Kimi K3 | 2.8T | 104B | 3.7% |
| GLM-5.3-Flash | 320B | 18B | 5.6% |
| Qwen3.8-Flash-Next | 125B | 6B | 4.8% |
Mixtral 世代の 30% 前後から、現在のフロンティアは 3〜6% のレンジに落ちている。この「深いスパース化」が意味するのは、知識容量と推論コストを分離できるようになったということだ。総パラメータは学習で詰め込める知識の量を決め、アクティブパラメータはそれを取り出すたびに払う代金を決める。両者が独立に動かせるなら、前者を増やして後者を抑えるのが合理的で、実際そうなっている。
したがって、モデルを比較するときに総パラメータ数を並べる意味はもう薄い。「125B の Qwen と 320B の GLM」という比較は、知識容量の話をしているのか、コストの話をしているのか、メモリの話をしているのかで結論が全部変わる。並べるべき数字は用途によって違う。
Qwen4 アーキテクチャの中身 — Gated DeltaNet と n-gram 埋め込み
Qwen3.8-Flash-Next は「Qwen4 アーキテクチャの早期プレビュー」と位置づけられていて、モデルカードから読み取れる構成にはスパース MoE 以外の仕掛けが2つ入っている。
1つ目は、アテンションの置き換え。 全 48 層は、12 個のブロックの繰り返しで構成されている。各ブロックは Gated DeltaNet が 3 層続いたあとに Qwen Sparse Attention が 1 層、という並びだ。Gated DeltaNet は線形アテンション系の機構で、系列長に対する計算量が二次ではなく線形に収まる。つまり全 48 層のうち 36 層が線形コスト、残り 12 層だけが本来のアテンションコストを払う。ネイティブ 262K・拡張 1M というコンテキスト長が現実的な価格で提供できているのは、この 3:1 の配分が効いている。
2つ目は、n-gram 埋め込みテーブル。 レイヤ2 に 2,000万件のバイグラム / トライグラムを持つテーブルが挿入され、これが 51B パラメータを占める。総パラメータ 125B の本体より、埋め込みテーブル 51B の方が比率として異様に大きい。狙いは、頻出する語の並びを重み計算で毎回再構成するのではなく、テーブル参照で済ませることにあると読める。これは計算をメモリに移す典型的なトレードオフで、アクティブパラメータ 6B という数字を成立させている一因でもある。
さらに Multi-Token Prediction(MTP)が 1 層分(4B)乗っている。1 ステップで複数トークンを予測する仕組みで、投機的デコーディングのドラフトモデルを外付けせずモデル内部に持つ構成にあたる。生成スループットに直接効く。
GLM-5.3-Flash 側は同等の内部仕様が公開されていないが、320B-A18B というスパース度と、SGLang / vLLM / TokenSpeed で動くという配布形態から、標準的な大規模 MoE の系譜にあることは読み取れる。加えてこちらはネイティブマルチモーダルで、レンダリング済み UI・ゲーム画面・3D 出力を直接読ませる用途を明示的に想定している。
「6B 相当で動く」という誤読 — FLOPs と VRAM は別物
ここが実務上いちばん重要な点だ。
「125B-A6B は 6B モデルの速度とコストで動く」という説明が広く流通している。これは計算量(FLOPs)については正しい。トークンあたりに通過する重みが 6B 分なら、行列積の総量も 6B 相当だ。
だがメモリについては成立しない。どのエキスパートが選ばれるかはトークンごとに変わるため、推論中は全エキスパートの重みがアクセス可能な場所に載っていなければならない。載せる必要があるのは総パラメータの方だ。
Qwen3.8-Flash-Next で実際に保持すべき量を数えると、本体 125B + n-gram 埋め込み 51B + MTP 4B = 約 180B パラメータになる。
| 精度 | 必要な重みメモリ(概算) |
|---|---|
| BF16 | 約 360 GB |
| FP8 | 約 180 GB |
| 4bit 量子化 | 約 90 GB |
GLM-5.3-Flash の 320B なら、FP8 で約 320 GB、4bit でも約 160 GB。ここに KV キャッシュが別途乗る。コンシューマ GPU の 24GB や 32GB とは2桁近く違う世界の話で、「6B モデルのつもり」で計画すると確実に破綻する。
ただし構造上の逃げ道はある。n-gram 埋め込みテーブルは参照するだけのルックアップであって、行列積を通す重みではない。エキスパート重みのように毎トークン GPU 上で計算に使われるものとは性質が違うため、階層化して置く余地がある。同様に、MoE のエキスパート重みを CPU メモリや NVMe に置いてオンデマンドで引く構成も、実装レベルでは選択肢に入る。いずれも帯域とレイテンシを代償にする話で、無償ではない。
実務的な結論はこうなる — アクティブパラメータは「1トークンあたりいくら払うか」を決め、総パラメータは「そもそも席に着けるか」を決める。API 経由で使うなら前者だけ見ればいい。手元で動かす計画を立てるなら、見るべきは後者だ。この2つを混同したまま「ローカルで動くようになった」と判断すると、GPU を買ったあとで気づくことになる。
なお、同じ MoE でも 4bit 量子化まで落としたときに出力品質がどう崩れるかは別問題で、KV キャッシュ精度やアテンションバックエンドの選択がトークン選択をずらす話は以前扱った。総メモリを削る方向の工夫は、そのまま品質リスクの積み増しになる。
ベンチマークの数字をどう読むか
両モデルとも、クローズドのフロンティアモデルとの比較を前面に出している。
GLM-5.3-Flash(Artificial Analysis 計測および Z.ai 公表値)
- Artificial Analysis Intelligence Index v4.1.1: 57(同規模オープンウェイトの中央値は 27)
- Terminal Bench 2.1: 84.3(Claude Opus 4.8 は 85.0)
- DeepSWE v1.1: 63.4(前世代 GLM-5.2 は 46.2)
- AutomationBench: 48.8(同 26.2)
- 出力速度 48.7 t/s、TTFT 1.52s(Z.ai API 実測)
Qwen3.8-Flash-Next(公式モデルカード掲載値)
- SWE-bench Pro: 62.5(Claude-Opus 比較値 53.4)
- DeepSWE 1.1: 58.7(Qwen3.8-27B は 42.2)
- GPQA Diamond: 91.7
- ClawEval-MM: 64.4(Claude-Opus 比較値 52.5)
数字としては強い。特に GLM-5.3-Flash の前世代からの伸び — DeepSWE で 46.2 → 63.4、AutomationBench で 26.2 → 48.8 という倍近い改善は、ベンダー自身の同条件比較なので信頼度が高い部類だ。世代内の相対値は、クロスベンダー比較よりずっと素直に読める。
一方でクローズドモデルとの並びは、そのまま受け取らない方がいい。理由が2つある。
ハーネス依存。 Qwen3.8-Flash-Next の SWE 系スコアは、Claude Code ハーネスと mini-SWE-agent ハーネスを使い、コンテキスト 256K で計測したと明記されている。エージェント型ベンチマークのスコアは、モデル単体の能力ではなく「モデル × ハーネス × コンテキスト予算」の合成値だ。同じモデルでもハーネスを変えれば数字は動く。
比較対象の世代。 Qwen が並べているのは Claude Opus 4.6 系、GLM が並べているのは Opus 4.8 だ。バージョンが違うものを横並びにして「オープンウェイトがフロンティアに追いついた」と一括りにはできない。
そして Terminal Bench 2.1 の 84.3 対 85.0 のような 1 ポイント未満の差は、実質的に「同じ帯域にいる」以上の意味を持たない。ここで意味があるのは順位ではなく、その帯域に入るためのトークン単価が1桁以上違うという事実の方だ。Artificial Analysis の集計ではタスクあたり $0.09、Z.ai 自身の試算では $0.045 とされている。
MIT と qwen-community-1.0 — 実は最大の分岐点
両者を「オープンウェイト」で一括りにしがちだが、ライセンスは別物だ。
- GLM-5.3-Flash: MIT ライセンス
- Qwen3.8-Flash-Next: qwen-community-1.0
MIT は OSI 承認の許諾的ライセンスで、商用利用・改変・再配布・派生物のクローズド化まで、著作権表示さえ残せば通る。320B 級のマルチモーダルモデルがこの条件で出てくるのは、率直に異例だ。
qwen-community-1.0 はベンダー独自のコミュニティライセンスで、Apache-2.0 と紹介している二次情報も出回っているが、Hugging Face の公式モデルカードに記載されているのは qwen-community-1.0 の方だ。この系統のライセンスは一般に利用規模や用途に条件が付くため、商用プロダクトに組み込む判断をする前に条文を直接読む必要がある。二次情報を根拠に法務判断をしてはいけない類の差分だ。
性能が近接している以上、採用判断を分けるのは往々にしてここになる。ベンチマークで数ポイント上のモデルより、ライセンスが素直なモデルの方が組織としては通しやすい。
実務でどう判断するか
1. コストがボトルネックの用途は、いま棚卸しのタイミング。 大量バッチ推論、評価パイプライン、常時稼働のエージェント。トークン単価が1桁下がると成立する設計が変わる。Terminal Bench で 85 点帯にいるモデルが $0.15/$0.50 で叩けるという条件は、半年前には存在しなかった。
2. ただし「安くなったから回し続ける」は別の失敗。 同じ日の Zenn では「AIは回せば回すほど凄いのか — 『常時稼働』という設計の敗北」が上位に上がっている。単価が下がっても、ループの停止条件が設計されていないエージェントは品質の面で破綻する。安い推論が直すのはコストだけで、設計は直さない。
3. ローカル運用を検討するなら、まず総パラメータで容量計算する。 前述の通り 180B / 320B を載せる話になる。大容量ユニファイドメモリ機が現実解になりうる領域で、逆に言えば一般的な単体 GPU 構成では 4bit まで落としても厳しい。
4. ライセンスは自分で読む。 MIT と qwen-community-1.0 の差は、性能差より実務インパクトが大きい場面がある。
5. 移行するなら自前の評価セットで測る。 公開ベンチマークはハーネス込みの合成値で、自分のプロンプト・ツール定義・コンテキスト長での挙動を保証しない。特にエージェント用途では、ツール呼び出しのフォーマット遵守率のようなベンチマークに出ない部分で差が出る。
まとめ
- GLM-5.3-Flash は 320B-A18B(スパース度 5.6%)、1M コンテキスト、ネイティブマルチモーダル、MIT ライセンス、$0.15/$0.50 per 1M トークン
- Qwen3.8-Flash-Next は 125B-A6B(同 4.8%)に n-gram 埋め込み 51B と MTP 4B を加えた構成。512 エキスパート中 11 個が発火し、48 層は Gated DeltaNet 3 層 + Sparse Attention 1 層の繰り返し。ライセンスは qwen-community-1.0
- 2026年のフロンティアはスパース度 3〜6% のレンジに落ちており、総パラメータ数は比較指標として機能しなくなった。見るべきはアクティブパラメータ(コスト)と総パラメータ(メモリ)を用途に応じて使い分けること
- 「A6B だから 6B 相当で動く」は FLOPs の話であってメモリの話ではない。 実際に保持が必要なのは Qwen で約 180B、GLM で 320B。FP8 でも 180GB / 320GB 級になる
- ベンチマークのクロスベンダー比較はハーネス依存かつ比較世代がまちまち。信頼できるのは同一ベンダー内の世代間比較(GLM の DeepSWE 46.2 → 63.4 など)の方
「フロンティア級」という言葉が、今回はじめて価格帯とセットで意味を持ちはじめた。ただし性能表の数字が近づいたことと、自分のワークロードで置き換えられることは別の話だ。判断材料として実務で効くのは、Terminal Bench の 1 ポイント差ではなく、ライセンス条文と、手元のマシンに載るかどうかという物理的な制約の方になる。
今日のその他のニュース
Supabase の realtime スキーマが変更不可に(破壊的変更) — 8月の Developer Update で、realtime スキーマに対する create / alter / drop がすべて権限エラーになった。マイグレーションで realtime スキーマを触っている構成は、アップデート後に失敗する。realtime.messages に対する RLS ポリシーは従来通り動作するため、通常の Broadcast / Presence 利用に影響はない。既存マイグレーションを grep しておきたい。(@supabase)
Gemini 3.7 Flash が Gemini API で GA、Firebase AI Logic からも利用可 — コーディング・エージェント用途を強化した版が正式提供に入った。2026/12/31 まで導入価格が設定されている。Firebase AI Logic 経由でモバイル / Web から Gemini Developer API を直接叩ける構成になっているため、バックエンドを挟まずクライアントから利用する選択肢が増える。(Firebase リリースノート)
Docker Desktop 8月アップデートに Kubernetes 周りの実害修正 — kind クラスタの起動失敗の修正、v1.36 で kubectl exec / kubectl attach が動作しない問題の修正、Windows での per-machine インストールから per-user への in-place 移行対応が入った。ローカルで kind を使っている場合はアップデート推奨。
ソース
- GLM-5.3-Flash: Frontier Intelligence, Flash Cost — Z.ai
- Qwen/Qwen3.8-Flash-Next — Hugging Face
- GLM-5.3-Flash — Artificial Analysis
- Z.ai launches GLM-5.3-Flash under MIT license — TestingCatalog
- GLM 5.3 Flash — OpenRouter
- 「Qwen3.8-Flash-Next」オープンウェイト公開 — PC Watch
- Meet Qwen3.8-Flash — @Alibaba_Qwen
- AIは回せば回すほど凄いのか ―「常時稼働」という設計の敗北 — Zenn