xAI Colossusが世界最大55万GPUなのに「実質6万台」しか動いていない件 — MFU 11%問題を技術解剖

はじめに

2026年に入ってメンフィスのxAI Colossusは555,000基のNVIDIA GPUを抱える「人類史上最大のAI計算施設」へと膨張した。ところが本日伝わったxAI社内メモによれば、この巨大クラスタのModel FLOPs Utilization(MFU)はわずか11%。理論ピーク性能の9割近くが「電気を食って熱を出すだけ」で実際のモデル学習に寄与していない、という衝撃的な数字だ。

本記事ではこの「MFU 11%問題」を、(1) MFUとは何か、(2) なぜxAIだけが11%なのか、(3) Meta 43%・Google 46%との差はどこから生まれるのか、という3点から技術的に整理する。GPUクラスタの規模競争を一歩引いて眺めるためのリファレンスとして読んでほしい。

ニュースの詳細 — 「11%」の意味と発火点

xAI社長のMichael Nicolls(SpaceX Starlink部門で製造とインフラ最適化を率いていた人物)が社内で配布したメモが、The InformationおよびBusiness Insider経由で報じられた。要旨は次の通り。

  • xAI Colossusは2026年1月時点で約555,000基のH100/H200相当GPUを稼働
  • そのうち実効的に「学習に貢献している」のは約60,000基相当(11%)
  • 残りの約490,000基は通電・通信はしているがアイドル時間が長く、データパイプラインの待ち合わせで止まっている
  • Nicolls氏はメモの中でこの数字を「embarrassing(恥ずかしい)」と表現し、2か月以内にMFUを50%へ引き上げることを目標に掲げた

ここで衝撃的なのは「不具合で動いていない」のではなく「動いているように見えるが計算リソースとしてはほぼ無効」という点だ。データセンターの電力契約・冷却・調達コストはGPU設置数で決まる一方、ROIは“動いているGPU数”ではなく“消化したFLOPs”で決まる。**11%という数字は、約490,000基ぶんの設備投資と電力が「学習FLOPsに変換されないまま消費されている」**ことを意味する。

技術的な背景 — MFUとは何か、なぜ低下するのか

MFU = 実効FLOPs ÷ 理論ピークFLOPs

MFU(Model FLOPs Utilization)はGoogleがPaLM論文で定式化した指標で、学習中に実際にモデルが消化したFLOPsを、ハードウェアの理論ピークFLOPsで割ったものだ。例えばH100のBF16理論ピークは989 TFLOPS。実際に学習中に観測された計算量が400 TFLOPS相当なら、MFU は約40%となる。

業界の経験則は次の通り。

  • 公開された大規模基盤モデルの学習: 35〜45%
  • Meta Llama-3.1の学習: 38〜43%
  • CoreWeaveなどMFU特化のクラスタ: 50%超
  • 「現実的に目指したい目標」: 65%前後

つまり、Meta 43%・Google 46%・xAI 11%という数字は、xAIが業界平均からも突き抜けて低い側に位置していることを示す。

何が「学習FLOPs以外」に時間を奪うのか

MFUを押し下げる要因は概ね以下のレイヤに分解できる。

  1. コレクティブ通信のオーバーヘッド: AllReduce、AllGather、All-to-Allなど。テンソル並列・パイプライン並列・ZeROなど分散戦略を組むほど、勾配・活性値・パラメータの同期通信が増える
  2. インターコネクトの帯域・トポロジ: NVLink内、ノード内PCIe、ノード間InfiniBand/RoCEのどこでボトルネックが出るか。一説にはネットワーク待ち時間だけで全体の最大50%が失われるケースもある
  3. データパイプラインのスタール: ストレージ→CPU→GPUのプリフェッチが追いつかず、GPUが入力待ちで遊ぶ
  4. ジョブスケジューリングと再起動コスト: 大規模クラスタでは故障率も増え、チェックポイントからの復帰コストが恒常的に効く
  5. 混合精度・カーネル選定の最適化不足: 同じ層でもFlashAttention・Triton実装・ライブラリ選択次第で実効FLOPsが倍以上違う

xAIのケースで特に名指しされたのは1〜3の領域、つまり**「分散学習スタックがクラスタ規模に追いついていない」**という古典的な症状だ。Nicolls氏はメモで「distributed stack is still not mature enough」と表現している。

なぜスケールしすぎると落ちやすいのか

経験則として、GPUを2倍に増やしてもMFUが2倍になることはない。むしろ次の理由で落ちやすい。

  • 同期コストの増加: ノード数nに対してAllReduceのコストは$O(\log n)$〜$O(n)$オーダーで効く
  • テールレイテンシ問題: 1台でも遅いノードがあるとステップ全体が待たされる(straggler effect)
  • ホットスポットが発生しやすい: ファブリック上で輻輳が起きると一気に全体スループットが落ちる

xAIは2024年の数万GPUから2026年の55万GPU超へと、わずか2年で1桁以上のスケールアップを行った。Meta・Googleは同規模のクラスタ運用に少なくとも3〜5年の試行錯誤を経ているのに対し、xAIはハードウェア拡張の速度にソフトウェアスタックの成熟度が追いついていない——というのが今回のメモの本質だ。

エンジニアへの影響 — 「規模=性能」の幻想を解く

この事件はxAI社内の話に見えて、AIインフラに関わるエンジニアには3つの普遍的な学びがある。

1. クラスタ評価指標として「GPU台数」より「MFU×台数」を見る

採用候補の研究機関や受託先のクラスタを比較するとき、「H100が何台」という数字単体では意味がない。実効計算能力 = 台数 × MFU × ピークFLOPsで見ない限り、4倍の規模差が同じ実効性能になる、という現象が普通に起きる。求人票・案件票・調達資料のいずれにおいても、MFUまたは「学習1ステップあたりの実効TFLOPS/GPU」を併記する習慣をつけたい。

2. 自社/受託の学習ジョブで取るべきプロファイリング

中規模(数十〜数百GPU)でも同じ問題は確実に再現する。最低限、次のメトリクスは常時取りたい。

  • ステップ時間の内訳(compute / communication / data load / idle)
  • AllReduce時間 vs 計算時間の比率
  • GPU SM稼働率(nvidia-smiの利用率は嘘をつくのでNsight Systemsなどで実測)
  • データローダ側のキュー長とスタール頻度

これらが揃えば、いきなりGPUを増やす前に「MFUを倍にしてコスト半減」が現実的に狙える。

3. クラウド/ベアメタル選定の判断材料

CoreWeaveやLambda、Crusoeなど「MFU特化」を売りにするGPUクラウドが増えている理由は、単純なドルあたりGPU時間ではなくドルあたり実効FLOPsで比較するとオンプレ・ハイパースケーラを上回るケースがあるからだ。逆に「安いGPU時間」だけで選ぶとデータパイプラインやネットワーク不備でMFUが半減し、結局トータルコストが膨らむ。受託案件で学習基盤を提案するときの判断軸として覚えておきたい。

まとめ

  • xAI Colossusは555,000 GPUを抱えながらMFUは11%、実効的には約60,000 GPU相当しか学習に寄与していない
  • Meta 43%・Google 46%、業界平均35〜45%と比較しても突出して低い
  • 原因は「ハードウェア拡張に分散学習スタックの成熟が追いつかなかった」こと。コレクティブ通信、データパイプライン、テールレイテンシといった古典的なボトルネックが規模ゆえに増幅した
  • 新社長Nicolls氏は2か月で50%への改善を宣言。GPU調達競争から「実効FLOPs競争」への局面転換が見えつつある
  • エンジニア視点では、クラスタ評価・プロファイリング・クラウド選定すべてにおいて「台数」より「実効MFU」で議論する習慣が利く

GPU台数の見出し競争が一服し、これからは“どれだけ効率よく回すか”が次の差別化軸になる。MFUは2026年のAIインフラ語彙として、最低限おさえておきたい指標だ。

ソース