Google第8世代TPU発表 — 訓練と推論を分離したTPU 8t/8iの狙いと、エージェント時代のインフラ設計

はじめに

2026年4月22日、Google Cloud Next に合わせて Google が第8世代 TPU を発表した。これまで単一アーキテクチャで世代を刻んできた TPU ファミリにおいて、訓練用の TPU 8t と推論用の TPU 8i という2つの物理チップに役割を分けた ことが最大のトピックだ。前世代 Ironwood(TPU v7x)からわずか数ヶ月での発表であり、発表時期・構成の分岐・ソフトウェアスタックの揃え方のすべてが「AIエージェント時代を見据えたインフラ再設計」というメッセージで貫かれている。本稿では、2チップ構成の技術的意味と、前世代からの改善幅、そしてエンジニアが読み取るべき含意を整理する。

2チップ構成の中身 — TPU 8t と TPU 8i

TPU 8t(training) は大規模モデル訓練向けに最適化されている。1つの Superpod 当たり最大 9,600 チップを構成でき、共有 HBM は合計 2 ペタバイト、ピーク計算性能は 121 エクサフロップス に達する。Pod 単位で前世代比約3倍の計算能力、そして「最大 100 万チップまでほぼ線形にスケールする」ことを Google は強調している。Pod 運用時の有効計算時間(goodput)は 97% 超で、自動故障検出・迂回機能により大規模訓練ジョブのリスタート頻度を抑えるのが運用上の差別化点だ。

TPU 8i(inference) はレイテンシとスループットの両立が焦点だ。1チップあたり HBM 288GB、オンチップ SRAM は 384MB と前世代の 3 倍に拡張され、KV キャッシュやアテンション計算に必要なメモリ局所性を大きく高めている。インターコネクト帯域は 19.2Tb/s(前世代比 2 倍)、新しい Boardfly トポロジにより Pod ネットワーク直径は 50% 削減、グローバルな集約操作のレイテンシは最大 5 倍改善された。Pod は 1,152 チップで構成され、推論クラスタの最小・最大単位を柔軟に切り出せる。

両チップ共通で、前世代比最大 2 倍の性能/ワット、価格性能比では TPU 8t が大規模訓練で 2.7 倍、TPU 8i が 80% の改善を謳う。冷却は第4世代液冷で、密度重視のデータセンタ設計に継続投資していることがわかる。一般提供は 2026 年後半予定。

なぜ「訓練」と「推論」を物理的に分けるのか

TPU を1系統に統一してきた Google がここで2チップに分岐した背景には、推論ワークロードの性格が根本的に変わった という判断がある。チャット型 LLM の応答生成ではなく、マルチステップで外部ツールを呼び、自己の出力を次の入力にフィードバックするエージェント型ワークロードでは、セッション中に保持する KV キャッシュが巨大化し、長尾のレイテンシがユーザ体感を直接損なう。メモリ帯域とオンチップ SRAM の拡張、集約操作のレイテンシ削減は、いずれも「1回の推論が長く、ステップ間の状態が重い」エージェント特有の要求に直接対応した設計だ。

一方の訓練側では、大規模な強化学習・セルフプレイ系のポストトレーニングが主役になりつつあり、線形スケーリング性と goodput(無駄になった計算時間の少なさ)が経済性を決める。TPU 8t は計算性能そのものより、「100 万チップ級までの線形性」と「97% の goodput」という2つの数字で競合を牽制している。両者の要求は一見似ているが、メモリ階層・インターコネクト・冷却密度の設計トレードオフは異なり、1つのダイで最適化するより分離したほうが素性が出る、という判断だ。NVIDIA が Blackwell 系で依然として汎用 GPU 路線を継続するなか、Google は「専用ハードで総所有コストを下げる」という差別化軸を明確化した と読める。

エンジニアにとって何が変わるか

第一に、Google Cloud 上で LLM を推論サービングしている場合、後半リリース後の TPU 8i への移行は費用対効果の見直し機会 になる。特に長文生成やエージェント的な連続呼び出しが多いワークロードでは、SRAM 3 倍・集約操作 5 倍改善の恩恵を素直に受けられる可能性が高い。JAX / MaxText はもちろん、PyTorch・SGLang・vLLM がネイティブサポート される点は運用面でも大きく、既存の推論サーバ実装をほぼそのまま移せる。

第二に、同日の GCP Release Notes では GKE DRANET が GA し、TPU v7x を含む AI アクセラレータを GKE 上でネイティブに扱える基盤が整った。第8世代 TPU も GKE / Vertex AI 経由で抽象化されて降りてくる見込みで、自前で MLPerf 級のジョブを組む少数の組織でなくとも、マネージド経由で恩恵が届く 流れは変わらない。

第三に、個人開発・フリーランス視点では直接購入対象ではないが、推論コストの低下が API 単価に反映される可能性(特に Gemini 系)を織り込む価値はある。エージェント系アプリのユニットエコノミクスは推論コストに強く引きずられるため、インフラ世代交代のタイミングは事業計画の前提として意識しておきたい。

まとめ

Google 第8世代 TPU は、単なる世代更新ではなく「訓練と推論は別物」という運用現場の感覚をハードウェア層に落とし込んだ再設計だ。121 エクサフロップスの TPU 8t、SRAM 3 倍・集約操作 5 倍の TPU 8i、両者に共通する 2 倍の性能/ワット — 数字の大きさよりも、エージェント時代の推論が長く・重く・状態を持つ という前提を Google が明示化したことに意味がある。一般提供は 2026 年後半。Gemini 系 API の単価や GKE 上の TPU 抽象化の進展とあわせ、推論コストのトレンドが再び動くタイミングになりそうだ。

今日のその他のニュース

TypeScript 7.0 Beta 公開

Microsoft が TypeScript 7.0 Beta を公開。Go 製ネイティブコンパイラ統合により大規模リポジトリの型チェック・コンパイル速度が桁違いに向上。--experimental-native で段階的移行が可能で、安定版は 2026 年後半を予定している(本ブログでも昨日詳報)。

Firebase SDK for Flutter v4.11.0 — Gemini Live API 対応

Firebase SDK for Flutter v4.11.0 がリリース。Gemini Live API による低遅延双方向ストリーミング(音声含む)の public preview に対応し、Flutter アプリへの音声対話 UI 組み込みハードルが大きく下がった。

Anthropic、Claude Code の Max プラン限定化を A/B テスト

Anthropic が Claude Code を上位有料プラン「Max」限定にする変更をテスト中との報道。Pro プランで運用している個人開発者・フリーランスは、移行コストの試算と代替ワークフローの準備が現実的な論点になる。

ソース