Gemma 4 12B が示す「エンコーダーフリー × 16GB VRAM」時代 — Google 新ローカルLLM徹底解説
はじめに
2026年6月3日、Google DeepMind が新しいローカル向けマルチモーダル LLM Gemma 4 12B を Apache 2.0 ライセンスで公開した。Hacker News では同日中に 985 ポイントを獲得し、リリース当日のトップ記事となっている。
注目点は単なる「新モデル」ではなく、設計思想に踏み込んだ変更だ。ビジョンと音声のエンコーダーを廃し、すべての入力を直接 LLM バックボーンに流し込むエンコーダーフリー設計を採用した。さらに、これを 16GB VRAM クラスの一般的なラップトップで動かせるところまで詰め切ってきた。
本稿では Gemma 4 12B の技術的な肝、既存マルチモーダル LLM との違い、そして同じく今週話題となった「RTX 4080 ローカルLLM ベンチマーク」と組み合わせて、現場のエンジニアがどう評価すべきかを整理する。
ニュースの詳細 — なにが発表されたか
Gemma 4 12B は Google が新たに公開した 12B パラメータのデコーダーオンリー Transformer。中型サイズの公開モデルとしては初めて、画像・音声を「ネイティブに」入力として扱えると公式が明言している。
主要スペックは次のとおり。
- パラメータ数: 12B(同シリーズには 4B / 27B もあり、本記事は 12B にフォーカス)
- VRAM 要件: フル精度で 16GB、量子化版で 8GB
- モダリティ: テキスト・画像・音声を統一処理
- ライセンス: Apache 2.0(商用利用・改変・再配布すべて可)
- ベンチマーク: MMLU Pro で 77.2%、26B MoE モデル相当の性能を主張
特筆すべきは音声入力対応。これまで音声を扱える公開 LLM は数十 B 以上のフラッグシップが中心で、12B クラスでネイティブ対応するのは事実上初めての試みだ。動画も静止画系列+音声トラックとして処理できるため、動画ファイルを 1 ファイル丸ごと食わせるような使い方ができる。
技術的な背景 — 「エンコーダーフリー」とは何か
ここがこの記事の本題だ。従来のマルチモーダル LLM(GPT-4V、LLaVA、Gemini 1.5 系などを含む)は、概ね次のような構造を取っていた。
- 画像は専用ビジョンエンコーダー(ViT 系)で特徴量に変換
- 音声は音声エンコーダー(Whisper 系など)でトークン列化
- それぞれの出力をプロジェクション層で LLM の埋め込み空間にマッピング
- 最後に LLM バックボーンが推論
この設計は実装が分かりやすい一方、エンコーダー自体が数百 MB〜数 GB の重みを持ち、推論時のレイテンシとメモリ使用量を押し上げるという宿命的な欠点を抱えていた。さらにエンコーダーは事前学習済みのものを凍結して使うことが多く、後段の LLM と統合的にファインチューニングするのが難しい。
Gemma 4 12B はこの構造を捨てた。
- ビジョン側: エンコーダーを「単一の行列乗算 + 位置埋め込み + 正規化」という最小限の埋め込みモジュールに置き換え、視覚処理そのものは LLM バックボーンに任せる
- 音声側: エンコーダーを完全に削除し、生の音声信号を直接 LLM のトークン次元空間に射影
結果として、画像・音声・テキストがすべて同じ重みで処理される。LoRA のようなアダプタを当てれば、マルチモーダル全体を 1 パスでチューニングできるのがエンジニアにとって最大のメリットだ。「ビジョンエンコーダーを別途凍結したまま、テキスト LLM だけ更新する」という従来の歪な構成から解放される。
ちなみにこのアプローチは、研究界で議論されてきた “fused / native multimodal” の系譜に位置づけられる。同時期発表の他社モデルに先んじて、Google が中型サイズで商業ライセンス込みで実装してきたインパクトが大きい。
エンジニアへの影響 — 何が変わるか
実務の文脈で考えると、Gemma 4 12B の登場は次の 3 つの局面で意思決定を変えてくる。
1. ローカル LLM 構成の見直し
同じ今週、Zenn で 「RTX 4080 でローカルLLM 7 モデルを実測したら 16GB VRAM の壁が見えた」 という記事が話題になった。15GB を超えるモデルは CPU オフロードが発生し速度が 1/10 以下に落ちる、という実測結果は、16GB 帯がローカル LLM の現実的なラインであることを裏付けている。
Gemma 4 12B はちょうどこのラインを攻めてきた。フル精度 16GB、量子化で 8GB という設計は、上記の壁を意識した上で作られているように見える。RTX 4060/4080、あるいは Apple Silicon の Mac で動かす選択肢として、いまある gpt-oss:20b や deepseek-coder-v2:16b と並んで筆頭候補に入る。
2. マルチモーダル前提のアプリ設計
これまで「LLM + 別の音声認識 API + 別の画像認識 API」と分散していた構成を、Gemma 4 12B 単体に寄せる選択肢が現実的になる。とくに動画解析、会議録音からの構造化、画像とテキストの混在チャットなどは、API 数を減らせるだけでコストもレイテンシも下がる。
ローカル実行と Apache 2.0 ライセンスが効くのは、医療・金融・法務など外部 API に送れない領域だ。これまでクラウド LLM を断念していたユースケースが、現場の PC 上で完結できる射程に入ってくる。
3. ファインチューニングの簡素化
エンコーダーフリーゆえに、LoRA を当てるだけで画像・音声・テキストを横断する適応が掛けられる。社内ドメインの画像と日本語テキストを混ぜたデータセットで丸ごとチューニング、という運用が現実的なコストでできるようになる。これは中小規模のチームには大きい。
まとめ
Gemma 4 12B は「ローカルで動くマルチモーダル LLM」をもう一段先に進めた。エンコーダーフリーで実行時コストを抑え、Apache 2.0 でビジネス利用の制約を外し、16GB VRAM という現場で揃えやすいラインに収めてきた点が秀逸だ。
短期的には、いま gpt-oss:20b や Qwen 3.5 系列を回している環境への代替候補。中長期的には、マルチモーダル前提のアプリ設計をローカル LLM で組むという選択肢を一般化する起点になる可能性がある。実機評価は急ぐ価値がある。
今日のその他のニュース
- Elixir v1.20 が漸進的型付けを正式導入(HN 928 pts)。動的言語に型を後付けで載せる潮流が、Python・Ruby に続き Elixir でも本格化した。型ヒントの段階的導入が可能で、既存コードベースを壊さない設計。
- VoidZero が Cloudflare に参画(HN 430 pts)。Vite / Rolldown / Oxc を束ねる Web ツールチェーンのキープレイヤーが Cloudflare 傘下入り。エッジ実行と JS ツールチェーンの距離がさらに縮まる。
- Anthropic 公式が Claude のコンテイメント設計を解説(HN 207 pts)。プロダクトごとに Claude をどう「閉じ込めて」いるかを公開。Managed Agents 利用時のセキュリティモデル理解には必読。
ソース
- Introducing Gemma 4 12B: a unified, encoder-free multimodal model — Google Blog
- Google DeepMind Releases Gemma 4 12B — MarkTechPost
- A Visual Guide to Gemma 4 12B — Maarten Grootendorst
- RTX 4080でローカルLLM 7モデルを実測したら「16GB VRAMの壁」が見えた — Zenn
- Elixir v1.20: Now a gradually typed language
- VoidZero Is Joining Cloudflare
- The ways we contain Claude across products — Anthropic