Bonsai 27B徹底解説 — 27B級LLMがiPhoneで動く「1ビット量子化」の仕組みと衝撃

はじめに

「27Bパラメータの大規模言語モデルが、iPhoneのメモリに収まって動く」——この一文だけ聞くと誇張に思えるかもしれない。だが2026年7月、Caltech出身の研究者らが立ち上げたスタートアップ PrismML が公開した Bonsai 27B は、まさにそれを実現したと主張している。1ビット版はわずか 3.9GB で、iPhone 17 Pro 上で動作するという。

本記事では、この Bonsai 27B がなぜ実現できたのかを、「1ビット量子化」という技術の核心から解き明かす。Microsoft の BitNet との違い、性能はどこまで保たれるのか、そしてオンデバイスAIがエンジニアの実務に何をもたらすのかまで踏み込んで解説する。

Bonsai 27Bとは何か — スペックの整理

Bonsai 27B は Qwen3.6 27B をベースに、極限まで低ビット化したモデルだ。2つのバリアントが提供されている。

バリアント実効ビット幅サイズ対応デバイス総合スコア(15ベンチ)
Ternary(3値)1.71 bit/weight5.9GBノートPC80.5点(フル精度比 約95%)
1-bit(2値)1.125 bit/weight3.9GBiPhone 17 Pro76.1点(フル精度比 約90%)

注目すべきは、単に「軽い」だけでなく 性能保持率が高い 点だ。特に数学・コーディングのカテゴリは「ほぼ無傷(nearly untouched)」と報告されており、実用タスクでの劣化が小さい。加えて 262Kトークンの長文コンテキスト、4ビット圧縮のビジョンタワーによるマルチモーダル対応、speculative decoding 対応、そして Apache 2.0 ライセンスと、実運用を強く意識した構成になっている。

速度面では、RTX 5090 上で 1-bit 版が最大 163 トークン/秒、Apple の M5 Max 上でも最大 87 トークン/秒に達する。オンデバイスでも体感で「待たされない」水準だ。

技術的背景 — 1ビット量子化とBitNetとの決定的な違い

ここが本記事の核心だ。通常、LLMの重みは FP16(16ビット)や BF16 で保持される。これを INT8、INT4 と削っていくのが「量子化」だが、ビットを削るほど情報が失われ、性能は落ちる。では「1ビット」まで削ると何が起きるのか。

重要なのは、Bonsai が 学習後に量子化した(post-training quantization)のではなく、最初から1ビット制約下でネイティブに学習している点だ。各重みを訓練の当初から -1 か +1 のいずれかに制約すると、ネットワークは「その制約の中で最も表現力が出る重み配置」を自ら学習する。後付けで丸めるのとは、獲得される内部表現の質が根本的に違う。

Microsoft が提唱した BitNet は 1.58ビットの3値(-1, 0, +1)を採用していた。この 0 は接続を「オフ」にするスイッチとして機能し、表現力の余地を残す。対して Bonsai の 1-bit 版は 0 を捨て、純粋に -1 / +1 の2値だけで戦う。オフスイッチのないより厳しい制約だが、ネイティブ学習でそれを補っている。一方で Bonsai の Ternary 版は BitNet と同じ3値方式を採り、精度を優先したい層に応える——つまり用途に応じて両者を選べる設計だ。

PrismML は独自指標「Intelligence Density(GBあたりの知能密度)」で 0.53/GB を掲げ、フル精度比で10倍以上、従来の低ビット手法比でも約2.7倍の効率だと主張する。同社の Bonsai ファミリーには 8B(約1GB)や 1.7B(0.24GB)もあり、Raspberry Pi クラスでも動く。

エンジニアへの影響 — オンデバイスAIが開く実務の扉

27B級のモデルがスマホで動くことの意味は、単なる「省メモリ自慢」ではない。推論をクラウドに投げなくてよくなるという構造変化だ。

第一に プライバシー。医療・金融・法務など、データを外部APIに送れない領域で、端末内完結のLLMは決定的な武器になる。第二に オフライン動作とレイテンシ。ネットワーク往復がゼロになれば、現場(工場・車載・ロボティクス)での常時推論が現実的になる。第三に コスト。トークン課金のクラウド推論に対し、オンデバイスは限界費用がほぼゼロだ。

もちろん万能ではない。フロンティアモデル(GPT-5.6 や Claude Sonnet 5)と正面から知能を競う用途では依然クラウドが優位であり、Bonsai の立ち位置は「十分賢く、かつ端末で完結する」ゾーンにある。エンジニアとしての実務的な勘所は、「この機能はフロンティアの知能が要るのか、それとも端末内で完結する堅実な推論で足りるのか」を切り分ける設計だ。Apache 2.0 で配布される以上、まず 8B 版あたりを手元で動かし、自分のユースケースの精度ラインを測るのが最短の検証ルートになる。

まとめ

  • Bonsai 27B は Qwen3.6 27B をベースにした1ビット/3値のLLMで、1-bit版は3.9GBでiPhone 17 Proに乗る。
  • 鍵は「学習後の量子化」ではなくネイティブ1ビット学習。BitNetの3値(0を含む)に対し、1-bit版は-1/+1の2値で戦う。
  • 数学・コーディングの性能保持率が高く、262Kコンテキスト・マルチモーダル・Apache 2.0と実運用志向。
  • インパクトはプライバシー・オフライン・コストの3点。フロンティアモデルとは棲み分ける設計判断が問われる。

オンデバイスLLMは「小さいから妥協する」段階を越えつつある。次に問われるのは、その知能を前提にどこまでの機能をクラウドから引き剥がせるかという、アプリ設計そのものの再定義だろう。

今日のその他のニュース

  • GKEが「AI Hypercomputer」化 — Google Kubernetes Engine が Pod Snapshots でエージェント状態を即時復元し、コールドスタートを最大90%削減。再エネ連動のCarbon-Aware Schedulingやエージェント用サンドボックスも追加され、AIエージェント運用基盤としての色を強めている。(GKE release notes)
  • LinkedInの長文投稿の40%はAI生成 — SNS上のコンテンツがどこまでAIで書かれているかを示す調査。文体の「AI臭」を検出・除去する話題(AI臭は語彙よりリズムに出る等)とも呼応し、生成文の見分け方が実務の関心事になりつつある。(GIGAZINE)
  • KFC全店品切れ、ニチレイへの不正アクセス — サプライチェーンへのサイバー攻撃が実店舗の在庫にまで波及した事例。AsyncAPIのOSSサプライチェーン侵害と併せ、「上流の一点」が広範囲を止めるリスクを改めて突きつけた。(ITmedia)

ソース