Kimi Delta Attention 徹底解説 — 1M文脈で6倍速・KVキャッシュ75%削減を実現した線形アテンションの正体

はじめに

新しいフラッグシップLLMの話題が価格やベンチマークに集中するなか、今週の Hacker News で静かに、しかし確実に伸びていたのは「アテンションの中身」の議論だった。Kimi Linear の論文、Kimi Delta Attention の解説記事、Kimi K3(2.8Tパラメータ)のアーキテクチャメモが、いずれも200pt前後を集めて上位に並んだ。

キーワードは 線形アテンション(linear attention) だ。文脈長が数十万〜100万トークンへ伸びるいま、従来の softmax アテンションが抱える「長くなるほど二乗で重くなる」問題は、コストにも速度にも直結する現実的なボトルネックになっている。本記事では、Kimi Delta Attention(KDA)が何を解決したのか、その発想を数式に踏み込みすぎずに整理し、2.8Tモデルへの実装が実務に何を意味するかまで解説する。

なぜ今「線形アテンション」なのか

標準的な softmax アテンションは、各クエリが「過去の全トークン」を毎回見に行く。系列長を T とすると計算量は T² に比例し、推論時には過去の Key/Value を丸ごと保持する KVキャッシュ がメモリを圧迫する。文脈が長いほど、この二次の壁が効いてくる。

線形アテンションはこの壁を避けるために、過去を「固定サイズの状態行列」に畳み込む。外積と内積の結合順序を入れ替える——(|v⟩⟨k|)|q⟩ = ⟨k|q⟩|v⟩ という単純な移項——だけで、全トークンを走査せず固定サイズの状態を更新するだけで済むようになる。計算量は系列長に対して線形、状態のサイズも一定だ。

ただし素朴な線形アテンションには弱点がある。状態の更新が「代入」ではなく「加算」で行われるため、同じキーに新しい値を書いても古い値が上書きされず、足し込まれてしまう。結果として過去の情報どうしが干渉し、記憶が濁る。これが長らく「線形アテンションは速いが精度で劣る」と言われてきた根本原因だった。

Kimi Delta Attention の仕組み — 「忘れ方」を鍛える

KDA の系譜は、この加算問題を段階的に潰してきた工夫の到達点として理解すると腑に落ちる。

まず DeltaNet。新しいキーで状態を一度クエリして「今の予測」を取り出し、正解との差分(delta)だけを書き込む。δ = β(v − S·|k⟩) という誤差項を導入し、学習可能な書き込み強度 β で更新する。β=1 なら完全な置き換え、小さい β なら緩やかな上書きになり、「狙ったキーだけを的確に修正する」ことができる。

次に Gated DeltaNet。修正は狙ったキー周辺に効くが、無関係な古い情報は残り続ける。そこでスカラーのゲート α で状態全体を先に減衰させてから書き込む。「まず忘れて、それから覚える」という順序だ。

そして Kimi Delta Attention の核心は、この忘却ゲートをスカラーから対角行列へ昇格させた点にある。α → D = Diag(α) とすることで、状態のチャネル(次元)ごとに「保持するか捨てるか」を独立に制御できる。全体を一律に薄める Gated DeltaNet に対し、KDA は「この特徴は残す、あの特徴は忘れる」というチャネル単位の忘却を実現する。線形アテンション(加算)→ DeltaNet(的を絞った置き換え)→ Gated DeltaNet(全体的な忘却)→ KDA(チャネル毎の忘却)という進化の流れだ。

実装面も巧妙で、デコード時は数行で書けるトークン単位の再帰、学習・prefill 時は同じ演算を大きな行列積へ変換するチャンク処理と、2つのモードを同一の定式化から得ている。

エンジニアへの影響 — Kimi K3 が示す実用ライン

Kimi Linear の論文は、KDA を単体で使うのではなく Multi-Head Latent Attention(MLA)と層ごとに混ぜるハイブリッド構成を採る。効率的な KDA を主体に、表現力が要る箇所に full attention 系を挿す設計だ。3B activated / 48B total の構成で検証され、フルアテンション比で KVキャッシュを最大75%削減、100万トークン文脈でデコードスループット最大6倍という数字を出しつつ、短文脈・長文脈・強化学習のいずれでもフルの MLA を上回ったと報告している。

この設計思想は、今週公開された Kimi K3(2.8T、現時点で最大級のオープンウェイトモデル) に本番投入された。通常のアテンションはマルチヘッド潜在アテンションへ、MoE は圧縮型の LatentMoE へ、そして標準アテンションは KDA へ——と、各コンポーネントが軒並み効率最適化版に置き換わっている。全層で位置埋め込みを持たない NoPE を採用した点も、フロンティア級では珍しい。

実務への示唆は明快だ。長文脈のRAGやエージェント、長い会話ログを扱うアプリでは、推論コストの主犯はしばしばKVキャッシュとデコード速度にある。線形アテンション系のハイブリッドは、その両方を大きく削れる「アーキテクチャ側の最適化」として現実解になりつつある。論文はカーネル実装・vLLM対応・チェックポイントを公開しており、自前で長文脈モデルを検証したいチームはすぐに手を動かせる。

まとめ

  • softmax アテンションの二次計算量とKVキャッシュ肥大は、長文脈時代の実コスト問題である。
  • Kimi Delta Attention は「忘却ゲートを対角行列へ昇格」させ、チャネル単位で記憶を取捨選択することで、線形アテンションの精度不足を克服した。
  • Kimi Linear は KDA と MLA のハイブリッドで、KVキャッシュ75%減・1M文脈6倍速を達成し、2.8Tの Kimi K3 に実装された。
  • モデル選定は価格やベンチだけでなく「アテンションの構造」で語られる段階に入った。長文脈コストに悩むなら、線形アテンション系の動向は追う価値がある。

今日のその他のニュース

  • MCP 2026-07-28 仕様でトランスポートがステートレス化 — Model Context Protocol の最新仕様が公開。トランスポート層をステートレスにする方針で、エージェント連携インフラの基盤アップデートとして注目されている。(blog.modelcontextprotocol.io)
  • Fil-C:Rust に書き直さず C をメモリ安全に — 既存の C コードを書き換えずにメモリ安全性を付与するアプローチを試した記事が Zenn で213 likes。移植コストを避けたい現場に刺さっている。(zenn.dev)
  • Mac mini(M4 Pro/48GB)で完全ローカルの LLM + RAG 環境 — オンプレ・プライバシー重視の実務に直結する、一台完結のローカル構成例。(qiita.com)

ソース