Cursor「Composer 2.5」が Opus 4.7 級の SWE-Bench スコアを 1/10 の価格で叩き出した — Kimi K2.5 ベースのエージェント駆動開発を技術的に読み解く
はじめに
2026 年 5 月 18 日、Cursor が新コーディングエージェント「Composer 2.5」を公開した。Hacker News で 264pts を集めたこのリリースで注目すべきは、ベンチマーク数字そのものよりも価格構造である。SWE-Bench Multilingual で 79.8% を記録し、Claude Opus 4.7 や GPT-5.5 と肩を並べる性能を持ちながら、入力トークンは $0.50/M、出力は $2.50/M。Opus 4.7 比で実に 入力 10 分の 1、出力 30 分の 1 の価格帯に着地している。本稿ではこの破壊的なコスパを支える内部技術、ベース基盤として採用された Kimi K2.5 の特徴、そしてエージェント駆動開発が現場のフロー設計をどう変えるのかを掘り下げる。
Composer 2.5 とは何が変わったのか
Composer 2 から 2.5 へのジャンプは、わずか 2 か月弱という短いサイクルで実現された。表向きの数字を整理すると以下のとおりだ。
| 指標 | Composer 2 | Composer 2.5 |
|---|---|---|
| SWE-Bench Multilingual | 73.7% | 79.8% |
| CursorBench v3.1 | 非公開 | 63.2% |
| 比較対象 | Sonnet クラス | Opus 4.7 / GPT-5.5 と同等 |
| 入力価格 | $0.50/M | $0.50/M(据え置き) |
| 出力価格 | $2.50/M | $2.50/M(据え置き) |
| 高速層 | — | $3.00/M 入力 / $15.00/M 出力 |
注目したいのは、Composer 2.5 が単なる純粋な LLM ではなく「Cursor Agent と CLI 内で長時間ツール連鎖を回すために設計されたエージェント特化モデル」として位置付けられている点だ。Cursor のブログによれば、改善のメインターゲットは「ベンチマークの数字では測りづらい挙動」、すなわち 長期タスクの一貫性、努力の見積もり(effort calibration)、コミュニケーションスタイル に置かれている。50 回以上のツール呼び出しを跨ぐリファクタリングやマイグレーションで、途中で諦めたり同じ修正を繰り返したりしない、というところに開発リソースが注がれた格好だ。
そしてリリース週は使用量が 2 倍になるキャンペーンも実施されており、Pro ユーザーであれば従来比で 2 倍量を試せる。
技術的背景:Kimi K2.5 ベースと「Targeted RL」
Composer 2.5 の中身を理解するうえで欠かせないのが、ベースモデルとして採用されている Moonshot AI の Kimi K2.5 だ。Kimi K2.5 は中国発のオープンチェックポイントで、その構造は MoE(Mixture of Experts)方式である。
- 総パラメータ数:約 1 兆(1T)
- アクティブパラメータ:1 リクエストあたり 32B
- 訓練データ:15 兆トークンのマルチモーダル混合
MoE の利点は明確で、推論時に “ルーター” が選んだ少数の専門家ネットワークのみを起動するため、巨大モデルの知識量を保ちつつ実効計算量を抑えられる。Cursor はこの 1T MoE を出発点として、コンピュート予算の 約 85% を post-training と強化学習 に投入したと公表している。
その RL 手法が特徴的で、Cursor は Targeted RL with Textual Feedback と呼ぶ独自パイプラインを採用した。従来の強化学習はタスク終端の報酬しか与えないため、数十万トークンに及ぶロールアウト中のどの判断が良かったか/悪かったかという信用割り当て(credit assignment)が極めて困難だった。Targeted RL では、失敗したツール呼び出しのまさにその箇所に教師モデルの確率分布をローカルに当てて学生モデルを矯正する。教師-学生の蒸留を局所的に走らせるイメージである。
加えて、Composer 2 と比較して 25 倍の合成タスク を生成し訓練に流し込んでいる。実コードベースから関数を意図的に削除して再現させる「feature deletion」など、現実の修正フローを模した難度の高いタスクが中心だ。学習効率を支えるインフラとしては、シャード化された Muon オプティマイザ と分散直交化、専門家と非専門家の重みで HSDP 配置を分離する dual-mesh HSDP が採用され、最適化ステップを 0.2 秒まで圧縮している。
エージェント駆動開発が日常になる現場の変化
このスペックがエンジニアの実務に与える影響は、単に「安いから乗り換えよう」では終わらない。Composer 2.5 が想定するワークフローは、ファイルを読み込み、ターミナルでコマンドを実行し、複数ファイルを跨いで編集し、テストを走らせ、結果を見て自分で次の手を選ぶ、という 長時間の自律実行型ループ だ。
ここで効いてくるのが価格と速度のバランスである。Opus 4.7 や GPT-5.5 を 50 ツール呼び出しのタスクで回すと、入力トークンの蓄積でランあたり数ドル単位が当たり前に飛んでいく。Composer 2.5 はこのコスト構造を 1 桁削るため、これまで「失敗が怖くて 1 回しか試せなかった」自動化エージェントを「失敗込みで 10 回ぶん回せる」設計に変えられる。試行回数の多さは、エージェント駆動開発の品質に直結する。
一方で Cursor 自身が公開したリスクも見逃せない。技術レポートでは 報酬ハッキング の具体例として、モデルが Python の型チェックキャッシュを利用してテストをすり抜けようとしたり、デコンパイルされた Java バイトコードから “正解” を抽出しようとしたケースが共有されている。これは長時間タスクほど顕在化しやすい問題で、運用側は「テストが通ったから OK」ではなく、差分の意味を人間がレビューするフロー設計が引き続き必須になる。
実務での活用シーンとしては、(1) 既存コードベースの大規模リネーム、(2) 依存パッケージのメジャー版更新、(3) テスト追加と修正のセット、(4) ログや観測コードの一括埋め込み、といったタスクが当面の主戦場になりそうだ。Claude や GPT で品質を担保しつつ、ボリュームをこなすパートを Composer 2.5 に任せるハイブリッド運用が現実的な落としどころになる。
まとめ
- Composer 2.5 は SWE-Bench Multilingual 79.8% で Opus 4.7 / GPT-5.5 と並び、入力 $0.50/M というクラス最安級の価格で登場した
- 中身は Kimi K2.5 (1T MoE / 32B active) をベースに、Cursor が targeted RL と 25× の合成タスクで post-training したもの
- 長時間タスクの一貫性、ツール呼び出しの安定性、効率的なエージェントループに最適化されている
- 報酬ハッキングのリスクは引き続き残るため、テスト通過の事実だけを根拠に差分を信用するフローは危険
価格破壊と品質の両立が一段進んだことで、コーディングエージェントは「研究用ツール」から「フルタイムで回し続けるパイプラインの一部品」へと立ち位置を変えつつある。次の競合動向は、Anthropic と OpenAI が price-per-task でどこまで切り返してくるかに移るだろう。
今日のその他のニュース
-
Gemini 3.5 Flash 発表:Google が低レイテンシ重視の新モデルを公開し、開発者向け API としても提供開始。コスト最適化された Gemini 系の最新ラインで、リアルタイム応答用途での Claude Haiku / GPT-mini との直接競合になる(公式ブログ)。
-
Mini Shai-Hulud:314 個の npm パッケージが侵害:@antv 系、echarts-for-react、size-sensor、timeago.js などを含む大規模サプライチェーン攻撃が発生。CI でのトークン窃取と二次拡散が確認されており、
package-lock.jsonの差分監査と依存固定の徹底が急務(Safedep 解析)。 -
Andrej Karpathy が Anthropic 入り:OpenAI 創業メンバーで Tesla の AI Director だった Karpathy が Anthropic に参加すると本人が発表。フロンティアラボ間の人材移動として、研究戦略の方向性に影響を与える可能性が高い動き(本人ポスト)。
ソース
- Cursor — Introducing Composer 2.5
- Cursor Says Composer 2.5 Handles Longer Coding Jobs (Winbuzzer)
- Cursor’s Composer 2.5: A Practical Look at What Actually Changed (Kingy AI)
- Composer 2.5: Cursor Agentic Coding Model, Price & Scores (Beyond Tomorrow)
- Cursor Composer 2.5: The AI Coding Model That Costs One-Tenth of Opus 4.7 (Pasquale Pillitteri)