GitHubスター600万件がフェイクだった — CMU大規模調査から読むOSS選定の新基準

はじめに

2026年4月、GitHub's fake star economy と題した大規模調査レポートが Hacker News で718ポイントを獲得し、ソフトウェア業界に大きな衝撃を与えている。調査の中核には Carnegie Mellon University(CMU)が ICSE 2026 で発表した査読付き論文があり、2019〜2024年の326百万スター/6.7億イベントを含む20TB分のGitHubメタデータを解析した結果、約600万件のフェイクスターと18,617件の関与リポジトリが特定された。

本記事では、この調査が示すフェイクスター経済の構造と、特にAI/LLM系OSSで深刻化している歪み、そしてエンジニアが実務でOSS選定を行う際の具体的な新基準を整理する。「スター数が信頼できなくなった」という結論で終わらせず、代替指標で戦える状態を目指す内容となっている。

スター経済の構造 — CMU調査が明らかにした事実

CMUの調査が突きつけた数字は率直に衝撃的だ。50スター以上のリポジトリのうち 16.66% が2024年7月時点で何らかのフェイクスター操作に関与していた。言い換えれば、スター数の上位をさらっているリポジトリの6つに1つで、何らかの人為的なスター操作が行われていた計算になる。

さらに興味深いのは、フェイクスターが検出されたリポジトリの 90.42%が2025年1月までに削除された という事実だ。これは調査側のフラグ付けが偶然ではなく、実際に問題のあるプロジェクトを正確に捕捉できていたことの強い裏付けとなる。削除されたリポジトリの多くは、実体のない短期プロジェクトや、投資・採用目的でスター数を盛っていた実験的なアカウントとみられる。

市場としてのフェイクスター

調査は単なるアカデミックな分析に留まらず、実在するフェイクスター売買市場の構造まで踏み込んでいる。価格帯は明確に階層化されており、用途に応じて使い分けられているという。

ティア単価特徴
バジェット$0.03〜$0.10使い捨てアカウント・即納
ミッドレンジ$0.20〜$0.50何らかの活動履歴あり
プレミアム$0.80〜$0.90エイジング済みアカウント・段階的納品

ベンダーは少なくとも12の専用サイトと24のFiverr上の出品が確認されており、無料で相互にスターを付け合う「スター取引所」プラットフォームまで存在する。アカウントの中央値年齢は997〜1,180日と、わざわざエイジングした購入済みアカウントが使われている点が、取引の成熟度を物語っている。

なぜここまで歪んだのか — 3,500倍のROI構造

フェイクスター経済がここまで規模を拡大した理由は、単純にROI(投資対効果)が異常に高いからだ。CMU調査は、ベンチャーキャピタル側の投資基準とスター数の相関を具体的に数値化している。

  • シード段階のスタートアップのスター数中央値: 2,850
  • シリーズA段階: 4,980
  • これらのスターを買い揃えるコスト: $85〜$285
  • 実際に調達されるラウンドサイズ: $1M〜$10M

単純計算で 3,500倍〜117,000倍のROI。どんな真っ当なマーケティング手法でもここまでの効率は出せない。ROSS Index(Runa Capitalが運営するOSSスタートアップ指数)上位にランクインした企業の68%が、この調達ルートを通っていたと推定されている。金額にして $169M(約250億円)相当が、少なくとも部分的にフェイクスターを経由して動いた計算になる。

個人的に最も重いと感じたのはこの構造だ。スター数という本来は無料で付与される指標が、資金調達に直結する数億円規模のシグナルに化けている。歪むべくして歪んだと言わざるを得ない。

AI/LLM系OSSで特に深刻 — 17.7万フェイクスター

カテゴリ別に見ると、AI/LLM系プロジェクトが非悪意カテゴリとしては最大のフェイクスター数(17.7万件)を抱えていた。ブロックチェーン/暗号資産系ほどの露骨さはないものの、スケールで見れば十分に大きい。

このタイミングは偶然ではない。2024〜2025年にかけて AI エージェントや RAG 基盤、ベクトル DB、LLM ランタイムといったカテゴリで、毎週のように新しいプロジェクトが誕生してきた。評価の不確実性が高く、かつ投資マネーが大量に流入している領域で、**「スター数が早い段階の唯一の社会的証明になってしまう」**構造があった。

調査が特に名指ししているのは Union Labsで、ROSS Index 第1位にランクインしながら、47.4%のスターがフェイクと判定されている。2人に1人近くがフェイクという水準は、もはや単発の操作ではなく運営方針として組み込まれたブーストと解釈するのが自然だろう。

検出の手がかり — 数字で見抜くフェイクスター

CMUの調査は同時に、エンジニアが手元で使える検出指標も明確にしてくれている。論文で提示された具体的な閾値は次の通りだ。

スターガイザー側のプロフィール特徴

指標フェイク比率が高いリポジトリ
フォロワー0のスターガイザー28〜81%
公開リポジトリ0のアカウント19〜37%
“ゴースト”アカウント(リポジトリ・フォロワー・Bio すべてなし)19〜28%

エンゲージメント比率指標

最も分かりやすいのは fork-to-star 比 と watcher-to-star 比 だ。

  • Fork-to-star 比: 健全なプロジェクトは平均 0.160、フェイク疑いがあるリポジトリは 0.020〜0.053
  • Watcher-to-star 比: 健全は 0.005〜0.030、フェイク疑いは 0.001(最大30倍の差)

極端な例として、157,000スターを持つ FreeDomain リポジトリでは、81.3%のスターガイザーがフォロワー0で、watcher-to-star比が類似の健全プロジェクトの26分の1だった。スター数だけを見れば超有名OSSだが、エンゲージメント指標まで含めると明らかに異常な分布が見える。

エンジニアが今日から変えるべき4つの基準

調査内容を踏まえ、OSSを選定する際に参考にすべき具体的な新基準を整理する。

1. Fork-to-Star 比をまず見る

もっともコストが低く、かつ効果的なチェック。10,000スター以上かつ fork-to-star 比が 0.05 未満のリポジトリは、少なくとも一度は「なぜ使う人がフォークしないのか」を疑って評価し直す価値がある。ブラウザで /network/members を見るだけで把握できる。

2. Watcher-to-Star 比で「実際に動かしている人」を確認

Forkはあくまで派生を示す指標で、企業内利用者はフォークせずに使うケースも多い。より実態に近いのが Watcher 数だ。スター数の 0.5%以下しかウォッチしていないプロジェクトは、広く観測されているわけではない可能性が高い。

3. スターガイザーの中身を20件だけ抜き打ち調査

GitHub API で GET /repos/{owner}/{repo}/stargazers を叩き、ランダムに20件のアカウントを確認する。フォロワー0・リポジトリ0の比率が 50%を超えるようなら、アラートを上げる価値がある。gh api コマンドならワンライナーで取得できる:

gh api -H "Accept: application/vnd.github.star+json" \
  "/repos/<owner>/<repo>/stargazers?per_page=100" \
  | jq '[.[] | .user.login] | .[0:20][]'

4. ユニーク月次コントリビューター数を最上位指標に置く

VC側のアナリストも指摘している通り、最も偽装が難しいのはコントリビューションの深さだ。GitHub Insights の “Contributors” タブで、過去3か月のユニーク月次コントリビューターを見るだけで、プロジェクトの実体がかなり見える。10人未満で推移しているプロジェクトは、スター数が何万であっても実質的に1人プロジェクトだと心得ておきたい。

AIエージェント時代の重み

この問題が2026年にこれほど深刻化しているのは、AIエージェント開発の加速と深く関係している。Claude Code / Gemini Code Assist / OpenAI Codex といったエージェントが、OSSを自動で探して導入するようになった。選定ロジックには、ほぼ例外なく**「GitHub Stars によるランキング」**が含まれている。

つまり、フェイクスターで水増ししたプロジェクトが、AIエージェントの力でさらに拡散する。人間のエンジニアが気付きにくい形で、質の低いコードが量産されるリスクが構造的に高まっている。

個人的に考えるに、今後のAIエージェント設計では、スター数ではなく fork-to-star 比・コントリビューター数・Issue 解決レート を選定の一次指標にするべきだろう。SkillsやMCPサーバーの配布においても、同じ考え方が効いてくるはずだ。

まとめ

CMU の ICSE 2026 論文が示したのは、「GitHub Stars はもはや単独では信頼できる品質指標ではない」という、ある意味で予想通りでありつつも、数字で裏付けられた衝撃的な事実だった。

  • 600万件のフェイクスター、18,617件のリポジトリが関与
  • 50スター超のリポジトリの16.66%が関与、検出後の削除率は90.42%
  • AI/LLM系で17.7万件、Union Labs は47.4%がフェイク
  • $85で2,850スター、投資ROIは3,500〜117,000倍
  • Fork-to-star 比 0.05 未満、Watcher-to-star 比 0.001 が危険シグナル

今後のOSS選定では、スターを見るだけの時代は終わったという前提で動くのが現実的だ。fork-to-star 比と watcher-to-star 比、そしてユニーク月次コントリビューター数を並べて見る習慣をつけるだけで、フェイクの大半は判別できる。特にAIエージェントに選定を任せる場合には、評価ロジックそのものに手を入れておきたい。

今日のその他のニュース

Apple CEO交代 — 15年ぶりTim Cook退任、John Ternus就任

Appleが2026年9月付で、Tim Cook CEOの退任と John Ternus の新CEO就任を公式発表した。Ternus氏はハードウェアエンジニアリング担当SVPとして Apple Silicon への移行を指揮してきた人物で、今後のAppleはオンチップAI推論(Neural Engine活用)を前面に出した戦略シフトが予想される。WWDC の発表内容が例年以上に注目される。

Qwen 3.6 Max Preview・Kimi K2.6 — オープン系LLMの追撃が本格化

Alibaba Cloud の Qwen 3.6 Max Preview と Moonshot AI の Kimi K2.6 が相次いでリリースされ、Hacker News でそれぞれ 497pts / 528pts を獲得した。特にKimi は同時公開された Vendor Verifier で「同じ重みでもプロバイダー次第で精度が変わる」問題を可視化する取り組みまで踏み込んでおり、オープン系エコシステムの成熟度が一段上がった印象。

Google Android CLI — AIエージェント向けで70%トークン削減

Googleが公開したAIエージェント向け公式 Android CLI は、JSON 構造化出力と最小情報返却により トークン消費 70%削減・実行 3倍高速化 を実現。Gradle 直呼び出しから CLI 経由への移行だけで、Claude Code / Gemini Code Assist 経由のモバイル開発コストが一気に圧縮される。

ソース