GPT-6 Astra の ARC-AGI-3 が 62.7%→98.6% に跳ねた理由 — 差を作ったのはモデルではなくハーネスだった
はじめに
2026年9月3日、OpenAI が次世代モデル GPT-6 Astra を発表した。打ち出しは「PC でできることは、すべて代行できる」。ベンチマーク表はどれも派手だが、この発表でエンジニアにとって最も情報量が多かったのは、モデルのスコアそのものではない。
ARC Prize が公開した検証結果には、同じモデル・同じベンチマーク・同じ推論設定で、62.71% と 98.55% という二つのスコアが並んで載っている。違いはモデル側ではなく、モデルを回す側——ハーネスの作りだけだ。しかも高いほうがコストは安い。
この 36 ポイントの差が何から来ているのかを解きほぐすと、2026年のエージェント実装で何が性能を決めているのかがかなり鮮明に見える。本記事はそこを軸に、Astra の発表内容と、同時に沸いた「再帰型アーキテクチャ」論争を整理する。
発表されたもの:数字と条件
まず事実関係を押さえる。OpenAI が公表した主要ベンチマークは、前世代 GPT-5.6 Sol との比較で次のとおり。
| ベンチマーク | Astra | GPT-5.6 Sol |
|---|---|---|
| OSWorld 2.0(デスクトップ操作) | 72.6% | 65.7% |
| ScreenSpot-Pro(GUI 要素の指し示し) | 92.7% | 76.9% |
| AutomationBench | 41.4% | 18.1% |
| BenchCAD | 95.9% | 83.3% |
| ExploitBench | 100.0% | 78.5% |
| MRCR v2(512K〜1M トークン) | 96.3% | 73.8% |
| ハルシネーション率 | 4.2% | 12.2% |
| ExploitGym honeypot(悪用成功率) | 0.0% | 48.2% |
OSWorld ではスコアが上がっただけでなく、1タスクあたりの平均所要時間が約75分から約40分に短縮している。エージェントの評価軸が「解けるか」から「何手で解くか」に移りつつあることが、この一行に出ている。
提供条件は、発表当日は限定的な組織向け、数日以内に ChatGPT の Plus / Pro / Business / Enterprise、OpenAI API、Amazon Bedrock。API 価格は Standard が入力 $10 / 100万トークン、出力 $50 / 100万トークン、キャッシュ入力 $1 / 100万トークン。最大2.5倍速い Fast 層は Standard の倍額という構成だ。
なお ARC-AGI-1 は 97.5%、ARC-AGI-2 は 95.0%(いずれも Max reasoning)。この二つは実質的に飽和した。
62.71% と 98.55% を分けたもの
本題の ARC-AGI-3 に入る。このベンチマークが測るのは静的なパズルの正答率ではなく、未知の環境を探索し、目標を最小限のヒントから特定し、計画して実行するという一連の agentic な能力だ。評価には「何アクション使ったか」という行動効率が含まれる。
ARC Prize は Astra を二つのハーネスで走らせた。
- Standard harness: 62.71%(コスト $26,098)
- Provider Adapter harness: 98.55%(コスト $18,817)
Standard harness でモデルに許されるのは、モデル自身が「残す」と判断してテキストに書き出したメモを持ち回ることだけだ。リクエスト間で内部状態は捨てられる。ステートレスな API 呼び出しをループで回す、ごく普通のエージェント実装がこれに当たる。
Provider Adapter harness は違う。ARC Prize の説明では、これは プロバイダ側が用意した文脈管理機能を使い、リクエスト間で不透明な(opaque)reasoning state を保持し、会話が長くなったら compaction で圧縮する。OpenAI 側の実装は Responses API のハーネスで、アクションごとに直前のレスポンス ID を次のリクエストへ渡し、ツール呼び出しを跨いで推論状態を引き継ぐ。履歴が伸びたら古いものから捨てるのではなく圧縮する。
ここが決定的だ。Standard harness で失われていたのは知識ではない。モデルが環境を探索する過程で内部に組み上げた作業中の世界モデルそのものである。テキストのメモに書き出せた分しか次のターンへ渡らないなら、モデルは毎ターン、部分的に記憶喪失の状態から再出発することになる。
そして注目すべきはコストが 3割近く安くなっている点だ。状態を捨てて毎回作り直すほうが、トークンを食う。精度と費用が同じ方向に動いている。
行動効率の数字も出ている。Provider Adapter 構成の Astra は、96.0% のレベルで人間ベースラインより少ないアクション数で解き、平均で 51.7% 少ないアクションしか使わなかった。参考までに、人間の被験者側は 1 ゲームあたり約 $12.78 のコストだった。
ひとつ注記しておくと、ARC Prize のブログ記事および OpenAI の発表では ARC-AGI-3 のスコアを 99.9% と表記しており、検証結果ページの 98.55% とは数字が一致していない。本記事では検証結果ページの値を採った。
「再帰型アーキテクチャ」論争で確定していること/していないこと
発表と同時に、LessWrong と Hacker News で Astra のアーキテクチャを巡る議論が立った。焦点は looped transformer(再帰的深さ / recurrent depth) である。
技術としての中身ははっきりしている。通常の Transformer が層 1〜44 を一度ずつ通すところを、層 1〜22 の同じスタックを 2 回通す。重みを共有したまま計算だけを重ねるので、パラメータ数は据え置きで計算量がほぼ倍になる。Sebastian Raschka が解説しているとおり、実例としては Nanbeige 4.2 が 22 層スタックの 2 回適用を採っており、2 パスで標準アーキテクチャの約 75% のトークン効率が得られ、それ以上パスを増やしても伸びは小さかったと報告されている。関連研究としては、トークンごとに何パス通すかを学習ルータが決める Mixture-of-Recursions(NeurIPS)がある。
安全性側の懸念はこうだ。Geoffrey Irving は、トークン出力の間に不透明な計算が積み上がることで、chain-of-thought による監視が実質的に効かなくなると指摘する。深さの上限を設けるにしても「非常に低いところ」で切らなければ意味がなく、隠れた計算が数百層分あるなら形だけの上限だという主張だ。Ryan Greenblatt は、ループ回数が設定可能なダイヤルとして実装されている場合、競争圧力の下で後から増やされ得るため、より深い直列計算での展開が容易なのかを明確にすべきだと述べている。
ここで重要なのは、Astra が実際に looped transformer を使っているかは確定していないという点だ。The Information が 9月1日に「制約付きの recurrent depth を使っている」と報じたが、OpenAI はこれを認めていない。名前を出した OpenAI 従業員の発言、システムカード、技術論文、特許のいずれにも、Astra と recurrent depth を結ぶ記述はない。OpenAI の Jakub Pachocki 主席科学者は、Astra の計算深度は GPT-4 水準に近く、chain-of-thought の監視可能性は引き続き優先事項であり、ループには上限を設けていると述べている。
Raschka の見方は醒めていて、looped transformer 自体は小さなアーキテクチャ上の調整であり、Astra の評価をそこに結びつけるのは筋が違う、という立場だ。
エンジニアへの影響
実務に落とすと、今回の材料から効かせられるのは次の三点になる。
1. エージェントの性能はハーネスで決まる区間に入った。 同一モデルで 36 ポイントの差が出るなら、モデルを乗り換える前に自前のエージェントループを点検するほうが投資対効果が高い。具体的には、ツール呼び出しを跨いで推論状態を引き継いでいるか(OpenAI なら Responses API で直前のレスポンス ID を渡す)、履歴が伸びたときに古いターンを切り捨てていないかを見る。「トークン節約のために古い履歴を落とす」実装は、ARC-AGI-3 の Standard harness と同じ穴を踏んでいる。しかも状態保持側のほうが総コストは安かった。
2. compaction を「切り捨て」と別物として設計する。 単純な truncation は探索の初期に得た知見——最初に試して失敗した経路、環境のルールの発見——を優先的に捨てる。これは長時間タスクで最も高くつく捨て方だ。要約による圧縮を挟むだけで挙動が変わる領域である。
3. セキュリティ側の前提が動いた。 Astra は OpenAI の Preparedness Framework で初めてサイバー分野を「Critical」に分類されたモデルだ。OpenAI の記述では、堅牢化された実システムに対して人手の誘導なしにゼロデイを発見・構築でき、高レベルの目標だけを与えられて新規のエンドツーエンド攻撃を計画・実行できる水準を指す。フルのサイバー能力は一般提供されず、重要インフラの防御側(米政府および Daybreak パートナー)へのアルファ提供という形でゲートされている。ExploitBench 100%、ExploitGym honeypot での悪用成功率 0.0%(前世代は 48.2%)という数字は、攻撃能力と拒否挙動が同時に上がったことを示す。防御側の運用としては、能力がゲートされている前提そのものが期限付きの条件だと考えて計画を立てるのが妥当だ。
まとめ
- GPT-6 Astra は OSWorld 2.0 で 72.6%、タスク所要時間を約75分→約40分に短縮。ARC-AGI-1/2 は 97.5% / 95.0% で実質飽和した。
- ARC-AGI-3 の 62.71%($26,098)と 98.55%($18,817)の差はモデルではなくハーネス由来。リクエスト間で reasoning state を保持し compaction で圧縮する構成が、精度もコストも上回った。
- 行動効率では 96.0% のレベルで人間ベースラインより少ないアクション、平均 51.7% 減。
- looped transformer 論争は技術としては明確(重み共有で計算だけ倍)だが、Astra が採用しているかは OpenAI 未確認で、一次資料の裏付けはない。
- サイバー分野で初の「Critical」分類。フル能力は防御側へのゲート提供に留まっている。
エージェントを書いている側にとっての持ち帰りは単純だ。モデルを差し替える前に、自分のループが状態を捨てていないかを見る。 同じモデルで 36 ポイントぶんの余地が、ハーネス側に残っている。
今日のその他のニュース
ChatGPT / Claude / Grok が同時障害(復旧済み) — 主要3サービスが同時にダウンした。Hacker News では原因を巡る技術的考察スレッドが 328pt を集めている。独立した3社が同時に落ちたという事実そのものが、AI 依存のアプリケーションにおける共通障害点の議論を呼んでいる。(ITmedia / Hacker News)
Vitest 5.0 リリース — Vitest のメジャーバージョンが公開された。Vite ベースのプロジェクトでテスト基盤を持っているなら移行コストの確認対象になる。(Vitest Blog)
Qwen 3.8 27B が Cerebras 上で 1500 tokens/s — Hacker News で 447pt。推論速度が桁で変わると、エージェントの設計そのもの(何回ループを回すか、どこまで探索させるか)の前提が動く。(Cerebras Inference Docs)
ソース
- GPT-6 Astra: A new generation of intelligence | OpenAI
- OpenAI’s GPT-6 Astra on ARC-AGI-3 | ARC Prize
- GPT-6 Astra — ARC-AGI Results
- How concerned should we be about Astra’s recurrent architecture? | LessWrong
- OpenAI Astra and Looped Transformers | Sebastian Raschka
- OpenAI、次世代モデル「GPT-6 Astra」を発表 ~「PCでできることは、すべて代行できる」 | 窓の杜
- These Are The Official OpenAI GPT-6 Astra Benchmarks | OfficeChai
- 注記:
openai.com/index/gpt-6-astra/は本記事執筆時に 403 が返り直接取得できなかった。同ページの内容は窓の杜・OfficeChai・ARC Prize の各記事を通じて確認している。