見出し画像

GPT-6 Astra(アストラ)」はこの一点だけわかればOK!AIはモデル戦争からワークフロー戦争へ

2026年9月3日(現地時間)、OpenAIが新世代モデル 「GPT-6 Astra(アストラ)」を発表。もちろんモデルそのものも非常に強いです。コーディング、科学、コンピューター操作、ブラウジングなど、多くの領域で最先端の数字を出しています。

今回はこの一点のみでGPT-6 Astraの特徴を掴んでいこうと思います。

その象徴が、ARC-AGI-3で起きた「62.7% → 99.9%現象」です。

同じGPT-6 Astraなのに、Standard Harnessでは最高62.7%。ところがProvider Adapter Harnessでは最高99.9%まで上がりました。しかも、モデルを別のもっと巨大なAstraに交換したわけではありません。

変わったのは、Astraを取り巻く「システム」です。

ここから見えてくるのは、AI競争が「どのモデルが一番賢いか」というモデル戦争だけではなく、モデルをどう動かし、どう文脈を維持し、どう仕事を継続させるかというAIシステム、そしてさらに上流のAIワークフローの競争へ広がっているということです。

【関連動画】

いいね・チャンネル登録していただけると嬉しいです🍀




ARC-AGI-3はこれまでのARCとはかなり違う

まずARC-AGI-3が何なのかを簡単に説明します。

ARC-AGI-1やARC-AGI-2は、基本的には静的なパズルです。いくつかの入力と出力の例を見せられて、「この世界にはどんな規則があるのか」を推論して、新しい問題に答えます。

一方、2026年に登場したARC-AGI-3はインタラクティブです。

AIは未知の環境に入れられます。そこで、

観察する
→ 推論する
→ 行動する
→ 世界が変わる
→ また観察する
→ 仮説を修正する
→ また行動する

ということを繰り返します。

つまり、一回の問題を一発で解く能力だけを見ているわけではありません。「このボタンは何をするのか」「この物体を動かすと何が起きるのか」「そもそもゴールは何なのか」といったことを、自分で探索しながら理解していく必要があります。

ARC Prize自身も、ARC-AGI-3を未知の抽象的なターン制環境におけるagentic intelligenceを研究するベンチマークと位置づけています。

ここが重要です。

一問一答なら、その瞬間のモデルの推論能力がかなり重要になります。しかし100回、200回と行動を繰り返すなら、それまでに何を試したのか、何が失敗したのか、どんな仮説を立てていたのかを失わないことが重要になります。

つまり「一瞬の賢さ」だけではなく、時間をまたいで賢さを維持できるかが問われるわけです。

Astraは62.7%から99.9%へ

ARC PrizeはAstraを2種類の条件で評価しています。

ひとつはStandard Harness。こちらはベンダー中立の条件で、モデルは自分が重要だと思った情報をVisible Notesとして持ち越すことができます。

この条件でAstraの最高スコアは**62.7%**でした。

これだけでもかなり強いです。

ところが、OpenAI側が用意した文脈管理機構を利用できるProvider Adapter Harnessでは、最高**99.9%**まで上昇しました。

ここで私は最初、「Harnessがものすごく強いのか」と考えました。

しかし詳しく見ていくと、少し違います。

重要なのはHarnessそのものというより、StatefulなContextの持ち方です。

Provider Adapterでは、Astraのopaque reasoning state、つまり外から直接見えない推論状態をリクエスト間で保持できます。そして会話や作業履歴が長くなった場合にはCompactionを使い、それまでの仕事を次の推論で再利用できるようにします。ARC Prize自身がこの仕組みを明記しています。

つまりAstraが突然もっと賢いモデルに交換されたわけではありません。

前に考えていたことを失わなくなった。

ここがものすごく大きいのです。

「もっと考える」より「考えたことを失わない」

この結果をさらに面白くしているのが、Reasoning Effort別のスコアです。

Standard Harnessでは、

  • Max:62.7%

  • XHigh:59.3%

  • High:54.8%

  • Medium:38.6%

  • Low:17.5%

  • None:35.2%

となっています。

ところがProvider Adapterでは、

  • Max:98.6%

  • XHigh:98.4%

  • High:99.9%

  • Medium:98.4%

  • Low:98.0%

  • None:96.7%

です。

これはかなり衝撃的です。

もちろん「Reasoningはもう必要ない」という話ではありません。しかし少なくともARC-AGI-3では、毎回ものすごく深く考えさせること以上に、それまでの推論成果を次の文脈へ正しく引き継ぐことが非常に大きな力を持っていることが分かります。

例えば一度、

「ACTION3は壁を動かす」
「黄色い物体がある場合は方向が反転する」
「仮説Aはすでに失敗した」
「次は仮説Bを試す」

というところまで分かったとします。

これを忘れたら、次のターンでまた「ACTION3って何だったっけ?」から考え直さなければいけません。

しかしStateとして残っていれば、そこはもう考えなくていい。次の未知の部分だけに推論能力を使えます。

つまり、Reasoningを減らしたというより、再Reasoningを減らしたと考えると分かりやすいです。

実際、Provider Adapterは両Harnessが共通して解けた167の条件で、総Tokenを約49%減らしながら、記録された経過時間も約3.66倍高速でした。性能を上げるために、むしろ大量に考えさせたわけではないのです。

これは「Reasoningの資産化」ではないか

私はここがAstraの非常に面白いところだと思っています。

従来のCoT、Chain of Thoughtは、ざっくり言えば、

Prompt → 深く考える → Answer

です。

ところが今回のような仕組みでは、

Reasoning₁
→ State₁
→ 行動
→ 新しい観察
→ Reasoning₂
→ State₂
→ Compaction
→ EssentialなState
→ Reasoning₃

という流れになります。

つまり、一回のCoTをただ長くしているのではありません。

CoTそのものを時間方向につなぎ、その成果をStateとして残し、長くなったら圧縮して次のCoTへ渡している。

私はこれをあえて名前を付けるなら、

Stateful Essential Prompt Chain

と呼びたいくらいです。

ポイントは「考えること」から「考えたことを資産として残すこと」への変化です。

一瞬ものすごく賢いAIよりも、昨日考えたこと、10分前に失敗したこと、今どこまで進んでいるのかを失わないAIの方が、長い仕事では強い。

これは人間でも同じですよね。

どれだけ頭のいい人でも、昨日やった仕事を全部忘れて毎朝ゼロから始めていたら、大きな研究やプロジェクトはなかなか進みません。

モデルだけではなく「System Architecture」が能力になる

だから私は、Astra以降のAIを見るとき、

AI能力 = Model × System Architecture

と考えると分かりやすいと思っています。

System Architectureをもう少し分解するなら、

Knowledge × Memory × Log × State × Context Management × Tools × Harness × Agent Architecture

などです。

Knowledgeは、ユーザーがAIに与えた研究資料や社内資料、データベースなど、AIが利用できる知識資源。

Memoryは、長期的に保持されたユーザー情報や過去の研究知識。

Logは、AIが実際に何をしたかという生の履歴。

Stateは、「今どこまで進んでいるか」という現在地。

Context Managementは、その膨大な情報の中から「今この推論に何を見せるか」を選択し、必要なら圧縮する仕組み。

ToolsはWeb、Python、Computer、MCPなどの手足。

Harnessは、それらを接続して実行ループを回す仕組み。

Agent Architectureは、Router、Subagent、検証Agentなどの役割分担です。

ARC-AGI-3の99.9%が、このすべての要素の効果を証明したわけではありません。今回特に強烈に見えたのは、StateとContext Management、そしてCompactionです。

しかし実際のAI利用では、その上にユーザー固有のKnowledge、Memory、Skills、Tools、Agent構成まで乗せることができます。

つまり同じAstraを使っていても、持たせるシステムによって全く違うAIになり得るわけです。

そして、もっと大きく見ると「ワークフロー戦争」

ここまで来ると私は、単に「AIシステム・アーキテクチャ戦争」と呼ぶよりも、さらに大きくAIワークフロー戦争と見る方が面白いと思っています。

その兆候はAstraだけではありません。

Claude Fable 5.1もTerminal-Bench Scienceで大きな伸びを見せました。

Terminal-Bench Scienceは、科学問題に答えるだけのベンチではありません。コードを書き、Terminalを使い、データを解析し、シミュレーションを走らせ、モデルをフィッティングするなど、科学研究のWorkflowそのものをAIエージェントに実行させます。

Fable 5.1はここで52.6%。Solは22.4%でした。約2.3倍です。

そしてAstraはさらに**64.6%**まで伸ばしています。

一方、Artificial Analysisの総合Intelligence Indexを見ると、Astraは61で、Fable 5.1の66を下回っています。つまり「モデル単体の総合的な賢さ」でAstraが圧倒しているわけではありません。

ここが非常に面白い。

単純な賢さの総合指数ではFable 5.1が上。

しかし、

Terminalを使う
科学Workflowを回す
未知環境を探索する
Stateを保持する
長い作業を継続する

という方向になるとAstraが急に強くなってくる。

私はこれを、

Model IQではなくWorkflow IQが伸びている

と見ると分かりやすいと思います。

OpenAIは「賢さ勝負」から逃げたのか

ここは少し慎重に見た方がいいでしょう。

「OpenAIはClaudeにモデル単体の賢さでは勝てないから、Workflowに逃げた」とまで断定する材料はありません。OpenAI自身はAstraを最も高性能なモデルとして位置づけていますし、FrontierMathやGPQAなど純粋な推論領域でも非常に強い数字を出しています。

ただ、競争軸を意図的に広げているとは感じます。

もはや「一問解いて何点」という世界だけではなく、

何時間仕事を続けられるか
道具をどう使うか
過去をどう保持するか
失敗からどう復帰するか
複数の仕事をどう組織化するか

まで含めてAIの能力として競争する。

これは非常に合理的です。

なぜなら私たちが最終的に欲しいのは、ベンチマークで1点高いAIではなく、仕事を最後までやってくれるAIだからです。

初心者にも恩恵があり、上級者にはさらに差が出る

そしてこの流れは、エンジニアだけの話ではありません。

OpenAI側がState管理やContext管理、Harnessなどをかなり整備してくれれば、一般ユーザーはその仕組みを自分で一から作らなくても、高度なエージェント体験を利用できます。

つまり初心者にとっては、高度なAIシステムの民主化です。

一方で上級者は、その上に自分のKnowledge、Memory、Skills、Tools、Router、Subagentなどを組み合わせられる。

すると、

Astra × OpenAIのSystem Architecture × ユーザー独自のSystem Architecture

という構造になってきます。

ここでは、同じAstraを使っている人同士でも結果が変わる可能性があります。

モデル選びだけではなく、

「自分はAIにどんな環境を与えているのか」

が重要になってくるわけです。

まとめ:AIは「深く考える」から「積み上げて考える」へ

GPT-6 AstraのARC-AGI-3「62.7% → 99.9%現象」を見て、私は単純に「Astraは99.9%だからすごい」という話だけでは少しもったいないと思います。

もっと重要なのは、

なぜ99.9%になったのか。

そこにあります。

Astraの推論を毎回使い捨てるのではなく、Stateとして保持し、長くなったContextを整理・圧縮し、次の推論へ渡す。

そうすることでReasoning Effortを大きく上げなくても、非常に高い性能を維持できた。

これは、

一回で深く考えるAI

から、

考えたことを失わず、圧縮し、積み上げながら考えるAI

への変化だと思います。

そしてさらに大きく見るなら、

AIモデル戦争

AIシステム・アーキテクチャ戦争

AIワークフロー戦争

へと競争軸が広がっている。

GPT-6 Astraで本当に注目したいのは、モデルそのものの賢さだけではありません。

「モデルの外側をどう作れば、AIはもっと賢く働けるのか」

その答えが、かなり具体的な形で見え始めたこと。

私はそこが、今回のAstraで最も重要なポイントではないかと思っています。


【プロフィール】

ワンダー・佐藤源彦(さとう もとひこ)
1977年生まれ
MBBS & AI共創イノベーション主催。
医療系の研究所、心理学の研究所の勤務を経て独立し、現在は生成AI(ChatGPT、Claude、Geminiなど)と心身に関する研究をしている。
主著『かんたんプロンプト』(芸術新聞社)『東洋医学と潜在運動系』(たにぐち書店)、2年間専門誌に連載、論文執筆などの執筆業を行いつつAI共創ライティングを開発中。
心理学・カウンセリング・コーチングをAIに技術転用し、AI共創プロンプトエンジニアリングを開発している。
AIスクール・AI企業研修・AIアプリ開発などを行う。

✅ワンダー佐藤総合リンク
https://linktr.ee/motohiko.sato

✅ワンダー佐藤源彦・著『かんたんプロンプト』(芸術新聞社から刊行)
※プロンプトエンジニアリングの基本から応用、タスク実行までを網羅
https://amzn.asia/d/80zVtv8

✅note記事
https://note.com/mbbs
※ChatGPT・Claude・Gemini・NotebookLM・Perplexity
※メンバーシップはじめました!

✅AI共創イノベーション(AIスクール・AI企業研修・AIアプリ開発のサイト)
https://mbbs-ai.jimdofree.com/

✅Facebook
https://www.facebook.com/motohiko1977
※リクエスト申請前にメッセージください

【AI共創イノベーションおすすめ動画】
https://www.youtube.com/watch?v=IXbKlwHUdbg&list=PLTcSHWqKTOojc8R-brID5q06JrmtiWRTl

サテライトチャンネル

References

  • OpenAI. (2026). GPT-6 Astra System Card. OpenAI.

  • OpenAI. (2026). OpenAI GPT-6 Astra: Autonomous agency and system architecture. OpenAI.

  • ARC Prize. (2026). Evaluating GPT-6 Astra on ARC-AGI-3 Benchmark. ARC Prize.

  • Artificial Analysis. (2026). Systemic Agents: Benchmarking and Architecture of GPT-6 Astra. Artificial Analysis.

#GPT6Astra #OpenAI #GPT6 #ARC_AGI_3 #AIエージェント #自律型AI #プロンプトチェーン #Harness #推論エフォート #ChatGPT6
#ハーネス #プロンプト #プロンプトエンジニアリング


いいなと思ったら応援しよう!

佐藤源彦@MBBS チップをいただけると、とても励みになります✨ いただいた分はすべて研究活動や記事制作に使わせていただきます🍀