GPT-6 Astraの概要と主な特徴

OpenAIが本日リリースした「GPT-6 Astra」は、同社が「最も知的で連携の取れたモデル」と位置付けている、コンピューター操作に特化したAIシステムです。これは、従来のチャットモデルとは異なり、人がソフトウェアを扱うようにブラウザやデスクトップアプリケーション、ターミナルを横断して、複数のステップを要するタスクを記述するのではなく、実際に完了させることを目的としています。

GPT-6 Astraは、105万トークンという驚異的なコンテキストウィンドウを持ち、複雑なコンピューター操作タスクを完遂することを目指しています。

このモデルはクローズドなホスト型サービスとして提供され、モデルのウェイトは公開されていないため、自己ホスティングはできません。現在はOpenAIのTrusted AccessおよびDaybreakプログラムに参加している組織のみが利用可能です。個人的には、ローカル環境での実行にこだわる私としては、クローズドな環境に留まるのは少し残念に感じますが、この種の先進的なモデルが最初にエンタープライズ向けに展開されるのは自然な流れと言えるでしょう。

開発者向けの変更点と技術的進化

GPT-6 Astraにおける開発者向けの最も大きな変更点は、コンテキストハンドリングの進化です。従来のCodexがコンテキストが埋まると以前のやり取りを要約して詳細が失われる問題を抱えていたのに対し、Astraはコンテキストウィンドウをまたいでメモを保持し、以前のメッセージやツール出力を遡って検索する機能を備えています。この機能はconfig.toml設定で実験的に利用可能となっており、数週間以内にはCodexのデフォルトとなる予定です。

また、Astraはユーザーからの回答に依存しない作業を続行しながら、ユーザーに質問を投げかけることが可能です。これにより、未解決の決定によってタスク全体が停滞する、従来のAIエージェントの一般的な失敗が解消されるでしょう。これは、エージェントシステムのロバスト性を大きく向上させる機能だと感じます。

モデルの仕様は以下の通りです(出典)。

項目 GPT-6 Astraの仕様
コンテキストウィンドウ 1,050,000トークン
最大出力トークン 128,000トークン
知識カットオフ 2026年4月30日
入力形式 テキスト、画像
出力形式 テキストのみ
推論レベル high, xhigh, max(reasoning.effortで設定)
ツールサポート コンピューター利用、ホスト型シェル、パッチ適用、スキル、MCP、ツール検索
ファインチューニング 非サポート

100万トークンを超えるコンテキストウィンドウは、複雑なマルチステップタスクにおいて極めて有効です。GCPのVertex AIのようなクラウドサービスでも長文対応は進んでいますが、ここまで大規模なコンテキストを扱えるモデルは、タスク自動化の可能性を大きく広げると感じます。Pythonバインディングがあれば、個人的に運用しているスクリプトにも組み込んで試してみたいですね。

ベンチマークと競合他社との比較

OpenAIは、GPT-6 Astraがいくつかのベンチマークで高い性能を示していると報告しています。

ベンチマーク GPT-6 Astraのスコア 競合モデル(参考)
OSWorld V2-Offline 72.6% GPT-5.6 Sol (65.7%), Claude Fable 5.1 (77.9% - 直接比較不可)
ARC-AGI-3 99.9% -
FrontierMath Tier 4 97.6% -
BenchCAD Vision2Code 95.9% Fable 5.1 (84.3%)
Terminal-Bench Science 64.6% Anthropic (52.6%)
DeepSWE v1.1 (コーディング) 74.1% Sol (72.7%), Muse Spark 1.3 (75.4%), Gemini 3.8 Flash, Claude Opus 5 n(非公式リーダーボード)

OSWorld V2-OfflineではGPT-5.6 Solの65.7%に対し72.6%を記録し、平均タスク時間も約75分から40分に短縮されています。AnthropicのClaude Fable 5.1は77.9%と報告されていますが、異なるOSWorldリリースを使用しているため直接比較はできないとのことです。

特に注目すべきはARC-AGI-3での99.9%というスコアですが、これは推論を保持し、長文コンテキストでは圧縮を用いるResponses APIハーネスを使用した結果であり、モデル単体の性能というよりエージェントシステム全体での測定値であると明記されています。これは、AIモデルの性能評価がいかにシステム全体の設計に依存するかを示す良い例だと感じます。

コーディング能力に関しては、DeepSWE v1.1で74.1%と、他のベンチマークほどの圧倒的な差は見られません。MetaのMuse Spark 1.3が75.4%を報告しており、公開リーダーボードではGemini 3.8 FlashやClaude Opus 5 nがさらに高いスコアを出しているようです。

私自身、Claude Codeを日常的に使っている身としては、コーディングベンチマークは常に気になるところです。Astraの能力を試してみたい気持ちでいっぱいです。

今回の発表は、単なる性能向上にとどまらず、AIがより複雑なコンピューター操作を自律的に行う未来への一歩を示していると感じます。特にエージェント機能の強化は、今後の開発において非常に重要な要素になるのではないでしょうか。