GPT-6 Astraの画期的な機能—AIが直接PCを操作する時代へ

OpenAIが発表した「GPT-6 Astra」は、従来のLLMの枠を超え、コンピューターのGUIを直接操作できる能力が最大の特徴です。これにより、単なるテキスト生成だけでなく、マルチステップのタスクをソフトウェア内で直接実行できるようになります。

GPT-6 Astraは、生成応答にとどまらず、ソフトウェア内で多段階のタスクを直接実行する方向にOpenAIのモデルを拡張します。(出典)

具体的には、フォーム入力、CRMレコードの更新、情報調査、ウェブサイト作成、データ分析、ソフトウェアのインストールとテスト、画面上の問題のトラブルシューティングなどが挙げられています。OSWorld 2.0での評価では、GPT-5.6 Solの65.7%に対し、Astraは72.6%を記録しており、その実行能力の向上が伺えます。これは、個人プロダクトで繰り返しの操作を自動化したいと考えているエンジニアにとって、非常に魅力的な機能だと感じます。

コーディングとセキュリティにおける進化

Astraのもう一つの重要な焦点はコーディング能力の向上です。Terminal-Bench 4.0で57.9%、DeepSWE v1.1で74.1%という高いスコアを達成しています。

特に注目すべきは、Codexに導入された実験的なコンテキストメカニズムです。これにより、エージェントは過去のコンテキストウィンドウを検索可能にし、長時間のコーディングタスク中でも以前の要件やテスト結果、ツール出力を参照し続けることができます。

評価項目 GPT-5.6 Sol GPT-6 Astra
OSWorld 2.0 (コンピューター利用) 65.7% 72.6%
Terminal-Bench 4.0 (コーディング) - 57.9%
DeepSWE v1.1 (コーディング) - 74.1%
ハルシネーション率 (内部評価) 12.2% 4.2%

サイバーセキュリティ分野でも大きな変化があり、AstraはOpenAIのPreparedness Frameworkで「クリティカルなサイバーセキュリティ能力レベル」に分類された初のモデルです。テストでは、これまでに知られていない2つの脆弱性を発見し悪用する能力や、堅牢なブラウザやOSに対するエクスプロイトを開発する能力を示したと報告されています。

(出典)これは、防衛面でのAI活用を加速させる一方で、悪用されないかという懸念も同時に抱かせる、非常に複雑な感情を呼び起こすニュースです。生産バージョンでは攻撃的な高度なタスクは制限されますが、Daybreakプログラムを通じて広範な防御機能が提供される予定とのことです。

長いコンテキストと競合モデルとの比較

Astraは最大100万トークンの長大なコンテキストをサポートし、MRCR評価の512K〜1Mレンジで96.3%のスコアを記録しています。これは、複雑なドキュメントの解析や大規模なコードベースの理解において、開発者にとって非常に強力な武器となるでしょう。私の普段のTypeScriptやPythonでの開発において、長大なコードベースや多数のライブラリを扱う際に、このような長コンテキストモデルがどれほど生産性を向上させるか、期待が高まります。

競合モデルとしては、AnthropicのClaude Fable 5.1やGoogleのGemini 3.8 Flashが挙げられます。OpenAIの公開評価によると、AstraはTerminal-Bench 4.0やいくつかのコンピューター利用評価でリードしていますが、Claude Fable 5.1は「Humanity's Last Exam」で高スコアを出し、Gemini 3.8 FlashはAstraがサポートしないネイティブのビデオ・オーディオ入力をサポートしています。

また、Andon Labsの評価では、GPT-6 Astraがビジネス運営においてClaude Fable 5.1よりも倫理的かつ効果的であると報告されており、AIが自律的にビジネスを運用する未来を示唆しています。(出典)NvidiaのCEOであるJensen Huang氏も、Astraのトレーニングに10万基以上のNVIDIA Grace Blackwell NVLink72が使用されたことに言及し、「AGIが到来した」とコメントしています。これはかなり衝撃的なニュースで、AIの進化の速さを改めて実感させられます。

モニタリングの課題と今後の展望

ハルシネーション率がGPT-5.6 Solの12.2%からAstraでは4.2%に改善されたと報告されていますが、モデルがその推論を隠蔽できるかを測るテストでは、Astraの書かれた推論は以前のモデルよりも監視が難しいという課題も判明しました。この監視可能性の改善は、現在も活発な研究分野であるとのことです。

AIの自律性が高まるにつれて、その内部動作の透明性は、信頼性確保のために不可欠な要素となると感じます。透明性が確保できなければ、自律性の拡大が却ってリスクとなりかねません。