GPT-5.6は3階層構成、価格差は最大5倍

OpenAIが発表した「GPT-5.6」は、単一モデルではなくSol・Terra・Lunaという3つのモデルで構成されています。

モデル 位置づけ 価格(入力/出力、100万トークンあたり)
Sol フラッグシップ 5ドル/30ドル
Terra バランス型 2.5ドル/15ドル
Luna 低コスト 1ドル/6ドル

利用できる範囲は提供面によって異なります。ChatGPTのPlus・Pro・Business・Enterpriseユーザーは中〜高負荷設定でSolを利用可能、無料版とGoプランは主にTerraを使う形になります。APIでは3モデルすべてが提供され、モデルが自らJavaScriptを書いて隔離されたV8ランタイム上で実行する「Programmatic Tool Calling」も新機能として加わりました(出典)。

Sol は Artificial Analysis Coding Agent Index で80点を記録し、Claude Fable 5を2.8ポイント上回りました。

ベンチマークで見るポジション——Claudeとの差は指標次第

OpenAIが公開した評価データによると、Solは複数のベンチマークで高いスコアを示しています。

  • Artificial Analysis Coding Agent Index v1.1:Solが80点でClaude Fable 5(77.2点)を上回る
  • BrowseComp:92.2%を記録
  • OSWorld 2.0:62.6%でClaude Opus 4.8を上回り、しかも出力トークン数は85%少ない
  • SWE-Bench Pro:Solは64.6%にとどまり、Claude Mythos 5の80.3%に約15ポイント差をつけられている(出典)

このように、指標によって優劣が入れ替わる点は率直に興味深いところです。「総合的にどちらが優れているか」を単純に語れる状況ではなく、用途に応じた見極めが必要になりそうです。

個人的には、SWE-Bench Proのような実践的なソフトウェア開発タスクでの差が気になります。日々の開発でどちらのモデルを使うかを判断する際、こうした実務寄りのベンチマークをもっと参考にしたいと感じます。

エージェント機能「ChatGPT Work」も同時発表

今回はモデル刷新と合わせて、業務タスクをブラウザ・モバイル・デスクトップ横断で自動実行する新エージェント「ChatGPT Work」も発表されました。ChatGPT Workはユーザーのアプリ内情報を参照しながら複数ステップのタスクをスケジュール実行でき、Anthropicの「Claude Cowork」と同様にコンピュータを操作してバックグラウンドでタスクをこなす仕組みです(出典)。

デスクトップでは既存のCodexアプリがChatGPTアプリに統合され、ローカルファイルやブラウザ、プラグイン経由で外部サービスとも連携できるようになります。

TechCrunchの報道によれば、OpenAI CEOのサム・アルトマン氏はSolについて「コーディングタスクでのトークン効率が従来比54%向上した」とCNBCに語ったとされています。また同社はGPT-5.6を「これまでで最も強力なサイバーセキュリティモデル」と位置づけており、米トランプ政権がその展開を制限しようとした経緯があったとも報じられています(出典)。

個人のプロダクトでAPIを使う立場としては、Lunaのような低価格帯モデルがどこまで実用に耐えるか試してみたいところです。