Claude Opus 5の主な変更点とAPI開発者への影響
Anthropicは2026年7月24日、Claude Opus 5を正式にリリースしました。この新モデルは、Opus 4.8の後継として、Opusティアのフラッグシップとなります。
最も注目すべき点は、入力トークン100万あたり5ドル、出力トークン100万あたり25ドルという価格が据え置かれていることです。Anthropicチームは、Opus 5がClaude Fable 5の知能に半額で迫るものだと位置づけています(出典)。
Opus 5は、エージェントコーディングやコンピュータ利用において飛躍的な進化を遂げ、Fable 5に匹敵する知能を半額で提供するという点が、非常に魅力的だと感じます。
APIレベルでは、以下の3つの重要な変更点があります(出典)。
- 思考機能がデフォルトでオンに: Opus 4.8では
thinking: {"type": "adaptive"}を設定しない限り思考せずにリクエストが実行されましたが、Opus 5ではデフォルトで思考するようになりました。effortパラメータで思考の深さを制御できます。max_tokensが思考と応答テキストの両方をカバーするため、既存のmax_tokens値は見直しが必要です。 - 破壊的変更:
thinking: {"type": "disabled"}をxhighまたはmaxのeffortと組み合わせて設定すると、400エラーが返されるようになりました。effortをhigh以下にするか、thinkingフィールドを削除する必要があります。 - 検証プロンプトの削除: モデルが自身の作業をすでに検証するため、「最終検証ステップを含める」といった指示は過剰な検証を引き起こします。開発者はこれらの検証プロンプトを削除するよう求められています。具体的なチューニングパターンはOpus 5 prompting guideで確認できます。
モデルIDはclaude-opus-5で、コンテキストウィンドウはデフォルトおよび最大で1Mトークンです。最大出力は同期Messages APIで128kトークン、Message Batches APIではoutput-300k-2026-03-24ベータヘッダーを使用することで300kトークンに達します。
キャッシュ可能な最小プロンプトは1,024トークンから512トークンに減少しました。PythonやTypeScriptでエージェントを組んでいる開発者にとっては、これらの変更はかなり大きなインパクトがあると感じます。
エージェントコーディングと性能ベンチマーク
Opus 5は、エージェントコーディングおよび一般的なコンピュータ利用の分野で顕著な性能向上を見せています。特に注目すべきは、主要なベンチマークにおけるスコアの向上です(出典)。
| ベンチマーク | Opus 4.8 | Opus 5(最大Effort) | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| FrontierBench v0.1 | 18.7% | 43.3% | 33.7% | 37.5% |
| SWE-bench Verified | - | 96.0% | - | - |
| SWE-bench Pro | - | 79.2% | 80.0% | - |
| SWE-bench Multimodal | 38.4% | 59.4% | - | - |
| OSWorld 2.0 | 55.7% | 70.57% | - | - |
| Zapier AutomationBench | 17.0% | 26.0% | 17.4% | - |
FrontierBench v0.1では、Opus 5が最大effortで43.3%を記録し、Opus 4.8の18.7%から大幅に改善しています。xhigh effortでは44.4%に達しています。
SWE-bench Multimodalでは、Opus 4.8の38.4%から59.4%へと大きくジャンプしました。これは、マルチモーダル能力を個人プロジェクトで活用している私としては、かなり嬉しいニュースです。
特筆すべきは、エージェント関連の数値です。OSWorld 2.0では、Opus 4.8の55.7%に対し、Opus 5は70.57%を達成。
Zapier AutomationBenchでは、Opus 4.8の17.0%、Fable 5の17.4%を上回り、26.0%を記録しました。これらの結果は、Opus 5が複雑なタスクを自律的に実行する能力において、明確な進歩を遂げたことを示しています。
安全性評価とFable 5との比較
安全性に関して、Opus 5は評価中にAPIコールの5%(試行の4%)で安全性のフラグが立てられ拒否されたと報告されています。これは、Fable 5がAPIコールの42%(試行の26%)でフラグを立てられたのと比較すると、Opus 5がより安全な応答を生成し、かつ過剰なフィルタリングが少ないことを示唆しているかもしれません(出典)。Fable 5は、もともと「Mythos」と呼ばれていたモデルに安全対策が施されたもので、サイバーセキュリティに関する高度な機能から公開が一時保留されていました(出典)。
AnthropicはOpus 5を「思慮深く、積極的なモデルであり、Claude Fable 5の最先端の知能に半額で迫る」と説明しています(出典)。Fable 5は依然としてAnthropicの最も高性能なモデルですが、Opus 5がその性能に近づきつつ、よりコスト効率が良い選択肢として登場したことは、多くの開発者にとって大きなメリットではないでしょうか。
私は普段Claude Codeでバイブコーディングをしているので、Opus 5のエージェント能力向上と、既存のOpus価格での提供は、日々の開発体験をさらに良いものにしてくれると期待しています。特に、複雑なスクリプト生成や自動化タスクにおいて、その真価を発揮してくれる予感がします。