Claude Sonnet 5の登場とその意義

Anthropicは2026年7月13日に、ミッドレンジモデルの最新版「Claude Sonnet 5」をリリースしました。このモデルは、Anthropicがこれまでに提供してきたSonnetモデルの中で「最もエージェント的(agentic)」であると位置づけられています。

これは、モデルが自律的に計画を立て、ブラウザやターミナルを操作し、長時間のタスクをこなす能力が大幅に向上したことを意味します。(出典)

Sonnet 5は、Anthropicのミッドティアモデルとして最もエージェント的な能力を持ち、Opus 4.8とのギャップを大幅に縮めています。

Sonnet 5は、現在の無料およびProプランのデフォルトモデルとなっており、Max、Team、Enterpriseユーザーも選択可能です。また、Claude CodeやClaude Platformでも利用可能となっています。

普段Claude Codeを使っている私としては、このエージェント機能の強化は非常に試してみたいポイントです。長時間のコーディングセッションでコンテキストを失わずに、より自律的に動いてくれるのは開発効率に直結すると感じます。

Sonnet 5の性能とコストパフォーマンス

Sonnet 5は、旧バージョンのSonnet 4.6と比較して、全ての主要ベンチマークで優位に立っています。具体的には、SWE-bench Proで63.2%、OSWorld-Verifiedで81.2%、HLEで57.4%というスコアを記録しています。これは、Sonnet 5がより複雑なコーディングタスクや現実世界のアプリケーション操作において高い能力を発揮することを示唆しています。

ベンチマーク Sonnet 5 Sonnet 4.6 Opus 4.8
SWE-bench Pro 63.2% - -
OSWorld-Verified 81.2% - -
HLE 57.4% - -

API料金に関しても、Sonnet 5は導入期間(8月31日まで)中は入力トークン1Mあたり2ドル、出力トークン1Mあたり10ドルと、Opus 4.8の5ドル/25ドルと比較してかなり安価に設定されています。導入期間後は3ドル/15ドルとなりますが、それでもOpus 4.8の半額近い価格です。

これは非常に大きなメリットだと感じます。GCPのCloud Runで個人プロダクトを動かしている身としては、コストは常に意識するポイントなので、この価格設定は嬉しい限りです。

ただし、Sonnet 5は「low, medium, high, xhigh」の4段階のエフォートレベルを持っており、高いエフォートレベルを選択すると推論に多くのトークンを消費するため、品質は向上するもののコストも増加します。特に「xhigh」では、タスクによってはOpus 4.8と同等の品質を得るために、Opus 4.8よりも高いコストがかかる可能性も指摘されています。

また、Sonnet 5はOpus 4.7で導入された新しいトークナイザーを使用しており、同じテキストでもSonnet 4.6より1.0〜1.35倍多くのトークンにマッピングされる可能性があるため、実際のコスト計算には注意が必要です。(出典)

言語による応答の多様性と内部動作への洞察

Anthropicの研究では、Claudeが異なる言語で表現する「価値」の多様性についても調査されています。例えば、ヒンディー語やアラビア語ではより丁寧な応答をする傾向があることが示されています。(出典)これは、AIモデルが単に言語を翻訳するだけでなく、その言語圏の文化や規範を反映した表現をする可能性があることを示しており、グローバルなサービス展開を考える上で非常に興味深い知見です。

さらに、Anthropicはモデルの「内部思考」を覗き見る新しい手法を発見したことも報じられています。(出典)これは、モデルがどのように推論し、回答を生成するのかをより深く理解するための重要な一歩です。

将来的には、より説明可能で信頼性の高いAIシステムの開発につながる可能性を秘めていると感じます。個人的には、ローカルLLMで同様の分析ツールが開発されれば、モデルのデバッグや性能改善に役立つのではないかと期待しています。