Grok 4.5 の特徴と開発背景
SpaceXAIが発表したGrok 4.5は、同社史上「最もスマートなモデル」とされており、その主要なターゲットはコーディング、エージェントタスク、そしてナレッジワークです。特に注目すべきは、AIコーディングエディタであるCursorと共同でトレーニングされた点でしょう。これにより、実際のエンジニアリング作業に特化したチューニングが施されています。
Grok 4.5は、コーディング、エージェントタスク、ナレッジワークに特化し、Cursorとの共同トレーニングで高いコード生成能力と効率性を実現しています。
モデルのトレーニングには、数万台ものNVIDIA GB300 GPUが使用され、大規模な実行に耐えうるトレーニング技術と安定化手法が導入されています。データ選定においても、重複排除、品質スコアリング、ドメインに特化した選択など、入念なキュレーションが行われているとのことです。
個人のLLM環境でNVIDIA製GPUを使っている身としては、こうした大規模トレーニングにはやはり高性能なハードウェアが不可欠だと改めて感じます。(出典)
ベンチマーク性能と効率性
Grok 4.5のベンチマーク結果は、多くの開発者が最も気にする部分ではないでしょうか。SpaceXAIは主要な4つのコーディングベンチマークでGrok 4.5の性能を公開しています。
| ベンチマーク (harness) | Grok 4.5 | トップモデル | その他 |
|---|---|---|---|
| DeepSWE 1.0 — pass@1 | 62.0% | Fable (max) 66.1% | GPT 5.5 (xhigh) 64.31%; Opus 4.8 (max) 55.75% |
| DeepSWE 1.1 (mini-swe-agent harness, DataCurve) | 53% | Fable (max) 70% | GPT 5.5 (xhigh) 67%; Opus 4.8 (max) 59%; GLM 5.2 44% |
| Terminal Bench 2.1 | 83.3% | Fable (max) 84.3% | GPT 5.5 (xhigh) 83.4%; Opus 4.8 (max) 78.9% |
| SWE Bench Pro — resolve rate | 64.7% | Fable (max) 80.4% | Opus 4.8 (max) 69.2%; GLM 5.2 62.1%; GPT 5.5 (xhigh) 58.6% |
上記の表からわかるように、全体的に「Fable (max)」がトップのスコアを記録していますが、Grok 4.5も特にTerminal Bench 2.1では競合に非常に近いスコアを出しています。SpaceXAIは、Grok 4.5が「同等の主要モデルを凌駕する」と述べていますが、自社のグラフでは「Fable (max)」が全ベンチマークでトップです。(出典)
性能面ではトップクラスに肉薄している一方で、Grok 4.5のもう一つの大きな強みはトークン効率です。SpaceXAIは、主要モデルと比較して約2倍のトークン効率を持つと報告しています。SWE Bench Proでは、Opus 4.8 (max)と比較して出力トークン数が約4.2倍少ないとのこと。
トークンコストがAI利用の大きな懸念事項となっている現状で、この効率性は非常に大きなアドバンテージになり得ます。私自身、日々の開発でAIを活用する中で、トークン消費量は常に気にしているポイントなので、これは非常に魅力的に感じます。
価格設定と開発者への影響
Grok 4.5の価格設定は、入力トークン100万あたり2ドル、出力トークン100万あたり6ドルと発表されています。80 TPS (Tokens Per Second) で提供されるとのことです。
この価格帯と効率性は、開発者にとって大きな意味を持つのではないでしょうか。特に、コストを抑えつつ高い性能を求めるスタートアップや個人開発者にとっては、有力な選択肢となり得ます。
入力トークン100万あたり2ドルという価格は、開発者にとってAIモデル活用のハードルを下げる重要な要因となるでしょう。
TechCrunchの報道によると、SpaceXAIはGrok 4.5を「Opusクラスのモデル」と表現しており、コーディング、アプリ開発、オフィスワーク、リサーチ、ライティングなど、AI業界が自動化を目指してきた典型的なタスク全般に対応できる「ワークホース」として特徴づけています。(出典)
私自身もPythonとTypeScriptをメインで使い、Claude CodeのようなAIコーディングツールを活用していますが、Grok 4.5が提供するこの高い効率性とリーズナブルな価格は、自分の個人プロダクトや日々のスクリプト開発に積極的に組み込んでみたいという気持ちになります。特に、複数のステップを要するソフトウェアエンジニアリングタスクにおいて、その推論能力と効率がどこまで発揮されるのか、実用面での検証が楽しみです。