Metaが初のクローズド課金制モデルを投入
Meta Superintelligence Labsが発表した「Muse Spark 1.1」は、エージェント向けタスクを想定したマルチモーダル推論モデルです。最大の特徴は、Metaのモデルとしては珍しくクローズド・従量課金制で提供される点にあります。これまでMetaのモデルは主にオープンウェイトとして公開されてきましたが、今回はMeta Model API経由でトークン単位の課金モデルとして提供されます(出典)。
価格は入力100万トークンあたり1.25ドル、出力100万トークンあたり4.25ドルで、これはAnthropicのClaude Haiku 4.5やOpenAIのGPT-5.6 Luna(低価格帯モデル)とほぼ同水準か、やや高めの価格設定です(出典)。コンテキストウィンドウは100万トークン規模で、テキスト・画像・動画・文書を入力できるマルチモーダル対応です。新規アカウントには20ドル分の無料クレジットが付与され、現時点では米国限定の公開プレビューとなっています。
ツール利用・推論系ベンチマークで首位、コーディングは3番手
Metaが公開したベンチマーク表によると、Muse Spark 1.1は次のような結果を示しています。
| ベンチマーク | 内容 | Muse Spark 1.1 | Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| MCP Atlas | 大規模ツール利用 | 88.1 | 82.2 | 75.3 | 78.2 |
| JobBench | 業務ツール利用 | 54.7 | 48.4 | 38.3 | 15.9 |
| Humanity's Last Exam | ツール併用推論 | 62.1 | 57.9 | 52.2 | 51.4 |
| SWE-Bench Pro | 実リポジトリでのコーディング | 61.5 | 69.2 | 58.6 | 54.2 |
(出典)
ツール利用系のベンチマークではMuse Spark 1.1が軒並み首位に立つ一方、実リポジトリでのコーディング精度ではOpus 4.8に一歩譲る結果となりました。
この結果から読み取れるのは、Muse Spark 1.1が「コーディング精度そのものを競うモデル」というより、複数のツールを組み合わせて業務プロセスをオーケストレーションするモデルとして設計されている点です。なお、ベンチマークの選定・実行はMeta自身が行っており、他社の最も得意な設定と比較している点には留保が必要です。
「出遅れたMeta」の巻き返しなるか
TechCrunchの報道では、Metaはこの分野で「やや出遅れている」と評されています。AnthropicとOpenAIは既に同種のエージェント型コーディングモデルを長く提供してきており、Muse Sparkの初版が発表されたのも今年4月と比較的最近です(出典)。
それでも、価格面で競合と横並びの水準を打ち出し、ツール利用系ベンチマークで優位を示したことは、Metaにとって無視できない一手だと感じます。個人開発の現場でも、複数のAPIやツールを組み合わせるエージェント的なワークフローを組む機会が増えているので、こうした「オーケストレーション特化」のモデルがどこまで実用に耐えるか、機会があれば自分のスクリプトに組み込んで試してみたいところです。