Cloudflareが「Clef」を発表—高速かつスマートな意思決定モデル

Cloudflareは、2026年10月1日(参考記事より)、新しい意思決定モデル「Clef」およびその軽量版「Clef-flash」を発表しました(出典)。これらのモデルは、特定タスクにおいて、より高速かつ高精度な意思決定を可能にするために設計されています。特に、Typesafe AIのJev System Oneモデルに代表される意思決定モデルの分野において、CloudflareはClefがJev Decision Indexで現時点でトップの評価を得ていると主張しています(出典)。

Clefは、特定タスクにおける高速かつ高精度な意思決定を可能にし、Jev Decision Indexでトップの評価を得ています。

ClefはWorkers AI上でホストされており、Jev API互換性も備えているため、既存のJevエコシステムからの移行も比較的容易であると考えられます。さらに、モデル自体はHugging FaceでApache 2.0ライセンスのもとオープンソースとして公開されており、ローカルでの実行やカスタマイズが可能です。また、ユーザーが自身のユースケースに合わせてClefをファインチューニングできる強化学習(RL)プラットフォームも同時に発表されています(出典)。

意思決定モデルとは何か?—LLMとの違い

意思決定モデルは、特定の入力に基づいて、エージェントがどのように行動すべきかを決定するための分類を行うAIモデルです。例えば、顧客サポートのメッセージを入力として受け取り、その緊急度や担当チームを確率とともに返すことで、チケットのルーティングやエエスカレーション、人間への引き継ぎといった自動的なアクションをトリガーできます。これにより、エージェントの意思決定プロセスから人間を排除し、より自律的なワークフローを構築することが可能になります(出典)。

特徴 意思決定モデル(Clef/Jev) 大規模言語モデル(LLM)
出力形式 境界のある構造化された出力(カテゴリ、確率など) 非決定論的、自由形式のテキスト、ツール呼び出し
速度 高速、低コスト 一般的に低速、高コスト
再学習の頻度 新しい分類カテゴリの追加に対する再学習は不要 特化タスクにはファインチューニングが必要
応用分野 分類、ルーティング、自律エージェントの意思決定 推論、テキスト生成、エージェントのツール呼び出し

この概念は、非決定論的でオープンエンドな出力を生成する大規模言語モデル(LLM)とは対照的です。LLMは推論やテキスト生成、エージェントのツール呼び出しには優れていますが、意思決定モデルはより限定的で構造化された出力を、安価かつ迅速に、一貫性を持って生成することに特化しています。Cloudflareは、Clefを社内の脅威インテリジェンスチームでドメイン分類に利用しており、ウェブサイトの分類にかかる時間が汎用LLM(gpt-oss-120b)の4.7秒に対し、Clefでは2.2秒と約2倍の高速化を実現したと報告しています(出典)。

Clefの独自性と技術的特徴

市場には意思決定モデルが増えてきていますが、Clefにはいくつかのユニークな特徴があります。

  1. ビジョンエンコーダー搭載:Clefは画像を入力として受け取り、視覚コンテンツを分類できます。これは、現時点でテキスト分類のみを行うJevとは異なる点です(出典)。マルチモーダル対応は、より幅広いユースケースでの活用を可能にする重要な要素だと感じます。
  2. 64kコンテキストウィンドウ:Jevの32kと比較して、Clefは2倍のコンテキストウィンドウを持っており、より多くの入力状態をモデルに与えることができます。これにより、複雑な状況判断や詳細な情報からの意思決定が期待できます(出典)。
  3. LLMバックボーン:ClefはQwen3.8-27Bを、Clef-flashはQwen3.5-9Bをベースにした、特別に後処理され凍結されたLLMバックボーンを使用しています(出典)。これにより、複雑な推論能力と、構造化された出力生成のバランスが取られているのではないでしょうか。

Clefはビジョンエンコーダーを搭載し、64kのコンテキストウィンドウ、そしてLLMバックボーンを持つ点で、競合モデルと差別化されています。

これらの特徴により、Clefは単なる分類器にとどまらず、より高度なエージェントワークフローの中核を担う可能性を秘めていると感じます。特に、画像認識と組み合わせた意思決定は、セキュリティ、コンテンツモデレーション、スマートシティなど、多岐にわたる分野で大きなインパクトを与えるのではないでしょうか。

エンジニア目線で見ると:コストとローカル実行の魅力

今回のCloudflare Clefの発表は、特にスタートアップや個人開発者にとって非常に魅力的な選択肢だと感じます。オープンウェイト(open-weight)であること、そしてApache 2.0ライセンスでHugging Faceで公開されていることは、ローカル環境での試行錯誤を非常に容易にします。

私の自宅PC(RTX 3090搭載)であれば、Clef-flashのようなモデルであればローカルで十分に動かせそうな予感がしますし、Qwenベースということで親近感も湧きます。個人プロダクトに組み込む際のライセンスの心配が少ないのも嬉しいポイントです。

Jevとの比較で特に目を引くのは、ビジョンエンコーダーの有無です。Jevがテキストベースであるのに対し、Clefが画像も扱えるのは大きなアドバンテージではないでしょうか。

マルチモーダルな意思決定が必要なアプリケーション、例えばWebサイトの脅威検出でスクリーンショット解析が必要な場合や、画像コンテンツの自動タグ付けとそれに続くアクション決定など、活用範囲が格段に広がるように感じます。64kのコンテキストウィンドウも、より複雑な入力パターンに対応できるため、システムのインテリジェンス向上に直結するでしょう。

また、Cloudflare Workers AI上でのホスティングと、強化学習によるファインチューニングプラットフォームの提供は、デプロイとカスタマイズの障壁を下げると感じます。GCPユーザーの私としては、Cloud Runと連携してClefを呼び出すようなアーキテクチャも検討できそうです。

意思決定モデルはLLMに比べてコストパフォーマンスが高く、特定のタスクに特化しているため、費用対効果を意識するビジネスロジックへの組み込みに最適だと考えます。Claude Codeに投げてみたら、サンプルのPythonバインディングなどは案外すぐ動きそうですね。