Jev互換の超小型AIモデル「Jeff」とは?
「Jeff」は、オープンソースで提供されるJev互換の決定モデルであり、2026年9月29日にバージョン1.1がリリースされました。Qwen3.5とGemma 4をベースにファインチューニングされており、0.8Bと2Bという非常に小さなパラメータ数で動作します。このモデルの最大の特徴は、ゼロショット分類に特化し、ローカル環境で驚異的な速度で意思決定を行う点です。
Jeffは、Jevと同じリクエスト形式で、ローカル環境にて約22ms〜28msという非常に高速な意思決定を実現します。(出典)
従来の大きなLLMとは異なり、テキスト生成や複雑な解析は行いません。その代わりに、与えられた状況と選択肢を基に、各オプションの確率を単一のフォワードパスで出力します。
これにより、RTX PRO 6000では約22ms、Apple M4 Max(MLX)では約28msという低レイテンシを実現しています。例えば、サポートキューのルーティング、ユーザーの意図分類、コンテンツモデレーション、さらにはゲームの行動選択など、多岐にわたる用途での活用が期待されます。
なぜローカル実行にこだわるのか?
Jeffがローカル実行に重点を置いている背景には、コストとレイテンシの問題があります。Jevのようなクラウドベースのサービスは便利ですが、リクエストごとにトークン消費が発生し、応答にも一定の時間がかかります。The Registerの記事によると、Jevstiller(Jeffの元になったプロジェクト)の場合、Jevは10億入力トークンあたり42ドルかかり、応答に約300msを要すると指摘されています。
これに対し、Jeffはローカルで実行されるため、トークン費用はゼロであり、CPUでさえ約15msという高速な応答が可能です。(出典)
Jeffの開発元は、クラウドGPUを一切使用せず、オープンモデル(Qwen3.8-Flash-Next)によって生成された合成トレーニングデータのみを使用し、RTX PRO 6000ワークステーションGPU一台でモデルの学習を行っています。これは、AI開発におけるオープンソースとローカル環境の可能性を強く示唆していると言えるでしょう。
Jeffの性能と使い方
Jeffは非常に小規模なモデルですが、ベンチマークではJevに匹敵、あるいは上回る性能を示すことがあります。例えば、v1.1の0.8Bモデルは、長文リストテストで40%から95%に精度が向上しました。さらに、ゼロショット分類の精度が不十分な場合でも、自身のデータで短時間のファインチューニングを行うことで、大幅な精度向上(例: 音声ナビゲーションで31.7%から95.8%)が見込めるとしています。
Jeffモデルの提供はHugging Faceを通じて行われています。ローカルでのモデル提供には、uv sync --no-default-groupsコマンドでCPU版を、NVIDIA GPU搭載PCでは--extra cuda、Apple Silicon搭載Macでは--extra macを追加してインストールします。その後、Hugging Faceからモデルをダウンロードし、専用のサーバーコマンドを実行することで利用可能です。
Jeffのモデル比較
| モデル名 | パラメータ数 | 特徴 |
|---|---|---|
| Jeff-Qwen3.5-0.8B | 0.8B | 高速、多選択肢対応 (v1.1で最大254オプション) |
| Jeff-Qwen3.5-2B | 2B | 高速、多選択肢対応 (v1.1で最大254オプション) |
| Jeff-Gemma4-E2B | 不明 (E2B) | 最大26オプション |
| Jeff-Qwen3.5-0.8B-Chess | 0.8B | チェスに特化してファインチューニング済み |
Jeffのリクエスト形式はJevと同様で、状況を説明するテキストと、選択肢を記述したリスト(最大254オプション)をJSON形式で送ります。回答は各オプションの確率、選択されたオプション、そして信頼度が含まれます。質問タイプは「choice」(選択)、「noul」(はい/いいえ)、そして「score」(スコア)の3種類が用意されています。
エンジニア目線で見ると:エッジAIやリアルタイム処理への可能性
今回のJeffの発表は、特にエッジAIやリアルタイム処理が求められるアプリケーションを開発しているエンジニアにとって、非常に魅力的な選択肢となり得るのではないでしょうか。私も個人プロダクトでLLMを活用していますが、応答速度やGPUコストが常に課題となります。Jeffのようにローカルでミリ秒単位の推論が可能であれば、ユーザー体験を損なうことなく、AIの恩恵を享受できる場面が格段に増えると感じます。
例えば、ゲーム内のNPCの意思決定、IoTデバイスでの即時的な状況判断、あるいはWebアプリケーションにおけるリアルタイムなユーザーインターフェースの動的変更など、多岐にわたるユースケースが考えられます。Pythonバインディングがあるため、私の普段のコーディング環境であるPythonやTypeScript(バックエンド連携)にもスムーズに組み込めそうです。特に、uvを使ったパッケージ管理と実行方法は、既存のPoetryやpipenvといったツールを使っている開発者にとっても導入障壁が低いと感じます。
NVIDIA GPUだけでなくApple Siliconにも対応しているのは、開発環境の多様性を考慮しており好感が持てます。自分のスクリプトで、まずは簡単なゼロショット分類を試してみたいですね。
注意点としては、あくまで「決定モデル」であり、Jevのような大規模な推論能力やテキスト生成能力は期待できない点です。しかし、ユースケースを絞れば、このトレードオフは非常に効果的だと考えられます。
特にファインチューニングが容易であるとされているため、特定のタスクに特化させて高精度なローカルAIを構築するアプローチは、コストと性能の両面で大きなメリットをもたらすはずです。為替レートの変動によるクラウドGPUコストへの影響も常に意識しているので、ローカルで完結できるのは大きな安心材料になります。