1Mトークンを支える低フットプリント—DeepSeek-V4.1-Flashの衝撃
DeepSeek AIは2026年9月10日、LLMの運用における主要なボトルネックであるKVキャッシュの肥大化に対処するため、「DeepSeek-V4.1-Flash」をリリースしました(出典)。このモデルは、552Bのバックボーンパラメータと196Bの追加Engramパラメータを持つマルチモーダルMoE(Mixture-of-Experts)モデルであり、なんと1Mトークンという驚異的なコンテキストウィンドウを提供します。プレフィル時には8B、デコード時には16Bのパラメータがトークンごとに活性化される設計です。
グローバルKVキャッシュのフットプリントはトークンあたり890バイトと、DeepSeek-V4-Flashの約1/4、DeepSeek-V1と比較すると約437分の1にまで劇的に削減されています。
これはLLMのHBM(High Bandwidth Memory)やSSD容量、帯域幅の負担を軽減する上で非常に重要な進化だと感じます。これまでの長いコンテキストを持つLLMでは、コストが問題で実用化が難しいケースも多かったのではないでしょうか。
DeepSeek-V4.1-FlashはオープンウェイトとしてMITライセンスで公開されており、vLLM、SGLang、Transformersといった主要なライブラリを通じてHugging Faceから利用可能です。さらに、低・中・高の推論ティアを持つパブリックAPIも提供されるとのことで、個人的には自分のプロダクトへの組み込みも検討したいです。
新たなアーキテクチャが生む効率性
DeepSeek-V4.1-Flashの効率化は、いくつかの革新的なアーキテクチャの変更によって実現されています。
1. 因果エンコーダー・デコーダー構造
モデルの40層のバックボーンは、20層の因果エンコーダーと20層のデコーダーに分割されています。YOCO(出典)にインスパイアされたこの設計では、デコーダーは独自のグローバルKVを計算せず、エンコーダーの最終隠れ状態から導出します。これにより、プロンプトトークンがエンコーダーで処理を終えるため、プレフィルの計算量をほぼ半分に削減できるとされています。
2. Compressed Sparse Attention 2 (CSA2)
DeepSeek-V4ではCSAとHeavily Compressed Attentionを組み合わせていましたが、V4.1-Flashでは純粋なCSA2を採用し、層間のキャッシュサイズ効率化に特化しています。CSA2レイヤーは以下の3つのモードのいずれかに静的に割り当てられます。
- Full: 独自のメインKVを計算し、そこからインデクサKを投影し、新しいTop-512インデックスを選択します。
- Reindex: 最後のFullレイヤーからのメインKVとインデクサKを再利用しますが、独自のインデクサQで再スコア付けします。
- Reuse: メインKVと最新のTop-Kインデックスの両方を再利用し、インデクサの計算を完全にスキップします。
これらのモードを組み合わせることで、不要なKVキャッシュの計算を省き、メモリ使用量を最適化しています。特にエンコーダーの18のCSA2層は「1 Full、5 Reuse」のグループを3つ使うことで、効率的なキャッシュ再利用を実現しています。
FP4 KVキャッシュとデプロイメントの最適化
DeepSeek-V4.1-Flashでは、メインKVキャッシュがE2M1形式で量子化されています(出典)。これはNVIDIAのNVFP4(出典)に倣いつつ、グローバルスケールを除いた形式です。ポストトレーニングにおける量子化対応トレーニングを通じて導入され、V4のFP8キャッシュと比較してストレージをほぼ半分に削減しています。
これはハードウェアのHBM容量を直接節約できるため、GPUの選択肢にも影響を与えるかもしれません。RTX 3090のようなVRAMの多いGPUを使っている身としては、ローカルLLMの実行にも期待が高まります。
デプロイメントレベルでは、SWA KVはもはやSSDに永続化されません。ホストDRAMの10%から切り出された分散プールに数分間のTTL(Time-To-Live)で存在し、グローバルKVは72時間の保証されたライフタイムを保持します。これにより、ミスの際にエンコーダーSWAバウンデッドリプレイが128トークンのみを再計算するだけで済むようになり、効率性が向上しています。
| 項目 | DeepSeek-V4-Flash | DeepSeek-V4.1-Flash |
|---|---|---|
| KVキャッシュフットプリント(トークンあたり) | 約3560バイト | 890バイト(約1/4) |
| コンテキストウィンドウ | - | 1Mトークン |
| KVキャッシュ量子化 | FP8 | FP4(E2M1) |
| デコーダーKV計算 | 独自計算 | エンコーダーから導出 |
| SWA KV永続化 | SSD | ホストDRAM(TTL数分) |
DeepSeek-V4.1-Flashは、763Bパラメータという巨大なモデルであるにもかかわらず、そのメモリ要件はサイズから期待されるほど高くありません(出典)。これはアーキテクチャの変更によって、よりスマートかつリソース消費の少ないモデルへと進化していることを示唆しています。