1Mトークンを支える低フットプリント—DeepSeek-V4.1-Flashの衝撃

DeepSeek AIは2026年9月10日、LLMの運用における主要なボトルネックであるKVキャッシュの肥大化に対処するため、「DeepSeek-V4.1-Flash」をリリースしました(出典)。このモデルは、552Bのバックボーンパラメータと196Bの追加Engramパラメータを持つマルチモーダルMoE(Mixture-of-Experts)モデルであり、なんと1Mトークンという驚異的なコンテキストウィンドウを提供します。プレフィル時には8B、デコード時には16Bのパラメータがトークンごとに活性化される設計です。

グローバルKVキャッシュのフットプリントはトークンあたり890バイトと、DeepSeek-V4-Flashの約1/4、DeepSeek-V1と比較すると約437分の1にまで劇的に削減されています。

これはLLMのHBM(High Bandwidth Memory)やSSD容量、帯域幅の負担を軽減する上で非常に重要な進化だと感じます。これまでの長いコンテキストを持つLLMでは、コストが問題で実用化が難しいケースも多かったのではないでしょうか。

DeepSeek-V4.1-FlashはオープンウェイトとしてMITライセンスで公開されており、vLLM、SGLang、Transformersといった主要なライブラリを通じてHugging Faceから利用可能です。さらに、低・中・高の推論ティアを持つパブリックAPIも提供されるとのことで、個人的には自分のプロダクトへの組み込みも検討したいです。

新たなアーキテクチャが生む効率性

DeepSeek-V4.1-Flashの効率化は、いくつかの革新的なアーキテクチャの変更によって実現されています。

1. 因果エンコーダー・デコーダー構造

モデルの40層のバックボーンは、20層の因果エンコーダーと20層のデコーダーに分割されています。YOCO(出典)にインスパイアされたこの設計では、デコーダーは独自のグローバルKVを計算せず、エンコーダーの最終隠れ状態から導出します。これにより、プロンプトトークンがエンコーダーで処理を終えるため、プレフィルの計算量をほぼ半分に削減できるとされています。

2. Compressed Sparse Attention 2 (CSA2)

DeepSeek-V4ではCSAとHeavily Compressed Attentionを組み合わせていましたが、V4.1-Flashでは純粋なCSA2を採用し、層間のキャッシュサイズ効率化に特化しています。CSA2レイヤーは以下の3つのモードのいずれかに静的に割り当てられます。

  • Full: 独自のメインKVを計算し、そこからインデクサKを投影し、新しいTop-512インデックスを選択します。
  • Reindex: 最後のFullレイヤーからのメインKVとインデクサKを再利用しますが、独自のインデクサQで再スコア付けします。
  • Reuse: メインKVと最新のTop-Kインデックスの両方を再利用し、インデクサの計算を完全にスキップします。

これらのモードを組み合わせることで、不要なKVキャッシュの計算を省き、メモリ使用量を最適化しています。特にエンコーダーの18のCSA2層は「1 Full、5 Reuse」のグループを3つ使うことで、効率的なキャッシュ再利用を実現しています。

FP4 KVキャッシュとデプロイメントの最適化

DeepSeek-V4.1-Flashでは、メインKVキャッシュがE2M1形式で量子化されています(出典)。これはNVIDIAのNVFP4(出典)に倣いつつ、グローバルスケールを除いた形式です。ポストトレーニングにおける量子化対応トレーニングを通じて導入され、V4のFP8キャッシュと比較してストレージをほぼ半分に削減しています。

これはハードウェアのHBM容量を直接節約できるため、GPUの選択肢にも影響を与えるかもしれません。RTX 3090のようなVRAMの多いGPUを使っている身としては、ローカルLLMの実行にも期待が高まります。

デプロイメントレベルでは、SWA KVはもはやSSDに永続化されません。ホストDRAMの10%から切り出された分散プールに数分間のTTL(Time-To-Live)で存在し、グローバルKVは72時間の保証されたライフタイムを保持します。これにより、ミスの際にエンコーダーSWAバウンデッドリプレイが128トークンのみを再計算するだけで済むようになり、効率性が向上しています。

項目 DeepSeek-V4-Flash DeepSeek-V4.1-Flash
KVキャッシュフットプリント(トークンあたり) 約3560バイト 890バイト(約1/4)
コンテキストウィンドウ - 1Mトークン
KVキャッシュ量子化 FP8 FP4(E2M1)
デコーダーKV計算 独自計算 エンコーダーから導出
SWA KV永続化 SSD ホストDRAM(TTL数分)

DeepSeek-V4.1-Flashは、763Bパラメータという巨大なモデルであるにもかかわらず、そのメモリ要件はサイズから期待されるほど高くありません(出典)。これはアーキテクチャの変更によって、よりスマートかつリソース消費の少ないモデルへと進化していることを示唆しています。