従来のOCRモデルが直面していた性能と効率のトレードオフ

従来のエンドツーエンドOCRモデルには、大きな構造的な問題がありました。出力トークンが増えるにつれてKVキャッシュが線形に膨張し、メモリ消費と生成レイテンシが同時に悪化するという課題です。数十ページのドキュメント解析では、この問題がさらに深刻化し、実運用には不向きな状態になっていました。

百度の Unlimited OCR は、Reference Sliding Window Attention(R-SWA)という新しい注意機構によって、この根本的な課題を解決する設計に切り替えました。

百度は DeepSeek OCR をベースラインとしながら、デコーダの注意機構をR-SWAに置き換えることで、KVキャッシュのサイズを出力長に依存しない定数に保つ設計を実現しました。(出典)これにより、ドキュメントの長さに関わらず、メモリ効率と処理速度の劣化を防ぐことが可能になったのです。

R-SWA:キャッシュサイズを固定化する仕組み

R-SWAの動作原理は、従来のマルチヘッド注意(MHA)と大きく異なります。

従来のMHA では、生成された各トークンに対して、それまで生成されたすべてのトークンのキーと値をキャッシュに保持する必要があります。この場合、キャッシュサイズは出力長 T に比例して増加し、メモリ使用量も処理時間も無限に増大する危険性がありました。

これに対し、R-SWAは以下の設計をとります:

  • 参照トークン(ビジュアルトークンとプロンプト)にはすべてアクセス
  • 直近 n トークン(デフォルト128)にはアクセス
  • それより前のトークンは破棄

この仕組みにより、キャッシュサイズは最大で「参照トークン数 + 128」に制限されます。出力が100トークンでも1000トークンでも、キャッシュサイズはほぼ変わりません。

キャッシュ成長の式で表すと、従来は C_MHA(T) = L_m + T だったのに対し、R-SWA では C_R-SWA(T) = L_m + min(n, T) ≤ L_m + n となり、T が増加しても右辺の値は変わらないということです。

この設計は「人間が書籍の内容を写すとき、ソース(参照)と直近の数行だけを見て、これまで写したすべてを毎回確認しない」という直感的な原理に基づいています。ビジュアルトークンは状態更新を受けないため、線形注意機構で起きる「段階的なぼけ」も回避できます。

モデルアーキテクチャ:DeepSeek OCR をベースとした続行学習

Unlimited OCR は完全な新規構築ではなく、DeepSeek OCR を継続学習により発展させたものです。以下のコンポーネントを保持しています:

  • DeepEncoder:ビジュアル圧縮エンジン
  • SAM-ViT(ウィンドウ注意付き)と CLIP-ViT(グローバル注意付き)をカスケード接続
  • 橋渡し部で16倍のトークン圧縮を実施
  • 1024×1024 PDFイメージは、わずか256ビジュアルトークンに圧縮される

  • MoEデコーダ:軽量で高効率

  • 3Bパラメータの総数に対し、推論時には500Mのみをアクティブ化
  • Mixture-of-Experts設計により、計算効率を大幅に改善

解像度モードは5種類から2種類に絞られています:

モード 用途 特徴
Base マルチページ処理 1024×1024固定
Gundam 単ページ処理 動的解像度対応

ベンチマーク成績:既存モデルを明確に上回る

Unlimited OCR は OmniDocBench v1.5 で 93.23 のスコアを記録しました。これは DeepSeek OCR ベースラインを 6.22ポイント上回る 成績です。

同じベースラインから出発しながら、アーキテクチャ改善だけで6点を超える改善を達成した点は、R-SWA設計の実効性を強く示唆しています。

この精度向上と、KVキャッシュの固定化による処理効率の向上を同時に実現している点が、このモデルの最大の価値といえます。従来なら「精度か効率か」という選択を迫られていた領域で、両立を実現したのです。

エンジニア観点での実装インパクト

このアプローチは、OCR に限らず、他のシーケンス生成タスクにも応用可能な知見を提供しています。

GCP Cloud Run や AWS Lambda のような制約のあるサーバレス環境では、メモリ使用量の予測可能性が極めて重要です。KVキャッシュが出力長に比例しないということは、ドキュメント長に関わらず、リソース要求が一定に抑えられることを意味します。これにより、スケーリング戦略の立案が格段に容易になります。

ローカルLLMの運用を行うエンジニアの方も、VRAM効率の改善は直接的なメリットになるでしょう。RTX 3090 のような高性能GPU でさえ、長文処理ではVRAM枯渇が現実的な課題ですが、この手法であれば、より小型で低コストなGPUでの運用も現実的になります。

今後への展開

この研究は、トランスフォーマー系モデルの根本的な制限に対する一つの解答例を示しています。ビジュアル言語モデル(VLM)や、長文対応が求められるドメイン(法務文書解析、医療記録処理)での採用が加速するとみられます。

また、R-SWA は比較的シンプルな機構のため、既存のOCRモデルだけでなく、汎用LLMの長文対応改善にも応用される可能性があります。オープンウェイトモデルの価格低下競争が進む中、「同じパラメータ数でより長い入力に対応できる」という効率性は、商用展開上の強力な差別化要因になります。

ただし、Unlimited OCR は ArXiv 論文段階での発表(出典)であり、商用サービスとしての提供状況は現段階では不明確です。今後、オープンソース化や API サービス化がどう進むかが、業界への実際の影響を左右する要因になるでしょう。