2つのアーキテクチャ、同じ基盤から分かれる設計

Liquid AI が今週公開した2つのモデルは、同じ基盤から分かれた異なるアプローチを採っています。(出典)

LFM2.5-Embedding-350M は Dense Bi-Encoder で、各ドキュメントを1つのベクトルに変換します。一方、LFM2.5-ColBERT-350M は Late-Interaction モデルで、トークン単位で複数のベクトルを保持し、クエリとの単語レベルのマッチングを行います。

同じバックボーン構造ながら、出力形式を変えることで異なるユースケースに対応する設計は、開発者の選択肢を広げる工夫です。

具体的には以下のような使い分けが想定されます:

項目 Embedding-350M ColBERT-350M
変換方式 ドキュメント全体→1つのベクトル トークン単位→複数のベクトル
インデックスサイズ 小さい(低コスト) 大きい(高精度)
検索速度 高速 中程度
得意な用途 高速検索重視 精度重視
活用例 商品カタログ、FAQ 詳細情報検索、再ランキング

因果言語モデルから双方向エンコーダへの転換

これら2つのモデルは、3月にリリースされた LFM2.5-350M-Base を基盤にしています。重要な点は、同じ基盤から「因果(Causal)」な構造を「双方向(Bidirectional)」な構造へ転換したことです。

従来の言語生成モデルは左から右への一方向で情報を処理します。これは文章生成には最適ですが、検索タスクではドキュメント全体の文脈を同時に参照する必要があります。Liquid AI は、この制限を解除するために以下の変更を加えました:

  • Attention Mask の変更:各トークンが左右両側の文脈に注視できるように変更
  • Convolution の非因果化:局所情報を過去だけでなく前後対称的に処理

アーキテクチャを因果から双方向へ転換することで、生成モデルの効率性を保ちながら検索に必要な全文脈表現を獲得しています。

モデル構成は以下の通りです。

  • 17層構成(Convolution層:10、Attention層:6、Pooling/Dense層:1)
  • 最大コンテキスト長:32,768トークン(実運用では512トークン程度に調整)
  • Embedding 出力:1,024次元(CLS-style Pooling)
  • ColBERT 出力:128次元/トークン(MaxSim Late Interaction)

多言語対応を実現した3段階の訓練戦略

両モデルの多言語対応(11言語)を実現するために、Liquid AI は以下の段階的な訓練手法を採用しています:

  1. 第1段階:英語での大規模対比学習(Contrastive Pretraining)
  2. 第2段階:強力なティーチャーモデルからの多言語・クロスリンガル知識蒸留
  3. 第3段階:困難なネガティブサンプルを使った最終ファインチューニング

英語で基盤を作り、その後に多言語へ拡張する戦略は、限られたリソースで高い多言語性能を実現する現実的なアプローチです。

Embedding モデルはクロスリンガルデータをより多く受け取るのに対し、ColBERT は Late-Interaction の特性上、クロスリンガル検索がより自然に機能するため、相対的にバランスの取れた学習になります。

RAG 導入時の選択肢として、検討の価値あり

この2つのモデルが「ドロップイン・リプレースメント」として位置付けられているのは、既存の RAG パイプラインへの統合を視野に入れているためです。特にエンジニアの方にとって関心が高い点は以下です:

  • パラメータ数の小ささ:350M は自作 PC(GPU メモリ 6GB 以上程度あれば)でも推論可能な規模
  • 軽量化による実行環境の自由度:クラウド(GCP の Cloud Run など)はもちろん、オンプレミスやエッジデバイスでの運用も現実的
  • Hugging Face での公開:LFM Open License v1.0 下で提供されており、商用プロジェクトでの活用も可能

検索精度が従来モデルと比較して具体的にどの程度向上しているかは、記事からは詳細情報がありません。ただし、ColBERT の Late-Interaction アプローチが学術的には有効とされているため、精度と速度のバランスを取る選択肢として検討する価値があります。

また参考として、最近では AI モデルそのものの中に人物情報がどの程度記憶されているかを測定する試みも出ています。「In the Weights」というサービスでは、異なる LLM に対してクエリを投げて、そのモデルの訓練データ内にどの程度の人物情報が埋め込まれているかを可視化しようとしています。(出典)同様に、検索モデルの性能測定やベンチマーク公開も、今後ますます重要になると感じます。