Inkling の特徴と業界への影響

Thinking Machines LabがHugging Faceで公開した「Inkling」は、複数の点で注目に値する大規模言語モデルです。まず、約1兆(975B)パラメータを持つ初のオープンモデルでありながら、画像、テキスト、音声入力をネイティブに受け入れるという点が画期的だと感じます (出典)。45兆トークンもの多様なデータで学習されており、音声、画像、テキストといったモダリティを横断した推論に特化しているとのことです。

Inklingは、約1兆パラメータを持ち、1Mコンテキストウィンドウを持つ初のオープンモデルとして、画像、テキスト、音声入力をネイティブに受け入れます。

これは、これまでの一般的なLLMがテキスト中心であったのに対し、現実世界の情報をより多角的に理解し、処理できる可能性を示唆しています。個人的には、この手のマルチモーダルモデルがローカルで快適に動くようになれば、個人プロダクトでの活用範囲が格段に広がるのではないかと期待しています。

独自のアーキテクチャと技術的詳細

Inklingは、デコーダーオンリーのマルチモーダルMoE(Mixture-of-Experts)モデルとして設計されており、975Bの全パラメータ中、アクティブなのは41Bパラメータです (出典)。このMoEの採用により、巨大モデルでありながら高速な推論を実現している点は、コストとパフォーマンスの両面で非常に魅力的です。

Inklingのアーキテクチャの主な特徴は以下の通りです。

  • デコーダーオンリー: 多くの最先端LLMと同様に、因果的自己回帰生成をサポートします。
  • マルチモーダル: テキスト、音声、画像を処理できます。
  • Mixture of Experts (MoE): 各層内のフィードフォワードネットワークがスパースであり、256のエキスパートの中から41Bのアクティブパラメータのみを使用することで、高速な推論を実現しています。これは、大規模モデルの効率的な運用を考える上で非常に重要な設計だと感じます。

さらに、RoPEの代わりに相対アテンションを使用したり、グローバルアテンションとスライディングウィンドウアテンションを組み合わせたハイブリッドアテンション、そして局所的な特徴抽出を助けるショートコンボリューションなど、パフォーマンスと効率を両立させるための様々な工夫が凝らされています (出典)。これらの技術的選択は、GCPのCloud RunやBigQueryといったサービスで大規模なMLワークロードを動かしているエンジニアの方々にとっても、非常に参考になるのではないでしょうか。

Inklingの主な技術要素

項目 特徴 従来のモデルとの違い
パラメータ数 975B (全パラメータ), 41B (アクティブパラメータ) MoEにより効率的な推論
コンテキストウィンドウ 1Mトークン 非常に大規模な情報を扱える
入力モダリティ テキスト、画像、音声 ネイティブなマルチモーダル対応
位置エンコーディング 相対アテンション RoPEではなく直接アテンション層で学習
アテンション機構 ハイブリッドアテンション (グローバル + スライディングウィンドウ) 計算効率の最適化
特徴抽出 ショートコンボリューション (SConv) 局所的な特徴抽出を強化
MoE設計 共有エキスパートシンク ルーティングエキスパートと共有エキスパートを組み合わせる

開発者フレンドリーなエコシステムと今後の展望

Thinking Machinesは、InklingをHugging Faceで公開するにあたり、Transformers、SGLang、llama.cppといった主要なツールでのDay-0サポートを提供しています (出典)。これは、開発者がすぐにInklingを試せるようにするための、非常に手厚い配慮だと感じます。特にllama.cppでのサポートは、RTX 3090を搭載した自作PCでローカルLLMを動かしている私のような人間にとっては、とてもありがたいニュースです。

今回のリリースは、Thinking Machines Labが「一律的なAIモデルへの賭けに反対する」という姿勢を強める中で、初のオープンモデルを投入したことになります (出典)。彼らはInklingをカスタマイズ可能なベースモデルとして位置付けており、ドメイン特化型のファインチューニングを通じて、新しいマルチモーダル推論アプリケーションを構築することを意図しているようです。今後は、特にビデオ処理能力や出力の多様化に期待したいところです (出典)。