「使う分だけ計算する」設計——1.6兆パラメータでも運用コストを抑える工夫
LongCat-2.0は、agentic coding(エージェントによるコード理解・生成・実行)を主眼に設計された次世代モデルです。(出典)アーキテクチャは主に4つのアイデアで構成されています。
- Zero-computation experts:句読点のような単純なトークンは計算をほぼ行わない「無演算エキスパート」に振り分け、複雑なトークンだけに多くの計算資源を割く。PIDコントローラーが動的に調整し、1トークンあたり330億〜560億パラメータという可変の活性化幅を実現する
- LongCat Sparse Attention(LSA):DeepSeek Sparse Attention(DSA)を発展させた設計で、Streaming-aware・Cross-Layer・Hierarchicalの3種類のインデックス手法を組み合わせ、100万トークンという長いコンテキストでも計算量の増大を抑える
- N-gram Embedding:1,350億パラメータ規模の埋め込みモジュールを追加し、局所的なトークン間の関係を捉えつつ大量バッチ処理時のメモリI/Oを削減する
- MOPD(後段学習パイプライン):Agent・Reasoning・Interactionの3種類の教師モデルの能力を1つのモデルに統合する
句読点のような「軽い」トークンには計算をほとんど割かず、複雑な処理が必要なトークンにだけ計算資源を集中させる。
非Nvidia環境での学習という選択
最も注目すべき点の一つは、35兆トークン以上に及ぶ事前学習と、その後の提供(サービング)の両方が、Nvidia製ではない国産のAI専用ASICスーパーポッド上で行われたことです。Meituanは、この学習の過程で「ロールバックや回復不能なロス急増は一度も起きなかった」と説明しています。(出典)
非Nvidia環境ではツールの成熟度がまだ発展途上とされる中、この安定性の主張は特に注目に値する。
提供面でも、6次元並列化やprefill-decode分離アーキテクチャ、独自の「スーパーカーネル」、L2キャッシュへの重みプリフェッチなど、I/O待ち時間を隠すための工夫が盛り込まれています。
| 項目 | LongCat-Flash(旧) | LongCat-2.0(新) |
|---|---|---|
| 公開年 | 2025年 | 2026年 |
| 総パラメータ数 | 560億 | 1.6兆 |
普段GCPのBigQueryやCloud Runを使う身としては、非Nvidia環境でここまでの規模のモデルを安定して学習・提供できているという主張は素直に驚きます。ローカルのRTX 3090で小規模なモデルを動かす際にも、こうした効率化の工夫が今後どこまで下りてくるのか興味があります。