Lean 4 向け証明エージェント、オープンソースで登場
Mistral AI が発表した Leanstral 1.5 は、数学の定理証明を自動化するための専用モデルです。Lean 4 という証明支援システム向けに特化した点が特徴で、論理的なステップを機械的に検証しながら証明を進めることができます。
Leanstral 1.5 は Apache 2.0 ライセンスで完全にオープンソース化されており、開発者コミュニティが自由に活用・カスタマイズできる状態です。
これは単なる一般向け大規模言語モデル(LLM)ではなく、数学的な厳密性を求める研究者やエンジニア にとって大きな価値があります。従来のモデルと異なり、AI が生成した証明が実際に正しいかどうかを機械的に検証できるため、信頼性が格段に高いのです。
128 個の「頭脳」を持つ効率的アーキテクチャ
Leanstral 1.5 の内部構造は Mixture-of-Experts(MoE) という設計を採用しています。これは、128 個の専門的なサブネットワーク(エキスパート)を備えており、処理するトークンごとに 4 つだけを活性化するという仕組みです。
総パラメータ数は 119B(1190 億) ですが、実際に使われるのは 1 トークンあたり 6.5B のみ。これにより、計算コストを抑えながらも大規模なモデルの表現力を保つことができます。また、コンテキスト長は 256k トークン に対応し、テキストと画像の両方を入力として受け付けます。
自分も個人プロジェクトで GPU パフォーマンスとメモリ効率のバランスを取ることの大切さを実感しているのですが、このアーキテクチャ設計は非常に実用的だと感じます。同じ性能を実現するなら、計算量を抑えることで推論コストが直結して下がるからです。
強化学習で「試行錯誤する AI」へ
Mistral AI の訓練パイプラインは 3 段階に分かれています。
- 中盤学習(Mid-training):基本的な言語理解を獲得
- 教師あり微調整(Supervised Fine-tuning):Lean 4 の文法に適応
- 強化学習(CISPO による RL):実践的な証明ワークフローを習得
特に強化学習では 2 つの環境を用意しており、一つは定理を与えられたら証明を試みる「マルチターン環境」、もう一つはファイルシステムで直接コードを編集しながら Lean の言語サーバーと対話する「コード エージェント環境」です。
モデルは Lean コンパイラのフィードバックを受け取ると、それを次の試行に反映させていくため、人間の数学者が行うのと似た試行錯誤プロセスが実現されています。
長いタスクで文脈がオーバーフローしないよう、過去のやり取りを圧縮する「コンテクスト圧縮」も実装されており、これは LLM の実用化において非常に重要な工夫だと思います。
ベンチマーク成績—複数で最高性能を達成
Leanstral 1.5 の性能は複数の評価セットで検証されています。
| ベンチマーク | スコア | 備考 |
|---|---|---|
| miniF2F(検証+テスト) | 100% | 飽和状態、Mistral による報告 |
| PutnamBench | 587 / 672問 | 問題あたり約 $4 |
| FATE-H(代数分野) | 87% | 新たな最高性能 |
| FATE-X(代数分野) | 34% | 新たな最高性能 |
| FLTEval pass@1 | 28.9 | 前モデルの 21.9 から改善 |
| FLTEval pass@8 | 43.2 | Opus 4.6 の 39.6 を超過 |
FLTEval は Fermat の最終定理リポジトリの実際のプルリクエストから構成されており、現実的なユースケースでの性能を示しています。特に注目すべきは、Anthropic の Opus 4.6 よりも高い pass@8 スコアを達成していながら、推論コストが約 7 分の 1 という点です。
コスト効率の面では、オープンソース・モデル(パラメータ数がこのモデルの 3~10 倍のものも含まれる)と比べても顕著に優れています。
活用可能性—研究からスタートアップまで
このモデルは学術的な価値にとどまりません。定理証明の自動化は、数学的な正確性が必須のシステム設計や形式検証にも応用できます。
Clause Code を使ったバイプログラミングの際にも、証明エージェントが補助的に機能する可能性があります。たとえば、型安全性が求められるコードを書く際に、自動で論理的な正確さをチェックするツールとして組み込めるかもしれません。
無料 API エンドポイント(leanstral-1-5)が提供されているため、開発者はすぐに試験運用を始められます。