LLMの課題—意思決定にはなぜ不向きなのか

現代のAIパイプラインは、シンプルな反射的な意思決定に大規模な生成系LLMを使用しているという、大きなボトルネックを抱えています。例えば、カスタマーサポートのチケットが届いたり、メールを受信したり、ユーザーがAPIにプロンプトを送信したりする際、必要とされるのは多くの場合、ごく限られた情報に対する迅速な判断です。

「このチケットはどの部署に回すべきか?」「このメールはフィッシング詐欺か?」「このプロンプトはシステムをジェイルブレイクしようとしているか?」「この問題の緊急度は0から3のスケールでどれくらいか?」といった問いに対し、8Bや70Bもの巨大なLLMを呼び出すのは明らかにオーバースペックです。トークンがストリーミングされるまで500ミリ秒から2,000ミリ秒も待たされ、推論に費用がかかり、さらに自由形式のテキストからクリーンなラベルを抽出するために正規表現やJSONパーサーを書く手間も発生します。 (出典)

LLMは、あたかも自信があるかのようにトークンを予測するだけで、その裏には数学的なキャリブレーションが全くありません。

さらに問題なのは、LLMが「hallucinate(幻覚)」を起こし、誤った自信を生成することがある点です。例えば、「confidence: 0.95」と出力しても、それは自信があるように聞こえるトークンを予測しているだけであり、その背後には数学的な根拠がありません。まさに人間の脳の「システム1」のように、瞬時に反射的な意思決定を下し、正直でキャリブレーションされた確率を30〜40ミリ秒で出力できるモデルが求められています。

Pythonでスクリプトを書いていると、ちょっとした判断ロジックにLLMを使いたくなる場面はありますが、このレイテンシとコストの課題は無視できません。もっと手軽に、かつ確実な判断ができるツールが欲しいと常々感じていました。

先行研究と「ブレイクスルー」の衝撃

今回の話題の発端は、2026年9月にTypeSafe AIが発表した「Jev」というモデルにあります。このJevは、OpenAIのChatGPT共同発明者の一人であるDiogo Almeida氏が設立した、潤沢な資金を持つフロンティアラボから発表されました。彼らは、非自己回帰型決定というコンセプトを、あたかも真新しい科学的ブレイクスルーであるかのように提唱しました。

しかし、技術論文もオープンなモデルウェイトも、学習データセットも一切公開されていません。(出典)

これに対し、筆者は2025年3月に既に同様の非自己回帰型モデルに関する論文をarXivで発表し(arXiv:2503.23303)、モデルウェイトをHugging Faceで、データセットも公開していました。2025年9月には、強化学習によって誘導されるスキーマベースの意思決定フレームワークに関する2番目の論文も発表しています(arXiv:2510.01237)。

このモデルは、強化学習(PPO)を用いて、セールス会話におけるターンごとのコンバージョン確率(0.0から1.0)を出力していました。Jevはこれをさらに汎用化し、RLCD(Reinforcement Learning for Calibrated Decisions)という手法で並列サンプリングを行い、確信度分布とスキーマ選択を水平方向に出力するものです。

Jevの応答時間は約150ミリ秒で、100万入力トークンあたり0.042ドルの料金設定となっています。(出典)

項目 筆者の初期モデル Jev (TypeSafe AI) RL Agent (筆者の最新版)
発表時期 2025年3月(初期) 2026年9月 2026年9月以降
主要技術 PPO over sequence representations RLCD (Reinforcement Learning for Calibrated Decisions) RLCD (厳密な適切なスコアリングルール)
用途 垂直特化型(セールス会話) 水平汎用型(スキーマ選択) 水平汎用型(System 1 decision model)
モデル公開 オープンソース(Hugging Face) クローズド 100%オープンソース
論文公開 arXivで2本公開 なし 詳細公開予定
レスポンスタイム 不明(初期版) 約150ミリ秒 33〜38ミリ秒 (GPU)
コスト 無料(オープンソース) 1M入力トークンあたり0.042ドル 無料(オープンソース)

応答速度を約4倍に高速化した「RL Agent」

オープンソースの研究として数ヶ月間心血を注いだものが、特定のユースケース向けだったという理由で見過ごされ、資金力のあるラボが同じ核心的なアイデアを汎用的にパッケージ化してすべての栄光を独り占めする。これは、オープンソースの世界ではよくある話だ、と筆者は述べています。(出典)

しかし、この悔しさをバネに、筆者は2025年3月と9月の論文から得たすべての教訓を活かし、古いアプローチのアーキテクチャ上の制限をすべて克服しました。そして、完全にオープンで汎用的なSystem 1決定モデル「RL Agent」を開発したのです。

このRL Agentは、双方向エンコーダ上に適切に構築されているため、GPU上ではわずか33〜38ミリ秒で実行されます。これは、Jevが公開している150ミリ秒のレイテンシと比較して、約4倍の高速化を実現していることになります。

しかも、このモデルは100%オープンソースです。(出典)

我々のモデルはGPU上で33〜38ミリ秒で実行され、Jevの公開レイテンシより約4倍高速で、100%オープンソースです。

GCPのCloud RunなどでPythonのAPIを動かす身としては、この30ミリ秒台という数字は非常に魅力的です。LLMの推論に数秒かかるところを、これだけ高速に判断できるなら、ユーザー体験を損なわずに多段階の意思決定を組み込めます。自分のプロダクトにもぜひ組み込んでみたいと感じました。

非自己回帰型決定モデルの未来

非自己回帰型決定モデルは、LLMが苦手とする「高速で正確な、校正された確率に基づく意思決定」の領域で大きな可能性を秘めています。特に、人間の脳のシステム1のように、瞬時に反射的な判断が求められるアプリケーションにとっては革命的と言えるでしょう。

筆者は、このRL Agentのアーキテクチャ、RLCDの数学的な仕組み、そして非自己回帰型決定モデルがなぜ未来であるのかについて、詳細なストーリーを公開する予定です。(出典)

この技術が普及すれば、AIチャットボットの応答速度向上はもちろん、セキュリティシステムの異常検知、金融取引のリアルタイム判断、IoTデバイスのエッジAIなど、幅広い分野で影響があるでしょう。特にローカルLLMを自作PCで動かしているエンジニアにとっては、この種の高速・軽量なモデルが、限られたリソースで高性能なAIを構築する鍵となるかもしれません。