エージェントが「ブレる」原因と診断ツール「Consistency Analyzer」

AIエージェントがタスクの実行中に「ブレる」、つまり異なる振る舞いをするのは、LLMのトークン生成における確率分布が大きく関係しています。LLMが次にどのトークンを選ぶかは確率分布に基づいていますが、この分布が「シャープ」な場合は特定のトークンに確率が集中し、安定した選択が行われます。

しかし、「フラット」な分布の場合、複数の候補トークンに同程度の確率が分散するため、僅かなノイズで異なる選択をしてしまう可能性があります。(出典)

個人的な感想ですが、これはモデルの推論時に temperature の値を低く設定しても、根本的な解決にはならない問題なのではないでしょうか。確率分布の形状自体がブレの原因であるならば、推論戦略そのものを見直す必要がありそうです。

IBM Researchは、この「ブレやすい決定点」を特定するための診断ツール「Consistency Analyzer」を開発しました。これはエージェントが過去に実行した一度の軌跡(trajectory)から、フリップしやすい決定点(モデルが別の行動を選択する可能性があったステップ)を再サンプリングして見つけ出します。

特徴として、正解データ(ground truth)が不要で、タスクを最初から最後まで再実行する必要がなく、単一の呼び出しで複数の補完(k=5がデフォルト)を要求するだけで診断が可能です。(出典)

一貫性を向上させる「consistency guidelines」

Consistency Analyzerによる診断結果を元に、エージェントの一貫性を高めるための「consistency guidelines」が新たに導入されました。これは、エージェント自身の過去の軌跡から再利用可能なガイドラインを自動的に抽出し、推論時に再注入する「ALTK-Evolve」システムに組み込まれる新しいタイプのガイドラインです。

これにより、一貫性ギャップを直接的に解消することを目指しています。(出典)

具体的な効果として、一貫性ギャップを24.4ポイントから12.0ポイントへと半減させることに成功したと報告されています。これは、同一タスクでのPass^5を16.0ポイント、類似タスクでのPass^5を13.0ポイント向上させつつ、平均的な精度を犠牲にしないという点で非常に注目に値します。この成果の全容は、arXivのテクニカルレポートで確認できるとのことです。

これはAIエージェントの実用化において、非常に重要な一歩だと感じます。特に、個人プロダクトでAIエージェントを組み込むことを考えている開発者にとって、信頼性と再現性は最も懸念される部分の一つです。今回のような研究が進むことで、より安定したAIシステムが構築できるようになるのではないでしょうか。

Claude Code など既存のAIコーディングツールでも、このような一貫性向上のためのアプローチが採用されることを期待しています。(参考)

AIエージェントが研究論文を自動でエージェント化し、結果を再現する「Paper2Agent」のような取り組みも進んでいます。研究成果の再現性確保は、AIエージェントの信頼性を高める上で非常に重要な要素となります。