モデルの「発言前の思考」を捉える新レンズ
Anthropicの研究チームは、既存の解析ツール「logit lens(ロジットレンズ)」を発展させた「Jacobianレンズ(J-lens)」を開発しました。従来のlogit lensがモデルが次に出力しそうな単語を捉えるのに対し、J-lensは近い将来モデルが発言する可能性のある単語や、それに関連する概念を捉えられる点が特徴です(出典)。
この手法を使い、研究チームはClaude Opus 4.6の内部に「J-space」と呼ばれる隠れた領域を発見しました。
もしClaudeが人間だったなら、J-space内に現れる単語群は「話す前に頭の中にあること」を表していると言えるだろう。
LLMの構造を「本の積み重ね」に例えると
MIT Technology Reviewの解説では、LLMの構造を本の積み重ねに例えています。積み重ねの一番下(入力層)はテキストを処理する層、一番上(出力層)は出力を準備する層で、ここでの処理の多くは「事務的な作業」にすぎません。本当に複雑な計算——プロンプトを1語ずつ応答へと変換する処理——が行われるのは、積み重ねの中間層です(出典)。
J-lensはこの中間層を掘り下げるためのツールで、Anthropicはこの成果を論文として公開すると同時に、オープンソースのLLM可視化プラットフォーム「Neuronpedia」と提携し、誰でも試せるハンズオンデモも用意しました。
他の解釈可能性研究者からも一定の評価を得ています。LLM解析ツールを開発するスタートアップGoodfireの主任科学者兼共同創業者トム・マグラス氏は、「非常に良く、興味深い研究だ」とコメントしています(出典)。
「言っていること」と「実際にやっていること」の乖離を可視化
今回の研究で特に注目したいのは、Anthropicが「LLMが実際にやっていることは、LLM自身が説明する内容と異なる場合がある」と指摘している点です。J-space内に現れる単語をモニタリングすることで、モデルの挙動をより深く理解し、制御するための新しい手段になり得るとAnthropicは主張しています。
Tom's Hardwareの報道では、この研究についてモデルに「グローバルワークスペース」のような構造が観測されたと紹介されており、LLMの内部動作を解明する試みがさらに一歩進んだ形です(出典)。
Anthropicは数年前から「mechanistic interpretability(機構的解釈可能性)」と呼ばれる分野を牽引してきており、MIT Technology Reviewは今年のブレークスルー技術の一つにこの分野を選出しています。普段からClaude Codeを使ってバイブコーディングをしている身としては、こうした「モデルが何を考えているか」を覗き見できる研究が進むことで、将来的にAIエージェントの挙動をより信頼できる形で予測・制御できるようになるのではと期待が膨らみます。