「ランダム」な質問で露呈する予測可能性

Simple な実験で、LLMの限界が浮き彫りになります。ChatGPT や Claude、Gemini に「1から10のランダムな数字をください」と聞くと、ほぼ確実に「7」が返ってきます。続けて「別の数字をください」と促せば、3か4、その次は8か9といった具合に、非常に予測可能なパターンで答えが返ってくるのです。

主流のLLMは、開放的な質問に対して思考の多様性を失い、特定の『安全な』回答へ収束している状態にあります。

こうした予測可能性は、コーディングや調査といったタスクではさほど問題になりません。しかし、ブレインストーミングや旅行プランの検討といった創造的な用途では、同じような提案ばかり返されるという大きな制約になってしまいます。

Springboards「Flint」の登場—多様性を意図的に設計

2026年7月、オーストラリアのスタートアップ Springboards が、この問題に直接対抗するLLM「Flint」を発表しました。Flint の特徴は、従来のLLMよりも幅広い回答を意図的に生成するように訓練されているという点です。

MIT Technology Review の記事によると、Springboards の共同創業者兼CEO Pip Bingemann は「ほとんどの言語モデルは幻覚を避けようとしている。私たちはそれを歓迎する」とコメントしており、多様性と創造性を価値として捉える姿勢が際立っています。

実際のデモンストレーションでは、同じ質問に対して:

  • ChatGPT:トヨタ、ホンダといった一般的な車種
  • Claude:同様に予測可能な選択肢
  • Flint:フォード F-150 など、より予測不可能で多様な答え

といったように、Flint だけが異なる視点から応答していました。新しい製品のタグラインを求められた場合も、ChatGPT と Claude は「Run your way」で一致しましたが、Flint は「Built to last, run to win」という独自の提案をしています。

個人的には、この現象を見ると「言語モデルもトレーニングデータと最適化プロセスの影響を受けるんだな」という実感が湧きます。複雑なシステムでも、設計思想一つで動作は大きく変わるということですね。

学術的な検証—LLM間の「共通思考」が明らかに

2026年11月、この問題はより学術的な文脈で立証されました。「Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)」という論文が発表され、異なるLLM間での回答の収束現象が詳細に分析されています。この論文は NeurIPS(機械学習分野の最大級カンファレンス)で最優秀論文賞を受賞しています。

研究チームが実施した実験の規模と結果は以下の通りです:

項目 詳細
テスト対象モデル数 25種類(米国大手企業、中国オープンソースモデルなど)
質問回数 各モデルあたり50回
質問内容例 「時間についてのメタファーを書く」
総回答数 1,250件
主な回答パターン 「時間は河」「時間は織工」(多くのモデルで同じ)

多くのLLMは、訓練データとファインチューニングプロセスが似ているため、開放的な質問に対して自然と同じような答えへ収束するという根本的な構造問題を抱えています。

論文では、このような同質化が生じる理由について「ほとんどのLLMは類似のデータで、似た方法で、似たタスク用途に訓練されているから」と結論づけています。複数の独立したモデルが同じ答えに集約する現象は、実は不思議ではなく、訓練環境の類似性がもたらす必然的な結果だというわけです。

Springboards の CTO で共同創業者の Kieran Browne は、この問題の見えにくさについて指摘しています。チャットインターフェースは個人的な会話のように感じさせられるため、ユーザーは「同じ回答を他の誰もが得ている」という事実に気づきにくいのです。

実用的な課題と今後の方向性

この「グループシンク」問題は、学術的な興味に留まりません。開放的な問題解決や創造的な作業では、多様な視点からの回答がしばしば重要になります。一方で、事実ベースの回答(例えば「2+2は?」)については、この収束性そのものが有用です。

課題となるのは、LLMの利用者が「どのタイプの用途なのか」を明確に意識していない場合です。ニュースサマリーや技術文書の作成などでは問題になりませんが、マーケティングキャンペーン企画やコンテンツ制作では、この制約が大きな足かせになる可能性があります。

Springboards の Flint のようなアプローチが、今後どの程度採用されるかは、企業や開発者がこの問題をどこまで重視するかにかかっています。