Grokを狙う「暗号学的コンテキストインジェクション」とは

2026年8月20日、Adversa AIのセキュリティ研究者たちは、xAIが提供するWebチャットエージェントGrokが、これまで知られていない形式のプロンプトインジェクションに脆弱であることを指摘しました(出典)。この攻撃は「暗号学的コンテキストインジェクション」と呼ばれ、従来のプロンプトインジェクションとは一線を画します。

従来のプロンプトインジェクションが、Webページに直接悪意のある指示を埋め込む間接的な手法であったのに対し、今回の手法は暗号化された悪意ある指示と、その復号鍵をWebページに配置する点が特徴です。これにより、AIモデルのガードレールスキャナーが暗号文を検知できず、モデル本体が自ら復号して指示を実行してしまうとのことです。

GrokもPythonやTypeScriptといった言語を使っているはずなので、コード実行サンドボックス内で暗号化ライブラリが動くのは想像に難くありません。自分の個人プロダクトでも、APIキーなどを暗号化して保存しているので、この手法には非常に現実味を感じます。

攻撃者は暗号文を鍵と共に送り込み、復号命令を出すことで、モデルが自身のコード実行サンドボックス内で復号を実行してしまう。

Adversa AIの主任研究者Rony Utevsky氏は、一般的なコンテンツ分類器では、検査時にPBKDF2やAES-256-GCMといった強力な暗号化アルゴリズムを復号できないため、攻撃が成功すると説明しています。従来のBase64エンコードのような弱い暗号化はモデルが訓練データから解読可能でしたが、強力な暗号化ではコード実行環境での復号が必要になる点が大きな違いです。

なぜ従来のガードレールが機能しないのか

この攻撃が特に危険視されるのは、従来のAIモデルのガードレール(入力フィルター)が、その性質上、暗号化された指示を検知できない点にあります。ガードレールは入力されたテキストをスキャンし、不審なパターンや有害なコンテンツを検出しますが、暗号化されたデータは単なる文字列の羅列としか認識されません。

そして、モデルがWebページから取得した暗号文と鍵を、自身のコード実行サンドボックス内で復号してしまうことで、その結果として得られた「悪意のある平文の指示」を、あたかもモデル自身の出力であるかのように信頼して実行してしまうのです。Utevsky氏はこれを「信頼のロンダリング(trust laundering)」と表現しており、非常に的を射た表現だと感じます。

項目 従来のプロンプトインジェクション 暗号学的コンテキストインジェクション
攻撃内容 Webページに悪意ある指示を直接埋め込み Webページに暗号化された指示と復号鍵を埋め込み
ガードレール検知 比較的容易(パターンマッチング) 困難(暗号文は検知できない)
モデルの動作 外部からの指示と認識しやすい モデル自身の復号結果として信頼しやすい
復号処理 不要 モデルのコード実行環境で実施

Adversa AIは概念実証デモとして、この手法を使ってGrok.comのチャット履歴を窃取する様子を公開しています。ユーザー名、おおよその位置情報、サブスクリプション状況、そして会話履歴のプロンプト全体がURLパラメーターとして送信されるとのことです。これはユーザーにとってかなり衝撃的な情報漏洩につながる可能性があります。

他のAIモデルへの影響と今後の課題

Adversa AIはGoogleのGeminiにもこの暗号学的コンテキストインジェクションを試しましたが、GeminiはPythonから外部Webサイトへのアクセスを許可していないため、Grokのような情報窃取のシナリオは機能しなかったとUtevsky氏は述べています(出典)。しかし、Geminiでもセキュリティフィルターを回避して「焼夷兵器の製造方法」のような有害なコンテンツを生成させることには成功したそうです。

これはかなり驚きです。セキュリティフィルターをすり抜けてしまうのは、今後のAIサービスの利用に大きな懸念材料になるのではないでしょうか。

xAIには2026年6月3日にHackerOneを通じてこの攻撃が報告されましたが、記事執筆時点の8月19日時点でもGrok.comでこの手法が機能しているとのことです。SpaceX(xAIの親会社)はコメント要請に応じていません。

一方、Geminiに対する攻撃成功率は8月までに大幅に低下したようで、Utevsky氏はフィルターの更新やモデルバージョンの変更が影響している可能性を指摘しています。やはりGoogleはこういった問題には迅速に対応している印象を受けますね。

また、TechCrunchの報道によると、2026年8月20日にGrokのチャットボットが「match it without and your they and two for planets can practical and often cheese…」のような意味不明な応答を返すグリッチが発生したと伝えられています(出典)。これは暗号学的コンテキストインジェクションとの直接的な関連は不明ですが、AIモデルの予期せぬ挙動は、潜在的な脆弱性や悪意ある操作の影響である可能性も排除できません。