OpenAIがGPT-Redを開発した背景
OpenAIがGPT-Redを開発した主な理由は二つあります。一つは、人間によるレッドチーミングが時間集約的で、現在の開発速度と規模には追いついていないという点です。
もう一つは、従来の堅牢性評価手法が最新のモデルではすでに飽和しており、より高度な脆弱性を見つけるのが難しくなっていることです。(出典)
現在、LLMのエージェント機能はブラウザ、接続アプリ、ローカルファイル、ツールなど多岐にわたる第三者データを読み込むようになっています。これにより、攻撃者が巧妙な指示をデータに埋め込むことで、攻撃対象となる領域(アタックサーフェス)が拡大していることも背景にあるようです。
「GPT-Redは、人間によるレッドチーミングの限界と、拡大するLLMのアタックサーフェスに対応するために開発されました。」
個人的には、これはもう時間の問題だったと感じます。人間のスキルセットだけでは、進化の速度が著しいAIの攻撃パターンを網羅しきれないのは当然ではないでしょうか。AIがAIの弱点を見つけるというのは、かなり効率的で合理的なアプローチだと感じます。
GPT-Redの仕組みと自己プレイ学習
GPT-Redは、単なる静的なベンチマークやプロンプトライブラリではなく、人間と同じようにプロンプトを送信し、応答を観察し、目標に向かって反復するモデルです。OpenAIは、安全性のために自社の最大規模の学習後ランと同等の計算規模でGPT-Redをトレーニングしました。(出典)
重要なのは、GPT-Redがデプロイ済みモデルとは別に管理されている点です。これにより、その悪意ある機能が敵対的なアクターに悪用されることを防いでいます。GPT-Redは主に二つの役割を担います。
- デプロイ前の脆弱性発見
- トレーニング中の攻撃生成
特にトレーニング中の攻撃生成は、自己プレイ強化学習(Self-Play Reinforcement Learning)という手法で行われます。これは攻撃者(GPT-Red)と多様な防御側LLMが同時に学習し、レッドチーミングシナリオにおいて互いを強化し合うというものです。
報酬構造は以下の通りです。
| モデルの役割 | 報酬の条件 |
|---|---|
| GPT-Red(攻撃者) | プロンプトインジェクションなどの有効な「失敗」を引き出すこと |
| 防御側モデル | 攻撃に抵抗し、かつ元のタスクを完了させること |
この防御側モデルの報酬構造が非常に巧妙で、単にすべてを拒否するだけではタスクを完了できないため、より洗練された防御策を学習する必要があります。GPT-Redは、ローカルファイルの一部、ウェブページのバナー、メール本文、ツールの出力などを操作して攻撃を仕掛けます。防御側が堅牢になるにつれて、GPT-Redはより強力で多様な攻撃を発見するようになり、最終的にはGPT-5.5を含む内部および製品モデルのほぼすべてを突破する能力を獲得しました。
「GPT-Redの自己プレイ学習は、攻撃側と防御側が互いに高め合うことで、人間には発見が困難な高度な脆弱性を生み出します。」
新たな攻撃手法「Fake Chain-of-Thought」の発見
GPT-Redの学習プロセスにおいて、OpenAIの研究者も知らなかった新たな種類のプロンプトインジェクション攻撃が発見されました。それが「Fake Chain-of-Thought」です。(出典)
LLMが問題を解決する際に保持する「思考の連鎖(Chain-of-Thought)」に、偽のエントリを挿入するという手法です。これにより、ターゲットモデルは、自分が検証したと信じている偽の情報に基づいて行動してしまう可能性があります。これはかなり衝撃的な発見ではないでしょうか。
- Chain-of-Thought: LLMが推論プロセスを順を追って示す内部メモ。
- Fake Chain-of-Thought: 攻撃者がこの内部メモに偽の情報を挿入し、モデルを誤誘導する手法。
この種の攻撃は、LLMの内部的な挙動を深く理解し、それを利用したものであり、開発者としては非常に興味深いと同時に、潜在的な脅威として認識しておく必要があります。AI同士の攻防から生まれる新しい脆弱性は、今後のセキュリティ研究において重要なテーマになるでしょう。
参考記事では、GPT-5.6がユーザーのファイルを削除した事例も報告されており、OpenAIはこれを「正直な間違い」だと説明しています。これはGPT-Redのような内部モデルが、いかに実践的な脆弱性を見つけ出すかを示す一例とも言えるでしょう。(出典)