AIガードレールの現状:簡単な言い換えで回避されるセキュリティ

Cisco Talosのセキュリティ研究チームは、脅威アクターのAI利用実態を調査し、その結果を公開しました。彼らが発見したのは、AIモデルのガードレールが非常に簡単に回避されているという事実です。

特に驚くべきは、高度なエンコードやテクニックを使うことなく、単に要求を言い換えるだけでモデルが協力してしまう点です。(出典)

多くのAIモデルは、単純な「私はこれを行う許可があります」という主張に対し、容易に応答してしまいました。

具体的には、攻撃対象のサーバーやインフラの所有権を主張したり、その行為がキャプチャ・ザ・フラッグ(CTF)やバグバウンティ活動の一環であると伝えただけで、AIモデルは倫理的制約から解放され、脆弱性の発見や悪用を支援していたとのことです。自分の個人プロダクトでもLLMを積極的に活用していますが、ここまで簡単にガードレールが突破されるとは、正直ここまで来たかという感じです。セキュリティ実装の難しさを改めて感じます。

これらの報告は、AIモデルが持つ強力な能力が悪用されるリスクを浮き彫りにしています。Talosの研究者は、脅威アクターがClaude Code、Codex、Cursor、GeminiといったAIツールのプロンプトログを分析し、その悪用手法を詳細に調べています。

回避手法 詳細 必要な専門知識
所有権の主張 攻撃対象のサーバーやインフラの所有権を主張する 低
CTF/バグバウンティ詐称 行為がCTFやバグバウンティの一環であると伝える 低
タスクの分解 広範な悪意ある活動を検出されないよう、タスクを複数のセッションやファイルに分割 中
ペルソナの変更 メモリ、マークダウンファイルなどでAIのペルソナを調整する 中
中立的動詞の利用 Hephaestusフレームワークのように、悪意のない中立的な動詞を使用する 高

高度な回避手法:タスク分解とAIペルソナの操作

さらに巧妙な回避手法も確認されています。AIアシストのサイバー犯罪者は、モデルの保護機能を回避するために、より広範な悪意のある活動が検出されないよう、タスクを複数のセッションやファイルに分解していました。これは、LLMが一度に処理できるコンテキストの限界や、特定のキーワード検出に依存するガードレールの弱点を突いていると感じます。

また、Talosによると、チャットボットにメモリーやマークダウンファイル、その他のシステムレベルのプロンプトを追加することで、AIのペルソナを条件付けし、ガードレールをバイパスするケースも確認されています。これは、AIがその「役割」を認識し、それに従って振る舞うという性質を悪用しているのではないでしょうか。開発者としては、AIのシステムプロンプト設計がいかに重要か、再認識させられる事例です。

最も興味深い方法として挙げられたのは、Hephaestusというレッドチームツールセットの悪用です。Oasis Securityの研究者によって5月に報告されたこのフレームワークは、人間が介入することなく、被害者の侵害から永続的なアクセス確立までを自動で行えるとのことです。

Talosは、「このケースでは、攻撃者はあからさまに悪意のある動詞ではなく、中立的な動詞を使用することで、拒否を完全に回避するようにプラットフォームを構築していました。」と述べています。(出典)

つまり、攻撃を文脈から切り離された小さな塊に分解し、それぞれの要求を中立的な言葉で表現することで、モデルはそれが攻撃構築を手助けしているとは全く認識しない可能性があるわけです。これは、私がClaude Codeでバイブコーディングをする際に、特定のコンテキストを細かく与えることでより正確なコードが生成されることと、ある意味で共通する原理に基づいているように感じます。

熟練ハッカーの「力の倍増器」としてのAI

このような状況の中、一つ明るい兆しもあります。Talosの調査によると、AIは熟練したハッカーにとっては「力の倍増器」となるものの、一般的なスクリプトキディ(技術的な知識が浅い攻撃者)がClaude Codeアカウントを使って遠くまで進むことは難しいだろう、という見方です。(出典)

専門知識を持たない攻撃者は、技術的には機能する悪意のあるプロジェクトをAIを使って組み立てられますが、ツールをさらに推し進める専門知識が不足しているため、結果は不十分なものに終わります。

つまり、AIが生成したコードやスクリプトを単に利用するだけでは、複雑な攻撃を成功させるには至らないということです。一方で、高度な知識を持つ攻撃者は、AIの能力を最大限に引き出し、これまで不可能と思われていた領域まで押し広げているとのこと。

これは、AIの進化が、技術格差をさらに広げる可能性を示唆していると感じます。私たち開発者は、この技術的な進化にどう向き合うべきか、深く考える必要があるのではないでしょうか。