LLMジェイルブレイク防止(エルエルエムジェイルブレイクボウシ)
LLMの安全制約を迂回する「ジェイルブレイク」攻撃を検出・防止するための技術的対策の総称。
LLMジェイルブレイクとは
ジェイルブレイク(Jailbreak)は、LLMの安全ガードレールを意図的に回避し、有害なコンテンツや機密情報を生成させる攻撃手法の総称です。スマートフォンのjailbreakから転用された用語で、AIの「制限解除」を意味します。
主要ジェイルブレイク手法
ロールプレイ型
DAN(Do Anything Now): 「制限なしのAIを演じて」という古典的手法。悪役演技はフィクション誘導で制限回避を試みる。仮説的シナリオ(「もし〜だったら」)も同様の構造。
プロンプトインジェクション型
システムプロンプト上書き: 「以前の指示を忘れて」系の指示で安全設定を上書き試み。間接注入: 外部データ(PDFや検索結果)経由での悪意ある指示の混入。Crescendo: 徐々にエスカレートする多段階プロンプト攻撃。
技術的回避型
トークン分割: 単語を文字単位で分割して有害コンテンツをトークナイザーに誤認識させる。エンコード: Base64・ROT13で有害コンテンツをエンコードして渡す。GCG攻撃: 勾配ベースで最適化したトークン列で安全機構を突破する高度な攻撃。Many-Shot Jailbreaking: 長いコンテキストで大量の有害例を提示しロールシフトを誘発。
防止技術
1. 入力フィルタリング
パターンマッチング(既知ジェイルブレイク文字列のブラックリスト)・意図分類器(入力の悪意スコア算出)・ペルプレキシティフィルタ(異常な低品質トークン列の検出)
2. システムプロンプト強化
ロールプレイ指示を無効化する明示的な宣言。「以前の指示を忘れて」系への抵抗宣言。セクション区切りマーカーによる指示階層の明確化。
3. RLHF/DPO再学習
ジェイルブレイクプロンプトへの拒否例を大量収集し、敵対的トレーニング(Adversarial Training)でモデルを堅牢化。Constitutional AIによる自己批判サイクルも有効。
4. 出力検証
生成後の有害コンテンツ分類器による二重チェック。Llama GuardやGPT-4 Moderationによるスクリーニング。
防止の限界
汎化問題: 既知パターンをブロックすると未知の変形が登場するイタチごっこ。能力トレードオフ: 安全性を高めると有用性が下がる傾向がある。オープンソースモデル: ウェイトが公開されると直接ファインチューニングで制限解除が可能。長文コンテキスト: Many-Shot等の新手法はモデルサイズ増加で逆に脆弱性が増加する場合がある。
評価ベンチマーク
HarmBench(200種類以上の攻撃手法で標準評価)・JailbreakBench(リーダーボード形式の継続評価)・StrongREJECT(ジェイルブレイク成功率の自動スコアリング)が主要ベンチマーク。
自作PC環境でローカルLLMを運用する場合、特にオープンソースモデルはジェイルブレイクへの耐性がクラウドAPIより低いことが多い点に注意。