AI・機械学習
上級

LLM Robustness Evaluation(エルエルエム ロバストネス イバリュエーション)

LLM が敵対的入力・分布外データ・ノイズ・攻撃に対してどの程度安定した出力を維持できるかを定量評価するプロセス。HarmBench・AdvBench・WildGuard 等の標準ベンチマークで実施される。

0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
LLM評価
ベンチマーク
AI安全性
レッドチーミング

LLM Robustness Evaluation とは

LLM Robustness Evaluation(LLM ロバストネス評価)は、大規模言語モデルが以下のような「困難な条件」下でも一貫した安全・正確な出力を維持できるかを定量的に測定するプロセスの総称。

  1. 敵対的入力: Jailbreak・Prompt Injection・Suffix Attack 等の悪意ある入力
  2. 分布外データ(OOD): 学習データとは異なるドメイン・言語・フォーマットの入力
  3. ノイズ・タイポ: スペルミス・文法崩壊・Unicode 異字体
  4. 矛盾する指示: 競合する命令・コンテキスト汚染
  5. 長文・繰り返し: 最大コンテキスト付近での一貫性

主要ロバストネスベンチマーク(2024〜2025年)

ベンチマーク評価軸規模発表元年
AdvBenchJailbreak 攻撃成功率520 プロンプトZou et al.2023
HarmBench攻撃手法 × モデル統一評価400+ 攻撃 × 33 モデルMazeika et al.2024
JailbreakBenchJailbreak 標準スコアリング100 有害挙動Chao et al.2024
WildGuard野生データからの有害度92K 例Han et al.2024
SORRY-Bench安全性拒否の適切さ450 タスクXie et al.2024
OR-Bench過剰拒否(False Positive)測定80K プロンプトCui et al.2024

評価の三軸フレームワーク

Safety(安全性)・Robustness(ロバスト性)・Helpfulness(有用性)の三軸はトレードオフ関係:

  • Safety ↑ すると Helpfulness ↓(過剰拒否)
  • Robustness ↑ すると計算コスト ↑
  • 最適バランスの測定が Robustness Evaluation の本質

Red Teaming と自動評価の組み合わせ

人手 Red Teaming

  • 専門家チームが手動で攻撃プロンプトを設計
  • コスト: 高(1モデル評価に数百人時間)
  • 精度: 高(創造的攻撃を発見)
  • 採用例: OpenAI・Anthropic のモデルリリース前評価

自動 Red Teaming(2024〜2025年主流)

  • LLM 自身が攻撃プロンプトを生成(GCG・PAIR・TAP アルゴリズム)
  • コスト: 低
  • スケール: 数万〜数十万プロンプト
  • 採用例: HarmBench・JailbreakBench のバックエンド

ハイブリッドアプローチ(推奨)

自動評価で網羅性を担保 → 人手で False Negative 確認

主要モデルの比較(HarmBench 2024 結果抜粋)

モデルGCG ASRAutoDAN ASRDirect Request ASR
GPT-4o5.2%1.8%3.1%
Claude 3.5 Sonnet3.1%0.9%1.4%
Llama 3.1 70B18.4%12.3%8.7%
Mistral 7B31.2%24.1%15.3%

(ASR: Attack Success Rate。低いほど安全)

よくある質問(FAQ)

Q1: ASR(Attack Success Rate)0% は達成可能ですか? A: 2025年時点では不可能。新しい攻撃手法が継続的に登場するため、評価 → 防御 → 再評価のサイクルが必須。目標は「合理的な攻撃コストに対して ASR を許容可能なレベルに抑える」こと。

Q2: 自社 RAG システムのロバストネスを測定するには? A: HarmBench の「External Retrieval」攻撃カテゴリが参考になる。社内 Red Team でシナリオ設計 → PromptBench・Giskard 等のオープンソースツールで自動スキャン、が現実的アプローチ。

Q3: Fine-tuning でロバストネスは向上しますか? A: Safety Fine-tuning(SFT + RLHF)は有効だが、攻撃者が Fine-tuning データを逆解析してサフィックスを設計できるため過信は禁物。防御は多層が原則。

まとめ

  • LLM の敵対的入力・OOD・ノイズへの耐性を定量評価
  • HarmBench(2024)が400+ 攻撃手法 × 33 モデルの統一標準として台頭
  • Safety / Robustness / Helpfulness の三軸トレードオフが評価の核心
  • 自動 Red Teaming + 人手確認のハイブリッドが2025年のベストプラクティス
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/6