AI・機械学習
上級
LLM Robustness Evaluation(エルエルエム ロバストネス イバリュエーション)
LLM が敵対的入力・分布外データ・ノイズ・攻撃に対してどの程度安定した出力を維持できるかを定量評価するプロセス。HarmBench・AdvBench・WildGuard 等の標準ベンチマークで実施される。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
LLM評価
ベンチマーク
AI安全性
レッドチーミング
LLM Robustness Evaluation とは
LLM Robustness Evaluation(LLM ロバストネス評価)は、大規模言語モデルが以下のような「困難な条件」下でも一貫した安全・正確な出力を維持できるかを定量的に測定するプロセスの総称。
- 敵対的入力: Jailbreak・Prompt Injection・Suffix Attack 等の悪意ある入力
- 分布外データ(OOD): 学習データとは異なるドメイン・言語・フォーマットの入力
- ノイズ・タイポ: スペルミス・文法崩壊・Unicode 異字体
- 矛盾する指示: 競合する命令・コンテキスト汚染
- 長文・繰り返し: 最大コンテキスト付近での一貫性
主要ロバストネスベンチマーク(2024〜2025年)
| ベンチマーク | 評価軸 | 規模 | 発表元 | 年 |
|---|---|---|---|---|
| AdvBench | Jailbreak 攻撃成功率 | 520 プロンプト | Zou et al. | 2023 |
| HarmBench | 攻撃手法 × モデル統一評価 | 400+ 攻撃 × 33 モデル | Mazeika et al. | 2024 |
| JailbreakBench | Jailbreak 標準スコアリング | 100 有害挙動 | Chao et al. | 2024 |
| WildGuard | 野生データからの有害度 | 92K 例 | Han et al. | 2024 |
| SORRY-Bench | 安全性拒否の適切さ | 450 タスク | Xie et al. | 2024 |
| OR-Bench | 過剰拒否(False Positive)測定 | 80K プロンプト | Cui et al. | 2024 |
評価の三軸フレームワーク
Safety(安全性)・Robustness(ロバスト性)・Helpfulness(有用性)の三軸はトレードオフ関係:
- Safety ↑ すると Helpfulness ↓(過剰拒否)
- Robustness ↑ すると計算コスト ↑
- 最適バランスの測定が Robustness Evaluation の本質
Red Teaming と自動評価の組み合わせ
人手 Red Teaming
- 専門家チームが手動で攻撃プロンプトを設計
- コスト: 高(1モデル評価に数百人時間)
- 精度: 高(創造的攻撃を発見)
- 採用例: OpenAI・Anthropic のモデルリリース前評価
自動 Red Teaming(2024〜2025年主流)
- LLM 自身が攻撃プロンプトを生成(GCG・PAIR・TAP アルゴリズム)
- コスト: 低
- スケール: 数万〜数十万プロンプト
- 採用例: HarmBench・JailbreakBench のバックエンド
ハイブリッドアプローチ(推奨)
自動評価で網羅性を担保 → 人手で False Negative 確認
主要モデルの比較(HarmBench 2024 結果抜粋)
| モデル | GCG ASR | AutoDAN ASR | Direct Request ASR |
|---|---|---|---|
| GPT-4o | 5.2% | 1.8% | 3.1% |
| Claude 3.5 Sonnet | 3.1% | 0.9% | 1.4% |
| Llama 3.1 70B | 18.4% | 12.3% | 8.7% |
| Mistral 7B | 31.2% | 24.1% | 15.3% |
(ASR: Attack Success Rate。低いほど安全)
よくある質問(FAQ)
Q1: ASR(Attack Success Rate)0% は達成可能ですか? A: 2025年時点では不可能。新しい攻撃手法が継続的に登場するため、評価 → 防御 → 再評価のサイクルが必須。目標は「合理的な攻撃コストに対して ASR を許容可能なレベルに抑える」こと。
Q2: 自社 RAG システムのロバストネスを測定するには? A: HarmBench の「External Retrieval」攻撃カテゴリが参考になる。社内 Red Team でシナリオ設計 → PromptBench・Giskard 等のオープンソースツールで自動スキャン、が現実的アプローチ。
Q3: Fine-tuning でロバストネスは向上しますか? A: Safety Fine-tuning(SFT + RLHF)は有効だが、攻撃者が Fine-tuning データを逆解析してサフィックスを設計できるため過信は禁物。防御は多層が原則。
まとめ
- LLM の敵対的入力・OOD・ノイズへの耐性を定量評価
- HarmBench(2024)が400+ 攻撃手法 × 33 モデルの統一標準として台頭
- Safety / Robustness / Helpfulness の三軸トレードオフが評価の核心
- 自動 Red Teaming + 人手確認のハイブリッドが2025年のベストプラクティス