LLMの生成出力を後処理段階で検査・修正・ブロックする技術。有害コンテンツ検出・PII除去・事実性検証・フォーマット強制等を推論パイプラインの最終段階で適用し、安全で正確な出力を保証する。
LLM Output Filtering(LLMアウトプットフィルタリング)は、大規模言語モデルが生成したテキストを、ユーザーに提示する前に検査・修正・ブロックする後処理技術である。モデル自体の安全性(アラインメント)や入力制御(ガードレール入力側)とは独立した最終防衛ラインとして機能し、2026年現在のLLMアプリケーションにおいて最も実装頻度の高い安全対策の一つである。
出力フィルタリングは複数の技術を組み合わせて実装される:
| ツール/API | 提供元 | 対応カテゴリ | レイテンシ |
|---|
| 価格 |
|---|
| マルチモーダル |
|---|
| Moderation API | OpenAI | 11カテゴリ | 50-100ms | 無料 | テキストのみ |
| Content Safety | Azure | 8カテゴリ | 30-80ms | $1/1K req | テキスト+画像 |
| Perspective API | 6カテゴリ | 40-90ms | 無料(制限あり) | テキストのみ | |
| Llama Guard 3 | Meta | 13カテゴリ | 100-200ms | 自己ホスト | テキストのみ |
| Presidio | Microsoft OSS | PII 17種 | 20-50ms | 無料 | テキストのみ |
| Cleanlab TLM | Cleanlab | 信頼性スコア | 150-300ms | $0.005/req | テキストのみ |
応答生成と同期的にフィルタリングを実行。チャットボット等のリアルタイム用途向け:
Server-Sent Events(SSE)のストリーミング出力を1トークンずつ監視。有害パターンを検出した時点でストリームを中断:
生成完了後に複数の重いフィルタを並列実行。バッチ処理・文書生成向け:
2026年時点のベンチマーク実績:
主な課題:
Q1: 出力フィルタリングはレイテンシにどの程度影響するか? A: 軽量分類器(Moderation API)で+50-100ms、LLMベース検証で+200-500ms。ストリーミング方式なら体感レイテンシへの影響は最小限(+5-10ms/トークン)。全体の応答時間に対して5-15%増が一般的。
Q2: フィルタリングとアラインメントのどちらが重要か? A: 多層防御の観点から両方必須。アラインメントは有害出力の生成確率を90-95%下げるが、残り5-10%はフィルタリングで捕捉する。特にプロンプトインジェクション経由の攻撃にはフィルタリングが最後の砦となる。
Q3: 日本語対応のフィルタリングツールはあるか? A: Azure Content SafetyとLlama Guard 3が日本語対応済み。OpenAI Moderation APIは英語中心だが日本語も基本検出可能。PII検出は日本語の住所・電話番号パターンに対応したカスタムルール追加が必要。