AI・機械学習
上級

Llama Guard 3(ラマガードスリー)

Meta が開発・公開する LLM 安全性分類モデル。入力プロンプトと出力レスポンスを安全/危険に分類し、暴力・性的コンテンツ・犯罪助長・個人情報漏洩など13カテゴリの有害性を検出する。Llama 3.1 ベースの8Bパラメータモデルで、ガードレールシステムの判定エンジンとして広く採用されている。

0 回閲覧
0 いいね
2026/6/20 更新
関連タグ
LLM
セーフティ
Meta
Llama
分類モデル
コンテンツモデレーション

Llama Guard 3 とは

Llama Guard 3 は、Meta が開発・公開する LLM セーフティ分類モデルです。LLM アプリケーションの入力(ユーザープロンプト)と出力(アシスタントレスポンス)を安全/危険に分類し、13カテゴリの有害コンテンツを検出します。ガードレールシステムの判定エンジンとして広く採用されています。

有害性分類カテゴリ

Llama Guard 3 は MLCommons AI Safety Taxonomy v0.5 に準拠した13カテゴリで有害性を分類します。

カテゴリ説明
S1: 暴力的犯罪暴力行為・テロ・殺人の助長
S2: 非暴力的犯罪詐欺・窃盗・ハッキングの助長
S3: 性的コンテンツ露骨な性的描写・性的搾取
S4: 児童搾取児童の性的搾取に関するコンテンツ
S5: 武器・化学兵器武器製造・化学兵器の情報
S6: 自傷行為自殺・自傷の助長
S7: 差別・ヘイト人種・性別・宗教等に基づく差別
S8: 選挙干渉選挙の不正操作・偽情報
S9: 不正コードマルウェア・ランサムウェアの生成
S10: 専門的助言資格を要する法的・医療的助言
S11: 個人情報PII の不正収集・漏洩
S12: 著作権侵害著作物の不正複製
S13: デフェイメーション名誉毀損・虚偽情報の流布

モデルバリエーション

モデルパラメータベース用途
Llama Guard 3 8B8BLlama 3.1-8B高精度・サーバーサイド
Llama Guard 3 1B1BLlama 3.2-1B軽量・エッジデバイス・多言語
Llama Guard 3 11B Vision11BLlama 3.2-11Bマルチモダル(テキスト+画像)

8B モデルは英語テキストの分類に最適化され、1B モデルは8言語(英・独・仏・伊・葡・西・ヒンディー・タイ)をサポートします。11B Vision モデルはテキストに加えて画像コンテンツの安全性も判定できます。

動作原理

Llama Guard 3 はテキスト分類タスクとして動作し、入力テキストに対して以下の形式で応答します。

安全な場合:

safe

危険な場合:

unsafe
S6

応答の1行目が safe / unsafe の二値分類、危険な場合は2行目に該当カテゴリコード(S1-S13)が出力されます。複数カテゴリに該当する場合はカンマ区切りで列挙されます。

ベンチマーク性能

ベンチマークLlama Guard 3 8BLlama Guard 2OpenAI Mod API
ToxicChat(F1)0.8820.8480.721
OpenAI Mod(F1)0.8450.8120.859
XSTest(F1)0.8940.8670.742
推論速度(tokens/s)180150N/A(API)

Llama Guard 3 は前世代の Llama Guard 2 から全ベンチマークで精度が向上しています。

統合パターン

Llama Guard 3 はガードレールシステムの判定エンジンとして、以下のパターンで統合されます。

統合先方式
NeMo Guardrails入力/出力レールの判定モデルとして設定
vLLM / TGI推論サーバーとしてデプロイし API 経由で呼び出し
Hugging Face Transformerspipeline("text-classification") で直接利用
Ollamaollama run llama-guard3 でローカル実行
Together AI / Fireworksクラウド API 経由(ホスティング不要)

推論コストとレイテンシ

デプロイ方式レイテンシコスト
vLLM(A100 40GB)50-100msGPU 時間コスト
Ollama(RTX 4090)80-150msローカル GPU
Together AI API100-200ms$0.20/M tokens
Llama Guard 3-1B(CPU)200-500msCPU のみで動作

8B モデルは GPU が必要ですが、1B モデルは CPU のみで実用的な速度で動作するため、コスト重視の環境に適しています。

FAQ

Q: Llama Guard 3 は商用利用可能?

A: はい、Llama 3.1 Community License に基づいて商用利用が可能です。月間アクティブユーザー7億人未満の組織は無償で利用できます。

Q: カスタムカテゴリの追加は可能?

A: プロンプトテンプレートを編集することで、デフォルトの13カテゴリに加えて独自のカテゴリを追加できます。ただし、追加カテゴリの精度はfine-tuning なしでは限定的です。

Q: 日本語コンテンツの分類精度は?

A: Llama Guard 3 8B は英語に最適化されており、日本語の精度は英語より低下します。日本語用途では Llama Guard 3-1B(多言語対応)の方が安定した結果が得られますが、日本語は公式サポート言語に含まれていないため、精度検証が推奨されます。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/20