RLHF安全アライメント(アールエルエイチエフアンゼンアライメント)
人間フィードバックからの強化学習(RLHF)を用い、LLMを有益・無害・正直な方向に誘導する安全性調整技術。
RLHF安全アライメントとは
RLHF(Reinforcement Learning from Human Feedback)安全アライメントは、大規模言語モデル(LLM)が有害・虚偽・有害なコンテンツを生成しないよう人間の価値観に沿わせる技術的プロセスです。単に「役に立つ」だけでなく「安全で正直」なモデルを作ることを目標とします。
3段階のトレーニングパイプライン
1. 教師あり学習(SFT)
- 人間の専門家が書いた理想的な応答例でベースモデルを微調整
- 数千〜数十万件のデモデータが必要
- モデルに「望ましい応答スタイル」を学習させる初期段階
2. 報酬モデル(RM)学習
- 同一プロンプトに対する複数の応答を人間が比較採点
- Bradley-Terryモデルなどで好み順序から報酬関数を学習
- 「より安全・より役立つ・より正直」な応答に高スコアを与える
3. 強化学習最適化(PPO)
- Proximal Policy Optimization(近位方策最適化)で報酬最大化
- KLダイバージェンス正則化でオリジナルモデルからの逸脱を防止
- 報酬ハッキング(reward hacking)を防ぐための係数調整が重要
主要な実装例
InstructGPT(OpenAI 2022年)がRLHFを商用LLMに初適用。ChatGPTはInstructGPT手法をスケールアップ。Claude(Anthropic)はConstitutional AI + RLHF。Llama 2 Chat(Meta)はオープンソースでRLHF公開。
RLHFの課題と限界
スケーラビリティ問題: 人間評価者のコストが高く、スケールに限界がある。解決策としてAIフィードバック(RLAIF)が登場。
評価者バイアス: 文化・教育背景による評価のばらつきが報酬モデルに偏見を注入する可能性。
報酬ハッキング: モデルが報酬モデルの抜け穴を利用し、人間には好ましく見えるが実際には有害な応答を生成する現象。
RLHF vs 代替手法
DPO(Direct Preference Optimization): RLHFのPPOステップを省略し、好みデータから直接微調整。計算コスト削減・安定性向上。
Constitutional AI(CAI): Anthropicの手法。人間フィードバックの代わりにAIが憲法的原則に基づいて自己批判・修正。
評価指標
HHH(Helpful, Harmless, Honest)ベンチマーク・WinRate(人間比較勝率)・TruthfulQA(事実性評価)・BBQ/StereoSet(バイアス測定)・RED-EVAL(有害プロンプト拒否率)が主要指標。
自作PCユーザーへの関連性
OllamaでLlama 3やGemmaをローカル実行する際、RLHFチューニング済みモデル(-instructや-chatバリアント)はベースモデルより安全で使いやすい。モデル選択時の参考指標となる。