RLHF(アールエルエイチエフ)
Reinforcement Learning from Human Feedbackの略。人間の評価・比較データを報酬信号としてLLMを強化学習で最適化し、有害出力を減らし人間の好みに沿った応答を生成させる手法。
RLHF (Reinforcement Learning from Human Feedback) とは
RLHFはLLMを人間の価値観・好みに整合させるためのトレーニング手法。2022年OpenAIのInstructGPT論文で実証され、ChatGPTの成功を支えた技術的基盤として広く知られる。
RLHFパイプライン 3ステップ
Step 1: Supervised Fine-Tuning (SFT)
Pretrained LLM + 高品質Instruction Data → SFT Model
- 人間が書いた良質な指示-応答ペアで初期チューニング
- 基本的な指示追従能力を習得
Step 2: 報酬モデル (Reward Model) 学習
同じプロンプトへの複数応答 → 人間が順位付け
→ 比較データ → 報酬モデル学習
- ランキング比較: 「応答Aより応答Bの方が良い」
- Bradly-Terryモデルで順位を確率的スコアに変換
- 報酬モデルは応答の品質スコアを予測
Step 3: PPO強化学習
SFT Model (Actor) + Reward Model → PPO → RLHF Model
- Actor (SFT Model) がトークンを生成
- Critic (Value Model) が状態価値を推定
- KL正則化: SFTモデルから乖離しすぎないよう制約
- Reward Model でスコアリング → 強化学習更新
PPOの課題とDPOへの転換
PPOベースのRLHFは実装が複雑で4つのモデル(Actor/Critic/Reward/Reference)を同時学習する必要があり、不安定になりやすい。2023年のDPO (Direct Preference Optimization) がRLHFの簡略化版として提案され、2024〜2025年にかけてDPO/SimPO/ORPOが主流に移行しつつある。
人間フィードバックの収集コスト
| 規模 | フィードバック件数 | アノテーターコスト目安 |
|---|---|---|
| 小規模 | 5,000〜10,000件 | $50,000〜$200,000 |
| 中規模 | 50,000〜300,000件 | $500K〜$3M |
| OpenAI規模 | 数百万件 | 数千万ドル |
AI Feedback (RLAIF) でLLM自身に評価させることでコスト削減が進んでいる。
Constitutional AI (Anthropic)
Anthropicが開発したRLHFの変形版。人間フィードバックの代わりに「憲法(principles)」を設定し、AIが自己批判・改善ループで報酬信号を生成(RLAIF)。Claude 2以降に適用。
HHH原則
RLHFが達成を目指す三原則:
- Helpful (有用性): ユーザーの要求を的確に満たす
- Harmless (無害性): 有害・危険な出力を避ける
- Honest (誠実性): 事実を正確に伝え、不確かさを明示する
よくある質問 (FAQ)
Q1: RLHFなしのSFTモデルとRLHFモデルの違いは? A: SFTのみでは有害な指示に従う・政治的偏向を示す・根拠なく自信満々に回答する等の問題が残る。RLHFで「拒否すべき要求を断る」「不確かさを表明する」「倫理的に問題ある出力を避ける」能力が大幅向上する。
Q2: オープンソースでRLHFは実現できるか? A: TRL(HuggingFace)のPPOTrainer、OpenRLHF(分散対応)、DeepSpeed-ChatでオープンソースのRLHFパイプラインが実装可能。報酬モデルはOpenAssistant/reward-model-deberta等が公開されている。
Q3: RLHFとDPOどちらを使うべきか? A: 計算資源が限られる場合はDPOが圧倒的に簡単(報酬モデル不要・PPO不要)。最高品質の整合性が必要で大規模GPU利用可能ならRLHF(PPO)が依然強力。2025年現在DPO/SimPO系が主流。
まとめ
- ChatGPT誕生の核心技術
- SFT → 報酬モデル → PPO の3段階パイプライン
- 実装複雑性からDPO/SimPO/ORPOへの移行が進む
- Anthropic Constitutional AI (RLAIF) が人間フィードバックコストを削減