AI・機械学習
上級

RLHF(アールエルエイチエフ)

Reinforcement Learning from Human Feedbackの略。人間の評価・比較データを報酬信号としてLLMを強化学習で最適化し、有害出力を減らし人間の好みに沿った応答を生成させる手法。

0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
LLM
強化学習
PPO
報酬モデル
アライメント
HHH

RLHF (Reinforcement Learning from Human Feedback) とは

RLHFはLLMを人間の価値観・好みに整合させるためのトレーニング手法。2022年OpenAIのInstructGPT論文で実証され、ChatGPTの成功を支えた技術的基盤として広く知られる。

RLHFパイプライン 3ステップ

Step 1: Supervised Fine-Tuning (SFT)

Pretrained LLM + 高品質Instruction Data → SFT Model
  • 人間が書いた良質な指示-応答ペアで初期チューニング
  • 基本的な指示追従能力を習得

Step 2: 報酬モデル (Reward Model) 学習

同じプロンプトへの複数応答 → 人間が順位付け
→ 比較データ → 報酬モデル学習
  • ランキング比較: 「応答Aより応答Bの方が良い」
  • Bradly-Terryモデルで順位を確率的スコアに変換
  • 報酬モデルは応答の品質スコアを予測

Step 3: PPO強化学習

SFT Model (Actor) + Reward Model → PPO → RLHF Model
  • Actor (SFT Model) がトークンを生成
  • Critic (Value Model) が状態価値を推定
  • KL正則化: SFTモデルから乖離しすぎないよう制約
  • Reward Model でスコアリング → 強化学習更新

PPOの課題とDPOへの転換

PPOベースのRLHFは実装が複雑で4つのモデル(Actor/Critic/Reward/Reference)を同時学習する必要があり、不安定になりやすい。2023年のDPO (Direct Preference Optimization) がRLHFの簡略化版として提案され、2024〜2025年にかけてDPO/SimPO/ORPOが主流に移行しつつある。

人間フィードバックの収集コスト

規模フィードバック件数アノテーターコスト目安
小規模5,000〜10,000件$50,000〜$200,000
中規模50,000〜300,000件$500K〜$3M
OpenAI規模数百万件数千万ドル

AI Feedback (RLAIF) でLLM自身に評価させることでコスト削減が進んでいる。

Constitutional AI (Anthropic)

Anthropicが開発したRLHFの変形版。人間フィードバックの代わりに「憲法(principles)」を設定し、AIが自己批判・改善ループで報酬信号を生成(RLAIF)。Claude 2以降に適用。

HHH原則

RLHFが達成を目指す三原則:

  • Helpful (有用性): ユーザーの要求を的確に満たす
  • Harmless (無害性): 有害・危険な出力を避ける
  • Honest (誠実性): 事実を正確に伝え、不確かさを明示する

よくある質問 (FAQ)

Q1: RLHFなしのSFTモデルとRLHFモデルの違いは? A: SFTのみでは有害な指示に従う・政治的偏向を示す・根拠なく自信満々に回答する等の問題が残る。RLHFで「拒否すべき要求を断る」「不確かさを表明する」「倫理的に問題ある出力を避ける」能力が大幅向上する。

Q2: オープンソースでRLHFは実現できるか? A: TRL(HuggingFace)のPPOTrainer、OpenRLHF(分散対応)、DeepSpeed-ChatでオープンソースのRLHFパイプラインが実装可能。報酬モデルはOpenAssistant/reward-model-deberta等が公開されている。

Q3: RLHFとDPOどちらを使うべきか? A: 計算資源が限られる場合はDPOが圧倒的に簡単(報酬モデル不要・PPO不要)。最高品質の整合性が必要で大規模GPU利用可能ならRLHF(PPO)が依然強力。2025年現在DPO/SimPO系が主流。

まとめ

  • ChatGPT誕生の核心技術
  • SFT → 報酬モデル → PPO の3段階パイプライン
  • 実装複雑性からDPO/SimPO/ORPOへの移行が進む
  • Anthropic Constitutional AI (RLAIF) が人間フィードバックコストを削減
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/6