RLHF(人間フィードバックによる強化学習)(アールエルエイチエフ)
RLHF(Reinforcement Learning from Human Feedback)は、人間の嗜好データを用いてLLMの出力品質を改善する強化学習手法である。OpenAIのInstructGPT論文(2022年)で体系化され、SFT(教師ありファインチューニング)→RM(報酬モデル学習)→PPO(強化学習最適化)の3段階パイプラインが標準となった。
RLHF(Reinforcement Learning from Human Feedback)は、大規模言語モデル(LLM)の出力を人間の好みに合わせて最適化する強化学習手法である。2022年にOpenAIが発表したInstructGPT論文で3段階パイプライン(SFT→RM→PPO)として体系化され、ChatGPTの品質を支える中核技術となった。
概要
RLHFは「人間が望む応答」を数値化し、モデルの方策(ポリシー)を強化学習で最適化する枠組みである。従来の教師あり学習(SFT)だけでは「正解テキスト」の定義が曖昧な自由形式タスク(対話・要約・創作)で限界があった。InstructGPT(Ouyang et al., 2022)はパラメータ数1.3BのSFTモデルが175BのGPT-3を人間評価で上回ることを示し、RLHFの有効性を実証した。2023年以降、Llama 2(Meta)、Claude(Anthropic)、Gemini(Google DeepMind)など主要LLMがRLHFまたはその派生手法を採用している。
RLHFの3段階パイプライン
RLHFは以下の3段階で構成される:
- Stage 1: SFT(Supervised Fine-Tuning) — 事前学習済みモデルを高品質な指示-応答ペア(通常1万〜10万件)で教師あり微調整する。InstructGPTでは約13,000件のデモンストレーションデータを使用した
- Stage 2: RM(Reward Model)学習 — 同一プロンプトに対する2つ以上の応答を人間が「どちらが良いか」比較評価し、そのペア比較データ(InstructGPTでは約33,000件)から報酬関数を学習する
- Stage 3: PPO(Proximal Policy Optimization) — 学習した報酬モデルのスコアを報酬信号として、SFTモデルをPPOアルゴリズムで強化学習する。KLペナルティにより参照ポリシー(SFTモデル)からの過度な乖離を抑制する
主要なRLHF実装の比較
| モデル/手法 | 開発元 | RM規模 | 比較データ量 | RL手法 | 公開年 |
|---|---|---|---|---|---|
| InstructGPT | OpenAI | 6B | 33K ペア | PPO | 2022 |
| Llama 2-Chat | Meta | 70B | 100万+ ペア | Rejection Sampling + PPO | 2023 |
| Claude 2 | Anthropic | 非公開 | 非公開 | RLHF + Constitutional AI | 2023 |
| Gemini | Google DeepMind | 非公開 | 非公開 | RLHF系 | 2023 |
| GPT-4 | OpenAI | 非公開 | 非公開 | RLHF(詳細非公開) | 2023 |
RL手法の選択肢と比較
RLHFの強化学習フェーズでは複数のアルゴリズムが使い分けられる:
- PPO(Proximal Policy Optimization): InstructGPT標準。クリッピングにより方策更新を安定化。ε=0.2が一般的。ただしハイパーパラメータ感度が高く、学習が不安定になりやすい
- Rejection Sampling(Best-of-N): N個の応答を生成しRMスコア最上位を選択。Meta Llama 2で採用。PPOより実装が単純だが推論コストがN倍になる
- DPO(Direct Preference Optimization): 報酬モデルを明示的に学習せず、嗜好データから直接ポリシーを最適化。Rafailov et al.(2023)提案。メモリ効率が高くPPOと同等性能を達成
- KTO(Kahneman-Tversky Optimization): ペア比較ではなく個別の良い/悪い判定データで学習可能。データ収集コストを大幅削減
- ORPO(Odds Ratio Preference Optimization): SFTとアラインメントを1段階で同時実行。Kim et al.(2024)提案
RLHFの課題と限界
- 報酬ハッキング(Reward Hacking): モデルがRMの抜け穴を悪用し、人間評価とは乖離した高スコア応答を生成する問題。長文化・過剰な丁寧さ・冗長な箇条書きなどの症状が典型的
- アノテーションコスト: InstructGPTでは40人のアノテーターを雇用。Llama 2では100万件以上のペア比較を収集。1件あたり$1〜5のコストで大規模データ収集は数百万ドル規模
- アノテーター間一致率: 人間の嗜好判断は主観的であり、Inter-annotator agreement(IAA)は典型的に70〜80%程度。文化・言語・専門性による偏りも課題
- 能力低下(Alignment Tax): RLHF適用後に一部のベンチマーク性能が低下する現象。コーディング能力や数学的推論で報告される事例がある
- 分布シフト: PPO訓練中にモデルの出力分布がRMの学習分布から逸脱し、RMの評価精度が低下する問題
よくある質問(FAQ)
Q1: RLHFとDPOはどちらを使うべきか? A: 2025〜2026年時点ではDPOが主流化しつつある。PPO-RLHFは理論的に最も一般的だが実装・チューニング難易度が高い。計算資源が限られる場合やデータ規模が中小(10万件以下)ならDPOが実用的。超大規模モデル(100B+)では依然としてPPO-RLHFが採用されるケースもある。
Q2: RLHFのアノテーションデータはどのくらい必要か? A: InstructGPTは約33,000ペアで実用水準を達成した。Llama 2は100万件以上を使用してさらに品質を向上させた。一般的には最低5,000〜10,000ペアから効果が見え始め、10万件以上で安定した品質改善が期待できる。ドメイン特化(医療・法律等)では少数でも高品質なアノテーションが重要。
Q3: オープンソースでRLHFを実装できるツールは? A: TRL(Transformer Reinforcement Learning、Hugging Face)がデファクト標準で、PPO・DPO・KTOを統一APIで提供する。DeepSpeed-Chat(Microsoft)はZeRO最適化との統合が強み。OpenRLHF(2024年公開)は分散学習に特化。AlignBot(2025年)はローコードでRLHFパイプラインを構築できる。
Q4: RLHFなしでアラインメントは達成できるか? A: Constitutional AI(Anthropic)はRLAIF(AI Feedback)で人間ラベルを大幅削減した。Self-Play Fine-Tuning(SPIN、2024年)はモデル自身の出力を使って反復改善する。Instruction-Following Evaluation(IFEval)のような自動評価ベンチマークでフィードバックを代替する研究も進んでいる。完全に人間を排除するのは困難だが、必要量を10分の1以下に削減する手法は実用段階にある。
まとめ
- RLHFはSFT→RM→PPOの3段階でLLMを人間の嗜好に合わせる強化学習手法
- InstructGPT(2022年)が体系化し、ChatGPT・Llama 2・Claude等の主要モデルが採用
- DPO・KTO・ORPOなどの軽量代替手法が台頭し、2025年時点でRLHFの選択肢は多様化
- 報酬ハッキング・アノテーションコスト・能力低下が主要課題
- TRL(Hugging Face)を中心にオープンソースツールが充実し、個人開発者でも実装可能になりつつある