AI・機械学習
中級
RLHF 報酬モデル訓練(アールエルエイチエフホウシュウモデルクンレン)
人間フィードバックによる強化学習。人間の選好データで報酬モデルを訓練し、そのモデルを使いPPOでLLMをファインチューニングする手法。ChatGPT・Claude・Geminiなど主要LLMのアライメントに広く採用される。
0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
rlhf
reward-model
ppo
alignment
instruct
RLHF 報酬モデル訓練とは
RLHF(Reinforcement Learning from Human Feedback、人間フィードバックによる強化学習)は、大規模言語モデル(LLM)を人間の意図や価値観に沿うように調整するアライメント手法です。2022年のOpenAI「InstructGPT」論文で体系化され、ChatGPT・Claude・Gemini・Llama-2(チャット版)など、現在の主要なチャットLLM訓練の基盤技術となっています。
RLHFの3段階プロセス
Step 1: SFT(Supervised Fine-Tuning)
まず、高品質なデモンストレーションデータで事前学習済みモデルを教師ありファインチューニングします。
- 人間のAIトレーナーが理想的な回答を作成
- 多様なプロンプトタイプ(要約・翻訳・QA・コーディング等)をカバー
- InstructGPTでは約13,000件のデモデータを使用
Step 2: 報酬モデル(RM)の訓練
SFTモデルが生成した複数の出力を人間が比較評価し、その選好データから報酬モデルを訓練します。
- 同じプロンプトに対して4〜9個の異なる回答を生成
- 人間のアノテーターがランキングを付ける
- Bradley-Terryモデル等でランキングを選好確率に変換
- 報酬モデルはスカラー値(報酬スコア)を出力するよう訓練
Step 3: PPOによる強化学習
報酬モデルを報酬関数として使い、PPO(Proximal Policy Optimization)でSFTモデルを最適化します。
最大化する目標: E[r_θ(x,y)] - β × KL[π_RL(y|x) ∥ π_SFT(y|x)]
- r_θ(x,y): 報酬モデルのスコア
- KLペナルティ: SFTモデルから大きく逸脱しないよう制約
- β: KLペナルティの強さを制御するハイパーパラメータ
RLHFの限界と代替手法
RLHFは有効な手法ですが、以下の課題があります。
- 報酬ハッキング: モデルが報酬モデルの評価を意図せず操作する
- 計算コスト: PPOは計算コストが高く、LLMスケールでは特に負担が大きい
- アノテーションバイアス: 人間の評価者の偏りや不一致が報酬モデルに伝播
これらを改善した手法として以下が登場しています。
- DPO(Direct Preference Optimization): PPOを使わず直接選好データからモデルを最適化
- ORPO(Odds Ratio Preference Optimization): SFTとRLHFを同時に実行するシングルパス手法
- IPO(Identity Preference Optimization): 報酬のオーバーフィッティングを防ぐ手法
- SimPO(Simple Preference Optimization): 参照モデル不要でシンプルな実装
主要LLMでの採用実績(2022〜2025年)
- InstructGPT(2022): RLHF体系化の論文。GPT-3を1.3Bパラメータ版RMで調整
- ChatGPT(2022): InstructGPTのスケールアップ版
- Claude 1/2/3(2023〜2024): Constitutional AIとRLHFの組み合わせ
- Llama-2-Chat(2023): MetaがオープンソースRLHF版Llamaモデルを公開
- Gemini Ultra(2024): マルチモーダルRLHFの適用
日本語LLMへの応用
Swallowシリーズ(東京工業大学)・Sarashina2(SB Intuitions)などの日本語LLMでも、日本語選好データを用いたRLHFが適用されています。日本語固有の文化的配慮(敬語・丁寧さ・文脈依存の礼儀)をRLHFで組み込む研究も進んでいます。