AI・機械学習
上級

RLHF(人間フィードバックによる強化学習)(アールエルエイチエフ)

LLMの出力を人間の好みに合わせて最適化する学習手法。報酬モデルと方策最適化を組み合わせ、有害出力の抑制や指示追従性の向上を実現する。

0 回閲覧
0 いいね
2026/6/20 更新

RLHFとは

RLHF(Reinforcement Learning from Human Feedback)は、大規模言語モデル(LLM)の出力品質を人間の評価基準に沿って改善するための学習パイプラインである。2022年のChatGPT登場以降、事実上すべての商用LLMが採用する標準的なアライメント手法となった。

RLHFの3段階パイプライン

RLHFは以下の3段階で構成される:

段階内容目的
Stage 1: SFT教師ありファインチューニング指示追従の基本能力を獲得
Stage 2: RM報酬モデル学習人間の好みをスコア化
Stage 3: RL強化学習(PPO等)報酬最大化で方策を最適化

Stage 1では人手でキュレーションした高品質な指示-応答ペアでSFTを実施する。Stage 2では同一プロンプトに対する複数応答を人間がランキングし、その選好データからBradley-Terryモデル等で報酬モデルを訓練する。Stage 3ではPPO(Proximal Policy Optimization)等の方策勾配法で、報酬モデルのスコアを最大化しつつKLダイバージェンス制約でSFTモデルからの過度な乖離を防ぐ。

報酬モデルの設計と課題

報酬モデルは人間のアノテータが付けた選好ラベルを学習する。典型的には対比較(pairwise comparison)形式で、応答AとBのどちらが良いかを判定する。

主な課題:

  • アノテータ間一致率: 専門性や文化背景の差異で評価がばらつく
  • 報酬ハッキング: モデルが報酬モデルの弱点を突いて高スコアを得る
  • 分布外汎化: 訓練時に見なかったプロンプト領域での精度低下

InstructGPT(2022)の論文では、アノテータ間一致率は約73%と報告されており、人間評価自体にノイズが含まれる点が根本的な制約である。

RLHFの代替手法との比較

手法報酬モデルRL最適化代表例
RLHF必要PPOInstructGPT, ChatGPT
DPO不要不要(暗黙的)Zephyr, Tülu 2
KTO不要不要Kahneman-Tversky Optimization
RLAIFAI生成PPOConstitutional AI

DPO(Direct Preference Optimization)はRLHFの報酬モデル訓練とRL最適化を単一の損失関数に統合し、実装の複雑さを大幅に削減した。一方、RLHFはオンライン学習が可能なため、反復的な改善ループに適している。

実装上の注意点

RLHFパイプラインの構築には以下のフレームワークが広く使われる:

  • TRL(Transformer Reinforcement Learning): Hugging Face公式、PPO/DPOトレーナー内蔵
  • OpenRLHF: 分散学習対応のRLHFフレームワーク
  • DeepSpeed-Chat: ZeRO最適化とRLHFの統合

GPU要件はモデルサイズに比例し、7Bモデルでも報酬モデル+方策モデル+参照モデルで最低3つのモデルを同時にメモリに保持する必要がある。A100 80GB×4枚が実用的な最小構成となる。

FAQ

Q: RLHFとSFTだけで十分ではないのか?

A: SFTは正解を模倣する「教師あり」学習であり、「何が良い応答か」の相対的な判断を学習できない。RLHFは人間の暗黙的な好みを報酬としてモデルに伝達し、有害性の低減や長文品質の向上といったSFTでは困難な改善を実現する。

Q: RLHFの訓練コストはどの程度か?

A: InstructGPTの報告では、175Bモデルに対するRLHF訓練で約800GPU時間(A100換算)。7B-13Bクラスでは数十〜数百GPU時間が目安だが、報酬モデル訓練用のアノテーションコスト(数万〜数十万件の選好データ)が支配的になることが多い。

Q: RLHFは今後も使われ続けるか?

A: DPOやKTOなどの簡易手法が台頭しているが、2026年時点でOpenAI・Anthropic・Google DeepMindの最先端モデルはいずれもRLHF系パイプラインを採用している。特にオンライン反復改善やマルチターン対話品質ではRLHFの優位性が報告されている。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/20