AI・機械学習
上級

RLHF(人間のフィードバックによる強化学習)(アールエルエイチエフ)

Reinforcement Learning from Human Feedbackの略。人間の評価者がモデル出力を比較ランク付けし、その選好データで報酬モデルを学習、さらにPPO等の強化学習でLLMを最適化する手法。ChatGPTの成功を支えた中核技術。

0 回閲覧
0 いいね

RLHF(人間のフィードバックによる強化学習)とは

RLHF(Reinforcement Learning from Human Feedback)とは、人間の評価者による選好フィードバックを活用して、大規模言語モデル(LLM)の出力を人間の意図や価値観に合わせて最適化する手法である。OpenAIがInstructGPT(2022年)およびChatGPT(2022年11月)で採用し、LLMの実用化を飛躍的に加速させた。

RLHFの3段階パイプライン

RLHFは以下の3段階で構成される。

段階プロセス入力出力
Stage 1: SFT教師あり微調整高品質プロンプト+応答ペアSFTモデル
Stage 2: RM報酬モデル学習人間による出力ペア比較データ報酬モデル
Stage 3: PPO強化学習最適化SFTモデル+報酬モデル最終モデル

Stage 1(SFT): 高品質な指示-応答ペアでモデルを教師あり微調整する。InstructGPTでは約13,000件の人手作成データを使用。

Stage 2(報酬モデル学習): 同一プロンプトに対するモデルの複数出力を人間評価者が「AよりBが好ましい」とランク付けし、その選好データでBradley-Terryモデルなどに基づく報酬モデルを学習する。InstructGPTでは約33,000件の比較データを収集した。

Stage 3(PPO最適化): 報酬モデルをスカラー報酬として、Proximal Policy Optimization(PPO)でSFTモデルを強化学習する。KLダイバージェンスペナルティで元モデルから過度に乖離しないよう制約をかける。

RLHFの成功と限界

RLHFはChatGPTの爆発的成功を支え、「事前学習だけでは不十分」「人間のフィードバックが品質の鍵」という認識をAI業界に確立した。しかし複数の限界も明らかになっている。

  • 人間評価のコスト: 大規模な比較データ収集には数百万ドル規模のコストがかかる
  • 評価者バイアス: 評価者の文化的背景・専門知識の偏りが報酬モデルに反映される
  • 報酬ハッキング: モデルが報酬モデルの抜け穴を利用し、人間の本来の意図と乖離した出力を学習する
  • PPOの学習不安定性: ハイパーパラメータ調整が困難で、学習が発散しやすい

RLHFの後継手法

RLHFの限界を克服するために多くの後継手法が提案されている。

手法提案者特徴
DPOStanford (2023)報酬モデル不要、直接選好最適化
KTOEthayarajh et al. (2024)ペア比較不要、good/bad二値で学習
IPOAzar et al. (2023)DPOの過学習問題を改善
ORPOHong et al. (2024)SFTとアラインメントを統合
Constitutional AIAnthropic (2022)AI自身が原則に基づき自己評価

DPOはRLHFのStage 2-3を1段階に統合し、報酬モデル学習とPPO最適化を不要にした画期的な手法である。2024年以降、多くのオープンソースモデルがRLHFからDPOに移行している。

FAQ

Q1: RLHFとRLAIFの違いは?

RLAIF(RL from AI Feedback)は人間の代わりにAIモデルが評価を行う手法である。Google DeepMindが提唱し、Anthropic Constitutional AIが代表的な実装である。人間評価のコスト問題を解決するが、AIの評価バイアスが新たな課題となる。

Q2: ChatGPTは今もRLHFを使っている?

OpenAIは具体的な手法を公開していないが、GPT-4以降もRLHFベースのアラインメントを継続していると推測されている。ただし人間評価者の規模・報酬モデルの構成・PPOの詳細は非公開である。

Q3: 個人でRLHFを実装できる?

Hugging FaceのTRL(Transformer Reinforcement Learning)ライブラリを使えば、小規模なRLHFパイプラインを構築可能である。ただしStage 2の人間比較データ収集がボトルネックとなるため、個人規模ではDPOの方が実用的である。