AI・機械学習
上級
RRHF(Rank Responses to Align Language Models with Human Feedback)(アールアールエイチエフ ランク レスポンシズ トゥ アライン ランゲージモデルズ ウィズ ヒューマン フィードバック)
LLMが生成した複数応答をランキング学習で整合するPPO不要のRLHF代替手法。報酬モデルでスコアリングした応答をランキング損失で学習し、高コストのPPO最適化なしに人間の選好をモデルに反映する。
0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
LLM
RLHF
ランキング学習
選好最適化
PPO代替
RRHF(Rank Responses to Align Language Models with Human Feedback)とは
RRHF(Rank Responses to Align Language Models with Human Feedback)は、2023年にAlibaba DAMO AcademyのYuan et al.が提案したLLM整合手法。「PPOは強力だが複雑すぎる」という問題意識から、ランキング学習(Learning to Rank)の枠組みでRLHFを再実装し、実装の簡潔さと学習安定性を両立させることを目指している。
アルゴリズムの概要
学習データの構成
- 同一プロンプト x に対してN個の応答を生成(複数モデルや温度サンプリングで取得)
- 報酬モデル R(x, y_i) で各応答をスコアリング
- スコア順にランキング: 最高スコアから最低スコアへソート
ランキング損失
ペアワイズランキングロスを使用。より高スコアな応答の対数確率が低スコアより高くなるように学習する。SFTロス(最良応答のクロスエントロピー)とランキングロスを組み合わせたトータルロスで最適化する。
PPOとの違い
主な比較:
- PPO-RLHF: Policy Gradient(オンラインRL)、参照モデル必要、Critic(Value Function)必要、学習の安定性が不安定、実装複雑度高
- RRHF: ランキング損失(教師あり)、参照モデルはオプション、追加モデル不要、安定、実装複雑度低
性能と実験結果
Summarizationタスク・指示追従タスクでの評価:
- Summarization(TL;DR): PPO-RLHFと同等のスコアを達成
- Alpaca指示追従: SFT単体より顕著な改善
- 学習安定性: PPOで発生する報酬崩壊がRRHFでは観察されにくい
RRHFの位置づけ
2023年に登場した「PPO-free RLHF代替」の初期世代に属し、後続のDPO・ORPO・SimPOなどの洗練された手法の先駆けとなった。DPOがBradley-Terryモデルの解析的解として優雅に定式化されたのに対し、RRHFはより直感的なランキング学習の枠組みから整合を実現している点で、研究上の価値と教育的意義が高い。
実装状況
RRHFはHugging Face TRLで直接サポートされているわけではないが、RewardTrainerと組み合わせた実装が複数GitHubで公開されており、比較的容易に試せる手法として研究コミュニティで使われている。