RLVR(Reinforcement Learning with Verifiable Rewards)(アールエルブイアール)
検証可能な報酬関数のみを使用してLLMを強化学習する枠組み。数学の正誤判定やコード実行結果など決定論的に検証できる報酬を用い、報酬モデルの誤り(ハッキング)を排除してスケーラブルな訓練を実現する。
RLVR(Reinforcement Learning with Verifiable Rewards)とは
RLVR(Reinforcement Learning with Verifiable Rewards)は、LLMの強化学習ポストトレーニングにおいて、検証可能な(verifiable)報酬関数のみを使用する枠組みです。DeepSeek-R1の論文(2025年1月)で体系的に提唱され、学習済み報酬モデルに依存しないスケーラブルなRL訓練の実現方法として注目を集めています。
RLVRの背景:報酬モデルの限界
従来のRLHF(Reinforcement Learning from Human Feedback)では、人間の選好データで訓練した**報酬モデル(Reward Model)**を使って方策を最適化します。しかしこのアプローチには根本的な問題があります:
- 報酬ハッキング — 方策が報酬モデルの欠陥を悪用し、人間には低品質に見えるが高スコアな応答を生成
- 分布シフト — 方策が進化するにつれ報酬モデルの訓練分布から外れていく
- スケーリングの難しさ — 報酬モデルも継続的に更新が必要で運用コストが高い
RLVRはこれらの問題を、「そもそも学習済み報酬モデルを使わない」という根本的な解決策で対処します。
RLVRの仕組み
RLVRで使用できる報酬関数は、以下の特性を持つタスクに限定されます:
適用可能なタスクと報酬例:
- 数学問題 → 最終答えが正解と一致するか(0/1)
- コーディング → 単体テストの通過率(0.0〜1.0)
- 論理パズル → 解の制約条件を満たすか(0/1)
- 形式検証 → JSON/XML等のスキーマ適合性(0/1)
- クイズ → 答えが正規表現パターンに一致するか
これらはすべて決定論的に計算可能なため、人間の判断も報酬モデルも不要です。
RLVR vs RLHF vs RLAIF
RLHFは人間フィードバックを報酬源とし報酬ハッキングリスクが高く、スケーラビリティは低いです。RLAIFはAI判定モデルを使用し中程度のリスクと適用範囲を持ちます。一方RLVRはルールベース検証を報酬源とし報酬ハッキングが発生しないため、スケーラビリティは最高ですが適用範囲は検証可能なタスクに限定されます。
DeepSeek-R1-ZeroにおけるRLVR
DeepSeek-R1-ZeroはSFTなし・RLVR単体で訓練されたモデルです。事前学習済みのDeepSeek-V3-Baseに対してGRPO+RLVRのみを適用し、明示的な指示なしに長い推論チェーンを自発的に生成するようになりました。これはRLVRがモデルの「思考能力」を引き出せることを実証した重要な事例です。
RLVRのスケーリング則
近年の研究では、RLVRには独自のスケーリング則が存在することが示されています:
- テストタイムスケーリング — 推論トークン数を増やすほど性能が向上
- モデルサイズスケーリング — 大きなモデルほどRLVRの効果が大きい
- 訓練データスケーリング — 問題の多様性が重要(難易度の幅が広いほど良い)
実装上の考慮点
報酬関数の設計では、数学において「最終答えのみ」か「途中ステップも」かで性能が変わります。Process Reward Model(PRM)と組み合わせたハイブリッドアプローチも有効です。難しい問題では0/1報酬が常に0になり学習信号がなくなる「報酬の希薄性」も課題で、問題難易度のキュリキュラム学習や部分点を与えるステップ報酬が対策として有効です。
まとめ
RLVRは「検証可能な答えが存在するタスク」において、報酬モデルなしでLLMの推論能力を大幅に向上できることを示した重要な概念です。数学・コーディング・科学分野でのLLM訓練の主流手法となっており、GRPO・DAPO・veRLなどのアルゴリズムと組み合わせて広く活用されています。