RLHF人間フィードバック収集(アールエルエイチエフニンゲンフィードバックシュウシュウ)
RLHF人間フィードバック収集は、LLMの応答品質を評価するためにアノテーターがペア比較または絶対評価で嗜好ラベルを付与するプロセスである。Scale AI・Surge AI等のプラットフォームで実施され、データ品質がRLHFの成否を決定する最重要要素となる。
RLHF人間フィードバック収集は、LLMが生成した応答を人間が評価・ランキングし、報酬モデルの訓練データを作成するプロセスである。RLHFパイプラインの品質は「人間フィードバックの質と量」に最も強く依存するため、アノテーション設計は研究・実務の双方で最重要テーマとなっている。
概要
人間フィードバックの収集方法は大きく2つに分類される。ペア比較(Pairwise Comparison)は同一プロンプトに対する2つの応答のうち「どちらが良いか」を選ぶ形式で、InstructGPT・Llama 2が採用した。絶対評価(Likert Scale)は各応答に1〜5点などのスコアを付ける形式だが、アノテーター間のスケール認識の違いにより一致率が低下しやすい。2025年時点ではペア比較が主流である。
アノテーション設計の要素
- プロンプト分布: 対話・要約・翻訳・コーディング・推論など多様なタスクをカバー。InstructGPTは有害コンテンツ回避のプロンプトも意図的に含めた
- 応答生成: 同一プロンプトから温度0.7〜1.0で4〜8個の応答を生成し、ペアを構成。多様性確保のためTop-p サンプリングを使用
- 評価基準: 有用性(Helpfulness)・正確性(Correctness)・無害性(Harmlessness)の3軸が標準。Anthropic はさらに「正直さ(Honesty)」を追加
- タイブレーク: 甲乙つけがたい場合の「引き分け」ラベルの扱い。InstructGPTは引き分けを許容し約20%が引き分け判定
- ペア構成戦略: ランダムペアよりも「RMスコアが近い応答ペア」を優先的にアノテーションするActive Learningが効率的
アノテーター管理と品質保証
| 項目 | InstructGPT (2022) | Llama 2 (2023) | 業界標準 (2025) |
|---|---|---|---|
| アノテーター数 | 40人 | 非公開(数百人規模) | 50〜500人 |
| 選抜率 | 面接 + テスト | 多段階スクリーニング | テスト合格率20〜40% |
| IAA (Inter-annotator Agreement) | ~73% | ~76% | 70〜80% |
| 時給 | $15〜25 | 非公開 | $15〜40 |
| 1ペアあたりコスト | ~$1.50 | 非公開 | $0.50〜5.00 |
| 品質監査 | ゴールドセット + 定期レビュー | ゴールドセット + AI支援 | リアルタイム一致率監視 |
アノテーションプラットフォーム
- Scale AI: 最大手。GPT-4・Claude等の主要モデルのRLHFデータを提供。専門アノテーターチーム + AI品質管理。年間契約$100万〜規模
- Surge AI: RLHF特化。言語学・AI研究者のアノテーターを厳選。柔軟なカスタム評価基準。月$5万〜
- Amazon Mechanical Turk (MTurk): 低コスト($0.10〜0.50/ペア)だが品質にばらつき。研究用途向き
- Labelbox / Appen: 汎用ラベリング。RLHFワークフローのカスタム構築に対応。$1〜3/ペア
- 内製チーム: OpenAI・Anthropicは専属チームを保有。品質最高だが固定費が大きい
- AI-Assisted Annotation: GPT-4でフィルタリング後に人間が最終判断。Scale AI(2024年)で50%コスト削減を達成
データ品質の測定と改善
- Inter-annotator Agreement (IAA): 同一ペアを複数人が評価した一致率。70%未満は評価基準の再定義が必要
- ゴールドセット検証: 正解が明確なペア(明らかに一方が優れる)を混入し、アノテーターの正答率を監視。90%未満で警告、80%未満で除外
- 一貫性チェック: 同一アノテーターに時間差で同じペアを再提示し、自己一致率を測定。85%以上が目標
- バイアス検出: 長い応答を常に好む「長さバイアス」、特定フォーマットを好む「形式バイアス」を統計的に検出・補正
- 異常値除外: 回答時間が極端に短い(3秒未満)、パターン回答(常にAを選択)を自動フィルタリング
フィードバック収集の倫理的課題
- アノテーター福利: 有害コンテンツ(暴力・差別・性的表現)の評価は心理的負担が大きい。TIME誌(2023年)はOpenAI委託先のケニア人アノテーターが時給$2未満で有害コンテンツを分類していたと報道
- 文化バイアス: 英語圏アノテーターの価値観が他言語・文化圏に一般化されるリスク。多言語RLHFでは現地アノテーターの確保が課題
- 嗜好の多様性: 「良い応答」の定義は個人・文化・用途で異なる。一律の嗜好ラベルがマイノリティの価値観を排除する可能性
- アノテーター同意: データが将来のモデル訓練にどう使われるかの説明と同意取得の必要性
よくある質問(FAQ)
Q1: ペア比較と絶対評価のどちらが優れているか? A: ペア比較が優れている。人間は2つの選択肢の相対比較が得意で、Inter-annotator agreementもペア比較の方が10〜15ポイント高い。絶対評価は個人の基準ばらつきが大きく、スコアの校正が困難。ただし、多次元評価(有用性・正確性・安全性を個別スコアリング)には絶対評価が適する場合もある。
Q2: 最低何件のペア比較データでRLHFは効果があるか? A: 5,000〜10,000ペアで効果が見え始める。InstructGPTは33,000ペアで実用水準を達成した。ドメイン特化(医療・法律等)では少数でも高品質なアノテーションが重要で、1,000ペアの専門家アノテーションが10,000ペアの非専門家アノテーションを上回る事例がある。
Q3: アノテーション品質を上げるコツは? A: 評価基準(ガイドライン)の具体化が最重要。「有用な応答」ではなく「質問への直接回答 > 関連情報の提供 > 一般的アドバイス」のように明確な優先順位を定義する。また、アノテーターへの定期的なフィードバック(誤判定例の共有)とキャリブレーションセッション(チーム全体で同一ペアを評価・議論)が効果的。
まとめ
- ペア比較がRLHFフィードバック収集の標準形式。IAA 70〜80%が目標水準
- Scale AI・Surge AIが主要プラットフォーム。コストは$0.50〜5.00/ペア
- ゴールドセット検証・一貫性チェック・バイアス検出で品質を担保
- AI-Assisted Annotationでコスト50%削減が実現段階
- アノテーター福利・文化バイアスへの配慮が倫理的に重要