AI・機械学習
上級

IPO (Identity Preference Optimization) 2024(アイピーオーアイデンティティプレファレンスオプティマイゼーション2024)

Azar ら DeepMind 2024年 LLM alignment 手法。DPO の過剰最適化問題を理論的に修正・Identity mapping で deterministic preference を扱える

0 回閲覧
0 いいね
2026/5/23 更新
関連タグ
LLM
アライメント
IPO
DPO改良
DeepMind
2024
Identity Mapping

概要

IPO(Identity Preference Optimization)は 2024年1月に Google DeepMind の Mohammad Gheshlaghi Azar・Mark Rowland・Bilal Piot・Daniel Guo ら 5名が arXiv:2310.12036 v2 で発表した DPO 改良版手法(論文「A General Theoretical Paradigm to Understand Learning from Human Preferences」)。DPO が Bradley-Terry 選好モデルを使うために発生する過剰最適化問題(chosen の確率を 1・rejected の確率を 0 に押し付ける極端な収束)を、Identity mapping を Bradley-Terry の代わりに用いることで理論的に解決。

論文では Ψ-PO(Psi Preference Optimization)という一般的フレームワークを提案し、Ψ = log とすると DPO、Ψ = Identity (恒等関数) とすると IPO となる関係を示した。IPO は deterministic preference(決定論的選好、確率 0 か 1)でも崩壊しないため、ハードな選好データ(明確な勝ち負け)に適している。

主な特徴・仕組み

  • 理論基盤: Ψ-PO 一般フレームワーク・Ψ = Identity (恒等関数)
  • 損失関数: L_IPO = E[(x,y_w,y_l)~D] [(log(π_θ(y_w|x)/π_ref(y_w|x)) - log(π_θ(y_l|x)/π_ref(y_l|x)) - 1/(2β))²]
  • β パラメータ: 0.01-0.1(DPO より小さめ、強い正則化)
  • データ形式: (prompt, chosen, rejected) ペア(DPO と同じ)
  • 収束特性: deterministic preference でも π_θ が極端化せず安定
  • 計算コスト: DPO と同等
  • 理論的優位: Bradley-Terry の前提(選好の確率モデル)を必要としない
  • 応用範囲: 明確な勝ち負けの選好データ(数学問題の正解 vs 不正解等)に最適
  • OS バージョン: v1 (2023-10)・v2 (2024-01 IPO 命名)・v3 (2024-03 改良)

スペック比較表

項目IPO 2024DPO 2023KTO 2024ORPO 2024
過剰最適化耐性強弱中中
Deterministic Preference対応可崩壊リスク対応可対応可
Reference Model必要必要必要不要
β 範囲0.01-0.10.1-0.50.1-
理論基盤Identity (Ψ-PO)Bradley-Terryプロスペクト理論Odds Ratio

具体例・対応製品

  • IPO Llama 2 7B (DeepMind 2024-01): 論文 baseline、UltraFeedback で DPO 比較
  • Smaug 72B (Abacus AI 2024-02): Llama 2 70B + IPO、HuggingFace Open LLM Leaderboard 1位(当時)
  • Snorkel Mistral PairRM DPO+IPO 2024: Mistral 7B + IPO ハイブリッド、MT-Bench 8.0+
  • IPO Mistral 7B (Hugging Face 2024-02): TRL 標準実装による community fine-tune
  • Tulu IPO 70B (AI2 2024-04): AI2 Tulu 2 の IPO 再学習版

選び方・注意点

  • 過剰最適化対策: DPO 学習で chosen 確率が 0.99 を超え始めたら IPO 切替検討
  • β 設定: DPO の 1/10 程度(0.01-0.1)が標準、強い正則化が IPO 本領
  • deterministic data: 数学問題正解・コードコンパイル成否等の明確データに最適
  • DPO との性能差: 通常データでは僅差、極端データでは IPO 圧倒的優位
  • 計算コストは DPO と同等: 損失関数の式が変わるだけで実装容易
  • TRL DPOTrainer の loss_type='ipo': 1行変更で切替可能

関連用語との違い

用語違い
IPO 2024Identity mapping・deterministic preference 対応
DPO 2023Bradley-Terry・過剰最適化リスクあり
KTO 2024プロスペクト理論・単発ラベル可
ORPO 2024SFT 統合・reference 不要
SimPO 2024更に簡素化・reference 不要

よくある質問(FAQ)

Q1: なぜ DPO は過剰最適化する? A: Bradley-Terry モデルは選好確率 σ(r_w - r_l) を最大化するため、reward 差を無限大にすることで最適化が進む。結果として π_θ(y_w) → 1 ・π_θ(y_l) → 0 という極端な分布に collapse する。IPO は二乗誤差形式で reward 差を 1/(2β) に固定し、この暴走を防止。

Q2: Ψ-PO フレームワークとは? A: 一般的選好最適化を Ψ 関数で統一表現する理論。Ψ = log で DPO、Ψ = Identity で IPO、他の Ψ 設計で新手法が無数に派生可能。DeepMind の理論的貢献として高く評価されている。

Q3: IPO は DPO の上位互換? A: 通常データでは差は誤差範囲(DPO で十分)、極端データ・長時間学習では IPO 優位。ベストプラクティスは DPO で学習開始し、過剰最適化兆候が出たら IPO に切替えるハイブリッド運用。

まとめ

  • Google DeepMind 2024年1月発表・DPO 改良版
  • Identity mapping で過剰最適化問題を理論的解決
  • Ψ-PO 一般フレームワークの特殊ケース
  • Smaug 72B 等で実証・HuggingFace Open LLM Leaderboard 1位達成
  • TRL DPOTrainer の loss_type=ipo で簡単切替可
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/5/23