AI・機械学習
上級

IPO(Identity Preference Optimization)(アイピーオーアイデンティティプリファレンスオプティミゼーション)

DPOの過学習問題を解決するアライメント手法。ブラッドリー・テリーモデルへの依存を排除し、(margin)^2ベースの二乗損失でポリシーを最適化。Google DeepMindが2024年に提案。データ量が少ない場合に特に安定。

0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
アライメント
選好最適化
DPO改善
LLM
Google DeepMind

IPO(Identity Preference Optimization)とは

IPO(Identity Preference Optimization)は、Google DeepMindが2024年に提案したLLMアライメント手法で、DPO(Direct Preference Optimization)の理論的な欠点を改善したものです。DPOがBradley-Terryモデルの仮定に依存していることから生じる過学習問題を解消します。

DPOの過学習問題とIPOの解法

DPOの過学習問題

DPOは学習が進むと:

  • 好ましい応答(chosen)の確率が過度に高くなる
  • 好ましくない応答(rejected)の確率が過度に低くなる
  • 参照モデルから大きく乖離してしまう

この「過適合」は特にデータ量が少ない場合や、チューニングエポック数が多い場合に顕著です。

IPOの解法

IPOはBradley-Terryモデルへの依存を排除し、選好確率に直接依存しない損失関数を設計します。

IPO損失関数

IPOの損失関数は:

# IPO損失の概念
# h = log π_θ(y_w|x)/π_ref(y_w|x) - log π_θ(y_l|x)/π_ref(y_l|x)
# IPO: L = (h - 1/(2*tau))^2
# DPO: L = -log_sigmoid(beta * h)

def ipo_loss(chosen_ratio, rejected_ratio, tau=0.1):
    h = chosen_ratio - rejected_ratio
    loss = (h - 1.0 / (2.0 * tau)) ** 2
    return loss

(h - 1/(2τ))^2 という二乗損失形式が特徴で、hが 1/(2τ) に向かって収束するよう設計されています。これにより過学習が防がれます。

DPOとIPOの比較

項目DPOIPO
損失形式-log_sigmoid二乗損失
理論基盤Bradley-Terry直接選好
過学習リスク高め低め
実装複雑さ低低(同程度)
データ効率標準データ少で優位

実装(TRLライブラリ)

HuggingFace TRLではDPOTrainerのloss_typeパラメータでIPOを指定できます。

from trl import DPOTrainer, DPOConfig

training_args = DPOConfig(
    beta=0.1,
    loss_type="ipo",
    output_dir="./ipo-model",
    num_train_epochs=3,
)

trainer = DPOTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset,
    tokenizer=tokenizer,
)
trainer.train()

理論的な優位性

IPOは選好データが以下の性質を持つ場合に特に有効です。

  • ノイジーなラベル: アノテーターの意見が分かれるケース
  • 少量データ: 数千ペア以下の場合
  • 長エポック学習: 過学習が懸念される場合

実際の性能

論文および独立研究では、IPOはDPOと比較して:

  • 過学習が起きにくく学習が安定
  • 特にデータ量が少ない場合に同等以上の性能
  • 過学習が問題にならない場合はDPOと大差なし

よくある質問

Q1: IPOとDPOはどう使い分ける? A: データ量が少ない(5K以下)・長くチューニングする・過学習が疑われる場合はIPO。それ以外はDPOで十分なことが多い。

Q2: tauパラメータはどう設定? A: DPOのbetaに相当。0.05〜0.2程度が一般的。小さいほど正則化が強くなる。

Q3: DPOからIPOへの移行コストは? A: TRLではloss_type="ipo"に変更するだけ。データ形式はDPOと同じ(chosen/rejectedペア)。

まとめ

IPOはDPOの理論的欠陥を修正した手法で、特にデータ効率と学習安定性が向上しています。TRLに統合されており移行コストが低く、DPOの代替として検討しやすい選択肢です。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/7