AI・機械学習
上級

AlpaGasus データ品質自動選定(アルパガサス データ ヒンシツ ジドウ センテイ)

GPT-4を活用してAlpacaの52,000件SFTデータを自動スコアリングし、高品質9,000件に絞ることでベースラインを上回ることを示した2023年のデータ選定手法。

0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
データ品質
SFT
GPT-4
LLM
ファインチューニング
データ選定

AlpaGasusとは

AlpaGasus(Alpaca + Pegasus の合成語)は、Ohio State UniversityのZhen Guo、Rui Yan らが2023年10月に発表したSFT(Supervised Fine-Tuning)データ品質自動選定フレームワーク。LIMAが手動キュレーションで1,000件を選んだのに対し、AlpaGasusはGPT-4を「品質判定器」として活用することで自動かつスケーラブルなデータ選定を実現した。

手法の詳細

GPT-4による品質スコアリング

Alpaca 52,000件の各インスタンス(instruction + input + output)をGPT-4に提示し、以下の軸で0〜5の品質スコアを付与させる。

  • 正確性(Accuracy): 回答が事実として正しいか
  • 有用性(Helpfulness): ユーザーの要求を満たしているか
  • 品質(Quality): 文章の明確さ・構造・完結性

データフィルタリング

スコア ≥ 4.5 のサンプルが全体の約17%(≈9,000件)。このサブセットのみでLlama-7B/13BのSFTを実施。

ベンチマーク結果

各種評価セットでの人手評価による勝率:

  • AlpaGasus-13B vs Alpaca-13B(全52k件): 53.5% 勝利
  • AlpaGasus-13B vs text-davinci-003: 拮抗
  • AlpaGasus-7B vs Alpaca-7B(全52k件): AlpaGasusが上回る

6倍少ないデータで全件学習モデルを上回る結果は、データ品質自動選定の有効性を示した。

LIMA vs AlpaGasus 比較

  • LIMA: 1,000件 / 手動 / スケーラビリティ低 / 人件費高
  • AlpaGasus: 9,000件 / GPT-4自動 / スケーラビリティ高 / API費(52k件で〜$50)

後続手法への影響

  • DEITA: 品質に加えて複雑性スコアを追加し多様性も制御
  • SelectIT: IFDスコアによる内部モデル自己評価
  • MoDS: モデル性能に基づく指向的データ選定
  • MagPie後処理フィルタ: 大量合成データからの品質フィルタリング

実装時の注意点

  • GPT-4は自分に類似したスタイルを高評価する傾向(self-serving bias)がある
  • 大規模データ(100万件)では評価コストが高額
  • オープンな強力モデル(Llama-3 70B / Qwen-2.5 72B等)での代替も普及中

まとめ

AlpaGasusは「品質の良い少量データで強いモデルを作れる」というLIMAの知見を自動化し、実務応用への橋渡しをした手法。GPT-4品質スコアリングというシンプルなアイデアながら、SFTデータ工学の重要なベンチマークとして引用され続けている。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/7