AI・機械学習
上級
AlpaGasus データ品質自動選定(アルパガサス データ ヒンシツ ジドウ センテイ)
GPT-4を活用してAlpacaの52,000件SFTデータを自動スコアリングし、高品質9,000件に絞ることでベースラインを上回ることを示した2023年のデータ選定手法。
0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
データ品質
SFT
GPT-4
LLM
ファインチューニング
データ選定
AlpaGasusとは
AlpaGasus(Alpaca + Pegasus の合成語)は、Ohio State UniversityのZhen Guo、Rui Yan らが2023年10月に発表したSFT(Supervised Fine-Tuning)データ品質自動選定フレームワーク。LIMAが手動キュレーションで1,000件を選んだのに対し、AlpaGasusはGPT-4を「品質判定器」として活用することで自動かつスケーラブルなデータ選定を実現した。
手法の詳細
GPT-4による品質スコアリング
Alpaca 52,000件の各インスタンス(instruction + input + output)をGPT-4に提示し、以下の軸で0〜5の品質スコアを付与させる。
- 正確性(Accuracy): 回答が事実として正しいか
- 有用性(Helpfulness): ユーザーの要求を満たしているか
- 品質(Quality): 文章の明確さ・構造・完結性
データフィルタリング
スコア ≥ 4.5 のサンプルが全体の約17%(≈9,000件)。このサブセットのみでLlama-7B/13BのSFTを実施。
ベンチマーク結果
各種評価セットでの人手評価による勝率:
- AlpaGasus-13B vs Alpaca-13B(全52k件): 53.5% 勝利
- AlpaGasus-13B vs text-davinci-003: 拮抗
- AlpaGasus-7B vs Alpaca-7B(全52k件): AlpaGasusが上回る
6倍少ないデータで全件学習モデルを上回る結果は、データ品質自動選定の有効性を示した。
LIMA vs AlpaGasus 比較
- LIMA: 1,000件 / 手動 / スケーラビリティ低 / 人件費高
- AlpaGasus: 9,000件 / GPT-4自動 / スケーラビリティ高 / API費(52k件で〜$50)
後続手法への影響
- DEITA: 品質に加えて複雑性スコアを追加し多様性も制御
- SelectIT: IFDスコアによる内部モデル自己評価
- MoDS: モデル性能に基づく指向的データ選定
- MagPie後処理フィルタ: 大量合成データからの品質フィルタリング
実装時の注意点
- GPT-4は自分に類似したスタイルを高評価する傾向(self-serving bias)がある
- 大規模データ(100万件)では評価コストが高額
- オープンな強力モデル(Llama-3 70B / Qwen-2.5 72B等)での代替も普及中
まとめ
AlpaGasusは「品質の良い少量データで強いモデルを作れる」というLIMAの知見を自動化し、実務応用への橋渡しをした手法。GPT-4品質スコアリングというシンプルなアイデアながら、SFTデータ工学の重要なベンチマークとして引用され続けている。