AI・機械学習
上級
IA³ ファインチューニング(アイエーキューブファインチューニング)
アテンションとFFNのアクティベーションを少数の学習可能スケーリングベクトルで調整するPEFT手法。Liu et al. 2022提案。LoRAより少ないパラメータ(0.01%程度)でin-context learningを超える精度を達成。Few-shotタスクに特に有効。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
IA3
PEFT
スケーリングベクトル
アテンション
Few-shot
ファインチューニング
IA³ ファインチューニング
IA³(Infused Adapter by Inhibiting and Amplifying Inner Activations)は、2022年にHaozheLiu et al.が提案した超軽量なPEFT手法。アテンションとFFNの内部アクティベーションをスケーリングベクトルで調整することで、極少数のパラメータでファインチューニングを実現する。
基本コンセプト
IA³は「行列を追加するのではなく、アクティベーションを要素積でスケールする」アプローチ:
IA³のAttention:
Output = softmax(Q(l_k ⊙ K)^T / sqrt(d)) × (l_v ⊙ V)
l_k: キースケーリングベクトル(d_k次元)l_v: バリュースケーリングベクトル(d_v次元)l_ff: FFNアクティベーションスケーリングベクトル(d_ff次元)
パラメータ数比較
| 手法 | LLaMA-7B 学習パラメータ |
|---|---|
| Full Fine-tuning | 7,000M |
| LoRA (r=4) | 167M |
| IA³ | 〜0.7M |
T-Few:IA³の実用パッケージ
T-Fewは IA³ + 修正損失関数(unlikelihood loss + length-normalized loss)を組み合わせたfew-shot学習フレームワーク:
- GPT-3(175B)をゼロショット: 精度ベースライン
- T-Few(11B)でIA³: GPT-3ゼロショットを超える精度
- データ効率: T-FewはGPT-3の1/16のパラメータで同等以上
IA³の適用場所
| 場所 | スケーリングベクトル | 次元 |
|---|---|---|
| Attentionキー | l_k | d_k |
| Attentionバリュー | l_v | d_v |
| FFN中間アクティベーション | l_ff | d_ff |
まとめ
IA³は「とにかくパラメータ数を最小化したい」・「few-shot学習に特化したい」場合の選択肢。T-Fewのような応用では実力を発揮する。