AI・機械学習
上級

IA³ ファインチューニング(アイエーキューブファインチューニング)

アテンションとFFNのアクティベーションを少数の学習可能スケーリングベクトルで調整するPEFT手法。Liu et al. 2022提案。LoRAより少ないパラメータ(0.01%程度)でin-context learningを超える精度を達成。Few-shotタスクに特に有効。

0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
IA3
PEFT
スケーリングベクトル
アテンション
Few-shot
ファインチューニング

IA³ ファインチューニング

IA³(Infused Adapter by Inhibiting and Amplifying Inner Activations)は、2022年にHaozheLiu et al.が提案した超軽量なPEFT手法。アテンションとFFNの内部アクティベーションをスケーリングベクトルで調整することで、極少数のパラメータでファインチューニングを実現する。

基本コンセプト

IA³は「行列を追加するのではなく、アクティベーションを要素積でスケールする」アプローチ:

IA³のAttention:
Output = softmax(Q(l_k ⊙ K)^T / sqrt(d)) × (l_v ⊙ V)
  • l_k: キースケーリングベクトル(d_k次元)
  • l_v: バリュースケーリングベクトル(d_v次元)
  • l_ff: FFNアクティベーションスケーリングベクトル(d_ff次元)

パラメータ数比較

手法LLaMA-7B 学習パラメータ
Full Fine-tuning7,000M
LoRA (r=4)167M
IA³〜0.7M

T-Few:IA³の実用パッケージ

T-Fewは IA³ + 修正損失関数(unlikelihood loss + length-normalized loss)を組み合わせたfew-shot学習フレームワーク:

  • GPT-3(175B)をゼロショット: 精度ベースライン
  • T-Few(11B)でIA³: GPT-3ゼロショットを超える精度
  • データ効率: T-FewはGPT-3の1/16のパラメータで同等以上

IA³の適用場所

場所スケーリングベクトル次元
Attentionキーl_kd_k
Attentionバリューl_vd_v
FFN中間アクティベーションl_ffd_ff

まとめ

IA³は「とにかくパラメータ数を最小化したい」・「few-shot学習に特化したい」場合の選択肢。T-Fewのような応用では実力を発揮する。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/6