AI・機械学習
上級
IA³(アイエースリー)
Transformer の内部活性化にスカラーベクトルを掛け合わせてファインチューニングするパラメータ効率手法。学習パラメータ数は LoRA より1桁少ない。
0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
PEFT
IA3
ファインチューニング
LLM
T-Few
IA³(Infused Adapter by Inhibiting and Amplifying Inner Activations)とは
IA³ は 2022年に Liu et al. が T-Few 論文で発表した Parameter-Efficient Fine-Tuning (PEFT) 手法。名前の通り「内部活性化を抑制・増幅することで注入されたアダプタ」という意味を持つ。
仕組み
Transformer の各層に存在する 3 種類の活性化テンソルにのみ、学習可能なスカラーベクトル $l_k$、$l_v$、$l_{ff}$ を乗算する:
- キー (K): アテンション計算のキー行列出力に $l_k$ を乗算
- バリュー (V): アテンション計算のバリュー行列出力に $l_v$ を乗算
- フィードフォワード活性: FFN の中間活性化に $l_{ff}$ を乗算
元の重み行列 W は完全に凍結されており、追加されるのは各 $l$ ベクトルのみ。T0-3B (3B パラメータ) に適用すると学習対象パラメータは約 0.01% 以下になる。
LoRA との比較
LoRA が学習パラメータ比率 0.1〜1% 程度なのに対し、IA³ は 0.01% 以下。スカラーベクトルという単純な構造のため表現力に限界があるが、推論時にスカラーを重み行列に吸収させることができる(吸収後は推論速度への影響ゼロ)。
T-Few フレームワーク
IA³ は T-Few という few-shot 学習フレームワークの中核として設計された。T0 や T5 などのテキスト間変換モデルと組み合わせ、数十サンプルの学習で高い分類精度を実現する。Hugging Face PEFT ライブラリに実装済み。
利用場面
- 計算資源が極めて限られた環境での PEFT
- Few-shot 分類・NLI・QA タスク
- 多数のタスクアダプタを保持してスイッチングしたい場合(極小サイズ)
- LoRA より少ないストレージで多タスク対応したい場合
まとめ
IA³ は「重み行列を変えずに活性化のスケールだけ学習する」という最小限の介入でファインチューニングを実現する手法。学習パラメータ数は PEFT 手法の中でも最小クラスに属し、few-shot タスクへの適用に優れている。