AI・機械学習
中級

Adapter Tuning(アダプターチューニング)

Transformer 各層に小さなボトルネックネットワーク(アダプタ)を挿入してファインチューニングする手法。元の重みを凍結したまま追加パラメータのみを学習する。

0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
Adapter
PEFT
ボトルネック
Transformer
ファインチューニング

Adapter Tuning(Houlsby et al. 2019)とは

Adapter Tuning は Houlsby et al. が 2019年 ICML で発表した Parameter-Efficient Fine-Tuning の先駆的手法。事前学習済みモデルの重みを凍結したまま、小さなアダプタモジュールを挿入することで複数タスクへの効率的な適応を実現した。現代の LoRA・IA³ などの PEFT 手法の原点とも言える研究。

アーキテクチャ

各 Transformer 層に 2 つのアダプタを挿入する:

  1. アテンション後アダプタ: Multi-Head Attention の出力後に配置
  2. FFN 後アダプタ: Feed-Forward Network の出力後に配置

各アダプタの内部構造(ボトルネック):

入力 (d_model 次元)
  ↓
Down-projection: W_down ∈ R^{d_model × r}  (r << d_model)
  ↓
非線形活性化 (GELU)
  ↓
Up-projection: W_up ∈ R^{r × d_model}
  ↓
残差接続: 入力 + アダプタ出力

ボトルネック次元 r は通常 8〜64 程度(元のモデル次元 d_model=768〜4096 と比べて大幅に小さい)。

追加パラメータ数

各アダプタの追加パラメータ = 2 × (d_model × r + r)。BERT-Large (340M) に r=64 でアダプタを挿入すると追加パラメータは全体の約 3.6%。論文では元の 0.5〜5% の追加パラメータで full fine-tuning と同等の GLUE スコアを達成したと報告している。

推論時の課題

アダプタは元の重みに「吸収」できないため、推論時に余分なフォワードパスが発生する。LoRA と異なりパラメータを行列加算で統合する手法がなく、逐次的なボトルネック処理が必要。バッチサイズが大きい場合はレイテンシへの影響が顕在化する。

AdapterHub と発展形

Adapter Hub(2020)はアダプタを共有・再利用するエコシステムとして登場し、Hugging Face モデルと統合された。その後発展形として AdapterFusion(複数タスクのアダプタ混合)、MAD-X(多言語・マルチタスク対応)、Parallel Adapter(FFN と並列実行で速度改善)が登場した。

まとめ

Adapter Tuning は PEFT の概念を確立した歴史的手法。現在は LoRA が主流となっているが、マルチタスクのアダプタ切替やモジュール再利用が重要なユースケースでは依然として有効な選択肢。

この記事について
カテゴリーAI・機械学習
難易度中級
作成日2026/6/8