AI・機械学習
上級
AdaLOMO(省メモリLLM最適化器)(アダロモ ショウメモリ エルエルエム サイテキカキ)
2023年にPeng Renら(Fudan大学)が提案した超省メモリLLM全パラメータ学習向けオプティマイザー。LOMO(LOw-Memory Optimization)をAdamの適応学習率と組み合わせ、7BモデルをGPU 1枚(メモリ8GB)でフルパラメータ学習可能にした。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
最適化
LLM
省メモリ
AdaLOMO
フルパラメータ
ファインチューニング
AdaLOMO — 8GB GPUでLLM全パラメータを学習する省メモリ最適化器
AdaLOMO(Adaptive LOw-Memory Optimization)は、2023年にPeng Ren・Zhengyan Zhangら(Fudan大学・Tsinghua大学)が発表した革新的なLLMファインチューニング用最適化アルゴリズムだ。
背景:フルパラメータ学習のメモリ問題
LLMのフルパラメータ学習(Full Fine-tuning)でメモリが大量に必要になる理由(7Bモデル・FP16):
- モデルパラメータ: 14 GB
- AdamWオプティマイザー状態(1次・2次モーメント): 28 GB
- 勾配バッファ: 14 GB
- アクティベーション: 10〜50 GB(バッチサイズ依存)
- 合計(フルAdam): 66〜106 GB
これではA100(80GB)でも難しく、RTX 4090(24GB)では不可能だ。
LOMAとAdaLOMOのアイデア
LOMO(前作、2023年): 逐次的に各層の勾配を計算→即時更新→解放を繰り返すことで、常時保持する勾配バッファをほぼゼロにする。ただし適応学習率なし(SGD相当)のため収束が遅い。
AdaLOMO: LOMAの逐次更新構造を維持しつつ、Adamの適応学習率(1次/2次モーメント)を組み込む。全レイヤーのモーメントを同時保持するのではなく、更新直後にモーメント統計も可能な限り解放・圧縮することでメモリを抑制する。
メモリ使用量の比較
- AdamW Full Fine-tuning: 最小GPU要件=80GB以上(A100 ×2)
- LoRA(rank=16): 24GB(RTX 3090×1)。パラメータ効率的
- LOMO: 14GB(RTX 3090/4090)。全パラメータ・SGD相当
- AdaLOMO: 8GB(RTX 3080/4060 Ti)。全パラメータ・適応学習率
品質比較
LoRAとAdaLOMOの比較実験(SuperGLUE他):
- 多くのタスクでAdaLOMO ≥ LoRA(全パラメータ更新の恩恵)
- Commonsense推論・長文生成では全パラメータ更新が有利
- PEFT(LoRA)は推論時のアダプター管理が必要だが、AdaLOMOは単一モデルとして管理が簡単
実装と利用
Fudan大学チームがGitHubでオープンソース公開(OpenLMLab/LOMO)。HuggingFace Transformers互換のAPIで既存のLLaMA/Mistral/Qwenモデルに適用可能。