LLM継続学習(エルエルエムケイゾクガクシュウ)
大規模言語モデルが新しいタスクやドメインを学習しながら、既存の知識を保持し続ける機械学習パラダイム。壊滅的忘却(Catastrophic Forgetting)を防ぎつつ、モデルを継続的に更新する手法の総称。
LLM継続学習(Continual Learning for LLMs)とは
LLM継続学習(Continual Learning)とは、大規模言語モデルが新しいタスクやドメインを学習しながら、以前に習得した知識・能力を失わないようにする機械学習の枠組みです。従来のニューラルネットワークでは新しいデータで学習すると既存の知識が上書きされる「壊滅的忘却(Catastrophic Forgetting)」が深刻な問題でしたが、LLMでも同様の課題が発生します。
なぜ継続学習が重要なのか
LLMは一度大規模事前学習(Pre-training)を行うと、そのコストは数億円から数十億円に達します。モデルを継続的に更新するたびにゼロから学習し直すことは現実的ではありません。継続学習はこの問題を解決し、既存の知識ベースを保ちながら新情報を効率的に統合する手段として注目されています。
壊滅的忘却(Catastrophic Forgetting)のメカニズム
壊滅的忘却は、新タスクの学習がネットワーク重みを大きく変更することで起きます。LLMでは数百億のパラメータが存在するため、局所的な変更が他の知識表現を破壊するリスクが常にあります。特にドメイン固有のFine-tuningでは、汎用能力が低下する事例が多数報告されています。
主要アプローチの分類
1. 正則化ベース手法
- EWC(Elastic Weight Consolidation): 重要なパラメータに罰則項を設けて過去の知識を保護
- SI(Synaptic Intelligence): オンライン正則化によるパラメータ保護
- L2正則化: 旧重みからの乖離を抑制
2. リプレイベース手法
- Experience Replay: 過去タスクのデータサンプルを混合して学習
- Generative Replay: Generative Modelで過去データを疑似生成して再学習
- Dark Experience Replay: 旧モデルの出力分布を蒸留して活用
3. アーキテクチャベース手法
- Progressive Networks: 新タスクごとにネットワークを拡張
- PackNet: パラメータを分割し各タスクに割り当て
- LoRA Continual Learning: アダプタ層を追加し干渉を最小化
4. プロンプトベース手法
- Progressive Prompts: タスク固有プロンプトベクトルを継続的に学習
- L2P(Learning to Prompt): プロンプトプールから状況に応じて選択
LLM特有の継続学習課題
指示追従能力の劣化: ドメイン特化学習によりInstructionフォローが弱まるケースがある。
文脈長依存性: Long Context対応モデルでは継続学習時のアテンション分布変化が激しい。
RLHF後のアライメント保持: 人間のフィードバックで調整済みモデルを継続学習すると、安全性・有用性バランスが崩れる問題がある。
2025年の最新動向
- MoE(Mixture of Experts)との融合: 専門家モジュールを新タスクに割り当てることで干渉を防ぐアーキテクチャが注目
- LoRA系アダプタの継続学習: 新タスクごとにLoRAモジュールを追加し、既存パラメータへの影響を最小化
- Constitutional AI継続学習: Anthropicの手法をベースに、倫理ガイドラインを維持しながら知識更新するアプローチ
- Selective Layer Tuning: 重要性の低い層のみ更新し上位層の表現を保護する効率的手法
実装における評価指標
| 指標 | 説明 | 理想値 |
|---|---|---|
| BWT (Backward Transfer) | 新タスク学習後の旧タスク性能変化 | ≈ 0 |
| FWT (Forward Transfer) | 旧タスクの知識が新タスク学習を助ける効果 | > 0 |
| Plasticity | 新知識の学習能力 | 高い |
| Stability | 旧知識の保持能力 | 高い |
まとめ
LLM継続学習は、モデルの「生涯学習」を実現するための重要な研究分野です。計算コストの削減、知識の鮮度維持、特定ドメインへの適応という三つのニーズを同時に満たすアプローチとして、2025年以降もLLMの実用化において核心的な役割を果たし続けるでしょう。