EWC(弾性重み固定)(イーダブリューシーダンセイオモミコテイ)
Elastic Weight Consolidationの略。ニューラルネットワークの継続学習において、過去タスクで重要だったパラメータに強い正則化をかけ、壊滅的忘却を防ぐ手法。フィッシャー情報行列を用いて各パラメータの重要度を推定する。
EWC(Elastic Weight Consolidation)とは
EWC(Elastic Weight Consolidation、弾性重み固定)は、DeepMindが2017年に発表した継続学習の基礎的な手法です。「ニューラルネットワークが人間のように多様なタスクを順次学習できるか」という研究課題への回答として提案され、壊滅的忘却(Catastrophic Forgetting)問題を正則化アプローチで解決します。
EWCの基本原理
EWCのコアアイデアは「過去のタスクに重要だったパラメータほど変化させにくくする」というシンプルな直観に基づいています。これを実現するために**フィッシャー情報行列(Fisher Information Matrix)**を用います。
フィッシャー情報行列の役割
フィッシャー情報行列Fは、各パラメータが損失関数に与える感度を表します。値が大きいパラメータ = 旧タスクの予測に不可欠 = 大きく変えると性能が落ちると解釈できます。
EWCの損失関数
L_EWC(θ) = L_B(θ) + λ/2 * Σ_i F_i(θ_i - θ*_A,i)²
- L_B(θ): 新タスクBの損失
- λ: 正則化の強さ(重要度の重み付け)
- F_i: パラメータiのフィッシャー情報(旧タスクAでの重要度)
- θ*_A,i: タスクA学習後の最適パラメータ
LLMへの適用
LLMは数十億のパラメータを持つため、フル計算は現実的ではありません。実用的には以下の近似が使われます:
対角フィッシャー近似
行列全体ではなく対角成分のみ計算(計算コストO(N))。精度は落ちるが大規模モデルに適用可能。
レイヤー選択的EWC
全層でなく重要な上位層(Transformer後半のAttention/FFN)のみEWCを適用。
Online EWC
複数タスクの重要度を累積的に管理するオンライン版。タスク数が増えても計算量が線形増加しない設計。
EWCの限界とLLM継続学習での課題
スケーラビリティ: タスク数が増えると保存すべきフィッシャー行列も増加。GPT-4サイズのモデルでは実用困難。
フィッシャー近似の精度: 対角近似では相関パラメータの重要度を過小評価しやすい。
ハイパーパラメータ感度: λの値が小さすぎると忘却が起き、大きすぎると新タスクを学習できない。
アテンション機構との相性: Multi-Head Attentionの重みは相互依存が強く、独立パラメータとして扱うEWCと相性が悪い場合がある。
EWCの改良手法
| 手法 | 改良点 | 特徴 |
|---|---|---|
| Online EWC | タスク数増加への対応 | 累積フィッシャー使用 |
| SI (Synaptic Intelligence) | オンライン重要度計算 | 学習中にパラメータ寄与を追跡 |
| MAS (Memory Aware Synapses) | ラベルなし重要度推定 | 出力変化量で重要度を定義 |
| IMM (Incremental Moment Matching) | モーメントマッチング | モデルパラメータ分布を整合 |
2025年のEWC活用事例
- 医療LLM継続学習: 新規疾患データを追加しながら既存診断能力を維持するためにEWCを活用
- コード生成モデル更新: 新プログラミング言語を追加学習する際の旧言語サポート保護
- LoRAとの組み合わせ: LoRAアダプタのパラメータにEWC正則化を適用し干渉を抑制
まとめ
EWCはフィッシャー情報行列という数学的に厳密な根拠を持つ継続学習手法であり、LLMのドメイン特化学習でも理論的基盤を提供します。大規模モデルへの適用には近似が必要ですが、その考え方は後続手法の多くに影響を与えており、継続学習分野の基礎として不可欠な概念です。