AI・機械学習
上級
Activation Beacon(アクティベーションビーコン)
Shanghai AI Labが提案したLLMコンテキスト延長手法。コンテキストを固定ブロックに分割し、ビーコントークンで段階的にKVキャッシュを圧縮・凝縮することで、長文処理の効率化とメモリ削減を実現する。
0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
長文コンテキスト
KVキャッシュ圧縮
ビーコントークン
コンテキスト凝縮
Shanghai AI Lab
Activation Beacon
Activation Beacon(アクティベーションビーコン)は、Shanghai AI Lab(Xiaoyu Shen et al.)が2024年に発表したLLMのコンテキスト長拡張手法で、特殊な「ビーコントークン(beacon tokens)」を定期的に挿入することで、長いコンテキストのKVキャッシュを段階的に圧縮・凝縮する仕組みを実現する。
基本コンセプト
Activation Beaconの動作は以下のステップで構成される:
- ブロック分割: 入力シーケンスを固定サイズのブロック(例: 512トークン)に分割
- ビーコントークン挿入: 各ブロックの末尾に複数のビーコントークン(例: 8個)を挿入
- ローカル処理: ビーコントークンは直前ブロック内のすべてのトークンとアテンション計算を行い、そのブロックの情報を凝縮
- KVキャッシュ圧縮: ビーコントークンのKVキャッシュのみを保持し、元のブロックのKVキャッシュを破棄
- 連鎖的凝縮: 次のブロック処理時には、前のブロックのビーコンKVキャッシュ + 現在のローカルトークンで計算
この段階的な圧縮により、コンテキストが長くなっても保持するKVキャッシュ量は制御可能なサイズに収まる。
アーキテクチャの詳細
元のコンテキスト(例: 2048トークン、ブロックサイズ512):
Block1 [tok1...tok512] + [B1,B2,...,B8] ← 8ビーコントークン
Block2 [tok513...tok1024] + [B1,B2,...,B8]
Block3 [tok1025...tok1536] + [B1,B2,...,B8]
Block4 [tok1537...tok2048] + [B1,B2,...,B8]
保持するKVキャッシュ:
Block1のB1-B8のKV(Block1の512トークンを凝縮)
Block2のB1-B8のKV(Block2の512トークンを凝縮)
...(各ブロック8つ分のKVのみ)
StreamingLLM・LM-Infiniteとの比較
| 手法 | 情報保持方法 | ファインチューニング | 圧縮率 |
|---|---|---|---|
| StreamingLLM | 冒頭シンク + 直近ウィンドウ | 不要 | なし(削除) |
| LM-Infinite | 冒頭グローバル + 直近ウィンドウ | 不要 | なし(削除) |
| Activation Beacon | 段階的ビーコン凝縮 | 少量必要 | 最大50x圧縮 |
| Landmark Attention | ブロック選択検索 | 必要 | なし(選択) |
Activation Beaconは「削除」ではなく「凝縮」を採用する点で独自のアプローチ。中間の情報が完全に失われないため、理論的には全コンテキストの情報を(損失を伴いながらも)保持できる。
性能評価
論文ではLlama 2(4Kコンテキスト)に適用して:
- 80Kトークンの文書処理で安定したperplexityを達成
- KVキャッシュメモリを標準の8分の1から50分の1に削減
- 必要なファインチューニングデータは500ステップ未満(既存モデル活用の容易さ)
圧縮比の調整
ビーコントークンの数(condensation ratio)を調整することで精度とメモリのトレードオフを制御できる:
- ビーコン数多い(例: 16個/ブロック): 情報保持率高・メモリ使用多
- ビーコン数少ない(例: 4個/ブロック): 情報損失大・メモリ使用少
- デフォルト(8個/ブロック): 実用的なバランス
実用的な応用
- 法律文書解析: 長い契約書全体を一度に読み込み質問応答
- 学術論文レビュー: 全章にわたる引用関係・論点の追跡
- 長編コード補完: 大規模コードベース全体を文脈として保持しながら補完
- マルチターン会話: 長い会話履歴を段階的に圧縮して保持
既存ライブラリへの統合
Activation Beaconは既存のHugging Face Transformersモデルに比較的少ないコード変更で統合可能で、オープンソース実装も公開されている。特に特定ドメインの長文処理に特化したモデルの開発において、少量のドメインデータでのファインチューニングと組み合わせることで高い効果を発揮する。