AI・機械学習
上級

Activation Beacon(アクティベーションビーコン)

Shanghai AI Labが提案したLLMコンテキスト延長手法。コンテキストを固定ブロックに分割し、ビーコントークンで段階的にKVキャッシュを圧縮・凝縮することで、長文処理の効率化とメモリ削減を実現する。

0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
長文コンテキスト
KVキャッシュ圧縮
ビーコントークン
コンテキスト凝縮
Shanghai AI Lab

Activation Beacon

Activation Beacon(アクティベーションビーコン)は、Shanghai AI Lab(Xiaoyu Shen et al.)が2024年に発表したLLMのコンテキスト長拡張手法で、特殊な「ビーコントークン(beacon tokens)」を定期的に挿入することで、長いコンテキストのKVキャッシュを段階的に圧縮・凝縮する仕組みを実現する。

基本コンセプト

Activation Beaconの動作は以下のステップで構成される:

  1. ブロック分割: 入力シーケンスを固定サイズのブロック(例: 512トークン)に分割
  2. ビーコントークン挿入: 各ブロックの末尾に複数のビーコントークン(例: 8個)を挿入
  3. ローカル処理: ビーコントークンは直前ブロック内のすべてのトークンとアテンション計算を行い、そのブロックの情報を凝縮
  4. KVキャッシュ圧縮: ビーコントークンのKVキャッシュのみを保持し、元のブロックのKVキャッシュを破棄
  5. 連鎖的凝縮: 次のブロック処理時には、前のブロックのビーコンKVキャッシュ + 現在のローカルトークンで計算

この段階的な圧縮により、コンテキストが長くなっても保持するKVキャッシュ量は制御可能なサイズに収まる。

アーキテクチャの詳細

元のコンテキスト(例: 2048トークン、ブロックサイズ512):

Block1 [tok1...tok512] + [B1,B2,...,B8]  ← 8ビーコントークン
Block2 [tok513...tok1024] + [B1,B2,...,B8]
Block3 [tok1025...tok1536] + [B1,B2,...,B8]
Block4 [tok1537...tok2048] + [B1,B2,...,B8]

保持するKVキャッシュ:
  Block1のB1-B8のKV(Block1の512トークンを凝縮)
  Block2のB1-B8のKV(Block2の512トークンを凝縮)
  ...(各ブロック8つ分のKVのみ)

StreamingLLM・LM-Infiniteとの比較

手法情報保持方法ファインチューニング圧縮率
StreamingLLM冒頭シンク + 直近ウィンドウ不要なし(削除)
LM-Infinite冒頭グローバル + 直近ウィンドウ不要なし(削除)
Activation Beacon段階的ビーコン凝縮少量必要最大50x圧縮
Landmark Attentionブロック選択検索必要なし(選択)

Activation Beaconは「削除」ではなく「凝縮」を採用する点で独自のアプローチ。中間の情報が完全に失われないため、理論的には全コンテキストの情報を(損失を伴いながらも)保持できる。

性能評価

論文ではLlama 2(4Kコンテキスト)に適用して:

  • 80Kトークンの文書処理で安定したperplexityを達成
  • KVキャッシュメモリを標準の8分の1から50分の1に削減
  • 必要なファインチューニングデータは500ステップ未満(既存モデル活用の容易さ)

圧縮比の調整

ビーコントークンの数(condensation ratio)を調整することで精度とメモリのトレードオフを制御できる:

- ビーコン数多い(例: 16個/ブロック): 情報保持率高・メモリ使用多
- ビーコン数少ない(例: 4個/ブロック): 情報損失大・メモリ使用少
- デフォルト(8個/ブロック): 実用的なバランス

実用的な応用

  • 法律文書解析: 長い契約書全体を一度に読み込み質問応答
  • 学術論文レビュー: 全章にわたる引用関係・論点の追跡
  • 長編コード補完: 大規模コードベース全体を文脈として保持しながら補完
  • マルチターン会話: 長い会話履歴を段階的に圧縮して保持

既存ライブラリへの統合

Activation Beaconは既存のHugging Face Transformersモデルに比較的少ないコード変更で統合可能で、オープンソース実装も公開されている。特に特定ドメインの長文処理に特化したモデルの開発において、少量のドメインデータでのファインチューニングと組み合わせることで高い効果を発揮する。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/7