AI・機械学習
上級
アクティベーションステアリング(アクティベーションステアリング)
LLMの推論中に残差ストリームの中間活性化に概念ベクトルを加算・減算することでモデルの出力を意図的に誘導する手法。モデルの再学習なしに行動制御が可能で、Activation Additionとも呼ばれる。
0 回閲覧
0 いいね
2026/6/7 更新
関連タグ
LLM解釈性
LLM制御
残差ストリーム
安全性研究
ステアリングベクトル
アクティベーションステアリング(Activation Steering)
アクティベーションステアリングは、LLMの推論中に内部活性化を直接操作することでモデルの出力傾向を制御する手法。重みの変更や再学習なしにリアルタイムでモデルの行動を誘導できる点で、RLHF等の従来手法と根本的に異なる。2023年のTurnerら「Activation Addition: Steering Language Models Without Optimization」で体系化。
基本的な仕組み
ステアリングベクトルの取得:
- 対照的なプロンプトペアを作成(例: 「積極的な文章」vs「消極的な文章」)
- 両プロンプトをモデルに通し、特定層の残差ストリーム活性化を取得
- 両活性化の差分ベクトル = ステアリングベクトル
ステアリングの実行:
h_l_new = h_l + α × steering_vector
係数 α(ステアリング強度)でどの程度概念を注入するか制御。α > 0 で概念を強化、α < 0 で概念を抑制。
Turner et al. (2023) の代表的実験
- バナナ実験: 「バナナ」概念ベクトルをGPT-2に注入 → どんな入力に対してもバナナについて語り出す
- 誠実さ制御: 「誠実」-「不誠実」ベクトルでClaude 1を制御し、脱獄耐性を変化させる
- 感情誘導: 恐怖・喜びベクトルで生成文章のトーンを変更
Anthropicの内部特徴制御実験(2024)
AnthropicはSAE研究の延長として、発見したClaude 3 Sonnetの特徴ベクトルを実際に操作する実験を行った。特定の感情・概念に対応する特徴を活性化させることで、モデルの応答傾向を変化させることに成功。これはActivation Steeringの洗練版といえる。
RepEng(Representation Engineering)との比較
| 手法 | ステアリングベクトル取得方法 | 特徴 |
|---|---|---|
| Activation Addition | 対照プロンプトの差分 | シンプル、不安定なことも |
| RepEng | PCA等の主成分分析 | より安定・精密な方向抽出 |
| SAE Steering | SAEで発見した特定特徴 | 最も解釈可能、計算コスト高 |
実装ツール
- steering-vectors (PyPI): 汎用ステアリングベクトルライブラリ
- transformer-lens: EleutherAI、介入実験に対応
- nnsight: 複雑な介入実験向け
- llama.cpp: Control Vectors機能(RepEng方式)を標準搭載
jisaku.comでの活用
ローカルLLM(RTX 4060 VRAM 8GB以上)上で動作するOSSモデル(Gemma 3/Mistral/Llama 3)に対してActivation Steeringを実験できる。「日本語で回答する」「コードのみ回答する」等の傾向ベクトルを取得・注入することで、プロンプトエンジニアリングの代替手法として活用可能。llama.cppのControl Vector機能を使えばGGUF形式のモデルに簡単に適用できる。