LLMキャリブレーション(ECE)(エルエルエムキャリブレーションイーシーイー)
LLMが出力する確率スコアが実際の正解率と一致しているかを測定・調整する技術。Expected Calibration Error(ECE)が主要指標で、値が低いほど確率の信頼性が高い。
LLMキャリブレーション(ECE)
概要
LLM Calibration(キャリブレーション)とは、モデルが出力する確率スコア(confidence)が実際の正解率(accuracy)に対して統計的に正確かを評価し、必要に応じて補正する技術だ。「80%の確信で回答する」と言ったとき、実際に80回中80回正解するのが「完全にキャリブレーションされた」状態を意味する。
Expected Calibration Error(ECE)
定義
ECEは最も広く使われるキャリブレーション指標。確信度をバケット(例: 0.0-0.1, 0.1-0.2, …, 0.9-1.0の10バケット)に分け、各バケット内で「平均確信度と実際の正解率の差」を加重平均したもの。
ECE = Σ(|Bm| / n) × |acc(Bm) - conf(Bm)|
Bm: mバケット内のサンプル集合
acc(Bm): バケット内の実際の正解率
conf(Bm): バケット内の平均確信度
n: 総サンプル数
ECEの解釈
| ECE値 | 解釈 | 例 |
|---|---|---|
| ECE < 0.02 | 優秀 | GPT-4oの特定タスク |
| 0.02 <= ECE < 0.05 | 良好 | 多くの本番LLM |
| 0.05 <= ECE < 0.10 | 要改善 | ファインチューニング直後 |
| ECE >= 0.10 | 不合格 | ベースLLMの未調整状態 |
LLMのOverconfidence問題
LLMは一般にOverconfident(過信)傾向がある。RLHF(人間フィードバックによる強化学習)によるチューニングがこの傾向を強める場合があることが複数の研究で示されている。
実例
- GPT-3.5の医療QA: 実際の正解率が60%でも「確信度90%」と報告するケース
- 幻覚(Hallucination)との関連: 存在しない文献を自信満々に引用する
- 多肢選択問題: 「A」が正解でも「B」を高確信度で選択
主要なキャリブレーション手法
1. Temperature Scaling
ソフトマックス直前のlogitをスカラーTで割る最もシンプルな手法。T > 1で確信度が低下(よりフラット)、T < 1で高確信度化。
from torch.nn.functional import softmax
T = 1.5 # 検証セットで最適化
calibrated_prob = softmax(logits / T, dim=-1)
2. Platt Scaling
事後的に2層の線形変換(a×logit + b)でキャリブレーション。バイナリ分類に強い。
3. Label Smoothing
訓練時に正解ラベルを0/1ではなく(1-ε)/ε(εは小さい値、例0.1)に平滑化。訓練データへの過適合を防ぎ、自然とキャリブレーションが改善される。
4. Verbal Calibration(言語的キャリブレーション)
LLMに確率を言語で表現させる手法。「確信度: 85%」「おそらく」「確実に」等のVerbalizer。Kadavathら(2022)が「LLMは自己の不確実性を言語化できる」ことを実証。
信頼度図(Reliability Diagram)
キャリブレーション状態を視覚化する標準ツール。X軸に確信度バケット、Y軸に実際の正解率をプロット。対角線(y=x)からの乖離がキャリブレーション誤差。
LLMキャリブレーション評価の課題
- 生成タスクの評価困難: 分類と異なり、生成テキストの「正解率」定義が難しい
- ブラックボックスAPI: クローズドモデル(GPT-4等)はlogit未公開のためECE直接計算不可
- タスク依存性: あるタスクでキャリブレーションされていても、他のタスクでは乖離する
- 言語間差異: 英語で良好でも日本語では乖離するケースが報告されている
2025-2026年のツール・フレームワーク
- LM-Eval-Harness(EleutherAI): 多タスクでのECE自動計算機能
- Calibration Suite(2025): HuggingFace対応のキャリブレーション評価ライブラリ
- OpenAI Eval Framework: GPT系モデルの確信度評価セット
- Japanese LLM Leaderboard(Nejumi): 日本語LLMのキャリブレーション評価を含む
まとめ
LLMキャリブレーション(ECE)は「モデルが自信を持って間違える」OverconfidenceリスクをECE指標で定量化し、Temperature Scaling等で調整する技術。医療・法律・金融など高リスク領域のLLM活用では、精度と並んでキャリブレーション品質が2026年の必須評価項目となっている。