EXL2(ExLlamaV2量子化フォーマット)(イーエックスエルツー)
ExLlamaV2推論エンジン用の混合精度量子化フォーマット。2〜8bitの任意精度を1bit刻みで指定でき、重要なレイヤーを選択的に高精度で量子化する最適化アルゴリズムを採用。同一VRAMでGPTQより5〜15%高品質な推論を実現する。
EXL2とは
EXL2(ExLlamaV2 Quantization Format)はGitHubユーザーturboderp(ExLlama・ExLlamaV2の作者)が開発した、ExLlamaV2推論エンジン専用の量子化フォーマットです。2023年後半に登場し、RTX 4090などのコンシューマーGPU向けに同一VRAM消費でGPTQより高品質な推論を実現することを主目的として設計されています。
EXL2はKoboldCPP、Oobaboogaテキスト生成WebUI(text-generation-webui)、TabbyAPI等のコミュニティ製LLMフロントエンドで広く採用されており、創作・チャット・ロールプレイ用途で強い支持を受けています。
EXL2の技術的仕組み
bpw(bits-per-weight)システム
EXL2最大の特徴は任意の混合精度です。GPTQが「全体4bit」「全体8bit」と均一に量子化するのに対し、EXL2は重要度の高いレイヤーを高精度、中間層を低精度で量子化し、トータルの平均精度をbpw(bits-per-weight)で指定します。
# EXL2量子化コマンド(convert.py)
python convert.py \
-i ./Llama-3.1-70B-Instruct \
-o ./Llama-3.1-70B-EXL2-4.25bpw \
-b 4.25 \ # 目標bpw
-hb 8 \ # Head bits(重要レイヤーのビット幅上限)
-c calibration.parquet # キャリブレーションデータ
GPTQ vs GGUF vs EXL2の性能比較
| フォーマット | Llama-3.1-70B サイズ | PPL | RTX 4090推論速度 | 対応環境 |
|---|---|---|---|---|
| GPTQ-Int4 | 36.5GB | 3.42 | 18 tok/s | vLLM/AutoGPTQ |
| GGUF Q4_K_M | 39.7GB | 3.38 | 22 tok/s | Ollama/LM Studio |
| EXL2 4.25bpw | 39.2GB | 3.31 | 28 tok/s | ExLlamaV2/KoboldAI |
| EXL2 5.0bpw | 45.8GB | 3.28 | 25 tok/s | ExLlamaV2/KoboldAI |
bpw別ファイルサイズ・用途ガイド
| bpw | Llama-3.1-70Bサイズ | VRAM目安 | 用途 |
|---|---|---|---|
| 2.2bpw | 20.5GB | 24GB(RTX 4090×1) | 最軽量・大雑把な推論 |
| 3.0bpw | 27.7GB | 24GB+RAM補助 | Mixtral MoEの圧縮に有効 |
| 4.25bpw | 39.2GB | A100 40GB / 2×RTX 4090 | 品質バランスの黄金比 |
| 5.0bpw | 45.8GB | A100 80GB | 高品質創作・翻訳 |
| 6.0bpw | 54.9GB | A100 80GB | ほぼ無損失 |
対応フロントエンド・エコシステム
| ツール | EXL2対応 | 特徴 |
|---|---|---|
| text-generation-webui | ネイティブ | ExLlamaV2バックエンド内蔵 |
| KoboldAI Lite | ネイティブ | 創作・TRPG向けUI |
| TabbyAPI | ネイティブ | OpenAI API互換サーバー |
| vLLM / TGI | 非対応 | GPTQ/AWQを使用 |
よくある質問(FAQ)
Q1: EXL2はHugging Faceからダウンロードできる? A: はい。mradermacher・bartowski等のユーザーが主要モデルのEXL2版を大量に配布している。Hugging Face検索で「EXL2」「exl2」を含むリポジトリが多数見つかる。
Q2: EXL2量子化には何が必要? A: Python環境(Python 3.11+)、ExLlamaV2、CUDA GPU(量子化自体はCPUでも可だが非常に遅い)。70B量子化にはA100 1枚で2〜4時間程度かかる。
Q3: GGUFとEXL2どちらを選ぶべき? A: CPU推論・Ollama・LM Studio使用ならGGUF。GPU専用(RTX 4090等)・Oobabooga・創作用途ならEXL2。推論速度と品質バランスはEXL2 4.25bpwが現状最良。
まとめ
- EXL2はExLlamaV2専用の混合精度量子化フォーマット。bpw単位で任意精度を指定可能
- キャリブレーション駆動の精度配分で同一ファイルサイズでGPTQより高品質
- RTX 4090環境での4.25bpwが品質・速度・サイズの最良バランス
- Oobabooga/KoboldAI/TabbyAPIエコシステムで創作・チャット用途の主流フォーマット