AI・機械学習
上級

EXL2(ExLlamaV2量子化フォーマット)(イーエックスエルツー)

ExLlamaV2推論エンジン用の混合精度量子化フォーマット。2〜8bitの任意精度を1bit刻みで指定でき、重要なレイヤーを選択的に高精度で量子化する最適化アルゴリズムを採用。同一VRAMでGPTQより5〜15%高品質な推論を実現する。

0 回閲覧
0 いいね
2026/5/24 更新
関連タグ
量子化
ExLlamaV2
混合精度量子化
bpw
GPU推論
テキスト生成WebUI

EXL2とは

EXL2(ExLlamaV2 Quantization Format)はGitHubユーザーturboderp(ExLlama・ExLlamaV2の作者)が開発した、ExLlamaV2推論エンジン専用の量子化フォーマットです。2023年後半に登場し、RTX 4090などのコンシューマーGPU向けに同一VRAM消費でGPTQより高品質な推論を実現することを主目的として設計されています。

EXL2はKoboldCPP、Oobaboogaテキスト生成WebUI(text-generation-webui)、TabbyAPI等のコミュニティ製LLMフロントエンドで広く採用されており、創作・チャット・ロールプレイ用途で強い支持を受けています。

EXL2の技術的仕組み

bpw(bits-per-weight)システム

EXL2最大の特徴は任意の混合精度です。GPTQが「全体4bit」「全体8bit」と均一に量子化するのに対し、EXL2は重要度の高いレイヤーを高精度、中間層を低精度で量子化し、トータルの平均精度をbpw(bits-per-weight)で指定します。

# EXL2量子化コマンド(convert.py)
python convert.py \
  -i ./Llama-3.1-70B-Instruct \
  -o ./Llama-3.1-70B-EXL2-4.25bpw \
  -b 4.25 \          # 目標bpw
  -hb 8 \            # Head bits(重要レイヤーのビット幅上限)
  -c calibration.parquet  # キャリブレーションデータ

GPTQ vs GGUF vs EXL2の性能比較

フォーマットLlama-3.1-70B サイズPPLRTX 4090推論速度対応環境
GPTQ-Int436.5GB3.4218 tok/svLLM/AutoGPTQ
GGUF Q4_K_M39.7GB3.3822 tok/sOllama/LM Studio
EXL2 4.25bpw39.2GB3.3128 tok/sExLlamaV2/KoboldAI
EXL2 5.0bpw45.8GB3.2825 tok/sExLlamaV2/KoboldAI

bpw別ファイルサイズ・用途ガイド

bpwLlama-3.1-70BサイズVRAM目安用途
2.2bpw20.5GB24GB(RTX 4090×1)最軽量・大雑把な推論
3.0bpw27.7GB24GB+RAM補助Mixtral MoEの圧縮に有効
4.25bpw39.2GBA100 40GB / 2×RTX 4090品質バランスの黄金比
5.0bpw45.8GBA100 80GB高品質創作・翻訳
6.0bpw54.9GBA100 80GBほぼ無損失

対応フロントエンド・エコシステム

ツールEXL2対応特徴
text-generation-webuiネイティブExLlamaV2バックエンド内蔵
KoboldAI Liteネイティブ創作・TRPG向けUI
TabbyAPIネイティブOpenAI API互換サーバー
vLLM / TGI非対応GPTQ/AWQを使用

よくある質問(FAQ)

Q1: EXL2はHugging Faceからダウンロードできる? A: はい。mradermacher・bartowski等のユーザーが主要モデルのEXL2版を大量に配布している。Hugging Face検索で「EXL2」「exl2」を含むリポジトリが多数見つかる。

Q2: EXL2量子化には何が必要? A: Python環境(Python 3.11+)、ExLlamaV2、CUDA GPU(量子化自体はCPUでも可だが非常に遅い)。70B量子化にはA100 1枚で2〜4時間程度かかる。

Q3: GGUFとEXL2どちらを選ぶべき? A: CPU推論・Ollama・LM Studio使用ならGGUF。GPU専用(RTX 4090等)・Oobabooga・創作用途ならEXL2。推論速度と品質バランスはEXL2 4.25bpwが現状最良。

まとめ

  • EXL2はExLlamaV2専用の混合精度量子化フォーマット。bpw単位で任意精度を指定可能
  • キャリブレーション駆動の精度配分で同一ファイルサイズでGPTQより高品質
  • RTX 4090環境での4.25bpwが品質・速度・サイズの最良バランス
  • Oobabooga/KoboldAI/TabbyAPIエコシステムで創作・チャット用途の主流フォーマット
この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/5/24