LLM量子化formats。GGUF(llama.cpp/Ollama・Q4_K_M sweet spot・Q8_0 high quality・FP16 baseline)・AWQ(Activation-aware Weight Quantization・vLLM/SGLang・4-bit GPU推論)・GPTQ(Generative PreTrained Transformer Quantization・classic 4-bit)・bitsandbytes(Hugging Face・Q4/Q8 dynamic)・MLX-quantized(Apple Silicon Q4/Q8)・FP8(Blackwell H100/B100 native・Hopper以降)・FP4(Blackwell・Multi Frame Gen訓練)・Q2/Q3 extreme(quality低下大)・Q5_K_M sweet・2026年 GGUF Q4 Local/AWQ Server主流。