LLM推論KV Cache最適化。PagedAttention (vLLM・OS Page Table類似)・Flash Attention 3 (Hopper H100)・Flash Attention 2.7 (Ampere/Ada/Blackwell)・Multi-Query Attention (MQA)・Group Query Attention (GQA・Llama 3)・Sliding Window Attention・KV Cache Quantization (q8_0/q4_0)・Prefix Caching・Speculative Decoding・Lookahead Decoding・¥0 OSS、2026年Hybrid Attention主流化。