グループドクエリアテンション(Grouped-Query Attention, GQA)とは、複数のQueryヘッドが1組のKey-Valueヘッドを共有するアテンション機構であり、Multi-Head Attention(MHA)の品質とMulti-Query Attention(MQA)のメモリ効率を両立する手法である。Google Researchが2023年の論文「GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints」で提案し、Llama 3.1、Gemma 2、Mistral、Qwen 2.5など2024-2026年の主要LLMの標準構成となった。