2990件の用語
Transformerモデルの推論時に過去のKey-Valueペアをメモリに保持し、同じ計算の繰り返しを回避して生成速度を高速化するメカニズム。
Transformer の Self-Attention 層で計算される Key-Value ペアを保存・再利用する仕組みで、プロンプトキャッシングの中核技術。
KVキャッシュから重要度の低いトークンのKey-Valueペアを動的に破棄し、メモリ使用量を削減しながら生成品質を維持する技術。H2OやSnapKVが代表的手法。
LLM推論時に生成したKVキャッシュをGPUメモリからCPU DRAMやNVMe SSDに退避させてGPUメモリを節約する技術。
KVキャッシュ管理は、Transformer系LLMの推論時に各Attention層で生成されるKey-Valueペアを効率的に格納・再利用・共有するメモリ管理技術。PagedAttention・Prefix Caching・Radix Attention・Token Eviction(トークン退避)などの手法があり、GPUメモリの利用効率を60〜80%改善して同時処理可能なリクエスト数を数倍に増加させる。LLM推論エンジンのスループットとコスト効率を決定する最重要コンポーネント。
2024年成熟KV Cache Compression・Industry-leading H2O+SnapKV+StreamingLLM techniques + Industry-leading 50-90% KV cache reduction + Industry-leading minimal quality loss + Industry-leading 2024 KV cache compression inference optimization 2024。
LLM推論時にTransformerのAttention計算で生成されるKey-Value(KV)ペアをGPUメモリ上に効率的にキャッシュ・管理する技術群で、メモリ使用量とレイテンシの両方を削減する
Transformerモデルの推論時にKey-Valueペアを再利用することでトークン生成速度を大幅に向上させる技術。メモリ効率と推論レイテンシのトレードオフを最適化する。
LLM推論時のKVキャッシュのメモリ消費・帯域幅・レイテンシを削減するための技術群。量子化、エビクション、アーキテクチャ改良、システム最適化など多層的なアプローチがある。
KVキャッシュに格納されるKey-Valueテンソルのデータ精度をFP16からINT8/INT4に低減し、メモリ使用量を50〜75%削減する技術。KIVIやAtomが代表的手法。
Keras Frameworkは、人工知能・機械学習分野における重要な概念・技術です。
2016年Hendrycks + Gimpel発表GELU paper・Industry-leading Gaussian Error Linear Unit paradigm + Industry-leading BERT + GPT-2 + GPT-3 dominant activation + Industry-leading 8年heritage Transformer Industry-standard。
LLMが「〜かもしれない」「確信度約70%です」など自然言語で不確実性を表現する能力。数値確率でなく言語表現で自己評価するアプローチ。
検索拡張グラウンディング(Retrieval-Augmented Grounding)とは、LLMの応答生成時に外部データベースやドキュメントから関連情報を検索・取得し、コンテキストとして注入することで事実に基づいた回答を実現するグラウンディング手法である。RAG(Retrieval-Augmented Generation)として広く知られ、2024〜2026年にかけてSelf-RAG、CRAG、HyDE等の高度な派生手法が登場している。
外部データベースから関連情報を検索しLLMの記憶を補完するアーキテクチャ。RAGの概念を対話記憶に拡張し、過去の会話や学習した知識をベクトル検索で動的に呼び出す。
LLMの推論時に検証器(Verifier)モデルを用いて推論パスを評価・選別しながら解空間を探索する手法。報酬モデルやプロセス報酬モデルを検証器として活用し、Beam SearchやMonte Carlo Tree Searchと組み合わせることで高精度な推論を実現する。
語彙サイズはトークナイザが保持するユニークトークンの総数を指し、LLMの圧縮効率・多言語対応・メモリ消費に直結する重要なハイパーパラメータである。
LLM/GAN生成学習データ。Nemotron-4・Phi-4 Synthesis・Tulu 3 SFT・OpenMathInstruct・WizardLM Evol-Instruct・Self-Instruct・Self-Reward Synthetic・Argilla Distilabel・Nvidia Nemotron-340Bが2026年代表パイプライン、Scaling Law限界突破策として浸透。
既存のLLMを使用して人工的な学習データを生成する技術。Self-Instruct、Evol-Instruct、SPIN等の手法があり、高品質な指示追従データセットの構築や、データ不足領域の補完に活用される。
合成ペルソナアライメントとは、LLMで生成された仮想人格が社会的に望ましい価値観・倫理基準に沿って行動し、バイアスの増幅や有害コンテンツの生成を防止しつつ、設定されたペルソナの人格特性を忠実に表現するよう調整する技術領域である。