2990件の用語
2024年成熟Multi-Query Attention・Industry-leading single KV head shared across queries + Industry-leading 10x+ KV cache reduction + Industry-leading inference speedup + Industry-leading Noam Shazeer Google MQA fast inference attention 2024。
全QueryヘッドがKey/Valueヘッドを1つ共有するアテンション機構。KVキャッシュを最小化することで推論速度を大幅に向上させるが、モデル品質はMHAより若干低下する傾向がある。
AI推論用Multi-GPU Rig。RTX 5090×2 (NVLink廃止後 PCIe Gen5 x16/x16)・RTX 4090×4 PCIe Gen4・MI300X×2 (Infinity Fabric Link)・Threadripper PRO 7995WX 7 PCIe Slot・WS Server MB ASUS WRX90E SAGE/Pro WS WRX80E・Open Rig Mining Frame流用・Bifurcation x4x4x4x4・Riser PCIe Gen4 16x→4x・1500W+ PSU 2台 redundant・¥1M-¥3M、2026年家庭72B Q4推論可能。
LLMが複数のツール呼び出しを連鎖的に実行するパターン。前の呼び出し結果を次の入力として使用し、複雑なタスクをステップ分割して解決する。
LLMの事前学習時に1つの位置から複数の将来トークンを同時に予測するよう訓練することで、モデルの表現力を向上させると同時に、推論時に2〜4倍の高速化を実現する学習・推論統合型の並列デコーディング手法。
LLMの訓練時に次の1トークンではなく複数トークンを同時予測する目標関数。Meta FAIRが2024年提案。DeepSeek-V3やLlama 4が採用し、投機的デコーディングによる推論高速化を可能にする。
単一のフォワードパスで複数の将来トークンを同時に予測するLLM訓練・推論手法。Metaが2024年に提案したMTPアーキテクチャが代表例で、訓練効率の向上・コード生成精度改善・推論高速化を同時に実現する。
Self-Attentionを複数の独立したヘッド(サブ空間)で並列実行し、それぞれ異なる観点から文脈を捉えた後に結合する機構。単一ヘッドでは捉えきれない多様な関係性(構文的・意味的・位置的)を同時に学習できる。
マルチヘッドアテンション(Multi-Head Attention, MHA)とは、アテンション計算を複数の独立したヘッド(部分空間)で並行実行し、各ヘッドが異なる種類の関係性パターン(構文的依存、意味的類似、位置関係など)を学習できるようにした機構である。Transformer原論文では8ヘッド構成だったが、GPT-4oでは推定128ヘッド、Llama 3.1 405Bでも128ヘッドに拡大している。
2024年5月DeepSeek発表Multi-Head Latent Attention MLA・Industry-leading low-rank KV joint compression + Industry-leading 93.3% KV cache reduction + Industry-leading DeepSeek-V2 + V3 signature attention + Industry-leading DeepSeek MLA innovative attention 2024。
DeepSeekが開発したKVキャッシュ圧縮技術。低ランク潜在ベクトルにKV情報を圧縮し、MHAと比較してKVキャッシュを93%以上削減する。
DeepSeek-V2が提案したKVキャッシュ圧縮型アテンション機構。Key/Valueをlow-rank潜在ベクトルへ圧縮してKVキャッシュサイズを大幅削減し、MHAと同等の表現力を維持しながら推論メモリコストを87%以上削減する手法。
Multimodal LLM (Vision+Audio)。OpenAI GPT-4o (Omni・Vision+Audio Native)・GPT-4o mini・Anthropic Claude 4 Vision (Sonnet/Opus)・Google Gemini 2.5 Pro Vision (Audio Native)・Gemini 2.5 Flash・Llama 4 Maverick (Multimodal)・Pixtral 124B Mistral・Qwen2-VL 72B/Qwen3-VL・Molmo 72B Allen AI・MiniCPM-V 2.6・InternVL 3・¥0 OSS-API・OCR/Chart理解、2026年Voice 2way+リアルタイムVideo対応標準。
画像+音声+動画+テキスト統合LLM。GPT-5 Vision/Voice・Claude Opus 4 Vision/Computer Use・Gemini 2.5 Pro(1M+・Video)・Grok 3 Multimodal・Qwen 2.5-VL-72B・Llama 4 Maverick multimodal・Pixtral Large(Mistral)・InternVL 2.5が2026年代表、CLIP/SigLIP vision encoder+LLM接続、OCR+画像理解+動画理解。
画像/動画/音声対応LLM。GPT-5 Omni(image/audio/video native)・Claude Opus 4.7 Vision(image+PDF)・Gemini 2.5 Pro(2M token・video/audio)・Llama 4 Vision・Qwen 2.5-VL-72B・Pixtral 12B(Mistral)・DeepSeek V3 Vision・InternVL 3.0 78B・NVLM-D-72B(NVIDIA)対応、2026年OCR/表抽出/動画要約+Computer Use基盤。
テキスト・画像・音声・動画など複数の情報形式(モダリティ)を統合的に理解・生成できる大規模言語モデルの総称。従来のテキスト専用LLMを拡張し、異なるモダリティ間の意味的対応関係を学習することで、より人間に近い多感覚的な情報処理を実現する。
Multimodal Realtime API。OpenAI Realtime API (gpt-4o-realtime・WebSocket・voice2voice)・Advanced Voice Mode ChatGPT (Free→Pro・iOS+Android+Web)・Google Gemini 2.5 Live API・Project Astra (Realtime Multimodal Camera+Voice)・Anthropic Claude Voice予告・Hume EVI 2 (Empathic Voice)・Cartesia Sonic 90ms Latency・Sesame CSM-1B・ElevenLabs Conversational AI 2.0・Sindre Sorhus Apple Intelligence Beta・¥¥¥¥¥-¥¥¥¥¥¥¥/M tokens、2026年Voice Realtime主流化。
テキスト+音声+画像+動画を同時に処理する LLM。GPT-4o Voice/Gemini Live/Claude 4.7 Realtime が代表、2026年は 100ms以下遅延で対話標準化。
2023 年に発表された状態空間モデル(SSM)ベースの LLM アーキテクチャ。Transformer の二次計算量(O(n²))問題を線形計算量(O(n))で解決し、長いコンテキストでの高速推論と低メモリ使用を実現する。
2024年成熟Mamba・Industry-leading selective state space model + Industry-leading linear-time scaling + Industry-leading O(n) vs Transformer O(n²) + Industry-leading CMU+Princeton Mamba state space architecture 2024。