2990件の用語
LLMが生成したテキストの事実性・品質・一貫性を自動評価する技術。FActScore・SAFE・Chainpoll・G-Eval・RAGAS・Langfuseなどのフレームワークが活用される。
LLMの推論フェーズでトークン生成確率を操作し、出力テキスト全体に検出可能な隠しシグナルを付与する手法。
LLM蒸留とは、大規模言語モデル(教師モデル)の知識を小型モデル(生徒モデル)に転移する技術で、推論コストを大幅に削減しながら高い性能を維持する手法である。
LLM信頼度校正(Confidence Calibration)とは、大規模言語モデルが出力する確率値や確信度スコアを実際の正答率と一致するように調整する技術の総称である。校正が不十分なモデルは過信または過小評価を起こし、下流タスクの意思決定品質を著しく損なう。Temperature Scaling、Platt Scaling、Isotonic Regression等の事後校正手法と、学習時に校正損失を組み込む手法に大別される。
大規模言語モデル推論実行。vLLM 0.8・llama.cpp・TensorRT-LLM 0.14・Ollama 0.5・LM Studio 0.4・Text Generation Inference(TGI)・SGLang・MLC LLMが代表フレームワーク、PagedAttention+Continuous Batching+Speculative Decoding+FP8/INT4 AWQ量子化で2026年H200/B200 SXM搭載サーバで100-1000 tok/s/user達成。
LLM推論エンジン(LLM Inference Engine)は、大規模言語モデルの推論処理を高速かつ効率的に実行するための専用ソフトウェア基盤。vLLM・TensorRT-LLM・SGLang・llama.cpp・Text Generation Inference(TGI)などが代表格で、KVキャッシュ管理・連続バッチング・量子化・テンソル並列といった最適化技術を組み合わせ、GPUメモリ効率とスループットを最大化する。
LLM(大規模言語モデル)の推論処理を高速化・省メモリ化するための総合的な技術体系。量子化・KVキャッシュ最適化・バッチング戦略・アテンション高速化などを組み合わせ、レイテンシ削減とスループット向上を実現する。
LLM推論チェーンとは、大規模言語モデルが複雑な問題を解決する際に、中間的な推論ステップを連鎖的に生成しながら最終回答へ到達する手法の総称である。Chain-of-Thought(CoT)を代表とし、2022年のGoogle Brain論文以降急速に発展した。
LLM推論バッチングは、複数の推論リクエストを束ねて同時に処理するスケジューリング技術。Static Batching(静的バッチング)・Dynamic Batching(動的バッチング)・Continuous Batching(連続バッチング)の3段階で進化し、GPUのTensor Core稼働率とメモリ帯域利用率を最大化する。連続バッチングの導入によりスループットは静的バッチング比で2〜5倍向上し、現代の推論エンジンの標準技術となっている。
LLM透かし回避手法とは、AI生成テキストに埋め込まれた統計的透かしを無効化・弱体化する技術の総称であり、パラフレーズ攻撃・翻訳ループ・トークン置換・蒸留攻撃など複数の手法が存在する。
LLM透かし検出とは、大規模言語モデルが生成したテキストに埋め込まれた統計的透かし(ウォーターマーク)を検出する技術であり、AI生成コンテンツの識別・追跡・著作権保護に活用される。
LLM透かし検出ツールとは、テキストに埋め込まれたLLM透かし(ウォーターマーク)を検出・分析するためのソフトウェアやAPIサービスの総称であり、GPTZero・Originality.ai・SynthID Detectorなどの商用サービスからオープンソース実装まで多様な選択肢がある。
LLM透かし蒸留攻撃とは、透かし付きLLMの出力を教師データとして別のモデルを学習させることで、透かしなしのテキスト生成能力を獲得する手法であり、LLM透かし技術の根本的な脆弱性として研究が進められている。
LLMスケーリング則とは、大規模言語モデルのパラメータ数・訓練データ量・計算量を増大させると、モデルの性能(損失)がべき乗則(Power Law)に従って予測可能に改善されるという経験的法則である。2020年のKaplan et al.論文で体系化され、GPT-4やLlama 3など現代の大規模モデル設計の理論的基盤となっている。
LLMの出力をJSON、XMLなど事前定義されたスキーマに厳密に準拠させる機能。OpenAI structured outputs、Anthropic tool_use、Google Gemini controlled generationなど各プロバイダが独自実装を提供し、アプリケーション統合の信頼性を飛躍的に向上させる。
LLMが生成したトークンを全文完成を待たずに逐次クライアントへ送信する出力方式。ユーザーの体感待ち時間を大幅に短縮し、ChatGPTやClaudeなどの対話型AIサービスで標準的に採用されている。
LLMの重みの多くをゼロにすることでメモリ削減・推論高速化を図る技術群。非構造化・半構造化・構造化の3カテゴリが存在する。
LLMの重み行列においてほとんどの値をゼロに近づけることでメモリ削減と演算効率化を実現するモデル圧縮アプローチの総称。
大規模言語モデル(LLM)の訓練時に過学習を防ぎ汎化性能を高めるための正則化手法群。Dropout・Weight Decay・Label Smoothing・Gradient Clipping などが代表的で、モデル規模が巨大になるほど適切な組み合わせと強度調整が精度・安定性の鍵を握る。
LLMの出力が人間の意図・価値観・倫理基準に沿うよう調整する技術領域の総称。RLHF・Constitutional AI・Guardrails等の手法を包括し、有害出力の抑制と有用性の維持を両立させる。