14805件の用語
LLMの重み行列を低ランクの行列積に分解してパラメータ数を削減する手法。LoRA(Low-Rank Adaptation)の理論的基盤であり、SVD分解やTensor Decompositionを用いてモデルの冗長性を除去する。
LLMの訓練データにベンチマークや評価用データが混入し、モデルの性能測定が不正確になる現象。公平な評価を阻害する重大な課題として研究が進む。
大規模言語モデル(LLM)の訓練・ファインチューニングにおいて、既存のデータセットを変換・合成して訓練データ量と多様性を増加させる技法群。Back-Translation・Paraphrase・Self-Instruct・Synthetic QA 生成などの手法があり、データ不足やドメイン偏りの課題を解決する。
LLMの学習に使用するデータセットを収集・選別・整理・品質管理する一連のプロセス。モデル性能の80%以上がデータ品質に依存するとされ、近年最も注目される研究領域の一つ。
LLM(大規模言語モデル)の学習データを収集・選別・品質管理する一連のプロセス。CommonCrawl等の大規模Webコーパスから有害コンテンツ除去・重複排除・品質フィルタリングを行い、高品質な学習データセットを構築する。
LLMデータキュレーションパイプラインとは、ファインチューニング用データセットの収集・クリーニング・フィルタリング・重複排除・品質スコアリング・多様性確保を体系的に管理するワークフローである。Argilla・Label Studio・Lilac等のツールが主流で、データ品質がモデル品質を決定する。
LLMの学習データセットから重複・類似テキストを検出・除去する技術。MinHash LSHやSuffix Arrayなどのアルゴリズムを用い、学習効率の向上とmemorization(暗記)リスクの軽減を実現する。
LLM(大規模言語モデル)を活用して非構造化テキストや文書から構造化データを自動的に抽出する技術。従来の正規表現やルールベースNLPでは対応困難だった曖昧な表現や文脈依存の情報を、LLMの言語理解能力によって高精度に抽出できる。
大規模言語モデルの学習データから重複・類似コンテンツを検出・除去する技術。完全一致(Exact Dedup)と近似一致(Fuzzy Dedup)の2段階で実施し、MinHash LSHやSimHashが代表的なアルゴリズムである。
大規模言語モデル(LLM)の学習に必要なデータを収集・前処理・品質管理・トークン化する一連のワークフロー。Common CrawlやFineWebなどの大規模コーパスを入力とし、学習可能な形式に変換する。
大規模言語モデルの学習データから低品質テキスト・有害コンテンツ・個人情報(PII)を自動検出・除外するフィルタリング技術。fastText分類器やperplexityベースのスコアリングが代表的な手法である。
LLMデータフライホイールとは、大規模言語モデルの本番運用で蓄積されるユーザーフィードバック・推論ログ・品質評価データを体系的に収集し、モデルの継続的改善に活用する好循環サイクルの総称である。データ収集→品質評価→サンプル選定→アノテーション→再学習→再デプロイの各段階を自動化パイプラインで結合することで、運用期間が長くなるほどモデル性能が加速度的に向上する仕組みを構築できる。
LLMの訓練データや微調整データに意図的に汚染データを混入し、特定の入力に対して攻撃者が望む誤動作を引き起こすバックドア攻撃手法。
大規模言語モデルの学習データに対して行うテキスト正規化・クリーニング・言語判定・エンコーディング修正などの初期処理工程。生データを後続の品質フィルタリングやトークン化に適した形式に変換する。
LLMが特定のテキスト(個人情報・著作物・テストデータ)を訓練時に記憶し、プロンプト誘導によって再現・出力できる状態を検出・定量化する手法。記憶抽出攻撃と汚染検出の両面を含む。
LLMが生成したテキストに人間には見えない統計的パターンを埋め込み、後から出所を検証できる技術。
LLMが敵対的入力(攻撃的プロンプト・分布外データ・ノイズ)に対して安定した安全な動作を維持する能力と、2025年時点での評価・強化技術の総体。
LLM(大規模言語モデル)がテキストを生成する際に、次のトークンを選択するアルゴリズムの総称。貪欲法・ビームサーチ・サンプリング系など複数の手法があり、生成品質・多様性・速度のトレードオフを制御する。
LLM(大規模言語モデル)の出力品質・安全性・信頼性を体系的に検証する手法の総称。従来のソフトウェアテストとは異なり、確率的な出力を扱うためファジーマッチング・LLM-as-Judge・統計的評価など独自のアプローチが必要となる。
LLMの推論フェーズにおいて追加の計算リソースを投入し、生成品質や正確性を向上させる手法の総称。訓練時の計算量(Train-Time Compute)に対し、推論時に計算を増やすことでモデルの実効性能を引き上げる考え方。