2990件の用語
言語モデルの事前学習で最も広く使われる損失関数。モデルが予測した次トークンの確率分布と正解分布の差異を最小化する。
LLMを用いて自律的に交渉を行うAIエージェント。価格交渉・契約交渉・資源配分など、対話的な合意形成タスクに特化。
LLM合成データとは、大規模言語モデル(LLM)を用いて人工的に生成されたテキストデータのことで、モデルの学習・評価・ファインチューニングに活用される技術である。
GPT-4やClaude等の強力なLLMを使って高品質なinstruction-followingデータを人工的に生成する技術。Self-InstructやEvol-Instructなどの手法でデータ生成コストを大幅に削減しつつモデル性能を向上させる。
LLM合成データ拡張とは、既存のデータセットをLLMの能力を活用して言い換え・翻訳・スタイル変換・難易度調整などにより量的・質的に拡張する技術であり、少量データからの効率的なモデル学習を実現する。
LLMを使って学習用データを人工的に生成する技術。実データの不足・プライバシー・コストの問題を補完し、指示チューニング・アライメント・ドメイン特化ファインチューニング向けデータを大量生成する。
LLM合成データ生成とは、大規模言語モデルのAPI呼び出しやローカル推論を通じて、学習用テキストデータを自動的に大量生産する技術であり、Self-Instruct・Evol-Instruct・Magpieなど多様な手法が存在する。
LLM合成データフィルタリングとは、LLMが生成した大量の合成データから低品質・有害・重複・矛盾するサンプルを自動的に検出・除去し、学習に使用するデータの品質を保証する技術である。
LLM合成ペルソナとは、大規模言語モデル(LLM)を用いて特定の人格特性・知識・行動パターンを持つ仮想的な人物像(ペルソナ)を生成し、ユーザーテスト・市場調査・教育シミュレーション・対話エージェントなどに活用する技術体系である。
LLM構造化出力とは、大規模言語モデルの応答をJSON・XML・特定スキーマなどの決まった形式で出力させる技術の総称で、アプリケーション統合やデータパイプラインの自動化において不可欠な機能である。
LLMの応答をJSON・XML・YAML等の構造化フォーマットで出力させ、プログラムから型安全に利用可能にする技術。OpenAIのStructured Outputs、AnthropicのTool Use、GoogleのControlled Generationなど各プロバイダが独自の実装を提供している。
LLMのアテンションヘッド・FFNニューロン・レイヤー全体などの構造単位を除去してモデルを軽量化する手法。非構造的プルーニングと異なりGPU推論で直接高速化が得られる。
LLM(大規模言語モデル)の学習において、損失関数の勾配情報を利用してモデルパラメータを効率的に更新する手法の総称。Adam 系を基本に、Lion・Sophia・LAMB など 2023-2026 年に多数の改良オプティマイザが提案され、学習速度・メモリ効率・収束安定性が大幅に向上した。
Transformerの二次計算量ボトルネックを解消するために設計された代替アーキテクチャの総称。状態空間モデル(SSM)、線形Attention、RNN復権型など複数のアプローチが存在し、長系列処理での推論効率を大幅に改善する。
コードの前後の文脈(プレフィックスとサフィックス)を入力として、中間部分を生成する技術。Fill-in-the-Middle(FIM)とも呼ばれ、コード補完の中核テクニックである。
大規模言語モデル(LLM)を用いてプログラムのソースコードを自動的に生成する技術。自然言語による指示やコメントからコードを出力し、開発生産性を飛躍的に向上させる。
LLMを用いてプログラムのバグを自動的に検出・原因特定・修正提案する技術。エラーメッセージやスタックトレースを解析し、根本原因の特定と修正コードの生成を行う。
LLMがプログラミング中のコードの続きを予測・提案する技術。カーソル位置の文脈を解析し、次に書くべきコードをリアルタイムで提示する。
LLMがエディタ上でリアルタイムにコードの続きを予測・提案する機能。Fill-in-the-Middle学習により、カーソル位置の前後文脈から最適なコード断片を生成する。
LLMを活用してソフトウェアのバグを自動検出・修正する技術。エラーメッセージやスタックトレースからバグの原因を推論し、修正パッチを自動生成する。SWE-Benchが標準評価基準。