14805件の用語
APIを通じて大量のクエリを発行し、対象LLMの重みや内部動作を模倣するモデルを構築する知的財産窃取攻撃。ブラックボックス設定で実行可能。
複数の学習済みLLMのパラメータを統合し、各モデルの長所を兼ね備えた単一モデルを生成する技術。追加学習なしで能力を合成できる点が最大の特徴である。
LLM Model Router(モデルルーター)とは、入力クエリの特性を分析し、複数の大規模言語モデルの中から最適なモデルを自動的に選択・振り分けする仕組みである。ML ベースの分類器やルールエンジンにより、品質を維持しながらコストとレイテンシを最小化する。
ユーザーのクエリ内容・複雑さ・コスト制約に応じて、最適なLLMモデルへリクエストを自動振り分けする技術。簡単な質問にはHaikuクラスの軽量モデル、複雑な推論にはOpusクラスの高性能モデルを割り当てることで、品質とコストを同時に最適化する。
LLM(大規模言語モデル)の推論品質・レイテンシ・コスト・異常検知をリアルタイムに監視し、本番環境での信頼性を維持する運用プラクティス。
LLMの生成テキスト中の差別・ヘイト・暴力・性的表現等を自動検出するモジュールと評価手法の総称。
正解ラベルのone-hot分布を平滑化し、モデルの過信を抑制する正則化手法。Transformerの原論文で採用され、LLMの汎化性能向上に貢献する。
LLMの性能を複数のベンチマークスコアに基づいてランキング形式で一覧表示するウェブサービス。HuggingFace Open LLM Leaderboard や LMSYS Chatbot Arena が代表的で、モデル選定の参考指標として広く利用されている。
LLM量子化とは、大規模言語モデルの重みパラメータを32ビット浮動小数点(FP32)から4ビット・8ビット整数などの低ビット表現に変換し、モデルサイズの削減と推論速度の向上を実現する圧縮技術である。Llama 3.1 405Bモデルの場合、FP16で約810GBのVRAMが必要だが、4ビット量子化により約200GBまで削減できる。
Microsoftが開発したLLM向けプロンプト圧縮フレームワークの第2世代。トークン分類による情報保持判定で元プロンプトを最大20倍圧縮しながら推論精度を維持する。低コスト・低レイテンシのRAGパイプラインに有効。
LLMへのリクエストを受信し、クエリの分析結果に基づいて最適なモデルやエンドポイントへ転送するミドルウェアコンポーネント。APIゲートウェイとしてリトライ、フォールバック、レート制限、コスト追跡などの運用機能も統合する。
クエリの複雑度・コスト・レイテンシ目標に応じてLLMモデルを自動選択するインテリジェントルーティング技術。小型モデルと大型モデルを使い分けてコストを最適化。
LLM Routing & Orchestration(LLMルーティング&オーケストレーション)とは、複数の大規模言語モデルに対してリクエストを最適に振り分け、連携動作を制御する技術体系である。コスト・レイテンシ・品質のトレードオフを自動最適化し、単一モデルでは達成できない柔軟性と経済性を実現する。
LLM推論のレスポンス時間を多角的に計測・監視する手法。TTFT(最初のトークンまでの時間)、TPS(1秒あたりのトークン生成数)、E2E(エンドツーエンド)レイテンシなどの指標を追跡し、ユーザー体験とSLOの維持を図る。
LLMのTransformerレイヤー全体を除去することでモデルを軽量化する構造的プルーニングの一形態。後半レイヤーほど重要度が低い傾向があり、ShortGPT・LaCo等のフレームワークで実用化されている。
LLM APIに送信するリクエストで出力形式を指定するパラメータの総称。text(自由テキスト)、json_object(JSON構文保証)、json_schema(スキーマ準拠JSON)の3段階があり、用途に応じて使い分ける。
LLMの脆弱性・有害出力・安全性の欠陥を意図的に発見するためのテスト手法。攻撃者の視点でモデルを評価し、Jailbreak・Prompt Injection・バイアス等のリスクを事前に特定する。
LLMの安全上の脆弱性を意図的に探索するセキュリティテスト手法。有害コンテンツ生成・ジェイルブレイク・プロンプトインジェクション・バイアス等のリスクを事前に発見・緩和するために実施される。
悪意ある入力・エッジケースを体系的に試みてLLMの安全上の脆弱性を発見・修正する評価プロセス。
LLM の安全性を検証するために、意図的に有害・不正な出力を引き出す攻撃的テスト手法。軍事・セキュリティ分野の「レッドチーム」概念を AI に応用し、モデルの脆弱性を発見して対策を講じるプロセス。