2990件の用語
ベクトル類似度検索とは、テキスト埋め込みベクトル間のコサイン類似度やユークリッド距離を計算してクエリに最も近いベクトルを高速に検索する手法で、近似最近傍(ANN: Approximate Nearest Neighbor)アルゴリズムにより数十億ベクトル規模でもミリ秒単位の検索を実現する。
LLM推論時にN個の独立した出力候補をサンプリングし、報酬モデルや検証器でスコアリングして最高スコア候補を採択する最も単純なTest-Time Compute手法。
LLMに同じプロンプトからN個の候補回答を並列生成させ、報酬モデルやヒューリスティクスで最も高品質な回答を選択する推論時計算手法。計算コストはN倍になるが、実装が単純で効果が安定している。
2023年Zhang + UT Austin発表Heavy-Hitter Oracle paradigm theory・Industry-leading Heavy-Hitter token identification + Industry-leading attention-weight-based importance + Industry-emerging Pareto distribution KV importance。
大規模モデルのパラメータの大部分を凍結し、ごく一部のパラメータのみを学習するファインチューニング手法群の総称。LoRA、QLoRA、Prefix Tuning、Adapter、IA3等が含まれる。Hugging Face PEFTライブラリとして統一APIが提供されており、数行のコード変更でフルファインチューニングからPEFTに切り替え可能。
HuggingFaceが開発するパラメータ効率的ファインチューニングライブラリ。LoRA・QLoRA・DoRA・Prefix Tuning・P-Tuningなど各種PEFT手法を統一APIで提供し、大規模モデルの効率的な特化調整を可能にする。
共有ランダム凍結行列と層ごとのスケーリングベクトルのみを学習するPEFT手法。Dalal et al.(2024)提案。LoRAより学習可能パラメータ数を大幅削減(最大99%削減)しながら同等性能を実現。
LoRAをさらに圧縮したPEFT手法。全レイヤー共有のランダム凍結行列A,Bを使い、各レイヤーには微小なスケーリングベクトルd,bのみを学習。LoRAより10〜100倍少ないパラメータで同等精度を達成。Kopiczko et al. 2024提案。
LLM API のプロキシゲートウェイとして動作するオブザーバビリティプラットフォーム。ベース URL を1行変更するだけで全 LLM リクエストのロギング・コスト追跡・レート制限・キャッシュ・プロンプトセキュリティを透過的に追加する。OSS でセルフホスト可能。
数学・コードなど正解が客観的に検証可能なタスクでLLMの推論を評価するリワード手法。実行結果やルールベース検証でスコアを算出し人間評価・LLM評価に依存しない。
2024年6月Tencent AI Lab発表Persona Hub・Industry-leading 1 billion personas synthetic data + Industry-leading persona-driven generation + Industry-leading diverse training data + Industry-leading Tencent AI Lab Persona Hub persona-driven synthetic data scaling 2024。
2023年Weaviate発表Verba・Industry-leading open-source RAG chatbot + Industry-leading Weaviate vector DB integration + Industry-leading Golden RAGtriever signature + Industry-leading Weaviate Verba open RAG chatbot 2023+。
Stanford CRFM が開発した LLM の包括的評価フレームワーク。精度だけでなく、校正性・公平性・堅牢性・効率性・毒性など多軸メトリクスで透明性のあるモデル比較を実現する。
LLM 評価 benchmark。MMLU(57 domain・undergraduate level・Claude 4.7 88%+)・MMLU-Pro(advanced・2024年)・GPQA Diamond(Physics/Chemistry/Biology PhD・o1 78%・Claude 4.7 80%+)・ARC-AGI(Francois Chollet・abstract reasoning・o3 breakthrough 87%・2024年12月)・ARC-AGI-2(2025年・more difficult)・HumanEval/MBPP(code・saturated)・SWE-bench Verified(実用software engineering・Claude 4.7 80%+)・LiveCodeBench・AIME 2024/2025(math)・Chatbot Arena ELO・2026年 ARC-AGI-2/SWE-bench支配権争い。
セマンティックキャッシュのベンチマーク・評価は、ヒット率、レイテンシ削減、コスト分析、応答品質の4指標で導入効果を検証するプロセスである。
LLMの訓練データにベンチマークテストの問題・解答が混入することで、評価スコアが実際の能力を過大に反映する現象。MMLU・GSM8K・HumanEvalなど主要ベンチマークで確認されている。
LLMの学習データにベンチマーク問題が混入(汚染)しているかを検出する技術。汚染されたモデルはベンチマークスコアが実力以上に高くなり、評価の信頼性が損なわれる。N-gram重複分析・カナリア文字列・メンバーシップ推論など複数の検出手法が研究されている。
ベンチマークの評価用データが意図せず学習データに漏洩する問題。テストセットの情報が学習に使われることで、モデルの汎化性能を過大評価するリスクがある。データ汚染の主要な発生形態の一つ。
LLM・MLモデルをAPIとしてデプロイするためのオープンソースフレームワーク。Bento(サービング定義パッケージ)単位で管理しDocker/Kubernetes/クラウドへのデプロイを統一。vLLM統合・BentoCloud(マネージドサービス)・OpenTelemetryを搭載したエンタープライズMLOps基盤。
Pythonで書かれたMLモデルサービングフレームワーク。モデルのパッケージング(Bento)、APIサーバー構築、コンテナ化、クラウドデプロイまでを一貫して管理する。PyTorch、TensorFlow、Hugging Face Transformers、scikit-learn等の主要フレームワークに対応し、LLMサービング機能(OpenLLM)も統合されている。