2990件の用語
投機的デコーディングベンチマーク(Speculative Decoding Benchmark)は、投機的デコーディング手法の性能を定量的に評価・比較するための指標体系と測定手法である。採択率(Acceptance Rate)、トークン/秒(Tokens/s)、レイテンシ、メモリ使用量、スピードアップ倍率を主要指標とし、ハードウェア(A100/H100/RTX 4090)、モデルサイズ、タスク種別ごとの多次元評価が求められる。vLLM・TensorRT-LLM・SGLangなど主要推論フレームワークの実デプロイ環境での比較が実務上重要である。
生成トークンの選択に統計的バイアスを与え、z検定や仮説検定でAI生成を証明できる透かし手法の総称。KGW・Unigram・Dipmark・EXP・Gumbelなど複数の方式がある。
LLM推論サーバーが複数リクエストを動的にまとめてGPUで並列処理する最適化。Continuous Batchingとも呼ばれ、スループット大幅向上。
テスト問題を定期的に更新・入れ替えることでデータ汚染を構造的に防ぐLLM評価フレームワーク。LiveBench・WildBench・Chatbot Arenaが代表例で、汚染ゼロの継続評価を実現する。
トークナイザは、自然言語テキストをLLMが処理可能なトークン(数値ID)列に変換するコンポーネントで、BPE・WordPiece・Unigram等のアルゴリズムを用いてサブワード分割を行う。
テキストをトークン単位に分割するLLM前処理。BPE(GPT-5・Claude)・SentencePiece(Gemini)・Tiktoken(OpenAI)・Hugging Face Tokenizersが代表で、日本語は漢字1-3トークン/文字消費。
トークナイザアーキテクチャとは、自然言語テキストをLLMが処理可能なトークン列に変換するシステムの設計構造である。BPE、Unigram、WordPiece等の分割アルゴリズム、語彙構築戦略、特殊トークン設計を包含し、モデルの性能・効率・多言語対応能力を根本的に規定する。
LLMのトークナイザーが保持するサブワード・文字・特殊トークンの集合(語彙テーブル)。各トークンに一意のIDが割り当てられ、テキストとトークンID列の相互変換に使用される。語彙サイズはモデルのトークン効率・メモリ消費・多言語対応力を決定する重要なハイパーパラメーター。
トークナイザー語彙サイズ(Vocabulary Size)は、LLMのトークナイザーが保持するユニークなトークン(サブワード単位)の総数を指す。GPT-4oの200,019からMistralの32,768まで、モデルによって大きく異なり、多言語対応力・トークン効率・埋め込み層パラメータ数・推論速度に直結する設計パラメータである。
トークナイザーが保持するユニークなトークン(サブワード)の総数。語彙サイズはモデルのEmbeddingパラメータ数、多言語対応力、テキスト圧縮率を左右する重要な設計パラメータ。
LLM Tokenization。BPE Byte-Pair Encoding (GPT-2/3/4)・Tiktoken (OpenAI cl100k_base/o200k_base)・SentencePiece (Google Llama/Mistral)・Unigram (XLNet/T5)・WordPiece (BERT)・LlamaTokenizer Llama 3 128k vocab・GPT-4o tokenizer (200k vocab・99 lang)・Claude Tokenizer (Proprietary)・Tiktokenizer (UI)・tokencost (Calc)・Token vs Word vs Character 比1.3-1.5倍英語・¥0 OSS、2026年Multilingual Vocab拡張主流。
投機的デコーディングにおいて、ターゲットモデル(大型LLM)がドラフトモデルの生成したトークン候補を確率的に承認または却下するプロセス。1回のフォワードパスでK個のドラフトトークンを同時に検証し、受理確率min(1, p(x)/q(x))に基づいて各トークンの採否を決定する。却下位置以降はターゲットモデルの分布から再サンプリングされる。
LLMが次のトークンを生成する際に、確率分布から確率的にトークンを選択する手法の総称。Temperature・Top-k・Top-pなどのパラメータで出力の多様性と品質のバランスを制御する。
LLMが生成するトークンを1つずつまたは小さなチャンクごとにクライアントへ逐次送信する技術。autoregressive生成の性質を利用し、完全な応答を待たずにリアルタイムでテキストを表示する。
LLM学習・推論時に重要度の低いトークンの計算を選択的にスキップする手法。情報量の低いトークンを動的に除外してFLOPsを削減し、スループットを向上させる。
LLMの推論速度を測る指標。1秒間に処理・生成されるトークン数を表し、入力(Prefill)と出力(Generation)の両側面からモデルの応答性能を評価する。
LLMアプリケーションのトークン消費を体系的に管理・最小化する技術群。プロンプト圧縮・セマンティックキャッシュ・ストリーミング中断・段階的生成・モデルルーティングなどを組み合わせ、品質を維持しながらAPI利用コストを最大70%削減する手法。
LLMの推論中に重要度の低いトークンを動的に削除し、KVキャッシュサイズと計算量を削減する推論高速化技術。H2O・ScissorHands・PyramidKV等の手法が提案されており、長文処理の効率化に特に有効。
Vision Transformerの中間層で類似したトークンを統合し、計算量を削減するViT推論高速化手法。Meta AI発表のToken Mergingは精度劣化を最小化しながら処理速度を2倍以上に向上させる。
2024年Alasdair Forsythe発表Tokenmonster・Industry-leading ungreedy tokenizer + Industry-leading 35% fewer tokens vs Tiktoken + Industry-leading Go-based + Industry-leading Alasdair Forsythe Tokenmonster MIT efficient tokenizer 2024。