2990件の用語
大規模言語モデルの推論・学習において、単一層のテンソル演算(行列積等)を複数GPU間で分割して並列実行する手法で、単一GPUのメモリに収まらないモデルの高速処理を実現する
>-
Google 主導開発の Python 機械学習フレームワーク。Eager Mode + Keras 統合 + TPU 最適化・GitHub スター187,000・PyTorch と二大フレームワーク.
Google 2019年9月リリースTensorFlow 2.0。Eager Execution標準+Keras統合+tf.function+Python pickle化・PyTorch対抗強化。
TensorFlow Lite(TFLite)は、Googleが開発した軽量化された機械学習フレームワークです。従来のTensorFlowはサーバーやデスクトップ環境で大規模なモデルを訓練・推論するために設計されていましたが、TFLiteはモバイル端末や組み込みシステム(IoT機器)などリソース制約のあるデバイス上で高速かつ低消費電力で推論を実行できるよう最適化されています。
大規模言語モデルの分散学習手法の一つ。Transformer の Attention 層や FFN 層の行列演算を複数 GPU に列方向・行方向に分割して並列実行する技術。Megatron-LM が提唱し、ノード内 NVLink 接続での高速通信が前提。
LLMの重み行列を複数GPUに分割して並列計算する推論・学習技術。単一GPUに収まらない大規模モデルを複数デバイスで協調実行し、バンド幅とスループットを向上させる。
LLM分散学習でTransformerの行列演算(Linear層・Attention・FFN)を複数GPUに列/行分割して並列実行する手法。単一レイヤーを分割するためGPU間の高速通信(NVLink)が必須。Megatron-LMが先行研究を確立し、現在の大規模学習の標準技術となっている。
大規模モデルの各層のテンソル演算を複数のGPUに分割して同時実行する並列化戦略。単一GPUのメモリに収まらないモデルの推論・学習を可能にする。
LLM生成時の出力の確率分布をスケーリングするパラメータ。0に近いと決定論的・高いと多様なランダム出力。テキスト生成のクリエイティビティと一貫性のトレードオフを制御する。
1985年Statistical Mechanics Temperature paradigm起源・1992年Hinton Boltzmann machines応用・Industry-leading Probability scaling sampling paradigm + Industry-leading T=0.7-1.0 default + Industry-leading temperature control + Industry-leading LLM sampling Industry-standard 全LLM Industry-leading adoption + Industry-leading Top-k/Top-p併用 Industry-standard。
LLMのテキスト生成時に出力のランダム性を制御するパラメータ。0に近いほど決定的(最も確率の高いトークンを選択)、高いほど多様で創造的な出力になる。一般的に0.0〜2.0の範囲で設定される。
Temperature Scaling(温度スケーリング)とは、学習済みモデルの出力logitを単一のスカラーパラメータT(温度)で除算することにより出力確率分布の尖度を調整し信頼度校正を改善する事後校正手法である。Guo et al.(2017)により提案されパラメータ数が1つのみという極めてシンプルな構造でありながら多くの設定で高い校正性能を達成する。
LLMのデコーディング時にsoftmax関数の入力logitをTemperature値で除算し、出力確率分布の鋭さ(エントロピー)を制御するパラメータ調整手法。低Temperatureで確定的、高Temperatureでランダムな出力を生成する。
text-to-video拡散モデル。OpenAI Sora 2(60秒 1080p 30fps)・Google Veo 3(120秒 4K)・Runway Gen-4 Turbo・Luma Dream Machine 2・Kling AI v2・Pika 2.5・Hailuo 02・Alibaba Wan 2.1が2026年代表、5-60秒動画生成+物理シミュ+キャラ一貫性改善。
テキスト→動画生成モデル。OpenAI Sora(60秒 1080p)・Sora 2(2025年)・Google Veo 3(4K 8秒)・Runway Gen-4 Turbo・Luma Dream Machine 1.6・Kling AI 1.6(中国 Kuaishou)・Pika 2.0・MiniMax Hailuo 02・Hunyuan Video(Tencent OSS)・Mochi 1(Genmo OSS)・CogVideoX・Wan 2.1対応、2026年短編広告+SNS素材定着。
投機的検証(Speculative Verification)とは、LLM推論における投機的デコーディング(Speculative Decoding)の中核をなす検証フェーズであり、小型のドラフトモデルが高速に生成した候補トークン列を大型のターゲットモデルが一括で検証・採択する仕組みである。ドラフトモデルの自己回帰生成を並列検証に置き換えることで、出力分布を変えずに推論速度を2〜5倍に高速化できる。Leviathan et al.(2023)とChen et al.(2023)が独立に提案し、現在はvLLM・TensorRT-LLM・SGLangなど主要推論フレームワークに標準実装されている。
DeepMindが2023年に発表した投機的デコーディングの数学的定式化。ドラフトモデルの確率分布q(x)から生成されたトークンを、ターゲットモデルの確率分布p(x)との比率min(1, p(x)/q(x))で確率的に受理・却下する。却下時は修正分布max(0, p(x)-q(x))から再サンプリングし、最終出力がターゲットモデル単体と同一分布になることを数学的に保証する。
LLM推論の高速化技術。小型ドラフトモデルが複数トークンを高速に生成し、大型ターゲットモデルが並列検証して不正解のみ棄却する。同一出力品質を維持しながら 2〜3 倍の高速化を実現する。
大規模言語モデル(LLM)の推論を高速化する手法。小型の「ドラフトモデル」で複数トークンを先行生成し、大型の「ターゲットモデル」で一括検証することで、出力品質を維持したまま推論速度を2〜3倍に向上させる。2023年にGoogleとDeepMindが独立に提案し、2025年以降の主要推論フレームワークに標準搭載されている。