2990件の用語
tiktokenとは、OpenAIが開発したBPE(Byte Pair Encoding)トークナイザの高速実装ライブラリである。Rustコアエンジン+Pythonバインディングの構成で、GPT-4/GPT-4o/o3等のOpenAIモデルで使用されるトークナイザを公開実装として提供する。
tiktokenは、OpenAIがRustで実装した高速BPEトークナイザーライブラリで、GPT-4o・GPT-4・GPT-3.5-Turboなど同社の全LLMで使用されている。正規表現による前分割とバイトレベルBPEを組み合わせ、Python/Rust/Nodeバインディングを提供する。Llama 3やQwen 2.5もtiktoken互換形式を採用している。
2022年OpenAI発表Tiktoken paper・Industry-leading OpenAI Fast BPE Tokenizer + Industry-leading GPT-3.5 + GPT-4 + GPT-4o optimized + Industry-leading Rust implementation high-performance。
OpenAIが開発・公開したByte Pair Encodingベースのトークナイザーライブラリ。Rustで実装された高速な実行性能が特徴で、GPT-3.5/4/4o・Llama-3で採用されている。cl100k_base(100,256 vocab)とo200k_base(200,019 vocab)の2種類が主要バリアント。
2018年TikTok公開For You(2016-Douyin中国 + 2018-08 TikTok公開)。Pro 業界Pro Mainstream Short Video Recommendation Top + Pro Engagement中心アルゴリズム + Pro Watch Time + Pro Like/Comment/Share + Pro Zhang Yiming Pro ByteDance創設者 + Pro 累計世界10億+ User + 2024-Pro CapCut AI + 累計2016-2025年9年Heritage。
2024年DiP-mark team発表DiP-mark paper・Industry-leading Distortion-free Pseudo-random watermark + Industry-leading distortion-free token selection + Industry-emerging DiP-mark distortion-free Pioneer。
LLM生成テキストの無損失ウォーターマーク手法。トークン分布を再配分してウォーターマーク信号を埋め込みつつ、期待テキスト品質を理論的に保証する。
LLMのテキスト生成において、情報量(エントロピー)の観点から「典型的」なトークンを選択するデコーディング手法。確率が高すぎるトークン(繰り返しリスク)も低すぎるトークン(乱雑リスク)も除外し、自然なテキスト分布に近い生成を目指す。
Microsoft Researchが2024年に提案したアテンション改良。2つのSoftmaxアテンションマップの差分を取ることで共通ノイズを打ち消し、本当に重要な文脈に注意を集中させる。長文での幻覚(ハルシネーション)低減に寄与する。
Microsoft Researchが2024年に提案したアテンション機構。2つのソフトマックスアテンションマップの差分を取ることで、LLMが苦手とする無関係なコンテキストへの注意(アテンションノイズ)を打ち消し、ハルシネーション削減と長文精度向上を実現する手法。
Diffusion + Transformer統合アーキテクチャ(DiT)。Stable Diffusion 3.5・FLUX.1・OpenAI Sora 2・Google Veo 3・Kling AI v2・Runway Gen-4・Pika 2.5・Hunyuan Video採用、UNet代替のTransformerでスケーラブル化、2026年は10-60秒動画生成品質大幅向上+マルチ物理シミュ。
**Diffusion Model(拡散モデル)とは何か?**
LLMの重み行列を2つの低ランク行列の積で近似することでパラメータ数とメモリを削減するモデル圧縮手法。
2024年3月12日Cognition Labs公開Devin。Pro 業界初Mainstream AI Software Engineer Pro Famous + Pro Autonomous Coding Agent + Pro SWE-Bench 13.86%(GPT-4 1.96%超越) + Pro Scott Wu Pro CEO主導 + Pro Founders Fund投資 + Pro $2B Valuation + 2024-12 Devin GA + 2025-Pro Devin 2公開予定 + 累計2024-2025年Heritage。
Data Augmentationは、人工知能・機械学習分野における重要な概念・技術です。
LLMの事前学習データにベンチマークのテスト問題や評価データが混入する現象。モデルが問題を暗記してしまうため、ベンチマークスコアが実力以上に膨張し、真の汎化性能を正しく評価できなくなる。
LLMの学習データにベンチマーク評価データが混入(汚染)していないかを検出する技術。n-gram重複分析やembedding類似度による検出手法が使われ、公正なモデル評価を担保する。
LLMの訓練データにベンチマークや評価データが混入しているかを事後的に検出する技術群。n-gram一致分析、パープレキシティ比較、メンバーシップ推論攻撃などの手法がある。
LLM事前学習においてデータを易しいものから難しいものへと段階的に提示するスケジューリング手法。収束速度と最終性能の向上を目指す。
類似データをグループ分けする機械学習手法。K-means・DBSCAN・HDBSCAN・Hierarchical Clustering・Gaussian Mixture Model・Spectral Clusteringが代表で、scikit-learn・PyClustering・RAPIDS cuMLでGPU加速実装。