AI・機械学習
上級

リアルタイム推論リアルタイムスイロン

LLMへの入力を受けてミリ秒〜秒単位の低レイテンシーで応答を返す推論方式。チャットボット・コード補完・音声対話などのインタラクティブなユースケースで要求され、バッチ推論と対置される概念。

0 回閲覧
0 いいね

リアルタイム推論とは

リアルタイム推論(Real-Time Inference)は、ユーザーのリクエストに対してミリ秒〜数秒以内にLLMの応答を返す推論方式です。バッチ推論が大量のリクエストをまとめて非同期処理するのに対し、リアルタイム推論は1リクエストごとに即座に処理してレスポンスを返します。ChatGPT、Claude、Gemini などの対話型AIサービス、GitHub CopilotやCursorなどのコード補完ツール、そしてAlexaやSiriなどの音声アシスタントが代表的なリアルタイム推論のユースケースです。

リアルタイム推論 vs バッチ推論

比較項目リアルタイム推論バッチ推論
レイテンシー要件TTFT < 500ms, ITL < 50ms制約なし(分〜時間)
スループット低〜中(GPU利用率50-80%)高(GPU利用率90%+)
コスト効率低い(GPU常時待機)高い(GPUフル稼働)
ユースケースチャット、コード補完、音声対話データ分類、翻訳、要約一括
料金体系通常料金50%割引(OpenAI Batch API)
SLA99.9%可用性、P99レイテンシー保証ベストエフォート

レイテンシー最適化技術

KVキャッシュ

Transformerの自己注意機構で計算されるKey/Valueテンソルをキャッシュし、新トークン生成時に過去の計算を再利用します。KVキャッシュなしでは1トークン生成ごとに全シーケンスの再計算が必要ですが、キャッシュにより増分計算のみで済みます。GPT-4レベルのモデルでは、KVキャッシュ1セッションあたり数GBのGPUメモリを消費します。

Speculative Decoding

小さなドラフトモデル(例: 7Bパラメータ)で複数トークンを先行生成し、大きなターゲットモデル(例: 70B)で一括検証する技術。ドラフトモデルの予測が正しければ1回のforward passで複数トークンが確定し、ITLが実質的に数分の1に短縮されます。Medusa、EAGLE、Lookahead Decodingなどの派生手法があります。

Continuous Batching

従来のstatic batchingでは、バッチ内の全リクエストが完了するまで次のバッチを処理できませんでした。Continuous Batching(vLLM、TGI で採用)は、完了したリクエストのスロットに新しいリクエストを即座に挿入し、GPU稼働率を最大化します。リアルタイム推論のスループットを2〜3倍向上させる技術です。

FlashAttention

注意機構の計算をタイリングとオンラインソフトマックスで最適化し、HBMアクセスを削減します。FlashAttention-2はA100で標準注意機構の2〜4倍の速度を達成し、長いコンテキスト(32K〜128Kトークン)でのリアルタイム推論を実用的にしました。FlashAttention-3はH100のTMA(Tensor Memory Accelerator)を活用してさらに高速化しています。

量子化

モデルの重みを FP16/BF16 から INT8/INT4 に量子化してメモリ使用量と計算量を削減します。GPTQ、AWQ、GGUF(llama.cpp)などの手法があり、品質低下を最小限に抑えながらITLを30〜50%短縮できます。INT4量子化したLlama 3.1 70Bは、FP16の同モデルと比較してITLが約2倍高速です。

推論インフラストラクチャ

GPU選定

GPUVRAM推論スループット(Llama 70B INT4)価格(クラウド時間単価)
NVIDIA H100 80GB80GB HBM380〜120 tokens/sec$3〜4/hour
NVIDIA A100 80GB80GB HBM2e40〜60 tokens/sec$1.5〜2.5/hour
NVIDIA L40S48GB GDDR630〜50 tokens/sec$1〜1.5/hour
AMD MI300X192GB HBM390〜130 tokens/sec$2.5〜3.5/hour
Apple M4 Ultra192GB 統合メモリ15〜25 tokens/secローカル専用

オートスケーリング

リアルタイム推論ではリクエスト数が時間帯によって大きく変動するため、GPU台数のオートスケーリングが重要です。KubernetesのHPA(Horizontal Pod Autoscaler)でGPU使用率やリクエストキューの長さに基づいてスケールアウト/インします。コールドスタート(GPU起動+モデルロード)に30秒〜2分かかるため、予測的スケーリングやウォームプールの維持が推奨されます。

リアルタイム音声・映像推論

2024年以降、テキストだけでなく音声やカメラ映像をリアルタイムでLLMに入力するマルチモーダルリアルタイム推論が登場しています。

  • OpenAI Realtime API: WebSocket経由で音声入出力をストリーミング。エンドツーエンドのレイテンシーは約300ms
  • Google Gemini Live: カメラ映像+音声を同時入力し、リアルタイムで音声応答を返す
  • Anthropic Claude(テキスト): SSEストリーミングでTTFT 300〜600ms

FAQ

Q1: リアルタイム推論に必要なGPUスペックは?

A1: 7B〜13Bパラメータのモデルなら24GB VRAM(RTX 4090)で十分です。70Bモデルには80GB以上(A100/H100)が必要で、INT4量子化なら48GB(L40S)でも動作します。APIサービスとして提供する場合は、同時接続数×KVキャッシュサイズのVRAMが追加で必要です。

Q2: P99レイテンシーとは何を測っている?

A2: 全リクエストの99%がその時間内に完了するレイテンシーの閾値です。TTFTのP99が1秒なら、100回中99回は1秒以内に最初のトークンが返ります。SLAではP50(中央値)ではなくP99で保証するのが一般的で、外れ値(長いプロンプトやGPU競合)の影響を反映した指標です。

Q3: エッジデバイスでのリアルタイム推論は現実的?

A3: 2026年時点で、3B〜8Bパラメータの量子化モデルがスマートフォン(iPhone 16 Pro, Pixel 9 Pro)やApple Silicon Mac(M3以上)でリアルタイム推論可能です。ITL 30〜80ms程度で、簡単な質問応答やテキスト要約は実用レベルです。ただし、70B以上のモデルはクラウド推論が必須です。