LLMの運用コストをリアルタイムに監視し、予算制約・コスト効率・ROIに基づいてモデル選択やリクエスト配分を動的に最適化するルーティング戦略。月間予算上限、テナント別課金、トークン単価の変動に対応する。
コストアウェアルーティング(Cost-Aware Routing)とは、LLMの利用コストをリアルタイムに追跡・予測し、コスト制約を考慮した上で最適なモデル選択とリクエスト配分を行うルーティング戦略である。単に最高品質のモデルを選ぶのではなく、「予算内で最大の品質」を実現する経済的最適化に焦点を当てる。
LLMの運用コストは以下の要素で構成される:
| コスト要素 | 説明 | 主要プロバイダの価格例(2026年) |
|---|---|---|
| 入力トークン | プロンプト・コンテキストのトークン数 | Opus: $15/MTok, Sonnet: $3/MTok, Haiku: $0.80/MTok |
| 出力トークン | 生成されたレスポンスのトークン数 | Opus: $75/MTok, Sonnet: $15/MTok, Haiku: $4/MTok |
| キャッシュヒット | プロンプトキャッシュ利用時の割引 | 通常価格の10-25% |
| バッチ処理 | 非同期バッチAPIの割引 | 通常価格の50% |
月間・週間・日間の予算上限を設定し、消費率に応じてモデルティアを動的に切り替える。月初は高品質モデル比率を高く、月末で予算逼迫時は軽量モデル比率を上げる適応型制御。
リクエストのビジネス価値(収益貢献度)を推定し、高価値タスクには高性能モデルを優先配分する。例:有料ユーザーの問い合わせ→Opus、無料ユーザーのFAQ→Haiku。
出力トークン数を予測し、短い応答が期待されるクエリ(分類、抽出、Yes/No判定)は出力コストが低いため高性能モデルでも経済的。長文生成が必要なクエリはコスト影響が大きいため軽量モデルを優先。
同等品質のモデルを複数プロバイダで比較し、最安のプロバイダを選択する。例:Claude Sonnet 4.6とGPT-4oが同等品質の場合、その時点で安い方を選択。プロバイダの価格変更にも動的に対応する。
マルチテナントSaaSでは、テナント(顧客企業)ごとにコスト制約が異なる:
コストアウェアルーターはテナントIDに基づいてこれらの制約を自動適用し、予算超過時にはリクエストを拒否またはダウングレードする。
LiteLLMはビルトインのコスト追跡機能を備えている:
general_settings:
max_budget: 1000 # 月間$1,000上限
budget_duration: 1mo
litellm_settings:
max_budget: 100 # ユーザー別$100/月
budget_duration: 1mo
model_list:
- model_name: cheap-model
litellm_params:
model: anthropic/claude-haiku-4-5-20251001
model_info:
max_budget: 200 # このモデルに$200/月上限
A1: 適切に設計されたルーティングでは、体感品質の低下は最小限に抑えられます。全リクエストの70-80%は軽量モデルで十分な品質を提供でき、残りの高難度リクエストにのみ高性能モデルを使うことで、平均品質を95%以上維持しながら60-70%のコスト削減が可能です。
A2: リアルタイム追跡が理想ですが、実用上は数分のラグは許容されます。LiteLLMはリクエスト完了後にPostgreSQLへコストを非同期書き込みし、数秒以内に集計値を更新します。月間予算の管理には日次集計でも十分な場合が多いです。
A3: LiteLLMやUnify AIなどのルーターは主要プロバイダの価格表を内蔵しており、API呼び出し時にトークン数とモデル単価から自動的にコストを算出します。プロバイダの価格変更時はルーターの更新(LiteLLMならpipアップグレード)で反映されます。