LLM APIトークン単価(エルエルエムエーピーアイトークン)
主要LLM API料金比較(2026年Q1)。Claude Opus 4.7 $15/$75 (in/out M tok)・Sonnet 4.6 $3/$15・Haiku 4.5 $0.25/$1.25・GPT-5 Pro $30/$60・o3 Pro $20/$80・Gemini 2.5 Pro $3.5/$10.5・DeepSeek V3 $0.27/$1.10・Grok 4 $3/$15・Prompt Caching 90%削減・Batch API 50%割引対応、長時間対話+Agent運用コスト比較必須。
概要
LLM APIトークン単価は、入力トークン(prompt)と出力トークン(completion)で別々に課金される。2026年Q1の主要サービスは、Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、GPT‑5 Pro、o3 Pro、Gemini 2.5 Pro、DeepSeek V3、Grok 4 で構成され、単価は $15/$75 から $0.25/$1.25 まで幅広い。さらに、Prompt Caching が 90 % コスト削減、Batch API が 50 % 割引を提供している。
主な特徴・仕組み
- 入力/出力別単価
例:Claude Opus 4.7 は入力 1 M トークンで $15、出力 1 M トークンで $75。Sonnet 4.6 は入力 1 M トークンで $3、出力 1 M トークンで $15。 - Prompt Caching
同一プロンプトを複数回呼び出す場合、キャッシュにより 90 % の料金が免除される。 - Batch API
連続リクエストをまとめると 50 % 割引が適用され、長時間対話やエージェント運用に有効。 - 長時間対話
1 M トークンを超える会話では、入力単価が低減されるケースがある。 - エージェント運用
複数タスクを同時に処理するエージェントは、Batch API と Prompt Caching の併用でコストを抑制できる。
スペック/製品比較表
| サービス | 入力単価 ($/Mトークン) | 出力単価 ($/Mトークン) | キャッシュ削減 | バッチ割引 |
|---|---|---|---|---|
| Claude Opus 4.7 | 15 | 75 | 90 % | 50 % |
| Sonnet 4.6 | 3 | 15 | 90 % | 50 % |
| Haiku 4.5 | 0.25 | 1.25 | 90 % | 50 % |
| GPT‑5 Pro | 30 | 60 | 90 % | 50 % |
| o3 Pro | 20 | 80 | 90 % | 50 % |
| Gemini 2.5 Pro | 3.5 | 10.5 | 90 % | 50 % |
| DeepSeek V3 | 0.27 | 1.10 | 90 % | 50 % |
| Grok 4 | 3 | 15 | 90 % | 50 % |
具体例・対応製品
- Claude Opus 4.7 – 1 M トークンで $15(入力)、$75(出力)。
- Sonnet 4.6 – 1 M トークンで $3(入力)、$15(出力)。
- Haiku 4.5 – 1 M トークンで $0.25(入力)、$1.25(出力)。
- GPT‑5 Pro – 1 M トークンで $30(入力)、$60(出力)。
- o3 Pro – 1 M トークンで $20(入力)、$80(出力)。
- Gemini 2.5 Pro – 1 M トークンで $3.5(入力)、$10.5(出力)。
- DeepSeek V3 – 1 M トークンで $0.27(入力)、$1.10(出力)。
- Grok 4 – 1 M トークンで $3(入力)、$15(出力)。
自作PCでの選び方・注意点
- 予算に合わせて入力単価が低いサービスを選択。
- 長時間対話が必要なら、Prompt Caching の有効化を確認。
- バッチ処理を行う場合は、Batch API の利用可否をチェック。
- API キーのレートリミットを把握し、スレッド数を調整。
- 1 M トークン単位での課金を前提に、トークン数を見積もる。
- 2025年にリリースされた新モデルは、入力単価が 10 % 低減されるケースがある。
- 2026年の更新で、出力単価が 20 % 低減されるサービスが登場。
- 最新のセキュリティプロトコルをサポートしているか確認。
- 次世代のエージェント機能を活用する場合、API のバージョン互換性を検証。
- コスト計算ツールを使用し、月間使用量をシミュレーション。
関連用語との違い
- トークン:文字列を分割した最小単位。単価はトークン数で計算。
- Prompt Caching:同一プロンプトを再利用することで、入力コストを削減。
- Batch API:複数リクエストをまとめて送信し、レートリミットを緩和。
- 長時間対話:連続した会話で、トークン数が増加するため、入力単価が変動。
- エージェント運用:複数タスクを同時に処理するAIエージェント。
よくある質問
Q1. 1 M トークンの料金は固定ですか?
A1. ほとんどのサービスで固定料金ですが、長時間対話時に割引が適用される場合があります。
Q2. Prompt Caching はどのサービスで利用できますか?
A2. Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、GPT‑5 Pro、o3 Pro、Gemini 2.5 Pro、DeepSeek V3、Grok 4 全てで 90 % 割引が適用可能です。
Q3. Batch API を使うとレートリミットはどう変わりますか?
A3. 50 % 割引と同時に、1 秒あたりのリクエスト数が 2 倍になるケースが多いです。
まとめ
2026年Q1の主要 LLM API は、入力単価が $0.25 から $30 まで、出力単価が $1.25 から $80 まで幅広い。Prompt Caching と Batch API を組み合わせることで、長時間対話やエージェント運用のコストを大幅に削減できる。自作PC で構築する際は、予算、トークン数、レートリミットを総合的に評価し、最適なサービスを選択することが重要です。