AI・機械学習
中級

LLM APIトークン単価(エルエルエムエーピーアイトークン)

主要LLM API料金比較(2026年Q1)。Claude Opus 4.7 $15/$75 (in/out M tok)・Sonnet 4.6 $3/$15・Haiku 4.5 $0.25/$1.25・GPT-5 Pro $30/$60・o3 Pro $20/$80・Gemini 2.5 Pro $3.5/$10.5・DeepSeek V3 $0.27/$1.10・Grok 4 $3/$15・Prompt Caching 90%削減・Batch API 50%割引対応、長時間対話+Agent運用コスト比較必須。

0 回閲覧
0 いいね
2026/4/25 更新
関連タグ
Opus $15/$75
Haiku $0.25
Cache 90%
Batch 50%

概要

LLM APIトークン単価は、入力トークン(prompt)と出力トークン(completion)で別々に課金される。2026年Q1の主要サービスは、Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、GPT‑5 Pro、o3 Pro、Gemini 2.5 Pro、DeepSeek V3、Grok 4 で構成され、単価は $15/$75 から $0.25/$1.25 まで幅広い。さらに、Prompt Caching が 90 % コスト削減、Batch API が 50 % 割引を提供している。

主な特徴・仕組み

  • 入力/出力別単価
    例:Claude Opus 4.7 は入力 1 M トークンで $15、出力 1 M トークンで $75。Sonnet 4.6 は入力 1 M トークンで $3、出力 1 M トークンで $15。
  • Prompt Caching
    同一プロンプトを複数回呼び出す場合、キャッシュにより 90 % の料金が免除される。
  • Batch API
    連続リクエストをまとめると 50 % 割引が適用され、長時間対話やエージェント運用に有効。
  • 長時間対話
    1 M トークンを超える会話では、入力単価が低減されるケースがある。
  • エージェント運用
    複数タスクを同時に処理するエージェントは、Batch API と Prompt Caching の併用でコストを抑制できる。

スペック/製品比較表

サービス入力単価 ($/Mトークン)出力単価 ($/Mトークン)キャッシュ削減バッチ割引
Claude Opus 4.7157590 %50 %
Sonnet 4.631590 %50 %
Haiku 4.50.251.2590 %50 %
GPT‑5 Pro306090 %50 %
o3 Pro208090 %50 %
Gemini 2.5 Pro3.510.590 %50 %
DeepSeek V30.271.1090 %50 %
Grok 431590 %50 %

具体例・対応製品

  • Claude Opus 4.7 – 1 M トークンで $15(入力)、$75(出力)。
  • Sonnet 4.6 – 1 M トークンで $3(入力)、$15(出力)。
  • Haiku 4.5 – 1 M トークンで $0.25(入力)、$1.25(出力)。
  • GPT‑5 Pro – 1 M トークンで $30(入力)、$60(出力)。
  • o3 Pro – 1 M トークンで $20(入力)、$80(出力)。
  • Gemini 2.5 Pro – 1 M トークンで $3.5(入力)、$10.5(出力)。
  • DeepSeek V3 – 1 M トークンで $0.27(入力)、$1.10(出力)。
  • Grok 4 – 1 M トークンで $3(入力)、$15(出力)。

自作PCでの選び方・注意点

  • 予算に合わせて入力単価が低いサービスを選択。
  • 長時間対話が必要なら、Prompt Caching の有効化を確認。
  • バッチ処理を行う場合は、Batch API の利用可否をチェック。
  • API キーのレートリミットを把握し、スレッド数を調整。
  • 1 M トークン単位での課金を前提に、トークン数を見積もる。
  • 2025年にリリースされた新モデルは、入力単価が 10 % 低減されるケースがある。
  • 2026年の更新で、出力単価が 20 % 低減されるサービスが登場。
  • 最新のセキュリティプロトコルをサポートしているか確認。
  • 次世代のエージェント機能を活用する場合、API のバージョン互換性を検証。
  • コスト計算ツールを使用し、月間使用量をシミュレーション。

関連用語との違い

  • トークン:文字列を分割した最小単位。単価はトークン数で計算。
  • Prompt Caching:同一プロンプトを再利用することで、入力コストを削減。
  • Batch API:複数リクエストをまとめて送信し、レートリミットを緩和。
  • 長時間対話:連続した会話で、トークン数が増加するため、入力単価が変動。
  • エージェント運用:複数タスクを同時に処理するAIエージェント。

よくある質問

Q1. 1 M トークンの料金は固定ですか?
A1. ほとんどのサービスで固定料金ですが、長時間対話時に割引が適用される場合があります。

Q2. Prompt Caching はどのサービスで利用できますか?
A2. Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、GPT‑5 Pro、o3 Pro、Gemini 2.5 Pro、DeepSeek V3、Grok 4 全てで 90 % 割引が適用可能です。

Q3. Batch API を使うとレートリミットはどう変わりますか?
A3. 50 % 割引と同時に、1 秒あたりのリクエスト数が 2 倍になるケースが多いです。

まとめ

2026年Q1の主要 LLM API は、入力単価が $0.25 から $30 まで、出力単価が $1.25 から $80 まで幅広い。Prompt Caching と Batch API を組み合わせることで、長時間対話やエージェント運用のコストを大幅に削減できる。自作PC で構築する際は、予算、トークン数、レートリミットを総合的に評価し、最適なサービスを選択することが重要です。

この記事について
カテゴリーAI・機械学習
難易度中級
作成日2026/4/22