← ホームへ戻る
LESSON 019AI開発10 分

AI APIの料金はどう計算する?Input・Output・Cached Tokenを分けて読む

AI APIは使用量課金が中心です。第019回では100万Token単位、InputとOutputの料金差、Cached Input、計算例、利用者増加時のスケールを解説します。

今日のたとえ一回いくらではなく、使った量と種類ごとに単価が違う電気料金の明細

AI APIの料金表を見ると、「1M TokensあたりUS$○○」のような表記がよく出てきます。

最初に覚えることは、1 Requestが固定料金ではないという点です。

短い一文を送る場合も、100ページ分の文書を送る場合も、HTTP上は一回のRequestかもしれません。しかし使用量は全く違います。

「1M Tokensあたり」とは?

**1M = 1,000,000(100万)**です。

たとえばInputが「US$2 / 1M tokens」と書かれていれば、その料金表では100万Input Tokenが2米ドルという意味です。

**US$**は米ドルです。日本円や台湾ドルではありません。

また、モデル料金は変更されます。実際に予算を組むときは、このLessonに付いている一次情報の公式Pricingページで最新価格を確認してください。

InputとOutputは別料金になりやすい

Textモデルでは、よく次のように分けられます。

Outputの方が高いモデルも多いですが、比率はProviderとModelによって異なります。

仮の料金で計算してみる

次は計算方法を理解するための仮の価格であり、現在の実際の料金ではありません。

仮に、

とします。

一回の処理でInput 5,000 Tokens、Output 1,000 Tokensを使った場合、

Input Cost:

5,000 / 1,000,000 × US$2 = US$0.01

Output Cost:

1,000 / 1,000,000 × US$8 = US$0.008

合計は、

US$0.018

です。

実際には、使用するモデルの最新公式料金へ数字を置き換えてください。

一回は安くても、10万回なら大きい

US$0.018は小さく見えます。

しかし同じ処理が100,000回なら、

100,000 × US$0.018 = US$1,800

です。

サービス運用では、一回の料金ではなく、平均Input、平均Output、月間Request数を一緒に見ます。

長いContextは気づかないうちに増える

毎回長い会話履歴、資料、System Promptを再送するとInputが増えます。

AgentやRAGでは、ユーザーが一回ボタンを押しただけでも内部では複数回APIを呼ぶことがあります。

ユーザー視点の「一回」と、課金上の「一回」は同じとは限りません。

Cached Inputは何でも無料になる仕組みではない

Providerによっては、同じ大きなPrefixを繰り返す場合にPrompt CacheやContext Cacheを使えることがあります。

ただし、最小Token数、保持時間、対応Model、Cache Hitの条件はProviderごとに違います。

基本式

Cost ≈ Input Tokens × Input Rate + Output Tokens × Output Rate + その他の課金項目

料金が100万Token単位なら、Token数を1,000,000で割ってから単価を掛けます。

画像、音声、動画、Storage、Toolなどは別の単位で課金される場合があります。

今日の一文

AI API料金は「一回いくら」ではなく、Input・Outputなど実際に使った量を単価へ掛けて計算します。

次の第020回では、一回のユーザー操作から複数のModel CallやTool実行が起こるAI Agentを見ていきます。

参考資料

たとえは直感をつかむ入口です。正式な定義や技術詳細は原典をご確認ください。

  1. OpenAI — API Pricing ↗
  2. Google — Gemini Developer API Pricing ↗
  3. xAI — API Pricing ↗
← 前の章018APIとは?自分のアプリとAIモデルの間にある「注文窓口」と考える
次の章 →020AI Agentとは?目標に向かって手順を選び、Toolを使い、結果を見て次へ進む仕組み
COMMUNITY

コメント

質問、感想、補足したいことがあれば、ここに残せます。

0 / 1200