AI APIの料金表を見ると、「1M TokensあたりUS$○○」のような表記がよく出てきます。
最初に覚えることは、1 Requestが固定料金ではないという点です。
短い一文を送る場合も、100ページ分の文書を送る場合も、HTTP上は一回のRequestかもしれません。しかし使用量は全く違います。
「1M Tokensあたり」とは?
**1M = 1,000,000(100万)**です。
たとえばInputが「US$2 / 1M tokens」と書かれていれば、その料金表では100万Input Tokenが2米ドルという意味です。
**US$**は米ドルです。日本円や台湾ドルではありません。
また、モデル料金は変更されます。実際に予算を組むときは、このLessonに付いている一次情報の公式Pricingページで最新価格を確認してください。
InputとOutputは別料金になりやすい
Textモデルでは、よく次のように分けられます。
- Input Tokens — モデルへ送る文章やContext
- Output Tokens — モデルが生成して返す文章
- Cached Input Tokens — 条件を満たした再利用Inputに割引料金が適用される場合のToken
Outputの方が高いモデルも多いですが、比率はProviderとModelによって異なります。
仮の料金で計算してみる
次は計算方法を理解するための仮の価格であり、現在の実際の料金ではありません。
仮に、
- Input: US$2 / 1M tokens
- Output: US$8 / 1M tokens
とします。
一回の処理でInput 5,000 Tokens、Output 1,000 Tokensを使った場合、
Input Cost:
5,000 / 1,000,000 × US$2 = US$0.01
Output Cost:
1,000 / 1,000,000 × US$8 = US$0.008
合計は、
US$0.018
です。
実際には、使用するモデルの最新公式料金へ数字を置き換えてください。
一回は安くても、10万回なら大きい
US$0.018は小さく見えます。
しかし同じ処理が100,000回なら、
100,000 × US$0.018 = US$1,800
です。
サービス運用では、一回の料金ではなく、平均Input、平均Output、月間Request数を一緒に見ます。
長いContextは気づかないうちに増える
毎回長い会話履歴、資料、System Promptを再送するとInputが増えます。
AgentやRAGでは、ユーザーが一回ボタンを押しただけでも内部では複数回APIを呼ぶことがあります。
ユーザー視点の「一回」と、課金上の「一回」は同じとは限りません。
Cached Inputは何でも無料になる仕組みではない
Providerによっては、同じ大きなPrefixを繰り返す場合にPrompt CacheやContext Cacheを使えることがあります。
ただし、最小Token数、保持時間、対応Model、Cache Hitの条件はProviderごとに違います。
基本式
Cost ≈ Input Tokens × Input Rate + Output Tokens × Output Rate + その他の課金項目
料金が100万Token単位なら、Token数を1,000,000で割ってから単価を掛けます。
画像、音声、動画、Storage、Toolなどは別の単位で課金される場合があります。
今日の一文
AI API料金は「一回いくら」ではなく、Input・Outputなど実際に使った量を単価へ掛けて計算します。
次の第020回では、一回のユーザー操作から複数のModel CallやTool実行が起こるAI Agentを見ていきます。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。