API料金は「入力トークン+出力トークン」の合計で決まり、プロバイダーによって単価が異なる
はじめに
営業の現場では――
「API 料金をその場でざっくり出したい」
「モデルを変えるとコストがどれくらい動くのかイメージできない」
といった声が聞かれることがあります。本記事では、API料金の基本的な仕組みから 最新価格の整理、そして 料金を大幅に下げられる割引メカニズム までまとめます。
- API 料金の基本式(入力+出力)
- トークンとは? ― 文字数 ≠ トークン数
- 主要モデルの最新価格表 & 簡易比較(2026年8月時点)
- 単価が変わる 3 つの仕組み(キャッシュ再利用/長文脈しきい値/バッチ API)
- 見積精度を高めるコツ & FAQ
APIとは何か
“窓口”としての役割
API(Application Programming Interface)は、サービス同士をつなぐ通信の窓口です。RESTやgRPCなど複数のプロトコルがありますが、本記事の主役はHTTP経由のテキストAPI。リクエストを送れば、モデルが推論しレスポンスとしてテキスト(または画像・JSONなど)を返します。
まず基本:料金は「入力トークン+出力トークン」
合計料金 =(入力トークン数 × 入力単価)+(出力トークン数 × 出力単価)
| 課金対象 | 説明 |
|---|---|
| 入力 | プロンプトやシステムメッセージなど、モデルに渡すテキスト |
| 出力 | モデルが生成するレスポンス |
⚠️ 単価は固定ではありません。後述の「キャッシュ再利用 / バッチ API」に該当すると最大 90 %引きになるケースもある一方、「長文脈しきい値」を超えると単価が上がるケースもあります。
トークンとは?
文字数とトークン数の違い、およびOpenAI・Google・Anthropicのトークナイザー確認方法の比較
文字数ではない課金単位
OpenAIやAnthropicの言語モデルは、テキストを細かい断片=トークンで扱います。1トークンは英単語なら≒4文字、日本語では語彙や句読点でばらつきが大きく、同じ100文字でもトークン数は言語で変動します。詳しくはOpenAIのトークナイザー解説が参考になりますOpenAI公式ドキュメント。
ざっくり換算
- 日本語:1トークン ≒ 1.3〜2文字(AIサービスによって差があり、Geminiが最も効率的な傾向)
- 英語:1トークン ≒ 0.75単語(100トークンで英単語75語程度)
トークナイザー
以下のツールを使用すると、テキストが言語モデルによってどのようにトークン化されるか、およびそのテキスト内のトークンの合計数を把握できます。プロバイダーごとにトークナイザーが異なるため、確認したいモデルに対応するツールを使ってください。
- OpenAI:OpenAI Tokenizerにプロンプトを貼り付けるだけで確認可能
- Google(Gemini):Google AI Studioのプロンプト入力欄に貼り付けると、入力トークン数が自動表示される
- Anthropic(Claude):貼り付けるだけの公式Webツールはなく、APIの
count_tokensエンドポイントを呼び出して確認する必要があるAnthropic公式ドキュメント
主要モデルの最新API単価・特徴一覧(2026年8月時点)
| プロバイダー | モデル | 入力(100万トークン) | 出力(100万トークン) | 最大文脈長 | 特徴(かんたん概要) |
|---|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $5.00 | $30.00 | 1.05 M | フラッグシップ フロンティア級の推論・長時間稼働のエージェントタスク向け |
| GPT-5.6 Terra | $2.00 | $12.00 | 1.05 M | バランス型 上位モデル相当の性能を低コストで提供する主力モデル | |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05 M | 最軽量・最速 要約・分類など大量リクエスト向け | |
| Anthropic | Claude Fable 5 | $10.00 | $50.00 | 1 M | Anthropic最上位 長時間稼働エージェント向けの次世代モデル |
| Claude Opus 5 | $5.00 | $25.00 | 1 M | 高性能 複雑なエージェント型コーディング・エンタープライズ用途向け | |
| Claude Sonnet 5 | $2.00 | $10.00 | 1 M | バランス型 速度と知能のバランスが良い主力モデル | |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200 K | 超高速 フロンティア級に迫る性能を持つ最速モデル | |
| Google Cloud | Gemini 3.6 Flash | $1.50 | $7.50 | 1 M | 現行の主力モデル 速度と知能のバランスに優れたマルチモーダル対応モデル |
| Gemini 3.1 Pro Preview | $2.00〜$4.00 | $12.00〜$18.00 | 1 M | プレビュー版最上位 200 Kトークン超で単価が上がる段階課金 | |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | 1 M | 最高コスパ 大規模バッチ・高頻度処理向け |
📍出典:OpenAI公式ドキュメント(Pricing)・OpenAI公式ドキュメント(Models)、Anthropic公式ドキュメント(Pricing)・Anthropic公式ドキュメント(Models)、Google公式ドキュメント(Pricing)・Google公式ドキュメント(Models)
※Claude Sonnet 5は当初2026年8月31日までの導入価格(入力 $2 / 出力 $10)とされていましたが、2026年8月にAnthropicが同価格を恒久化すると発表し、9月1日以降に予定されていた入力 $3 / 出力 $15 への値上げは実施されないことになりました(出典:上記Anthropic公式ドキュメント)。 ※Gemini 3.1 Pro Previewでは200 Kトークンを超えると入力 $4.00 / 出力 $18.00に切り替わります(出典:上記Google公式ドキュメント)。 ※GPT-5.6 Sol/Terra/Lunaも、入力272 Kトークンを超えるとリクエスト全体の入力単価が2倍・出力単価が1.5倍に切り替わります(例:Terraは入力 $2.00→$4.00 / 出力 $12.00→$18.00)OpenAI公式ドキュメント。
単価が変わるケース
単価は固定ではなく、リクエストの送り方や量によって “最大 90% OFF” になることもあれば、一定のしきい値を超えて単価が上がることもあります。 「同じ入力が多いか」「長文かどうか」「リアルタイム性が要るか」 の 3 つを軸にワークロードを整理すると、コストを最適化しやすくなります。
API料金の単価が変わる3つの仕組み(キャッシュ再利用・長文脈しきい値・バッチAPI)
キャッシュ再利用・長文脈しきい値・バッチ APIとは?
| 用語 | どういう仕組み? | 料金への影響 | 代表的な条件 | 向いているケース |
|---|---|---|---|---|
| キャッシュ再利用(Prompt / Context Caching) | 同じ入力をもう一度送ったときに、前回の結果を流用。 モデルには“差分”だけ渡すので入力分がほぼタダ。 | 【割引】入力料金が最大 90 %OFF | - OpenAI Cached Input(GPT-5.6 系) - Anthropic Prompt Caching - Google Context Caching | FAQ・ABテスト・リトライ処理 |
| 長文脈しきい値 | モデルごとに設定されたトークン数の境界を超えると、自動的に“高いレーン”へ切り替わる段階課金。 超過分だけでなく、リクエスト全体が高い単価になる点に注意。 | 【割増】境界を超えるとリクエスト全体の 単価アップ | 例:Gemini 3.1 Pro Preview は200k超で入力$4.00/出力$18.00 例:GPT-5.6シリーズは272K超で入力2倍/出力1.5倍 | 会議録・大型レポートの解析 |
| バッチ API / Batch Mode | リアルタイム性が要らない大量リクエストを、まとめて夜間などに処理。 サーバーの空き時間を活用できる。 | 【割引】入力も出力も最大 50 %OFF | - OpenAI Batch API - Claude Batch Processing - Gemini Batch Mode | ログの一括要約・夜間ジョブ |
📍割引率・単価アップの条件は、いずれも上記「主要モデルの最新API単価・特徴一覧」と同じ各社公式ドキュメントの記載に基づきます。
見積精度を上げる 4 つのコツ
| やること | ひとことで言うと | 具体例・なぜ大事? |
|---|---|---|
| ① 公式トークナイザーで数える | まずは正しいトークン数を確認 | OpenAI・Geminiは公式Webツールにプロンプトを貼り付けるだけで確認可能。 Claudeは公式Webツールがなく、API(count_tokensエンドポイント)経由でのみ確認できます。 可能な範囲で確認すれば見積もり誤差を大きく減らせます。 |
| ② キャッシュ再利用を設計に組む | 同じ入力は“使い回し” | FAQ や AB テストのように同じプロンプトを何度も送るなら「キャッシュ再利用」を ON。 入力料金が 最大 90 %OFF になります。 |
| ③ 長文しきい値をまたがない | 一定のトークン数を超えると単価急騰するモデルもある | 例:Gemini 3.1 Pro Preview は 200 K 超から入力単価が2倍・出力単価が1.5倍。 例:GPT-5.6シリーズも272 K超から入力2倍・出力1.5倍。 大きな文書は章ごとに分割して送ると安く済みます。 |
| ④ バッチ API を夜に流す | “急がない大量処理”はまとめ送り | 昼間は見積もりだけ、深夜にバッチ API で一括実行。 入出力とも 最大 50 %OFF。 ログ集計や大量分類と相性抜群。 |
FAQ
| Q | A |
|---|---|
| Dify・GPTs 経由だと請求先は? | 呼び出し API キーの所有者へ課金されます。 社内ツールに組み込む場合は管理キーと個人キーを分ける運用が安全です。 |
| 日本語だと誤差が大きい? | 文字数÷1.3〜2(プロバイダーにより変動)が目安。 業務で厳密に積算する場合は公式トークナイザーでの確認が必須。 |
| モデル自動切替は有効? | FAQ・チャット → Flash-Lite/Luna 精密レポート → GPT-5.6 Sol/Claude Fable 5 など、品質・速度・コストの三軸最適化が可能。 |
まとめ ― 4 つだけ押さえれば OK
- 覚える公式は 1 行だけ
- 料金 = 入力トークン料 + 出力トークン料
- 単価が変わるポイントは 3 つ
- キャッシュ再利用:入力料金が 最大 90 %OFF(OpenAI・Anthropic・Google共通)
- バッチ API:急がない大量処理は 最大 50 %OFF
- 長文しきい値:Gemini 3.1 Pro Preview(200 K超)やGPT-5.6シリーズ(272 K超)など、境界を超えるとリクエスト全体の単価アップ(唯一、割引ではなく増額)
- タスク別にモデルを自動切替
- 例)FAQ → Flash-Lite/Luna、精密レポート → GPT-5.6 Sol/Claude Fable 5
- 品質とコストのベストバランスが取れる
- 最後は公式ドキュメントで再確認
- 価格・モデルラインアップは数週間〜数か月単位で更新される(発売直後の値下げ・価格改定も珍しくない)
- キャッシュ/バッチ/しきい値を組み合わせて “最小コスト・最大効果” を狙おう
出典一覧
- 「API Pricing」 — OpenAI公式ドキュメント
- 「Models」
- 「Key concepts」
- 「Pricing」 — Anthropic公式ドキュメント
- 「Models overview」
- 「Gemini Developer API Pricing」 — Google公式ドキュメント
- 「Gemini models」
- 「トークンカウント」 — Anthropic公式ドキュメント
- 「GPT-5.6 Terra モデルページ」 — OpenAI公式ドキュメント
関連サイト
- OpenAI Tokenizer — プロンプトのトークン数を確認できる公式ツール
- Google AI Studio — Geminiモデルのプロンプト入力トークン数を確認できる公式ツール

執筆者:えだまめ
Elcamyでバックオフィスとブログ執筆を担当。AI未経験の状態からAI活用を学び、Claude CodeをはじめとするAIエージェントの実務活用法を発信している。
更新情報はElcamy公式Xでも発信中。