AI の API 料金は「安いか高いか」の一言では語れません。いまの市場ははっきり二層に分かれていて、要約や分類をこなす軽量モデルは 100 万トークンあたり入力 $0.2〜$1 まで下がる一方、最上位モデルは入力 $5〜$10・出力 $25〜$50 という高い水準に張り付いています。この二層構造を読めるかどうかが、コスト設計の分かれ目です。本記事は、価格の現在地・動く理由・賢い使い分け・特定ベンダーに縛られないための備えを、初めての方にも分かるよう整理します。
FIG.1 「床」は下がり続け、「天井」は高止まり——平均ではなく二層で見る
01いまの相場感
日常的な要約・分類・翻訳であれば、入力 100 万トークンあたり $0.2〜$1 程度の軽量モデル(GPT-5.6 Luna、Claude Haiku 4.5、Gemini 3.7 Flash など)で十分にこなせます。100 万トークンは日本語でおよそ 50〜70 万字相当なので、書籍数冊ぶんの分量を数十円〜数百円で処理できる計算です。
この水準を支えているのは、半導体の効率向上(新世代 GPU・専用チップ)、推論を軽くする技術(量子化・蒸留・Mixture of Experts)、そして競合の激化です。安く速く動く層は今も広がり続けています。
安いのは 「普段づかいの層」。最先端の最上位モデルは、別の力学で動いています。
02主要モデルの料金(2026 年・概算)
下表は本記事更新時点の公開価格の目安です。料金は頻繁に改定されるため、実際に採用するときは必ず各社の公式ページで最新値を確認してください。主要 3 社の現行ラインナップは、OpenAI が GPT-5.6 の 3 変種(Sol / Terra / Luna)、Anthropic が Fable 5 / Opus 5 / Sonnet 5 / Haiku 4.5、Google が Gemini 3.7 Flash を中心とする構成です。出力は入力の 5〜6 倍に設定されているのが各社共通の特徴で、出力をいかに短くするかがコストに直結します。
| モデル | 入力 ($/1M) | 出力 ($/1M) | 位置づけ |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $30 | OpenAI 最上位 |
| GPT-5.6 Terra | $2 | $12 | 性能と価格のバランス |
| GPT-5.6 Luna | $0.20 | $1.20 | 軽量・大量処理 |
| Claude Fable 5 | $10 | $50 | Anthropic 最上位(長時間エージェント) |
| Claude Opus 5 | $5 | $25 | 高性能(エージェント・企業業務) |
| Claude Sonnet 5 | $2 | $10 | 中位・バランス |
| Claude Haiku 4.5 | $1 | $5 | 軽量・高速 |
| Gemini 3.7 Flash | $0.75 | $3.75 | 軽量・マルチモーダル |
| Mistral Large 3 | $0.50 | — | 低価格な欧州製旗艦 |
| DeepSeek(V4 世代) | $0.1 台 | $0.3 前後 | 超低価格・中国製 |
「—」は本記事執筆時点で確実に裏取りできなかった値で、空欄のままにしています(不確かな数字は載せない方針)。プロンプトキャッシュやバッチ処理を併用すれば、ここからさらに 50〜90% 下がる場合があります(後述)。
03最上位モデルは高止まりしている
注目すべきは、最先端モデルの値段が下げ止まっていることです。OpenAI の最上位 GPT-5.6 Sol は入力 $5・出力 $30、Anthropic の最上位 Claude Fable 5 は入力 $10・出力 $50 で、軽量モデルの数十倍の単価が付いています。Anthropic はさらに、応答を速くする「Fast Mode」を Claude Opus 5 向けに $10 / $50 の別建て枠として提供しています。
理由はシンプルで、最先端モデルは作るのも動かすのも高いからです。学習コストの巨大化、長文コンテキスト(数百万トークン)やマルチモーダル(音声・動画)の処理負荷、そして需要増による計算資源の逼迫。フロンティアの体験を求める人には、相応の対価が請求される時代に入りました。
「床」側にも上昇圧力が現れ始めました。超低価格帯を牽引してきた DeepSeek は 2026-08-06、低価格AIモデルへの需要急増を理由に「大幅な」値上げを予告しました(SCMP 報道)。天井(最上位)だけでなく、床(軽量・新興)側でも需要と計算資源の逼迫で単価が動きうる局面に入りつつあります。
FIG.2 単価は「下げる力」と「上げる力」の綱引きで決まる。層によって勝つ側が違う
04モデルの使い分け——「カスケード」で考える
コストを抑える最大のコツは、全部を最上位モデルに任せないことです。タスクの難しさに応じて、3 つの階層を組み合わせます。
最上位(Frontier)
複雑な推論、難しいコード生成、エージェントの「司令塔」。高価なので使いどころを絞る。
中位(Mid)
日常業務、要約、翻訳、一般的な対話。性能とコストのバランスが良い主力。
軽量(Light)
分類、振り分け、定型処理、大量バッチ。安く速く、件数を捌く。
この「モデルカスケード」では、まず安いモデルで処理し、手に負えないものだけ上位へ回します。仮に件数の 80% を軽量、15% を中位、5% を最上位で捌ければ、すべてを最上位で動かす場合に比べて総コストは大きく下がります(構成しだいで 数分の 1 になることも)。重要なのは、最初から最上位を選ぶのではなく「一番安い選択肢で足りるか」から考える習慣です。
FIG.3 モデルカスケード:安い順に試し、手に負えない分だけ上位へエスカレーション
05特定ベンダーに縛られないための備え
価格や性能は毎月のように動きます。今日いちばん安いモデルが、半年後もそうとは限りません。だからこそ、いつでも乗り換えられる状態を保つ設計が効いてきます。
| 縛られやすい作り | 乗り換えやすい作り |
|---|---|
| 特定ベンダーの API を直接あちこちに埋め込む | 呼び出しを 1 か所の「薄い層」に集約する |
| モデル名・料金前提がコード全体に散らばる | モデル選択を設定で切り替えられる |
| 移行コストが読めず、値上げに弱い | A/B テストで差を測りながら移れる |
実務では、LangChain・LlamaIndex・Vercel AI SDK といったフレームワークや、OpenRouter・Together AI のような複数モデルを統一 API で呼べるサービスがよく使われます。大がかりに導入しなくても、自社で薄いラッパー(呼び出しの入口を一本化する層)を作るだけでも、切替の自由度は大きく上がります。あわせて、同じタスクで複数モデルを定期的に評価し、新モデルが出たら A/B テストで性能とコストの差を測る運用を仕組みにしておくと、値上げや新登場に振り回されにくくなります。
06そもそもの請求額を減らす実務テクニック
モデル選び以前に、同じモデルでも工夫で安くなる余地があります。代表的なのは次の 3 つです。
プロンプトキャッシュを使う
同じシステムプロンプトやツール定義を毎回送るなら、キャッシュ機能で繰り返し部分の入力費用を大幅に節約できる。OpenAI・Anthropic とも、キャッシュから読み出した入力トークンは通常単価の 1/10(9 割引)で課金される。エージェント運用では事実上必須。
バッチ処理に回す
即時応答が不要な処理(夜間の一括分類など)は、バッチ用の割引枠を使うと半額程度になることが多い。リアルタイム性を捨てられる仕事は積極的に回す。
出力を短く設計する
出力は入力の数倍の単価。冗長な回答を避け、必要な形式(JSON など)に絞るだけで効く。検索結果を渡す場合も、要約してから投入すると入力側も軽くなる。
07自前で動かす(セルフホスト)の損益分岐
オープンウェイトのモデルを自社のサーバーで動かす選択肢もあります。ただし「自前のほうが安い」とは限りません。判断はおおむね処理量で決まります。
- 少量(月数百万トークン規模):API のほうが安い。自前で抱える固定費が割に合わない。
- 中量(月 1 億トークン規模):API と自前がほぼ拮抗。運用力しだい。
- 大量(月 10 億トークン超):自前が有利になりやすい。ただし下記の隠れコストを織り込んだ上で。
見落としやすいのが運用コストです。GPU の確保・料金、監視や障害対応、セキュリティ、モデル更新の手間——これらは API なら提供側が負担している部分。単価表だけ比べると判断を誤ります。「トークン単価」ではなく「総保有コスト」で比べるのが鉄則です。
Watch the Hidden Fees
安さに飛びつく前に確認したい「隠れた費用」
表向きの単価が安くても、追加課金で実コストが膨らむことがあります。長文コンテキストやマルチモーダル(音声・動画)に対する別料金、高速応答や高推論モードの上乗せ単価がその代表です。データの処理地域を指定すると 1.1 倍の割増が付く(OpenAI の地域処理エンドポイント、Anthropic の US 限定推論)ように、基本単価の外側の条件でも実額は動きます。「基本単価 × 想定トークン数」だけで見積もると外すので、自分の使い方に対する実額を試算してから採用しましょう。
FIG.4 基本単価に「長文・マルチモーダル・高速/高推論」の上乗せが積もって実コストになる
守りの基本は単純です。採用前に自分の典型ワークロードで実額を試算し、使用量の上限・アラートを設定して暴走を防ぎ、請求の内訳(基本・キャッシュ・追加機能)を定期的に確認する。これだけで「気づいたら高額請求」の多くは避けられます。
082026 年の見通し
確実に言えるのは、市場が二層に分かれて動くということです。裏取りできない予測は避けつつ、観測されている傾向を挙げます。
- 床は下がり続ける:軽量モデルや新興・中国系モデル(DeepSeek、Qwen 系など)の安さが、低価格帯の競争を加速させている。
- 天井は強気:最上位モデルは入力 $5〜$10・出力 $25〜$50 の水準を保ち、高速モードなどの上位枠も別建てで用意される。
- 追加課金の比重が増す:長文・マルチモーダル・高速応答など、基本単価の外側で料金が積み上がる構造が広がっている。
つまり、これからは「単価が安いか」より「自分の使い方でいくらになるか」を見る目が重要になります。
09まとめ——4 つを仕組みにする
API 価格の動きは、上手に乗れば個人にも企業にも追い風です。振り回されないための要点は、次の 4 つを「その場の判断」ではなく仕組みにしておくことに尽きます。
- モデルカスケード:一番安い選択肢から試し、必要な分だけ上位へ。
- ベンダー抽象化:呼び出しを一本化し、いつでも乗り換えられる状態を保つ。
- 節約テクニック:プロンプトキャッシュ・バッチ・出力短縮を標準装備にする。
- 定期再評価:価格と性能は動く前提で、定点観測と試算を続ける。
そして料金・性能の数字は必ず各社の公式ページで最新を確認すること。本記事の価格はあくまで更新時点の目安であり、明日には変わっているかもしれません。「数字を覚える」のではなく、「動く市場の読み方」を身につけるのが、長く効くコスト戦略です。



