PVL.AI
メニューを開く

ホワイトペーパー · LLM コスト

安いモデルが
一番高い。

表示価格は実際の支払額をほとんど予測できず、総保有コストはなおさらです。同じ設問・同じ上限で、実出力トークンは 53 倍の開きがありました。

  • PDF · 8 ページ
  • 日本語
  • v1.0 · 2026-09

本書が扱うこと

01

表示価格は当てにならない

同一設問・同一上限で実出力は 14〜744 トークン。では何を基準に比べるべきか。

02

モデル階層は失敗コストに合わせる

「難しさ」ではなく「間違いがいつ発覚するか」。実運用のルーティング表を掲載。

03

max_tokens は安全弁

小さく設定しても節約にならず、支払済みの入力費を無駄にするだけ。三度踏んだ記録。

04

キャッシュは静かに失敗する

接頭辞が短いとキャッシュは作られず、エラーも出ない。並列リクエストは衝突する。

05

バッチの二つの誤解

5 割引は本当。ただしキャッシュとは加算されず、逐次検証・再試行の処理には逆効果。

06

可観測性と二つの事故

プロバイダ申告のコストは信用できない。さらに 96 回連続失敗、原因はモデルではなかった。

本書の実測値

53×

同一設問での実支払トークン差

3

回踏んだ同じ max_tokens の罠

42pp

完全な接頭辞による用語遵守の向上

想定読者

  • どのタスクにどのモデルを充てるか決める技術責任者
  • 請求額は増えているが理由を説明できないチーム
  • 「安いモデルに替えたらいくら浮くか」を検討中の意思決定者

本書の数値はすべて実運用の実測値であり、推計ではありません。開示方針:採用したモデルは名指しし、不採用のものは名指ししません(結果は当社のタスク上でのみ成立するため)。