PVL.AI
開啟選單

白皮書 · LLM 成本

便宜的模型
最貴。

牌價幾乎無法預測實付金額,更無法預測總持有成本。同一題、同樣的上限,不同模型的實付 token 差到 53 倍。

  • PDF · 8 頁
  • 繁體中文
  • v1.0 · 2026-09

這份白皮書回答什麼

01

牌價不能預測實付

同一題、同樣上限,五個模型的實際輸出從 14 到 744 token——比較基準該用什麼。

02

模型檔次對齊失敗成本

不是「任務難不難」,而是「做錯了多久會被發現」。附我們七條產線的實際路由表。

03

max_tokens 是安全閥

設太小不會省錢,只會把付掉的輸入費變成廢品。我們在同一個坑裡摔了三次的完整紀錄。

04

快取的安靜失敗

前綴不夠長時快取不會建立、也不會報錯;並行請求會互相撞掉快取。

05

批次的兩個誤解

五折是真的,但不能和快取疊加,也不該用在需要逐筆校驗重試的任務上。

06

可觀測性與兩個事故

供應商回傳的金額不能信;還有一次 96 次呼叫全滅,原因根本不在模型。

文中的實測數字

53×

同一題的實付 token 差距

3

次踩進同一個 max_tokens 坑

42pp

完整前綴帶來的術語遵循提升

誰該讀這份

  • 要決定「哪個任務用哪個模型」的技術主管
  • 帳單在漲、但說不清楚漲在哪裡的工程團隊
  • 正在評估「換便宜模型能省多少」的決策者

本文所有數字來自 PVL AI 生產環境的實測紀錄,非估計值。揭露原則:點名我們選用的模型,不點名落選的——落選結果只在我們的任務上成立。