01
牌價不能預測實付
同一題、同樣上限,五個模型的實際輸出從 14 到 744 token——比較基準該用什麼。
白皮書 · LLM 成本
牌價幾乎無法預測實付金額,更無法預測總持有成本。同一題、同樣的上限,不同模型的實付 token 差到 53 倍。
同一題、同樣上限,五個模型的實際輸出從 14 到 744 token——比較基準該用什麼。
不是「任務難不難」,而是「做錯了多久會被發現」。附我們七條產線的實際路由表。
設太小不會省錢,只會把付掉的輸入費變成廢品。我們在同一個坑裡摔了三次的完整紀錄。
前綴不夠長時快取不會建立、也不會報錯;並行請求會互相撞掉快取。
五折是真的,但不能和快取疊加,也不該用在需要逐筆校驗重試的任務上。
供應商回傳的金額不能信;還有一次 96 次呼叫全滅,原因根本不在模型。
53×
同一題的實付 token 差距
3
次踩進同一個 max_tokens 坑
42pp
完整前綴帶來的術語遵循提升
本文所有數字來自 PVL AI 生產環境的實測紀錄,非估計值。揭露原則:點名我們選用的模型,不點名落選的——落選結果只在我們的任務上成立。