PVL AI
開啟選單

實作觀點

AI 影片生成:難的不是生成,是驗收

把 AI 影片當生意做,瓶頸不在模型好不好,而在你有沒有辦法在交付前知道這支片是不是壞的。生成模型今天已經能產出足以放上官網的畫面,也同樣能產出「輸送帶自己變長」「三爪卡盤轉著轉著爪子消失」這種一眼假的畫面——而這兩種結果會來自同一個模型、同一組參數,只差一句提示詞。能不能量產,取決於你有沒有一套「哪些鏡頭本來就不該叫 AI 做」的判斷,以及一套逐秒檢查的驗收方法。選模型是最容易的一步,也是最不重要的一步。

四個結論

  1. 01

    AI 影片的失真集中在「離散動作」與「複雜幾何旋轉」——一顆顆掉落的產品、夾著工件高速旋轉的卡盤、噴出的液體。同一個模型拍「鏡頭移動+機器靜止」卻穩定得多。這不是模型優劣問題,是任務類型問題。

  2. 02

    靜態抽幀驗收會漏掉全部的動態瑕疵。結構變形、物件增殖、方向錯誤都發生在時間軸上;改用逐 0.5 秒的網格逐格比對後,前三輪「看起來沒問題」的成品全部現形。

  3. 03

    保真度隨秒數衰減:首格最可信(那就是你的來源照片),越往後模型自由發揮越多。實務對策是生成長段、只取前段,並用多個短鏡頭快切取代單一長鏡頭——短段快切還有個副作用好處:2 秒的瑕疵幾乎看不出來,15 秒的瑕疵整支報廢。

  4. 04

    最便宜的模型往往最貴。我們對測四個低價模型做提示詞前處理,其中最便宜的那個把運算預算全燒在內部推理然後交白卷;另一個「能跑」的模型把「遠小於」理解成「約一半」——它讓使用者以為問題解決了,實際放大了原本的錯誤。便宜而錯的輸出,成本是整批重做。

為什麼「換一個更好的模型」解決不了這件事?

因為失真的來源不是模型能力不足,是任務違反了模型的機率本質。

生成模型輸出的是「看起來合理的下一格」。機器動作的本質卻是等速、重複、單向、離散——而模型的傾向是漸變、隨機、雙向、連續。兩者衝突的地方就是穿幫點。「一顆顆生產出來的產品」需要的是因果(前一顆離開、下一顆出現),模型只會把它糊成一團連續變形。你換再貴的模型,這個結構性衝突不會消失,只會變得比較不明顯。

真正有效的做法是在寫腳本階段就不要下這種單。同一個訊息可以用做得到的鏡頭講:不拍「產品一顆顆掉下來」的瞬間,改拍「已經成排的成品+緩慢推鏡」,觀眾自己會補上因果。專業的產業 b-roll 本來就是這樣拍的——動感來自運鏡與剪輯節奏,不是機器在畫面裡耍雜技。

為什麼提示詞要先被改寫,而不是直接送進模型?

因為使用者自然會寫出模型系統性誤解的詞,而這些詞是可以列舉的。

最典型的是相對尺寸。我們要一根「直徑遠小於卡盤」的細棒料,模型生出比原本還粗兩三倍的工件——相對量詞被反向理解。修法不是換模型,是把它換成具體錨點:「約 20mm、成人手指粗細」「像鉛筆一樣細長」。同一類問題還有精確數量(「一排三顆」)、要求模型畫出中文字(必然崩壞)、以及物理上不該存在的元素(常溫機械冒蒸氣)。

這些都是可以自動化的。把實測累積的失敗模式做成規則,在生成前跑一次便宜的語言模型改寫,成本佔一張圖不到百分之二,但直接決定命中率。更重要的設計選擇是:改寫過程要讓使用者看得到。我們的做法是打字時就即時提示「相對尺寸模型常誤解,建議改用具體比例」,生成後再顯示「已自動優化你的描述」並可展開比對。偷偷修好會讓客戶學不到東西,下一次還是寫出同樣的句子。

我們從四個開源專案學到什麼,以及它們共同缺什麼?

四個公開專案各自解掉了管線的一段,而它們全都沒有處理「你怎麼知道輸出是對的」。

它們的共同缺口不是疏忽,是定位差異:這些是示範專案,示範專案的成功條件是「能跑出一次漂亮的結果」;生意的成功條件是「不能交出一次難看的結果」。這兩件事之間的全部距離,都在驗收層。

同樣值得記下的是我們沒有採納的。其中一個是設計精巧的微型內容審核模型——免費、不外洩提示詞,但它是英語成人內容專用,而我們的流量是中文的工業機械描述,風險域不對,重訓的投資報酬率現在不成立。另一個是「限流後讓使用者填自己的 API 金鑰」,這直接違反我們永不下發任何供應商金鑰的原則。看過並且拒絕,跟沒看過,是兩件不同的事。

如果你要評估一家做 AI 影音的供應商,該問什麼?

不要問他們用什麼模型。問這四題:哪些鏡頭你們不接、你們怎麼驗收、同一支片重做要多少錢、你們的失敗紀錄在哪裡。

第一題答不出來的,代表他們還沒撞過牆,你會成為他們的學費。第二題「我們會看過」不是答案——要能說出以什麼時間粒度、檢查哪幾種特定失效模式。第三題如果重做成本高到他們不願意重做,你拿到的就是第一次的結果。第四題最關鍵:有系統累積失敗經驗的團隊,下一支片會比上一支好;沒有的,每一支都是重新賭一次。

我們自己的答案寫在產品裡:哪些鏡頭不接是明文規則,驗收是逐秒網格,生成失敗自動退點,而每一次穿幫都會回寫進內部知識庫——那本知識庫現在是我們最不想交出去的資產,比任何一支成品都值錢。

四個開源專案:各自解掉什麼,以及我們採納了什麼

專案它解掉的問題我們採納的做法
loras-dev風格型錄化的生圖介面每個風格帶一組提示詞精修規則——這個欄位設計啟發我們把失敗模式規則化
violin影片翻譯全管線:轉錄、翻譯、配音、混音帶日期戳的供應商費率表+逐案成本回算;以及「一個風格預設同時綁多個管線階段參數」的資料結構
blinkshot即時生圖與濫用防護來源檢查(擋掉不經瀏覽器的直接呼叫)作為縱深防禦的一層
napkins截圖轉應用程式它維護一份公開的評測基準(數百次跑分紀錄)——把品質當數據管理的紀律值得抄
實例:業主提交三張設備照片,產出 15 秒商業影片。畫面中的機器結構、比例與細節全程與原照片一致。

為什麼換一個更強的 AI 影片模型,解決不了畫面失真的問題?

因為失真的來源不是模型能力不足,而是任務違反了模型的機率本質。生成模型輸出的是「看起來合理的下一格」,而機器動作的本質是等速、重複、單向、離散——模型的傾向卻是漸變、隨機、雙向、連續。兩者衝突之處就是穿幫點。換更貴的模型不會消除這個結構性衝突,只會讓它變得比較不明顯;有效的做法是在寫腳本階段就不下這種單。

有機械設備要拍,不確定哪些鏡頭做得到?

告訴我們你要拍什麼設備、給誰看。我們會直接說哪些鏡頭我們接、哪些不接,以及為什麼——比報價單有用。