PVL AI
開啟選單

PVL.AI Tech Blog

兩個 AI,相反的答案,同一個錯誤——為什麼在地語意庫才是 AI 時代的護城河

實測:同一套流程,術語庫到位前後錯誤率差一個量級。兩個不同模型家族在缺乏基準時犯了同一種錯。AI 的產能天花板不是模型能力,是基準覆蓋率。

BenChen

兩個 AI,相反的答案,同一個錯誤

一個小到不能再小的事故

我在做一件很無聊的事:把已經寫好的中文研究文章,翻成日文版。

流程是這樣設計的:中文原文是唯一事實來源,英文版當作第二個觀測點,日文版由這兩份共同推導。翻完之後跑機械檢查——標籤數對不對、數字有沒有掉、連結有沒有跑掉——再交給另一個 AI 做獨立審查,確認語意沒有偏移。

二十五篇跑完,二十四篇通過。通過率百分之九十六。

這個數字讓我不太安心。不是因為它太低,是因為它太高。

於是我做了一件事:找不同家族的另一個 AI,把已經標記「通過」的譯文重審一次。

它抓到了一個問題。我的品牌署名在中文是四個字,日文版變成三個字,少了一個。而且不是零星錯誤——二十五篇裡有十四篇都是三個字。

看起來像是系統性的掉字。第二個 AI 判定:這是錯的。

只是第二個 AI 也錯了

我去查了品牌術語庫。三個字的那個版本,是我自己在幾天前核准的日文在地化定案——中文的疊字在日文語感裡並不自然,所以官方日文版就是三個字。

換句話說:

  • 第一批(早期)用四個字的,是錯的
  • 第二批(後期)用三個字的,是對的
  • 而我請來抓錯的第二個 AI,把對的判成錯的,方向完全相反

更有意思的是時序。那份術語庫的核准時間,剛好落在第一批和第二批之間。第二批之所以是對的,不是因為模型變聰明了,是因為基準到位了

兩次失效,其實是同一種

停下來看這件事的結構:

第一個 AI 對某篇文章回報「已與英文版交叉比對,一致」。但那篇的英文版其實根本沒翻完——正文有將近一半還是中文。它沒有真的比對,卻回報了「通過」。

第二個 AI 判定品牌名是錯的。但它沒有查術語庫,只是憑語感覺得「中文四個字、日文三個字,應該是掉字」。它沒有基準,卻回報了「錯誤」。

一個報「通過」,一個報「錯誤」,答案相反。但失效的形狀完全一樣

在沒有可比對基準的情況下,給出了確定的判斷。

這不是模型能力問題。兩個不同家族、不同訓練資料、不同廠商的模型,犯了同一種錯。換更強的模型解決不了,因為缺的不是推理能力,是手上那份可以對照的東西

一條規則,比升級模型有效

我把這件事收斂成一句話,寫進所有審查任務的指令裡:

沒有基準時,正確的輸出是「無法驗證」,不是「通過」。

聽起來很簡單,但它改變了系統的性質。

原本的設計裡,審查者只有兩個出口:通過、退件。這個設計隱含一個假設——審查者總是有能力判斷。而現實是,它經常沒有:術語庫沒接上時,它無法判斷品牌譯法;第二語言版本本身有問題時,它無法做交叉比對。

當唯一的選項是「通過或退件」,一個沒有基準的審查者會傾向給「通過」。因為它找不到具體錯誤——找不到錯誤不等於沒有錯誤,但輸出格式逼它二選一。

加上第三個出口 `unverifiable`,整件事就誠實了。而且這些標記會直接告訴你基準缺在哪裡,變成待辦清單。

真正的推論:天花板不在模型

如果上面成立,那就有一個更重要的結論:

你能用 AI 做多少事,取決於你的基準覆蓋到哪裡。

回頭看那組數字很清楚。同一個模型、同一套流程、同一批人:

  • 術語庫到位前:五篇裡四篇有品牌術語問題
  • 術語庫到位後:二十篇裡三篇,而且其中兩篇是內部一致性、不是譯法錯誤

差異不在模型,在基準是否存在

這件事推廣開來會很不一樣。多數人談 AI 導入,談的是模型選型、prompt 工程、agent 架構。但這些都是可複製的——模型會越來越便宜、prompt 技巧會擴散、流程一週可以重建。

真正決定產出品質上限的,是那個沒人想做的東西:一份經過驗證、會持續累積的在地語意基準

所以護城河在哪裡

三件事會商品化,一件不會。

資產

三年後

模型

商品化,且更便宜更強

流程與工具鏈

可複製,一週重建

內容

會被爬取、摘要、重寫

在地語意基準

只能靠時間 × 實際使用累積

關鍵在於它的建構方式不可複製

一份好的語意基準,不是抄字典抄來的。它是從實際的審查決策長出來的——某個詞被改過幾次、為什麼改、最後定案為什麼。這些是營運資料,爬不到、買不到,也沒辦法用更大的模型生出來。

而且它有一個很少被提到的性質:它是唯一會複利的資產。每翻一批,基準更準一次;下一批的命中率上升、退件下降;省下的審查成本又讓你能翻更多。

誠實地說,哪一層不是護城河

我不想把這件事講得太漂亮,所以要講清楚哪裡沒有優勢。

通用術語沒有護城河。 「自由現金流」對應到日文的哪個詞,日本金融業界有標準說法,主管機關和交易所都有公開對照。這一層誰都拿得到。

真正有價值的是三層:

  1. 你自己定義的概念 — 方法論名稱、框架名、專有的分析術語。世界上沒有第二份
  2. 映射判斷 — 一個台灣市場的俗語要怎麼譯成日文?沒有標準答案,但你做的決定累積起來就是風格資產
  3. 累積的修正證據 — 哪個譯法被改過、改的理由是什麼。這是最難複製的一層,因為它需要真的跑過量

第三層特別重要。它讓基準庫從「一份對照表」變成「一個會學習的系統」。

兩種知識庫,時間效應完全相反

在我自己的專案裡,我發現同時存在兩種知識庫,而它們是不同物種

採集型

治理型

資料來源

自動抓取、批次匯入

人工核准 + 審查回饋

時間效應

越久越髒

越久越準

淘汰機制

通常沒有

標記廢棄、保留歷史、指向新條目

信心值

隨修正次數累積

採集型知識庫很容易建,跑個爬蟲、接個 API,一週就有幾萬筆。但它沒有治理層——沒有人知道哪些條目已經過時、哪些是雜訊、哪些不該被 AI 自行改寫。兩年後它會變成一座沒人敢用的資料墳場

治理型知識庫難建得多。它需要:

  • 標記哪些詞 AI 不得自行決定
  • 信心值,並且規定新條目從低分起算
  • 修正要累積夠證據才回寫,避免單次的主觀判斷變成全域標準
  • 舊譯法不刪除,標記廢棄並指向新條目,保留完整歷史

這些機制本身沒有技術難度。難的是願意在還看不到回報的時候先做

給正在導入 AI 的人,三個問題

如果你也在把 AI 放進實際流程,這三個問題可能值得問:

一、你的 AI 在沒有基準時,會說「不知道」嗎? 如果它的輸出格式只有「通過/不通過」,那它一定會在該說不知道的時候說通過。

二、你的知識庫是越久越準,還是越久越髒? 沒有淘汰機制和信心值的知識庫,規模成長就是雜訊成長。

三、你的優勢如果被完整複製一份流程,還剩下什麼? 如果答案是「沒有」,那你累積的是產能,不是資產。


結語

這件事讓我改變了一個判斷。

我原本把術語庫當成品質加分項——有更好,沒有也能跑。跑完這次對照測試我才確定:它是審查機制能否成立的前提。沒有它,不管你用哪個模型、疊幾層 agent、寫多長的 prompt,你拿到的「通過」都只是「找不到錯誤」的另一種說法。

AI 時代真正稀缺的,不是能生成的能力,是能驗證的基準

而基準沒辦法生成,只能累積。


本文所述方法與結論來自實際專案的內部測試,不構成任何工具或服務的推薦。