Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
讓 Claude 替你工作,不只是幫你回答
claudecowork-me.com
最新
排程任務失敗了,你怎麼會知道:從「靜默失敗」到有備援的自動化設計  ·  別叫 Claude 找答案,叫它幫你推翻假設:用假設檢驗取代直接求解  ·  跨語言內容審核工作流:不是翻得對不對,是每個語言版本有沒有說同一件事  ·  複製貼上依賴症:新手最容易忽略的問題不是不信任 Claude,是信任得太快  ·  該不該升級到更貴的 Claude 方案:與其看功能表,不如先算這三筆帳  ·  新人入職資料整理工作流:把散落各處的資訊整理成一份新人自己看得懂的入職包
名詞解析 · auditing-validation

Golden Set

黃金樣本集
auditing-validation intermediate

30 秒版 · 給沒耐心的人
正確輸出已人工核可的一組固定任務,每次改 prompt 或換模型後重跑,用前後差異判斷改動是變好還是變壞。
完整解說 +
01 · 這是什麼?

黃金樣本集是一組固定不變的真實任務,通常 20 到 50 筆,每一筆的正確輸出都已經有人審過、確認可以直接交出去。關鍵在「固定」兩個字:改 prompt、把 Claude 從一個模型換到另一個、往 Claude Projects 知識庫多塞幾份文件之後,重跑同一組任務,把新輸出跟已核可的版本擺在一起比對。這跟隨機抽查不是同一件事——抽查回答的是「今天這份輸出能不能用」,黃金樣本集回答的是「今天這套系統比上週好還是壞」。它也不等於工程上的測試套件,因為正確答案是判斷題,不是字串比對,兩份寫法不同的會議紀錄可能都算對。

02 · 為什麼存在?

改 prompt 的時候,人只會盯著自己想修的那個問題有沒有變好,不會注意到原本正常的十筆裡有兩筆悄悄壞掉了。模型版本更新、把任務從一個模型換到另一個、知識庫多了幾份文件、排程任務的觸發條件微調——這些都會改變輸出行為,但辦公室裡幾乎沒有人留著「上一版長什麼樣」的紀錄。於是品質討論很快變成印象之爭:有人說最近變好了,有人說最近怪怪的,兩邊都拿不出東西來對。黃金樣本集存在的理由只有一個,就是把「上一版長什麼樣」從記憶變成可以隨時調出來比對的檔案,讓改動的效果變成看得見的差異,而不是各說各話。

03 · 如何影響你的決策?

先選題:主力是每週都會跑、平凡到沒人想討論的那種任務,再加上幾筆已知會出錯的邊緣案例,例如附件是掃描檔、來信中英夾雜、資料裡有前後矛盾的數字。接著把每一筆的輸入和已核可輸出成對存起來,放試算表或 Claude Projects 知識庫都可以,重點是任何人都調得到。要驗證時,用批次處理一次跑完整組,逐筆對照三件事:事實有沒有錯、該有的欄位齊不齊、語氣符不符合對外標準。通過門檻不是全對,而是「不能比上一版差」。實務上有兩種做法:嚴格比對適合輸出格式固定的任務(欄位、數字、日期),評分表判斷適合開放式寫作,由人給每筆 1 到 5 分再看總分變化。維護上,每季換掉幾筆已經永遠會過的樣本,補進新踩到的錯誤。

04 · 你該怎麼辦?

建一組黃金樣本集大概要花半天:整理 20 到 30 筆輸入、把已核可的輸出貼進去、寫下比對標準。之後每次改動重跑約十幾分鐘。值不值得,看兩個條件:同一種任務你每週跑超過三五次,而且輸出會直接進到客戶信箱、主管簡報或對外文件。符合這兩點,半天換來的是「改壞了會當場知道」,而不是三週後被客戶指出來。只跑一次的任務不需要這套,建了也沒有下一次可以比。真正要留意的風險是樣本集老化:用久了,裡面全是你早就修好的問題,跑起來永遠 100% 通過,看起來很安心,其實已經測不到任何東西。判斷方式很簡單——如果連續兩次重跑都沒有任何一筆失敗,那不是系統變穩了,是樣本集該換血了。

實際例子 +

Anthropic 每次發布新模型,都會在 model card 上公布同一組公開基準測試(MMLU、GPQA、SWE-bench 等)的分數。題目固定不變,外界才能把新舊模型的分數直接放在一起比;如果每次發布都換一組題目,分數再高也說明不了模型變強。這就是黃金樣本集在做的事,只是規模不同。

常見誤解 +
✕ 誤解1
× 誤解:黃金樣本集就是把 AI 的輸出存起來當範本,實際是:存的是「已經被人審過、確認可以交出去」的輸出,沒經過人工核可的輸出存再多也只是舊紀錄,比對出來的差異無法判斷好壞
✕ 誤解2
× 誤解:樣本集通過率 100% 代表工作流很穩,實際是:連續多次全數通過通常代表樣本集已經老化,裡面只剩早就修好的問題,該換進新的失敗案例而不是慶祝
這件事跟你有什麼關係 +
直接影響

黃金樣本集的優點是把品質從印象變成可比對的差異,改壞了當場就知道,換模型或改 prompt 時不必靠賭;缺點是前期要花半天整理、之後每季要維護換血,樣本集本身會老化失效,而且對輸出開放性很高的任務(創意文案、策略發想),比對標準難以定義,容易變成主觀評分的另一種包裝。

提問
請至少輸入 10 個字
更多相關主題