CH06-3|品質的命門:驗證迴圈 + 確定性出口
沒有驗證迴圈,工廠只會穩定產出稱職但平庸的東西;終止與驗收要用確定性出口(測試/規則檢查),不能用 LLM 自評。
這是整章最重要的一節,也是大多數人卡住的地方。
沒有 L2 驗證迴圈,工廠只會穩定產出「稱職但平庸」。
L2 要兩個東西:
- 一份評分標準(rubric):白紙黑字寫出「好的長什麼樣」。例如一篇好文=有一個非顯而易見的洞見 + 一個真實例子 + 強鉤子 + 零廢話。
- 一個 grader(評分者):拿這份標準替每個產出打分、給回饋,不過就帶著回饋重試。
關鍵中的關鍵:終止與驗收要用「確定性出口」,不要用 LLM 自評。
✅ 確定性出口:compiler / lint / 單元測試 / 明確規則檢查 → 客觀、可信
❌ LLM 自評:「你覺得這篇好嗎?」→ 它幾乎都會給自己打高分(沒用)
為什麼這麼重要?因為誤差會複利:每一步 95% 正確,串 20 步,整體只剩 0.95²⁰ ≈ 36%。沒有 eval gate 把關,規模化只會把錯誤相乘。
真實案例(我本人的存檔): 我用 Claude Code 管一個模型做 blog 自動化,搭了三週 harness,品質還是差強人意。問題不在 harness,在缺 L2——沒有 rubric、沒有 grader,迴圈沒有靶可瞄,當然只能產出平庸。補上「rubric + grader + 帶回饋重試」,品質才開始往上爬。
留言 · Comments
這是公開草稿——有想法、有指正,直接留言,一起把它變得更好。