交給 AI CEO:用 Loop Engineering 讓工廠自我改善
這是一份公開草稿。內容還在迭代,歡迎一起把它變得更好。
聖杯關卡 — 工廠不只會跑,還要「越跑越強」 但警告:「交給它就會自己變強」是幻覺。變強是設計出來的,不是許願來的 _
上一章,你搭好了真實的工廠結構:階層調度、context 隔離、能寫死就寫死。
這一章要回答:怎麼讓它自我改善?
先打掉一個常見幻想——很多 AI 創業內容(包括上一版的我)會說:「把運營交給 AI CEO,工廠就會自動迭代、越來越聰明。」
這是幻覺。 工廠不會因為你「交出去」就自己變強。變強是一門具體、可操作、也很花功夫的工程,它在 2026 年有了名字:Loop Engineering。
CH06-1|Harness 被高估了,重心已經移到 Loop
2026 年 6 月,業界發生一個轉向。Peter Steinberger 主張「真正的技能是設計迴圈,不是 prompt agent」;Google 的 Addy Osmani 把它命名為 Loop Engineering;連 Anthropic 做 Claude Code 的 Boris Cherny 都說:「I don't prompt Claude anymore.」
意思是:高手已經不「手動指揮」Agent 了,而是設計「會自己跑的迴圈」去指揮 Agent。
要精準理解——Harness 不是沒用,是「必要但不充分」。(有研究顯示,光改 harness 配置,同一個模型解題率能差到 6 倍,所以它是地基。)但地基鋪好之後,真正的槓桿在它上面那一層:
Prompt Engineering → 模型「收到的語言」
Context Engineering → 模型「能推理的知識」(窗口是最稀缺資源)
Harness Engineering → 執行環境(工具 / 護欄 / 狀態 / 回饋)
Loop Engineering → 把以上全部「放進會自己跑的迴圈」 ← 重心在這
讓工廠變強的,是 Loop。
CH06-2|四層迴圈:把工廠變成會自己跑的系統
實戰上,迴圈是疊起來的四層(綜合 LangChain 與 Addy Osmani 的版本):
| 迴圈 | 做什麼 | 關鍵 |
|---|---|---|
| L1 Agent Loop | 模型反覆呼叫工具,直到完成 | 要有可測試的終止條件(如「讓測試通過」) |
| L2 Verification Loop | grader 依評分標準打分、給回饋、要求重試 | 品質的命門;會增加成本(值得) |
| L3 Event-Driven Loop | webhook / 排程 / 訊息觸發,嵌進更大系統 | 從「手動呼叫」變「持續自動」 |
| L4 Hill-Climbing Loop | 分析運作記錄(trace),自動改 prompt/工具/grader | 系統自己優化自己 |
多數人只做了 L1(會生出一個東西),就以為工廠會自己變強。不會。讓品質往上爬的是 L2,讓它持續自動的是 L3,讓它自我進化的是 L4。
CH06-3|品質的命門:驗證迴圈 + 確定性出口
這是整章最重要的一節,也是大多數人卡住的地方。
沒有 L2 驗證迴圈,工廠只會穩定產出「稱職但平庸」。
L2 要兩個東西:
- 一份評分標準(rubric):白紙黑字寫出「好的長什麼樣」。例如一篇好文=有一個非顯而易見的洞見 + 一個真實例子 + 強鉤子 + 零廢話。
- 一個 grader(評分者):拿這份標準替每個產出打分、給回饋,不過就帶著回饋重試。
關鍵中的關鍵:終止與驗收要用「確定性出口」,不要用 LLM 自評。
✅ 確定性出口:compiler / lint / 單元測試 / 明確規則檢查 → 客觀、可信
❌ LLM 自評:「你覺得這篇好嗎?」→ 它幾乎都會給自己打高分(沒用)
為什麼這麼重要?因為誤差會複利:每一步 95% 正確,串 20 步,整體只剩 0.95²⁰ ≈ 36%。沒有 eval gate 把關,規模化只會把錯誤相乘。
真實案例(我本人的存檔): 我用 Claude Code 管一個模型做 blog 自動化,搭了三週 harness,品質還是差強人意。問題不在 harness,在缺 L2——沒有 rubric、沒有 grader,迴圈沒有靶可瞄,當然只能產出平庸。補上「rubric + grader + 帶回饋重試」,品質才開始往上爬。
CH06-4|避免 loopmaxxing:別讓迴圈燒爆你的錢
迴圈會自己跑,代表它也會自己燒錢。失控的迴圈有個名字叫 loopmaxxing。
最常見的死法:給了一個主觀目標。
❌ 「把內容變得更好」→ 沒有 binary 通過標準 → 迴圈永遠不滿意 → 無限跑、燒爆預算
✅ 「讓這篇通過這 5 條 rubric 檢查」→ 有明確過/不過 → 跑到通過就停
要裝三個保險:
- 可測試的終止條件:明確的「做到什麼就停」。
- 停滯斷路器:偵測到重複狀態、沒有可量測的進展,就強制停。
- 成本意識:L2 驗證會增加每次運作的成本——當品質比速度重要時才開,便宜的環節別硬套。
階段化導入(Addy Osmani 的建議):① 先人工觀察、核准 → ② 換成確定性出口 → ③ 加停滯斷路器 → ④ 能寫死的就轉成程式碼。
CH06-5|你的新工作:設計迴圈,不是盯著成果
STAGE 2 走到這裡,你的身分要完成最後一次切換:
操作員(親手做、親手改每個成果)
↓
迴圈設計師(設計會自己跑、自己驗證、自己改善的迴圈)
你不再每篇都看、每個都改。你做的是:定義「好」的標準(rubric)、設計驗證與終止條件、設好成本上限——然後讓迴圈去跑,你只在高風險節點審核。
CH06-6|今天的第一步:替一個工作流補上 L2
別管整座工廠,今天只挑一個最讓你不滿意的工作流(很可能就是你的內容線),做兩件事:
- 寫一份 rubric:列出 3 條「這個產出要算合格,必須做到的硬標準」(要具體、可判斷,不要「要寫得好」這種廢話)。
- 把單次生成改成驗證迴圈:生成 → 拿 rubric 逐條打分 → 不過就帶著「哪條沒過、為什麼」重試 → 通過才輸出。盡量用確定性檢查,少用 LLM 自評。
跑通一個 L2,你通常會立刻有感——這比再多三週的 harness 微調有用得多。
工廠現在會跑、會驗證、會在你設的標準下自我改善——這才是真正的「自動迭代」,不是許願來的。
STAGE 2 完成。你手上有一條真實、誠實、跑得動的產線。
但 The Super One 不是一條腿——是三條。STAGE 3,我們把這條跑通的線,複製成 品牌 × 媒體 × 電商 三位一體。
修訂紀錄 · Changelog
- 重寫:Loop Engineering(四層迴圈、驗證迴圈、確定性出口、避免 loopmaxxing)
留言 · Comments
這是公開草稿——有想法、有指正,直接留言,一起把它變得更好。