跳到主要內容
← 回找觀念
第三架構:環境工程與修正循環|第 3 篇

把自己從迴圈裡換掉

「AI 產出 → 你測 → 你貼錯誤 → AI 改」這個迴圈裡,你是最貴也最慢的那一環。把你判斷對錯的邏輯寫成測試或檢查,讓系統自己跑、自己餵回去,你只看結果。

2026-07-21 發布 · 2026-09-16 更新 · 作者整理:Lucas

你大概很熟這個流程:AI 吐一版程式,你複製到本機跑,壞了,把錯誤訊息貼回去,它改一版,你再跑、再貼。一個下午過去,你做的事情是搬運錯誤訊息。

這叫 Human-in-the-loop,人站在迴圈中間,用自己的時間提供回饋。模型還不夠強的時候這是必要的。現在多半不是。

2026 年中,OpenClaw 的作者 Peter Steinberger 發了一句很多人轉貼的話:「你不該再親手 prompt coding agent 了,你該設計一個 loop 去 prompt 它。」Claude Code 的負責人 Boris Cherny 說的是同一件事:「我不 prompt Claude 了。我有迴圈在跑,是它們在 prompt Claude、決定下一步。我的工作是寫迴圈。」

這件事有個名字,Loop Engineering。核心只有一個動作:把你腦中判斷對錯的邏輯寫下來,變成系統能自己跑的檢查。

自我修正閉環

Step 1Test

先跑測試或檢查。

Step 2Read Log

把錯誤訊號轉成 Context。

Step 3Fix

針對證據修正。

Step 4Retest

重跑驗收,直到通過或熔斷。

先把「你怎麼判斷對錯」寫出來

想一想,AI 寫錯的時候你是怎麼發現的?你看測試有沒有過、看頁面載入有沒有超過兩秒、核對專有名詞有沒有拼錯、檢查表格欄位有沒有對齊。

這些判斷有一個共同點:它們都可以被寫下來。能寫成程式的,寫成測試或 linter(自動檢查程式格式與常見錯誤的工具);不能寫成程式的——語氣對不對、有沒有符合品牌——寫成另一個 AI 拿著評分表去檢查。Anthropic 把這個模式叫 evaluator-optimizer:一個產出、另一個評估並給回饋,來回直到過關。

寫下來之後,你就不用每次親自判斷了。這一步是 Loop Engineering 的全部,其他都是工程細節。

我的經驗是,第一次做這件事最難的不是寫測試,是承認自己的判斷可以被寫下來。「我看了就知道」這句話,八成可以拆成三到五條具體的檢查。

在你的環境裡把迴圈接起來

最簡單的版本,任何有執行權限的代理工具都能做。

先寫檢查,再寫功能。動工前叫 AI 先寫測試腳本(為什麼要先看到它失敗,先紅燈再綠燈那篇講)。腳本是確定性的:功能對就通過,錯就丟出明確的錯誤。

然後告訴 AI 迴圈的規則。在常駐檔或任務說明裡寫一句:「改完之後執行測試;失敗就讀錯誤訊息、修改、再跑,直到通過才回報。」有執行權限的工具會照做,它自己跑、自己讀、自己修,你看到的是通過之後的版本。

進階一點,讓系統在它交卷前攔一次。Claude Code 的 hook 可以在特定事件(例如它要執行某個指令之前、或它宣稱完成時)自動跑一段檢查,失敗就把結果塞回對話。LangChain 那個 13.7 分的實驗做的是同一件事,他們叫它 middleware:在代理說「做完了」之前,強制它對照任務規格再驗一遍。

接起來之後,AI 在背景默默重修五輪、十輪,通過了才敲你的門。你從搬運工變成驗收的人。

當然,迴圈會失控。目標定得不夠準、檢查有漏洞,它可能在背景無限打轉燒錢。所以接下來兩篇要講:迴圈什麼時候啟動、什麼算做完(可驗證目標),以及什麼時候必須強制停下來(迴圈的停損)。沒讀完那兩篇之前,別讓迴圈整晚跑。

動手做

網頁版沒有執行權限,也能做半自動的迴圈:把你的判斷寫成清單,叫它交卷前自己過一遍。

接下來的產出,交給我之前你要自己跑一次下面的檢查清單。每一項回答「通過/未通過+原因」,有未通過的先修再交,最多修三輪。三輪還過不了,把過不了的那一項和原因告訴我,不要硬交。
檢查清單:
1.(例:所有專有名詞跟我給的對照表一致)
2.(例:每個段落不超過五句)
3.(例:沒有任何一句是「值得注意的是」開頭)
4.(例:數字都有來源,找不到來源的標「待查」)
任務:(貼上)

有 Claude Code、Codex 這類能執行的工具,一句話就接上。在任務說明或常駐檔加這段:

規則:每次修改程式後執行 `npm test`(換成你的測試指令)。測試失敗時,讀完整的錯誤輸出,修改,再執行;重複直到全部通過。連續三次錯誤訊息完全相同就停下來告訴我,不要繼續試。通過之後,回報你改了什麼、跑了幾輪。

接對了的樣子:你收到的第一版就是通過檢查的版本,不是「請幫我看看」的版本;錯誤訊息不再經過你的剪貼簿;AI 回報的時候會說「跑了三輪」而不是「做好了」;你的檢查清單在長,每次新的「不對」都變成一條新檢查。

想練一下的話,拿你最近一次對 AI 產出說「不對」的情況,把「不對」拆成三條可以打勾的檢查。拆不出來的那一條,通常是你自己也還沒想清楚標準。

你在迴圈裡,你就是最貴、最慢的那一環。Loop Engineering 只有一個動作:把你判斷對錯的邏輯寫下來,讓系統跑。能寫成程式的寫成測試,不能的寫成清單讓另一個 AI 拿著檢查。但迴圈接好之前先讀後面兩篇,沒有停損的迴圈會整晚燒錢。

站內延伸

來源: Addy Osmani:Loop Engineering(整理了 Steinberger 與 Cherny 的原話與脈絡);Anthropic:Building effective agents(evaluator-optimizer 模式);LangChain:Improving Deep Agents with harness engineering(完成前強制驗證的 middleware)。

第三架構 · 第 3 篇 · 迴圈設計

你在迴圈裡,
你就是最慢的那環

什麼時候看這張:它交一版你跑一次,壞了你貼錯誤回去,一下午都在搬運。

它交出來你先別看系統跑檢查錯就餵回去通過才給你你只驗收
  • 把你判斷對錯的邏輯寫下來,讓系統自己跑
  • 寫不成程式的,就列清單讓另一個它拿著檢查
  • 最難的是承認:我看了就知道,其實拆得出來

第一個動作拿上次你對它說「不對」的地方,拆成三條可以打勾的檢查。十分鐘,拆不出來代表還沒想清楚。

2026-09-16 查證稜線 Ridgeline
← 看更多找觀念文章
取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功,之後每封信都附一鍵退訂。