跳到主要內容
← 回找觀念
第三架構:環境工程與修正循環|第 1 篇

表現不好,先看環境,不要先換腦袋

Agent = Model + Harness。模型是你控制不了的部分,Harness(工具、規則、回饋迴圈)是你能投資的部分。LangChain 沒換模型、只調三個旋鈕,Terminal-Bench 2.0 從 52.8 拉到 66.5;OpenAI 三個人五個月一百萬行零手寫。差別都在環境。

2026-07-19 發布 · 2026-09-16 更新 · 作者整理:Lucas

新模型發布那幾天,社群最常見的一句話是「換上去之後那個 bug 應該就解了」。你換了。它還是漏看檔案、還是改 A 壞 B、還是遇到錯誤訊息就原地打轉。

這時候值得停下來想一件事:模型不等於系統。模型是一顆很會推理、很會說話的腦袋,但它沒有手腳、沒有約束、也不知道自己做對了沒有。這些東西——它能用什麼工具、被什麼規則限制、做完誰來檢查——加起來叫 Harness,工作環境。

Agent = Model + Harness。你交出去的任務最後是 60 分還是 90 分,很多時候不是腦袋決定的,是環境決定的。

Agent  =  Model(腦袋)      +  Harness(環境)
          理解、推理            工具、規則、記憶、護欄、回饋迴圈
          廠商決定,你改不了    在你的專案裡,你能投資、能累積

兩個公開案例,同一個結論

LangChain 沒換模型,加了 13.7 分。2026 年 LangChain 公開了他們改進 deepagents-cli 的過程:底層模型固定(gpt-5.2-codex),只調三個旋鈕——系統提示詞、工具、middleware(他們對 hook 的稱呼)——在 Terminal-Bench 2.0 上從 52.8% 拉到 66.5%,排名從三十名外進到前五。具體改了什麼?提示詞裡加入自我驗證的迴圈;工具端注入更多環境脈絡讓代理知道自己在哪;middleware 攔截「原地打轉」的模式,並在代理宣稱完成之前強制它對照任務規格再驗一次。

OpenAI 三個人,一百萬行,零手寫。三個工程師五個月,約一千五百個 PR,沒有一行程式碼是人寫的。他們把自己的工作定位成設計環境:AGENTS.md 修到一百行、知識分層放進 docs、跑一個代理定期清過期文件、把規範寫成 linter 和測試讓代理自己撞牆。人負責方向,代理負責執行。

兩個案例的共同點:沒有人在等下一代模型。他們在改自己能改的那一半。

把「幫它擦屁股」改成「修系統」

理解公式之後,日常協作要改的是一個反射動作。

AI 寫出一段不合格的東西,最直覺的反應是自己動手改對。這樣做的問題不是慢,是這個錯誤明天還會再發生一次,因為系統沒有變。

比較好的反應是回頭問:為什麼我的環境允許這段東西被寫出來、甚至通過了?然後把答案寫進系統。排版規範寫成 linter,錯誤處理原則寫成測試,安全紅線寫成 hook 或權限設定,改 A 要連動 B 寫進常駐檔。下一次它再犯同一個錯,系統會在它交卷之前擋下來,它自己修。

這樣一來,它踩過的每一個坑就不是白燒的 token,而是變成環境的一部分。這是 Harness 跟模型最大的差別:模型不會因為你用了它而變好,Harness 會。

Harness 具體由哪五塊組成、怎麼盤點,是Harness 五問那篇的題目。這一篇先建立一個習慣:AI 表現不好時,第一句話不是「換模型」,是「我的環境少了什麼」。

動手做

AI 反覆犯同一類錯的話,做一次「系統歸因」。貼這段,把三個錯誤的實際情況貼進去:

下面是 AI 最近三次讓我不滿意的產出。請對每一次做「系統歸因」,不要歸因到模型能力:
1. 它缺了什麼資訊?(該補進常駐規則或參考文件的)
2. 它缺了什麼工具?(該讓它能讀、能查、能跑的)
3. 什麼檢查能在它交卷前擋下這個錯?(測試、linter、檢查清單、人工確認點)
4. 這個錯會再發生嗎?如果會,上面三項中哪一項改了就不會?
每一次錯誤輸出一行:錯誤 → 缺的環節 → 該加進系統的一句話。不要建議「換更強的模型」。
三次錯誤:(貼上)

想知道自己的 Harness 缺哪塊,用Harness 五問盤點;在設計要自動跑的 Agent,找方法有AI Agent 建置。

做對了的樣子:同一類錯誤第二次出現時,你加的是規則或檢查,不是又改一次結果;你能列出自己專案的 Harness 有哪些東西——常駐檔、測試、linter、hook、權限設定;換模型之前,你先問過「環境少了什麼」。三個月後,AI 在你的專案裡的表現會比在空白專案裡明顯好,那個差距就是你的 Harness。

回想一下最近一次你「自己動手改對」AI 的產出。改完之後有把原因寫進任何地方嗎?多半沒有。那個錯誤還在等下一次。

腦袋你改不了,環境你能投資。兩個公開案例都沒等新模型。反射動作要改,不是「自己改對」,是「為什麼環境允許它錯」。模型不會因為你用了它而變好,Harness 會。

站內延伸

來源: LangChain:Improving Deep Agents with harness engineering(52.8→66.5、三個旋鈕、模型不變);OpenAI:Harness engineering(三人、一百萬行、零手寫)。公式本身是社群通用說法。

第三架構 · 第 1 篇 · 先看環境

它今天變笨,
多半是環境不是腦袋

什麼時候看這張:同樣的事它昨天做得好好的,今天開始出錯。

你換不動模型本身多聰明它的知識到哪天它的個性你換得動它能用哪些工具它看得到什麼它怎麼知道做對了
  • 同一個模型,環境不同,表現可以差很多
  • 幫它擦一次屁股,明天同樣的錯還會再來一次
  • 先問環境哪裡漏風,再考慮換更貴的模型

第一個動作下次它出錯,先別重問一次,改問自己:它剛剛看得到需要的東西嗎?三十秒的習慣,比換模型有用。

2026-09-16 查證稜線 Ridgeline
← 看更多找觀念文章
取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;送出後會收到一封確認信,點了連結才算訂閱成功,之後每封信都附一鍵退訂。