新模型發布那幾天,社群最常見的一句話是「換上去之後那個 bug 應該就解了」。你換了。它還是漏看檔案、還是改 A 壞 B、還是遇到錯誤訊息就原地打轉。
這時候值得停下來想一件事:模型不等於系統。模型是一顆很會推理、很會說話的腦袋,但它沒有手腳、沒有約束、也不知道自己做對了沒有。這些東西——它能用什麼工具、被什麼規則限制、做完誰來檢查——加起來叫 Harness,工作環境。
Agent = Model + Harness。你交出去的任務最後是 60 分還是 90 分,很多時候不是腦袋決定的,是環境決定的。
Agent = Model(腦袋) + Harness(環境)
理解、推理 工具、規則、記憶、護欄、回饋迴圈
廠商決定,你改不了 在你的專案裡,你能投資、能累積
兩個公開案例,同一個結論
LangChain 沒換模型,加了 13.7 分。2026 年 LangChain 公開了他們改進 deepagents-cli 的過程:底層模型固定(gpt-5.2-codex),只調三個旋鈕——系統提示詞、工具、middleware(他們對 hook 的稱呼)——在 Terminal-Bench 2.0 上從 52.8% 拉到 66.5%,排名從三十名外進到前五。具體改了什麼?提示詞裡加入自我驗證的迴圈;工具端注入更多環境脈絡讓代理知道自己在哪;middleware 攔截「原地打轉」的模式,並在代理宣稱完成之前強制它對照任務規格再驗一次。
OpenAI 三個人,一百萬行,零手寫。三個工程師五個月,約一千五百個 PR,沒有一行程式碼是人寫的。他們把自己的工作定位成設計環境:AGENTS.md 修到一百行、知識分層放進 docs、跑一個代理定期清過期文件、把規範寫成 linter 和測試讓代理自己撞牆。人負責方向,代理負責執行。
兩個案例的共同點:沒有人在等下一代模型。他們在改自己能改的那一半。
把「幫它擦屁股」改成「修系統」
理解公式之後,日常協作要改的是一個反射動作。
AI 寫出一段不合格的東西,最直覺的反應是自己動手改對。這樣做的問題不是慢,是這個錯誤明天還會再發生一次,因為系統沒有變。
比較好的反應是回頭問:為什麼我的環境允許這段東西被寫出來、甚至通過了?然後把答案寫進系統。排版規範寫成 linter,錯誤處理原則寫成測試,安全紅線寫成 hook 或權限設定,改 A 要連動 B 寫進常駐檔。下一次它再犯同一個錯,系統會在它交卷之前擋下來,它自己修。
這樣一來,它踩過的每一個坑就不是白燒的 token,而是變成環境的一部分。這是 Harness 跟模型最大的差別:模型不會因為你用了它而變好,Harness 會。
Harness 具體由哪五塊組成、怎麼盤點,是Harness 五問那篇的題目。這一篇先建立一個習慣:AI 表現不好時,第一句話不是「換模型」,是「我的環境少了什麼」。
動手做
AI 反覆犯同一類錯的話,做一次「系統歸因」。貼這段,把三個錯誤的實際情況貼進去:
下面是 AI 最近三次讓我不滿意的產出。請對每一次做「系統歸因」,不要歸因到模型能力: 1. 它缺了什麼資訊?(該補進常駐規則或參考文件的) 2. 它缺了什麼工具?(該讓它能讀、能查、能跑的) 3. 什麼檢查能在它交卷前擋下這個錯?(測試、linter、檢查清單、人工確認點) 4. 這個錯會再發生嗎?如果會,上面三項中哪一項改了就不會? 每一次錯誤輸出一行:錯誤 → 缺的環節 → 該加進系統的一句話。不要建議「換更強的模型」。 三次錯誤:(貼上)
想知道自己的 Harness 缺哪塊,用Harness 五問盤點;在設計要自動跑的 Agent,找方法有AI Agent 建置。
做對了的樣子:同一類錯誤第二次出現時,你加的是規則或檢查,不是又改一次結果;你能列出自己專案的 Harness 有哪些東西——常駐檔、測試、linter、hook、權限設定;換模型之前,你先問過「環境少了什麼」。三個月後,AI 在你的專案裡的表現會比在空白專案裡明顯好,那個差距就是你的 Harness。
回想一下最近一次你「自己動手改對」AI 的產出。改完之後有把原因寫進任何地方嗎?多半沒有。那個錯誤還在等下一次。
腦袋你改不了,環境你能投資。兩個公開案例都沒等新模型。反射動作要改,不是「自己改對」,是「為什麼環境允許它錯」。模型不會因為你用了它而變好,Harness 會。
站內延伸
- 五個組成怎麼盤點 → Harness 五問
- 回饋迴圈怎麼建 → 把自己從迴圈換掉
- Harness 的實作 → 找方法AI Agent 建置
來源: LangChain:Improving Deep Agents with harness engineering(52.8→66.5、三個旋鈕、模型不變);OpenAI:Harness engineering(三人、一百萬行、零手寫)。公式本身是社群通用說法。
它今天變笨,
多半是環境不是腦袋
什麼時候看這張:同樣的事它昨天做得好好的,今天開始出錯。
- 同一個模型,環境不同,表現可以差很多
- 幫它擦一次屁股,明天同樣的錯還會再來一次
- 先問環境哪裡漏風,再考慮換更貴的模型
第一個動作下次它出錯,先別重問一次,改問自己:它剛剛看得到需要的東西嗎?三十秒的習慣,比換模型有用。