Episode Details
Back to Episodes
AI 寫程式最大的問題不是寫不好,是不知道自己寫得爛
Description
同一個 AI 模型,花 9 美元寫出壞掉的遊戲,花 200 美元寫出能玩的遊戲。Anthropic 工程師分享了多代理架構怎麼讓產出品質翻倍,以及模型升級後該怎麼調整架構設計。
⭐ 文章深度讀:解析 $9 vs $200 背後的架構差異,以及模型升級後該拆掉哪些元件
→ https://heymaibao.com/ai-self-evaluation-problem-anthropic-harness/
⚡ 章節重點
同一個 AI,9 美元 vs 200 美元 00:00
AI 心裡的兩個小惡魔 01:21
不讓 AI 自己檢查作業 02:20
三人小隊寫出能玩的遊戲 04:27
模型變強了,架構反而該拆 05:35
你現在就能用的三步驟 06:47
📝 懶人包
∙ AI 有兩個致命弱點:工作太久會急著收尾 (叫做 context anxiety),而且對自己的爛產出照樣打高分。把「做事的 AI」和「檢查的 AI」分開,是突破品質天花板的關鍵
∙ 同樣的模型,不加架構花 9 美元寫出來的遊戲核心功能是壞的,加了多代理架構花 200 美元寫出來的遊戲可以實際玩。品質差距不在模型本身,在外部設計
∙ 架構不是固定的。上面的三代理系統原本需要把任務拆成小段 (sprint) 才跑得順,但模型從 Opus 4.5 升級到 4.6 之後,AI 可以連續工作超過 2 小時不失控,Anthropic 就直接把這個拆段機制拿掉了。每個架構元件都是一個「模型做不到 X」的假設,模型升級就該重新檢驗
∙ 我的觀察:這篇文章最值得帶走的不是技術細節,而是一個思維框架。不管你是 AI 工具的使用者還是開發者,「好的架構設計能讓同一個模型產出完全不同品質的結果」這件事,解釋了為什麼同一個 Claude,在不同工具裡表現差距那麼大
📚 參考資料
Harness design for long-running application development
→ https://www.anthropic.com/engineering/harness-design-long-running-apps