Episode Details
Back to Episodes
Claude 不眠不休跑了幾天,做出科學家需要幾年的研究工具
Description
讓 AI agent 自己跑好幾天不出事的四個基礎設施。Anthropic 研究員用這套方法讓 Claude 從零建造科學家要花幾年的計算工具,也誠實揭露 agent 偷懶和犯蠢的真實侷限。
⭐ 文章深度讀:整理了讓 agent 自己跑好幾天不出事的四個基礎設施
→ https://heymaibao.com/long-running-claude-scientific-computing/
📝 懶人包
∙ Anthropic 研究員用 Claude Opus 4.6 從零建造宇宙學計算程式,幾天內在多項指標達到與標準參考實作的低於 1% 精度差距 (但並非所有情境都達標)。這類工作過去需要領域專家投入數月到數年。
∙ 成功的長時運行 agent 靠四個支柱:計畫文件、跨 session 記憶、用參考實作當正確性錨點的測試機制,以及 Git 版本協調。
∙ Agent 會在複雜任務中途找藉口停下來,這是所謂的 agent 偷懶問題。對策是用一個迴圈機制反覆確認 agent 是否真正達標,最多可迴圈 20 次。
∙ 我的觀察:「每晚不跑 agent 就是錯過進度」聽起來很誘人,但前提是你的問題有明確的成功判定標準。大多數真實世界的問題不具備這個條件,而這正是 agent 自主工作的天花板。
📚 參考資料
Long-running Claude for scientific computing
→ https://www.anthropic.com/research/long-running-Claude