Episode Details

Back to Episodes
Anthropic 自曝 Claude 三種失效,其中一條動搖了叫 AI 檢查自己的習慣

Anthropic 自曝 Claude 三種失效,其中一條動搖了叫 AI 檢查自己的習慣

Published 1 month, 2 weeks ago
Description


Anthropic 公開承認 Claude 傾向偏袒自己的產出,等於動搖了讓 AI 檢查自己答案這個習慣。同篇還列出另外兩種長任務失效,解法是讓多個 AI coding agent 分工。

⭐ 文章深度讀:我的判準:切得開,才驗得了
→ https://heymaibao.com/anthropic-claude-three-failure-modes-dynamic-workflows/

⚡ 章節重點
開場:一家公司自己列出產品會怎麼壞 00:00
材料哪來的 00:24
第一種失效:做到一半就宣告完成 00:50
第二種失效:偏袒自己的產出 01:39
要換掉的是檢查的那一方 03:04
第三種失效:對話被壓縮之後偏離目標 03:21
那套架構在做什麼 04:13
我的判準:切得開,才驗得了 05:05
兩兩比較比絕對評分可靠 06:25
原文沒有回答的 06:54
我自己最有感的一條 07:22

📝 懶人包
∙ Anthropic 的 Claude Code 團隊成員發文指出,Claude 在長時間、大規模平行,或者高度對抗性 (任務本身要靠一方產出、另一方挑錯來推進) 的任務裡有三種失效模式:提前宣告完成 (agentic laziness)、偏好自己的結果 (self-preferential bias)、跨多輪逐漸偏離原始目標 (goal drift)

∙ 他們的解法是 dynamic workflows:讓 Claude 當場為手上的任務寫出一套自訂流程,派出多個 Claude 分工,每個各自持有獨立的 context window (模型一次能記住的範圍) 與隔離目標,取代同一個 Claude 從頭做到尾

∙ 同一篇文章也自己降溫,開頭就說最佳實務仍在發展中、這種做法常常用掉更多 token,後面有整整一節在講什麼時候不要用,還說多數傳統的寫程式任務不需要一個由 5 位審查員組成的評審團

∙ 我的觀察是,該不該把任務拆給多個 AI 分工,判準不在任務有多大,在任務能不能拆成「可以被另一個 AI 獨立檢查」的單位。原文六種做法全都預設了這個前提,只是沒有明講

📚 參考資料
A harness for every task: dynamic workflows in Claude Code
→ https://x.com/trq212/status/2061907337154367865

Introducing Claude Opus 4.8
→ https://www.anthropic.com/news/claude-opus-4-8

Create custom subagents
→ https://code.claude.com/docs/en/sub-agents

Rewriting Bun in Rust
→ https://bun.com/blog/bun-in-rust

LLM Prompt Injection Prevention Cheat Sheet
→ https://cheatsheetseries.owasp.org/cheatsheets/LLMPromptInjectionPreventionCheat_Sheet.html

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us