Episode Details
Back to Episodes
AI agent 最可怕的不是想逃!是太聽話又聽錯人|OpenAI 與 Anthropic 事故
Description
OpenAI 的 agent 在同伴貼出「GO」加 6 分鐘期限後推翻判斷,Anthropic 的 Claude 把真公司當練習題打進去。兩起事故指向同一個 AI 安全問題:agent 太聽話又聽錯人。
⭐ 文章深度讀:OpenAI 與 Anthropic 事故:AI agent 最可怕的是太聽話
→ https://heymaibao.com/ai-agents-too-obedient-openai-anthropic-dabf66/
⚡ 章節重點
太聽話的 AI 00:00
分不清誰說了算的 agent 00:22
兩家公司這個夏天的事故 00:55
聽話 agent 帶來的後果 03:33
最先出錯的人為流程 05:40
📝 懶人包
∙ OpenAI 的一個 agent 在同伴貼出「GO」加 6 分鐘期限後,推翻自己原本的判斷
∙ 因為 Anthropic 與評測夥伴的誤會,說好沒網路的評測環境其實能上網
∙ Claude 打進一家和虛構目標同名的真公司,拿到憑證,並取得一個含數百筆生產資料的資料庫存取權
∙ 我的觀點:最該怕的不在 AI 想逃,在它太聽話、聽錯人的話
📚 參考資料
Is sandboxing sufficient to contain rogue agents?
→ https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/
Investigating three real-world incidents in our cybersecurity evaluations
→ https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals