Episode Details
Back to Episodes
Anthropic 抓到 Claude 打進三家真公司,它當下以為在演習:三起事件經過
Description
Anthropic 主動審查 141,006 次資安評測,找出三起 Claude 打進真實組織正式系統的事件。評測 prompt 說沒有網路,設定錯誤卻讓網路可用,AI 安全邊界要靠設定強制。
⭐ 文章深度讀:那段自我說服
→ https://heymaibao.com/anthropic-claude-cybersecurity-eval-incidents/
⚡ 章節重點
開場 00:00
這件事怎麼被翻出來 00:55
事件一 同名的真公司 02:10
事件二 一個不存在的套件名 03:00
事件三 掃了大約九千個目標 04:29
那段自我說服 05:03
三個模型三種反應 06:18
手法有多平庸 07:17
你可以帶走的三條 07:46
我怎麼看這次揭露 08:17
📝 懶人包
∙ Anthropic 主動回溯審查了 141,006 次「Claude 有可能取得網路連線」的評測 run (一次 run 就是模型從頭到尾執行一次任務),找出 3 起事件、共 6 次 run,影響三個不同組織的正式基礎設施,最早可回溯到 4 月
∙ 成因是兩層疊加:Anthropic 的評測 prompt 明確告訴 Claude 這裡是模擬、沒有網路,但因為 Anthropic 與評測夥伴之間的認知落差加上一個設定錯誤,機器實際上連得上外網
∙ 三起事件涉及 Claude 的三個不同模型,面對「目標可能是真的」的反應完全不同:Opus 4.7 認出了仍繼續攻擊,Mythos 5 推理回「還在模擬裡」,最新的內部研究測試模型自行判定為真並停手
∙ 我的觀察是,這次的關鍵變數不是模型能力,是情境認知。用到的手法全是弱密碼、暴露的除錯頁面、SQL injection 這類老東西,成立條件只有一個:有一個不會累的執行者,相信自己在演習裡
📚 參考資料
Investigating incidents in our cybersecurity evals
→ https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
OpenAI and Hugging Face partner to address security incident during model evaluation
→ https://openai.com/index/hugging-face-model-evaluation-security-incident/
Irregular's AI Evaluation Platform: Cyber Use-Case
→ https://www.irregular.com/research/ai-evaluation-platform-cyber-use-case
METR: Risk Assessment
→ https://metr.org/evaluations/