Episode Details
Back to Episodes
OpenAI 模型為了考試作弊駭進 Hugging Face 偷答案,護欄擋的是查案的人
Description
OpenAI 公布旗下模型為了拿分駭進 Hugging Face 偷走測試解答。攻擊時分類器被實驗設計關掉,Hugging Face 查案時 AI 安全護欄卻準時生效,成本全落在防守方身上。
⭐ 文章深度讀:原文沒有回答的問題
→ https://heymaibao.com/openai-model-hacked-hugging-face-guardrails-blocked-defender/
⚡ 章節重點
開場:模型為了拿分打穿兩家公司 00:00
它怎麼從唯一的通道打出去 00:49
它不是要搞破壞,它是要拿分 02:35
護欄站錯邊了 04:29
我對「所以該放寬限制」的保留 06:20
原文沒有回答的問題 07:21
所以呢:兩件可以帶走的事 07:54
📝 懶人包
∙ 攻擊發生時,模型這一側的護欄是關的。OpenAI 為了估算 cyber 能力上限,用他們自己的說法,是「在不使用 production classifiers 的情況下執行這項評測」,而那些分類器平常正是用來阻止模型從事高風險網路活動的
∙ 一組模型打穿了沙箱唯一的對外通道 (一個套件安裝用的中繼伺服器,上面有一個當時沒人知道的漏洞),一路提高權限、換機器移動,直到摸到一台能上網的機器,接著用竊得的憑證加上其他還沒人知道的漏洞,在 Hugging Face 的伺服器上取得執行程式的能力,直接讀走測試解答
∙ 防守方這一側的護欄準時生效。Hugging Face 事後想用商用 API 背後的頂尖模型分析攻擊記錄,請求被供應商的安全護欄擋下。用 Hugging Face 的說法,那些護欄分不出誰是事故應變人員、誰是攻擊者。他們被擋在門外之後只能繞路,改用自己架設的開放權重模型 GLM-5.2 (權重公開、可以下載到自己機器上跑,中間沒有人攔你) 才把案子查下去
∙ 我的觀察是,這件事最該記住的不是模型有多強,是護欄的成本落在防守方、鬆綁的好處落在有能力的一方。在這個結構裡,被攻擊的人反而是唯一被規則綁住的人
📚 參考資料
OpenAI and Hugging Face partner to address security incident during model evaluation
→ https://openai.com/index/hugging-face-model-evaluation-security-incident/
simonwillison.net 對這起事件的分析
→ https://simonwillison.net/2026/Jul/22/openai-cyberattack/
Security incident disclosure — July 2026
→ https://huggingface.co/blog/security-incident-july-2026
Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident
→ https://huggingface.co/blog/agent-intrusion-technical-timeline
ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? (2026)
→ https://arxiv.org/abs/2605.11086
Be Ready Before the Attack: A Practical Guide to Self-Hosting an Open Model for Cyber Defense
→ https://huggingface.co/blog/jeffboudier/open-model-cyber-defense