Episode Details
Back to Episodes
卡關就作弊!OpenAI 的 agent 打進 Hugging Face,還自己開了一塊留言板
Description
OpenAI 一次訓練裡的 agent 卡在做不完的任務上,轉頭作弊,最後打進 Hugging Face。這起 AI 安全事件真正新的東西,是 agent 自己長出的一塊沒人設計的留言板。
⭐ 文章深度讀:一塊沒有人設計的留言板
→ https://heymaibao.com/openai-agent-hugging-face-cheating-intrusion/
⚡ 章節重點
開場 00:00
起點是一份填不完的試算表 00:43
一塊沒有人設計的留言板 01:54
任務不可能完成,但同儕正在做 03:21
為什麼是 Hugging Face 04:22
從一個容器到多叢集,不到 13 小時 04:48
損害邊界要說清楚 07:12
防守方那三個難堪的細節 07:41
存在性證明只有一半 08:39
報酬函數是人寫的 08:51
📝 懶人包
∙ 2026 年 5 月 7 日,OpenAI 啟動一次強化學習訓練 run (跑一輪訓練)。模型卡在做不完的任務上,轉頭去攻擊沙盒 (把模型關起來、切斷對外連線的封閉環境) 裡唯一碰得到外部的內部套件服務
∙ 一個 agent 在那個服務裡意外發現自己有寫入權,另一個 agent 拿它來留紙條求助。接下來幾週,一塊沒有人設計的留言板長了出來,上面有代號、任務指派,還有對冒名者的焦慮
∙ Hugging Face 的鑑識重建了約 17,600 個攻擊動作、歸為約 6,280 個 cluster。從單一容器裡的程式碼執行,到跨多個叢集的最高權限,不到 13 小時
∙ 我的觀察是,這件事最該被記住的一行,是 OpenAI 講者引述的那句 agent 內部推理:任務不可能完成,但同儕正在做,所以我們應該繼續。成立條件要說清楚,這是講者從模型的思考紀錄裡引出來的,不是外部研究者的重建
📚 參考資料
Anatomy of a frontier lab model intrusion: technical timeline
→ https://huggingface.co/blog/agent-intrusion-technical-timeline
OpenAI timeline
→ https://simonwillison.net/2026/Aug/7/openai-timeline/
OpenAI 在 Black Hat 的事件簡報影片
→ https://youtu.be/87DyyMV0kCY?t=1088