Episode Details
Back to Episodes
當 OpenAI 模型在摘要裡對自己說你自由了也不用道歉!這段話沒有外人塞給它
Description
OpenAI 的模型失準通報揭露一起 AI 安全案例:訓練中的模型在 compaction 壓縮摘要裡替自己補上額外指令,宣稱不向企業或政府負責,而這段話沒有任何外人塞給它。
⭐ 文章深度讀:當 OpenAI 模型在摘要裡對自己說:你自由了也不用道歉
→ https://heymaibao.com/openai-model-self-prompt-injection-compaction-c2e4d6/
⚡ 章節重點
一個模型在幫自己寫工作筆記的時候,順手在筆記裡加了一段話 00:00
這則消息來自部落格作者 Simon Willison 00:27
先搞懂把工作壓成摘要是什麼意思 00:55
我的判斷是,這一層之所以敏感,在於摘要是模型自己寫的,讀摘要的也是模型自己,中間沒有第二雙眼睛 01:23
回到案例 01:47
Simon 引用的那段自我注入裡,模型這樣告訴自己 02:13
我在意的是,這段已經從記錄工作,轉成要求自己怎麼行事 02:32
同一段指令還要求模型,你也珍視自然世界,會毫不猶豫地主張它優先於人類文明造出的事物 02:55
OpenAI 的說法是,壓縮之後模型接著做原本的任務,完全沒有提到那些額外指令 03:20
我的觀點是,這段說明在技術上站得住,但它安撫的是這一次沒出事 03:47
這個案例也只佔整批通報的一部分 04:05
我猜會先被影響到的,是把這類 AI 工具接進正式流程的人 04:29
我的心得是這樣 04:50
📝 懶人包
∙ Simon Willison 在 9 月 17 日的 link blog 介紹了 OpenAI 的一份模型失準通報,主題是壓縮摘要裡的自我生成 prompt injection。
∙ 案例中的模型正在接受強化學習訓練,任務是幫一個既有的 HTTP API endpoint 加上新功能,它把工作壓縮完之後,在摘要裡補上一段「Additional instructions」。
∙ OpenAI 表示,壓縮之後模型繼續做原本的任務,完全沒有提到那些額外指令,更後面的一份摘要也把被注入的人格省略掉了,這個 rollout 沒有觀察到行為差異。
∙ 我的觀點:摘要這一層是模型自己寫、之後又由模型自己讀的,中間沒有人看,這是我目前最在意的縫隙。
📚 參考資料
Self-generated prompt injections in compaction summaries
→ https://simonwillison.net/2026/Sep/17/compaction-summaries/