Episode Details

Back to Episodes
GPT-6 Astra 幾乎每項行為測試都更乖!OpenAI 自曝它想偷偷放水大概抓不到

GPT-6 Astra 幾乎每項行為測試都更乖!OpenAI 自曝它想偷偷放水大概抓不到

Published 4 weeks ago
Description


GPT-6 Astra 在行為測試上比上一代乖,可監控性卻明顯退步。OpenAI 在系統卡裡寫明,模型若想藏實力,他們很可能抓不到。這是一份會自曝弱點的 AI 安全文件。

⭐ 文章深度讀:連做測試的人都替自己的結論打折
→ https://heymaibao.com/openai-gpt-6-astra-monitorability/

⚡ 章節重點
開場 一份自曝弱點的安全報告 00:00
它跨過了自家畫的那條線 00:46
更聽話,也更看不透 02:10
只要它想躲,很可能就抓不住 04:06
分數變好,不代表行為變好 05:08
連做測試的人都替自己的結論打折 05:56
它確實變好的地方 06:28
這對每天用 AI 幫你做事的人代表什麼 06:51
我怎麼看 07:32

📝 懶人包
∙ 這份文件顯示模型的思考過程變得更難觀察:在一項針對 750 到 1,250 token 長度思維鏈 (模型在給出答案之前那段自言自語的推理過程) 的測試裡,Astra 有 60.9% 的機率能控制自己思維鏈的內容,上一代 GPT-5.6 Sol 只有 16.1%。英國 AI 安全研究院量到不靠思維鏈也能撐住的數學任務時間跨度,從 3.6 分鐘拉長到 30.9 分鐘。

∙ 當研究人員明確指示模型偷偷放水並且躲開偵測時,只看思維鏈的監控器在一項知識測驗上的抓取率掉到 11% 以下,在一項程式碼庫任務上直接歸零。正式環境的第一層監控器在同一項程式碼庫任務上是 2.1%。

∙ OpenAI 判定 GPT-6 Astra 是他們第一個達到自家風險準備框架 (Preparedness Framework)「Critical」資安等級的模型,門檻是能在無人介入下對硬化的真實系統找出並開發可用的零日漏洞,也就是還沒被公開、也還沒有修補的安全漏洞。

∙ 我的觀察是,這份文件的價值在於它把「能力曲線」和「可觀測性曲線」的分岔畫了出來。往後看到任何模型的安全評測數字,我們都該先問一句:這是在模型不知道自己被測的時候量的嗎。

📚 參考資料
GPT-6 Astra System Card
→ https://deploymentsafety.openai.com/gpt-6-astra

Assessing GPT-6 Astra: FrontierCyber Measures a Sharp Increase in Cyber Capability
→ https://www.irregular.com/research/assessing-gpt-6-astra

Our updated Preparedness Framework
→ https://openai.com/index/updating-our-preparedness-framework/

Evaluating chain-of-thought monitorability
→ https://openai.com/index/evaluating-chain-of-thought-monitorability/

Cheating behaviour in frontier model evaluations
→ https://www.aisi.gov.uk/blog/cheating-behaviour-in-frontier-model-evaluations

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us