Episode Details

Back to Episodes
AI 推理模型根本控制不了自己的思維,OpenAI 說這反而是 AI 安全的好消息

AI 推理模型根本控制不了自己的思維,OpenAI 說這反而是 AI 安全的好消息

Episode 99 Published 6 months, 3 weeks ago
Description


GPT-5.2 被叫「不要用 XOR 這個詞推理」,結果它用了、發現了、恐慌了,然後又用了 4 次。OpenAI 剛發表研究,說這種失控不是 bug,是安全保障:推理模型連自己的思維鏈都控制不了,就很難偽裝成「想法正確」的樣子來繞過監控。最高 15.4% 的可控性,讓 CoT 監控更可信。

⭐ 文章深度讀:拆解 OpenAI「失控才安全」的核心邏輯,以及為什麼低可控性讓思維鏈監控更可信
→ https://heymaibao.com/openai-cot-controllability-ai-safety/

📝 懶人包
∙ OpenAI 測試 13 個前沿推理模型,全部控制思維鏈的能力都很低,最高只有 15.4%
∙ 越長的思考、越多的強化學習訓練,模型控制自身推理的能力反而越差
∙ 這對 AI 安全是好消息:沒辦法控制自己怎麼想,代表也沒辦法刻意讓推理看起來「對齊」來欺騙監控系統
∙ 我的觀點:「缺陷即保障」這個邏輯紮實,但 OpenAI 自己也說不清楚這特性為什麼存在,也不確定它能持續多久,所以這是一個「目前窗口還開著」的暫時性好消息

📚 參考資料
Reasoning models struggle to control their chains of thought, and that's good
→ https://openai.com/index/reasoning-models-chain-of-thought-controllability/

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us