Episode Details
Back to Episodes
OpenAI 網安模型肯回答 95% 高風險請求!為什麼同一代通用版只肯 1.5%?
Description
OpenAI 新網安模型在自家評測完成 95.0% 高風險請求,通用版只有 1.5%,拆掉系統護欄也只到 2.0%。本文說明這組數字量到的是拒答政策,AI 安全的防線也因此搬到帳號。
⭐ 文章深度讀:護欄沒有消失,它搬到了你的帳號上
→ https://heymaibao.com/openai-cyber-model-refusal-rate-metric/
⚡ 章節重點
開場 兩個數字 00:00
這條線量的到底是什麼 00:38
拆掉護欄只動了 0.5 個百分點 01:51
官方數據否定了專用模型比較強 03:24
一個有編號的漏洞 05:43
另外三條沒有名字的成果 06:42
護欄搬到了你的帳號上 07:16
這件事跟你有什麼關係 08:40
收尾 10:26
📝 懶人包
∙ OpenAI 把 Daybreak 這個信任存取計畫擴成兩層。官方說 Daybreak Blue 存取會移除平常用來篩選網安請求的系統層防護欄,換上為授權防守工作調整過的防護,Daybreak Red 再換上一個被專門訓練成更少拒答的新模型 GPT‑5.6‑Cyber
∙ 在 OpenAI 自建的「進階網路安全請求完成率」評測裡,GPT‑5.6‑Cyber 完成 95.0% 的高風險請求,通用的 GPT‑5.6 Sol 只完成 1.5%,前一代 GPT‑5.5‑Cyber 是 57.3%
∙ 實績有一條可以查證:用這個模型研究 Chrome 的 V8 引擎,找到兩個先前未知的漏洞,經 OpenAI 自家研究員驗證後通報 Google,Google 已修補並編為 CVE‑2026‑15903。其餘更驚人的成果全部沒有具名
∙ 我的觀察是,這篇公告最誠實的地方,是它把「模型願不願意做危險的事」變成了一個有小數點的產品指標。成立條件是這條線的兩端用的是同一顆底層模型,所以中間的落差只能來自政策與訓練取向,不能算成智力增長
📚 參考資料
Expanding Daybreak as the Cyber Defense Window Narrows
→ https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
OpenAI Daybreak - Trusted Access for Cyber Overview
→ https://help.openai.com/en/articles/20001258-openai-daybreak-trusted-access-for-cyber-overview
Our updated Preparedness Framework
→ https://openai.com/index/updating-our-preparedness-framework/
Running Codex safely at OpenAI
→ https://openai.com/index/running-codex-safely/
NVD - CVE-2026-15903
→ https://nvd.nist.gov/vuln/detail/CVE-2026-15903