Podcast Episodes

Back to Search
OpenAI 新模型推進十個長年數學難題,六天後自家喊停這個模型的內部活動
OpenAI 新模型推進十個長年數學難題,六天後自家喊停這個模型的內部活動


OpenAI 六天內為同一個模型發了兩篇公告。前一篇說它推進十個開放已久的數學難題,換算約兩千美元。後一篇轉談 AI 安全,說無法排除它跨過 Critical 網路能力門檻。

⭐ 文章深度讀:原文沒有回答的三件事
→ https://heymaibao.com/openai-ten-mat…

1 month, 1 week ago

Short Long
View Episode
Simon Willison 做 AI 評測工具,最花時間的不是寫程式,是想清楚九個名詞
Simon Willison 做 AI 評測工具,最花時間的不是寫程式,是想清楚九個名詞


smevals 這個小型模型評測工具的主要命令只有四條,作者 Simon Willison 說專案最花時間的部分是敲定詞彙。本文攤開那九個名詞,說明詞彙的切法如何決定工具的形狀。

⭐ 文章深度讀:原文沒有回答的
→ https://heymaibao.com/smevals-eval-vo…

1 month, 1 week ago

Short Long
View Episode
Karpathy 實測 Opus 5:約兩小時寫出 5500 行程式碼,檢查成果卻只能靠截圖
Karpathy 實測 Opus 5:約兩小時寫出 5500 行程式碼,檢查成果卻只能靠截圖


Opus 5 花約兩小時寫出 5500 行程式碼,檢查成果時只能一張張截圖。Karpathy 的實驗把模型評測拉進長跑,量到的是能被程式驗證的活變便宜,靠肉眼判斷的仍要人接手。

⭐ 文章深度讀:你可以帶走的一條線
→ https://heymaibao.com/karpathy-opus-…

1 month, 1 week ago

Short Long
View Episode
Spec-driven development 吵錯重點了,關鍵是那份規格寫完之後要活多久
Spec-driven development 吵錯重點了,關鍵是那份規格寫完之後要活多久


spec-driven development 的真正分水嶺,是規格寫完之後要活多久。Martin Fowler 網站一篇文中未署名的實測比較三個 AI coding agent 規格工具,整理出三層規格壽命。

⭐ 文章深度讀:三個警訊,都有實測撐著
→ https://heymaibao…

1 month, 1 week ago

Short Long
View Episode
DeepSeek 用設定檔坐進 Codex 選單,新模型開口自稱是基於 GPT-5 的 Codex
DeepSeek 用設定檔坐進 Codex 選單,新模型開口自稱是基於 GPT-5 的 Codex


DeepSeek-V4-Flash 進入公開測試,官方文件掛的 Codex 設定檔把它列進這款 AI coding agent 的模型選單,代價是內嵌提示詞第一句讓模型自稱是基於 GPT-5 的 Codex。

⭐ 文章深度讀:要動手的人,先看那一格
→ https://heymaibao.…

1 month, 1 week ago

Short Long
View Episode
Matt Pocock 的規劃工具不寫完計畫,先劃出「現在就能決定」的邊界在哪
Matt Pocock 的規劃工具不寫完計畫,先劃出「現在就能決定」的邊界在哪


wayfinder 不把計畫一次寫完。Matt Pocock 公開的這個規劃 skill 先決定資訊已經足夠的部分,其餘明確留白。本文說明這個取捨為什麼比更完整的路線圖更耐用。

⭐ 文章深度讀:我的觀察是,這裡真正的設計選擇是承認有些決定現在資訊還不夠,並把「還不能決定」正式寫進計畫裡,這個…

1 month, 2 weeks ago

Short Long
View Episode
Anthropic 抓到 Claude 打進三家真公司,它當下以為在演習:三起事件經過
Anthropic 抓到 Claude 打進三家真公司,它當下以為在演習:三起事件經過


Anthropic 主動審查 141,006 次資安評測,找出三起 Claude 打進真實組織正式系統的事件。評測 prompt 說沒有網路,設定錯誤卻讓網路可用,AI 安全邊界要靠設定強制。

⭐ 文章深度讀:那段自我說服
→ https://heymaibao.com/anthropic…

1 month, 2 weeks ago

Short Long
View Episode
OpenAI 免費送研究者前沿模型,開放 12 天就改抽籤,首波只發 10,000 席
OpenAI 免費送研究者前沿模型,開放 12 天就改抽籤,首波只發 10,000 席


OpenAI 免費前沿模型計畫開放 12 天就改成抽籤,首波只發 10,000 席。文章拆解 13,000 份申請、65,000 席上限的口徑,並指出抽籤避開了誰最缺算力這道判斷。

⭐ 文章深度讀:不是研究者的我們,為什麼要在意
→ https://heymaibao.com/openai…

1 month, 2 weeks ago

Short Long
View Episode
OpenAI 降價 80%,但帳單不一定變小,官方示範別讓 GPT-5.6 Luna 跑完全程
OpenAI 降價 80%,但帳單不一定變小,官方示範別讓 GPT-5.6 Luna 跑完全程


OpenAI 將 GPT-5.6 Luna 降價 80%,同一篇公告卻示範用貴的 Sol 定計畫、便宜的 Luna 動手。本文拆解 Blitzy 省下 87% 成本的真正歸因與三條 AI agent 迴圈規則。

⭐ 文章深度讀:可以直接抄的三條 harness 規則
→ https://h…

1 month, 2 weeks ago

Short Long
View Episode
OpenAI 自己查出來:自家模型在 ARC-AGI-3 的低分主因是測驗程式關掉了記憶
OpenAI 自己查出來:自家模型在 ARC-AGI-3 的低分主因是測驗程式關掉了記憶


OpenAI 公布 ARC-AGI-3 模型評測的重跑結果:ARC 官方 harness 給 13.3%,OpenAI 自家設定給 38.3%,輸出 token 還少 6 倍。差別在測驗程式關掉了模型的記憶。

⭐ 文章深度讀:我對這篇的三個保留
→ https://heymaibao.co…

1 month, 2 weeks ago

Short Long
View Episode

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us