Episode Details

Back to Episodes
OpenAI 自己查出來:自家模型在 ARC-AGI-3 的低分主因是測驗程式關掉了記憶

OpenAI 自己查出來:自家模型在 ARC-AGI-3 的低分主因是測驗程式關掉了記憶

Published 1 month, 2 weeks ago
Description


OpenAI 公布 ARC-AGI-3 模型評測的重跑結果:ARC 官方 harness 給 13.3%,OpenAI 自家設定給 38.3%,輸出 token 還少 6 倍。差別在測驗程式關掉了模型的記憶。

⭐ 文章深度讀:我對這篇的三個保留
→ https://heymaibao.com/openai-arc-agi-3-harness-memory/

⚡ 章節重點
開場 00:00
這個模型明明不笨 00:35
問題出在記憶被關掉了 01:24
改了什麼,差多少 02:09
反直覺的那一格 03:10
我對這篇的三個保留 03:41
那 ARC 的做法錯了嗎 04:00
你可以拿回去做的事 04:18

📝 懶人包
∙ OpenAI 用官方 harness (跑這個測驗的那套外框程式) 跑 ARC-AGI-3 公開題組,GPT‑5.6 Sol 得 13.3%,換成自家設定重跑,同一個模型得 38.3%,輸出的 token (模型產出的文字量) 還少了 6 倍

∙ 被關掉的兩件事都是記憶。每做完一個動作,模型的私有推理內容就被丟棄,對話長到超過上限時,最舊的訊息會被直接砍掉

∙ OpenAI 給 API 開發者的三條建議:改用 Responses API 而不是舊的 Chat Completions、保留推理、開啟 compaction (壓縮式的脈絡管理)

∙ 我的觀點是,記憶對 agent 來說是地基等級的東西。所以一個 benchmark 分數量到的,其實是模型加上跑它的那套程式,這兩者拆不開

📚 參考資料
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
→ https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

ARC Prize 對 GPT-5.5 與 Opus 4.7 在 ARC-AGI-3 表現的分析
→ https://arcprize.org/blog/arc-agi-3-gpt-5-5-opus-4-7-analysis

ARC Prize 評分方法與 RHAE 指標說明
→ https://docs.arcprize.org/methodology

ARC-AGI-3 人類基準資料集的建立方式
→ https://arcprize.org/blog/arc-agi-3-human-dataset

Responses API 的新工具與功能
→ https://openai.com/index/new-tools-and-features-in-the-responses-api/

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us