Episode Details
Back to Episodes
Karpathy 實測 Opus 5:約兩小時寫出 5500 行程式碼,檢查成果卻只能靠截圖
Description
Opus 5 花約兩小時寫出 5500 行程式碼,檢查成果時只能一張張截圖。Karpathy 的實驗把模型評測拉進長跑,量到的是能被程式驗證的活變便宜,靠肉眼判斷的仍要人接手。
⭐ 文章深度讀:你可以帶走的一條線
→ https://heymaibao.com/karpathy-opus-5-5500-lines-screenshot-check/
⚡ 章節重點
開場 00:00
這次實驗到底做了什麼 00:26
題目換了,量到的東西也換了 01:41
粗糙是從哪裡來的 02:26
崩掉的是哪一道門檻 03:43
你可以帶走的一條線 04:55
📝 懶人包
∙ Karpathy 給 Opus 5 《魔戒》開頭的第一段文字、100 萬 token 的預算 (他標成大約 10 美元),要它用 three.js 這套跑在瀏覽器裡的 3D 工具做出一個畫面。模型跑了大約 2 小時,寫出 5500 行程式碼,用程序化的方式把故事渲染出來
∙ 他說我們正開始離開那種用「畫一張騎腳踏車的鵜鶘 SVG (create an svg of pelican on a bicycle)」來測 LLM 的領地,題目正在換成長時間、大預算的長跑
∙ 他說這些模型無法輕易稽核自己的工作,因為沒辦法高效且原生地感知影片,或在裡面玩遊戲。這次 Opus 5 只能非常緩慢吃力地在不同時間點截圖,中間搞砸了幾次
∙ 我的觀察是,成品粗糙在這裡不是失敗,是量測結果。這次真正被量到的是模型檢查自己的那條迴路有多窄
📚 參考資料
Andrej Karpathy 在 X 的原始貼文
→ https://x.com/karpathy/status/2083749667410727319
Model system cards
→ https://www.anthropic.com/system-cards
Pelicans on a bicycle
→ https://simonwillison.net/2024/Oct/25/pelicans-on-a-bicycle/
Task-Completion Time Horizons of Frontier AI Models
→ https://metr.org/time-horizons/
Genie 3: A new frontier for world models
→ https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/