Episode Details
Back to Episodes
Simon Willison 做 AI 評測工具,最花時間的不是寫程式,是想清楚九個名詞
Description
smevals 這個小型模型評測工具的主要命令只有四條,作者 Simon Willison 說專案最花時間的部分是敲定詞彙。本文攤開那九個名詞,說明詞彙的切法如何決定工具的形狀。
⭐ 文章深度讀:原文沒有回答的
→ https://heymaibao.com/smevals-eval-vocabulary-nine-terms/
⚡ 章節重點
開場 00:00
先講這是什麼 00:29
那九個名詞 01:03
為什麼說詞彙決定了工具的形狀 03:11
上手路徑是寫給 AI agent 的 04:37
原文沒有回答的 05:09
你可以帶走的 06:07
結語 07:08
📝 懶人包
∙ smevals 是一個新的小型評測工具,可以拿同一組題目去跑不同的模型設定,再對結果打分數
∙ 作者說這個專案最花時間的部分是敲定它的詞彙,那份詞彙表有九個名詞
∙ 執行和評分是兩條分開的命令,原文明說 runs 與 grading 是分開處理的
∙ 我的觀察是,這個專案最值得抄的不是工具本身,是它先把九個名詞定清楚才動手的順序
📚 參考資料
smevals - a small eval suite for evaluating models, prompts, and harnesses
→ https://simonwillison.net/2026/Jul/31/smevals/
smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant
→ https://primeradiant.com/blog/2026/smevals.html
About | Prime Radiant
→ https://primeradiant.com/about/
Demystifying evals for AI agents
→ https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
Inspect
→ https://inspect.aisi.org.uk/
LLM Evals: Everything You Need to Know
→ https://hamel.dev/blog/posts/evals-faq/