Episode Details

Back to Episodes
AI 幻覺的真正原因:不是模型不夠聰明 是考試規則獎勵猜題

AI 幻覺的真正原因:不是模型不夠聰明 是考試規則獎勵猜題

Episode 91 Published 6 months, 3 weeks ago
Description


LLM 幻覺不是 bug,是訓練目標的數學必然。OpenAI 論文揭露:9/10 主流 benchmark 用二元計分獎勵猜測,讓「我不知道」永遠拿零分。解法不是更好的偵測,而是改計分規則。

⭐ 文章深度讀:把論文的數學證明拆解成考試猜題的日常比喻
→ https://heymaibao.com/why-llms-hallucinate/

📝 懶人包
∙ LLM 幻覺是訓練目標的數學必然。即便訓練資料完全正確,cross-entropy loss (交叉熵損失函數) 的最佳化本身就會產生幻覺。
∙ 主流 AI benchmark 幾乎全用「答對得分、不答零分」的考試計分法,等於在系統性獎勵模型猜測,而不是坦承不確定。
∙ 解法不是發明更好的幻覺偵測工具,而是改變現有 benchmark 的計分規則,讓「我不知道」不再被懲罰。
∙ 我的觀點:這篇論文最大的價值不是告訴我們幻覺解不掉,而是指出我們一直在用錯的方式衡量進步。當計分規則本身在獎勵猜測,所有試圖減少幻覺的努力都在逆流而上。

📚 參考資料
Why Language Models Hallucinate (Kalai et al., 2025)
→ https://arxiv.org/abs/2509.04664

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us