Episode Details

Back to Episodes
Claude Opus 5 評測:思考強度開太高,它反而做得更糟,帳單也只降兩成

Claude Opus 5 評測:思考強度開太高,它反而做得更糟,帳單也只降兩成

Published 1 month, 2 weeks ago
Description


Claude Opus 5 每 token 便宜一半,但整份任務的帳單只降到八成左右。這篇模型評測長文另外指出思考強度開太高會被扣分,以及拒答少了約 85% 的同時幻覺率往上。

⭐ 文章深度讀:那到底該把哪件事交給誰
→ https://heymaibao.com/claude-opus-5-review-effort-too-high/

⚡ 章節重點
開場 把強度開到最高,分數反而掉下來 00:00
這部影片在講什麼 00:26
第一條線 思考強度給越多不一定越好 00:59
第二條線 每個詞元便宜一半,帳單只降兩成 03:14
第三條線 拒答變少,幻覺變多 04:46
三條線收斂 局部思考強,全局思考弱 06:32
作者的分派清單 07:00
今天就做一件事 07:41

📝 懶人包
∙ 這篇整理的官方定位是:Claude Opus 5 接近 Claude Fable 5 的能力、每 token 一半的價格,而且少掉大部分的拒答

∙ 但這篇評測指出,思考強度開到高檔時,Opus 5 會去做沒被要求的事而被扣分,作者推測中等強度通常就夠

∙ 同一篇引述的數據裡,不必要的拒答相對 Fable 下降約 85%,同時 ArtificialAnalysis 量到它的幻覺率比 Fable 高

∙ 我的觀察是,這三件事拆開看像三則零碎的評測筆記,疊在一起就是同一句話:模型選擇已經從「挑最強的那個」變成「把角色分派給對的那個」

📚 參考資料
Claude Opus 5 Is Highly Capable, But Is No Mythos
→ https://x.com/thezvi/status/2082166350701637794

Introducing Claude Opus 5
→ https://www.anthropic.com/news/claude-opus-5

Pricing - Claude Platform Docs
→ https://platform.claude.com/docs/en/about-claude/pricing

Claude Opus 5: the new leader in agentic knowledge work
→ https://artificialanalysis.ai/articles/claude-opus-5-leader-agentic-knowledge-work

Vibe Check: Claude Opus 5 Is Brilliant in Flashes, Frustrating in Practice
→ https://every.to/vibe-check/opus-5

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us