Episode Details
Back to Episodes
Claude Opus 5 評測:思考強度開太高,它反而做得更糟,帳單也只降兩成
Description
Claude Opus 5 每 token 便宜一半,但整份任務的帳單只降到八成左右。這篇模型評測長文另外指出思考強度開太高會被扣分,以及拒答少了約 85% 的同時幻覺率往上。
⭐ 文章深度讀:那到底該把哪件事交給誰
→ https://heymaibao.com/claude-opus-5-review-effort-too-high/
⚡ 章節重點
開場 把強度開到最高,分數反而掉下來 00:00
這部影片在講什麼 00:26
第一條線 思考強度給越多不一定越好 00:59
第二條線 每個詞元便宜一半,帳單只降兩成 03:14
第三條線 拒答變少,幻覺變多 04:46
三條線收斂 局部思考強,全局思考弱 06:32
作者的分派清單 07:00
今天就做一件事 07:41
📝 懶人包
∙ 這篇整理的官方定位是:Claude Opus 5 接近 Claude Fable 5 的能力、每 token 一半的價格,而且少掉大部分的拒答
∙ 但這篇評測指出,思考強度開到高檔時,Opus 5 會去做沒被要求的事而被扣分,作者推測中等強度通常就夠
∙ 同一篇引述的數據裡,不必要的拒答相對 Fable 下降約 85%,同時 ArtificialAnalysis 量到它的幻覺率比 Fable 高
∙ 我的觀察是,這三件事拆開看像三則零碎的評測筆記,疊在一起就是同一句話:模型選擇已經從「挑最強的那個」變成「把角色分派給對的那個」
📚 參考資料
Claude Opus 5 Is Highly Capable, But Is No Mythos
→ https://x.com/thezvi/status/2082166350701637794
Introducing Claude Opus 5
→ https://www.anthropic.com/news/claude-opus-5
Pricing - Claude Platform Docs
→ https://platform.claude.com/docs/en/about-claude/pricing
Claude Opus 5: the new leader in agentic knowledge work
→ https://artificialanalysis.ai/articles/claude-opus-5-leader-agentic-knowledge-work
Vibe Check: Claude Opus 5 Is Brilliant in Flashes, Frustrating in Practice
→ https://every.to/vibe-check/opus-5