Sonnet 4.6 → 5:全面進步,沒有明顯短板
Sonnet 4.6 在 2026 年 2 月讓「Opus 級能力平民化」,Sonnet 5 則是把這條路線走得更遠——在每一個公開測試項目上都贏過前代,沒有出現「A 項變強、B 項變弱」的取捨。4
- 自主規劃能力——能夠制定計畫、呼叫瀏覽器與終端機等工具,並在多步驟任務中自主執行到接近完成的程度,這在幾個月前還需要更大、更貴的模型才能做到
- 自動檢查輸出——不需要明確指示,模型會主動驗證自己的輸出是否合理
- 幻覺率與溝通品質改善——技術領域的可靠性進一步提升
- 安全性提升——「不當行為」(如配合濫用請求、欺騙)的比率低於 Sonnet 4.6,更擅長拒絕惡意請求、抵禦 prompt injection 劫持攻擊
- 1M context window 從 beta 轉正——Sonnet 4.6 標準預設是 200K tokens,1M 只是限量開放的 beta 功能。Sonnet 5 直接把 1M tokens 設為所有付費方案的預設值,不用另外申請開通;最大輸出維持 128K tokens8
Benchmark:逼近 Opus 4.8 的關鍵一步
| 測試 | Sonnet 4.6 | Sonnet 5 | Opus 4.8 | 意義 |
|---|---|---|---|---|
| SWE-bench Pro | 58.1% | 63.2% | 69.2% | 差距從 11.1 分縮小到 6 分 |
| Terminal-Bench 2.1 | 67.0% | 80.4% 🏆 | — | 單項最大躍進,終端機操作大幅進化 |
| OSWorld-Verified | 78.5% | 81.2% | — | 電腦操作持續進步 |
| Humanity's Last Exam (tools) | 46.8% | 57.4% | 57.9% | 幾乎追平 Opus |
| GDPval-AA v2(知識工作) | — | 1,618 🏆 | 1,615 | 知識工作任務超越 Opus |
幾個值得注意的點:2
- Terminal-Bench 2.1 從 67% 到 80.4% 是這次升級中最戲劇性的進步,代表模型操作終端機、串接指令、處理複雜 shell 工作流的能力大幅提升——這正是 AI Agent 執行真實開發任務時最常用到的能力。
- GDPval-AA v2 超越 Opus 4.8——延續 Sonnet 4.6 的傳統,在辦公室、知識工作類任務上,中階模型再次贏過自家旗艦,暗示 Anthropic 持續針對「白領工作流程」進行專門調優。
- SWE-bench Pro 差距縮小——雖然仍落後 Opus 4.8 約 6 個百分點,但已比 Sonnet 4.6 時代的 11 分差距明顯拉近。
定價:推廣期比 Opus 4.8 便宜 60%
| 模型 | 輸入價格 | 輸出價格 | 定位 |
|---|---|---|---|
| Sonnet 5(推廣期,至 2026-08-31) | $2 / 1M tokens | $10 / 1M tokens | 日常主力,代理引擎 |
| Sonnet 5(標準價,2026-09-01 起) | $3 / 1M tokens | $15 / 1M tokens | 與 Sonnet 4.6 相同價位 |
| Opus 4.8 | $5 / 1M tokens | $25 / 1M tokens | 旗艦推理,精準度優先 |
| Haiku 4.5 | $0.80 / 1M tokens | $4 / 1M tokens | 大量呼叫,延遲敏感 |
值得注意:搭配 prompt caching 可再省最多 90% 成本,batch processing 則可省 50%。另外,若工作負載需要限定在美國境內運算,US-only inference 選項會加收 1.1 倍費用。3
現在是 Claude 免費版與 Pro 的預設模型
跟 Sonnet 4.6 當初的模式一樣,Sonnet 5 已經取代前代,成為 claude.ai 免費版和 Pro 訂閱的預設模型,並同步在 Anthropic API、Amazon Bedrock、GitHub Copilot 等平台上線。1 5
- 免費與 Pro 用戶不需要任何設定,自動使用新模型
- GitHub Copilot 已將 Sonnet 5 列為正式支援(GA)模型6
- Claude Code 中可用
/model指令切換,或直接指定claude --model claude-sonnet-5
Sonnet 5 vs Opus 4.8:什麼時候用哪個?
| 場景 | 推薦 | 原因 |
|---|---|---|
| 日常 Agentic Coding | Sonnet 5 | Terminal-Bench 大幅進步,成本只要 Opus 的 40% |
| 工具串接 / 瀏覽器操作 | Sonnet 5 | OSWorld、HLE(tools) 都逼近 Opus 水準 |
| 知識工作 / 辦公任務 | Sonnet 5 | GDPval-AA v2 實際超越 Opus 4.8 |
| 大量 API 呼叫 | Sonnet 5 | 推廣價期間成本優勢明顯,適合 24/7 代理 |
| 精準度要求極高的任務 | Opus 4.8 | SWE-bench Pro 仍領先約 6 分 |
| 最高強度推理(max effort) | 視情況 | 業界分析指出:拉到最高 effort 時,Sonnet 5 成本可能反超 Opus 4.8,此時該直接選 Opus2 |
💡 路由建議
簡化原則:Sonnet 5 處理大多數 agentic coding、工具使用與知識工作;Opus 4.8 留給精準度要求最高的任務;Haiku 4.5 負責高流量、延遲敏感的操作。低到中等 effort 等級下 Sonnet 5 的性價比最清楚,但拉滿 effort 時要留意成本可能超過 Opus 4.8 反而不划算。
Claude 5 家族中唯一「全球通行」的成員
值得一提的背景:Claude 5 家族目前有四名成員——Opus 4.8、Sonnet 5、Haiku 4.5,以及頂級的 Fable 5(Mythos-class)。其中 Fable 5 在 2026 年 6 月中旬一度因美國出口管制被限制,非美國開發者無法使用,直到 2026 年 7 月 1 日才因安全對齊完成而解除。7
相較之下,Sonnet 5 從發布之初就沒有這類限制,全球開發者都能正常存取——這也是為什麼它適合作為多數團隊的預設選擇:不用擔心地緣政治風險,只需要專注在成本與效能的權衡上。
總結
Sonnet 5 延續了 Anthropic「旗艦能力平民化」的策略:不追求單一項目的絕對第一,而是在 Agentic Coding、工具使用、知識工作等實用場景上全面貼近 Opus 4.8,同時維持遠低於旗艦的價格。Terminal-Bench 2.1 從 67% 跳到 80.4% 是這次升級中最值得關注的進步——這代表 AI Agent 在真實開發環境中的可靠度又往前跨了一大步。
🎯 對不同用戶的建議
- 免費/Pro 用戶:不用做任何事,已自動升級。可以感受一下終端機/工具操作任務的明顯進步。
- 開發者:如果現有代理系統還在用 Sonnet 4.6,直接切換到 Sonnet 5,API 相容性沒有問題。
- 企業:把握推廣價期間(至 2026-08-31)的 $2/$10 定價,評估是否能把更多工作負載從 Opus 4.8 遷移過來。
- 需要高精準度的團隊:SWE-bench Pro 上 Opus 4.8 仍領先約 6 分,關鍵任務建議保留 Opus。
References 參考文獻
- Anthropic - Introducing Claude Sonnet 5
https://www.anthropic.com/news/claude-sonnet-5 - MarkTechPost - Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Agentic Coding Benchmarks, API Pricing, and Cost-Performance Tradeoffs Compared
https://www.marktechpost.com/2026/06/30/anthropic-claude-sonnet-5-vs-sonnet-4-6-vs-opus-4-8-agentic-coding-benchmarks-api-pricing-and-cost-performance-tradeoffs-compared/ - Claude Platform Docs - Pricing
https://platform.claude.com/docs/en/about-claude/pricing - TechCrunch - Anthropic launches Claude Sonnet 5 as a cheaper way to run agents
https://techcrunch.com/2026/06/30/anthropic-launches-claude-sonnet-5-as-a-cheaper-way-to-run-agents/ - AWS Machine Learning Blog - Introducing Claude Sonnet 5 on AWS
https://aws.amazon.com/blogs/machine-learning/introducing-claude-sonnet-5-on-aws-anthropics-most-capable-sonnet-model/ - GitHub Changelog - Claude Sonnet 5 is generally available for GitHub Copilot
https://github.blog/changelog/2026-06-30-claude-sonnet-5-is-generally-available-for-github-copilot/ - oao-web AI 知識庫 - Claude Fable 5 出口管制事件
/ai-knowledge/claude-fable-5.html - Claude Platform Docs - What's new in Claude Sonnet 5
https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5