Claude Sonnet 5:逼近 Opus 4.8 的推理能力,Agent 引擎全面升級 重大更新

重點摘要:Anthropic 於 2026 年 6 月 30 日發布 Claude Sonnet 5,距離 Sonnet 4.6 約四個月。新模型在每一項測試上都超越前代:Terminal-Bench 2.1 從 67.0% 大幅躍升至 80.4%,SWE-bench Pro 從 58.1% 提升至 63.2%,逐漸逼近 Opus 4.8 的表現。定價維持親民:推廣期(至 2026-08-31)$2/$10 per 1M tokens,之後回到 $3/$15,仍比 Opus 4.8 便宜一半以上。已成為 Claude 免費版與 Pro 的預設模型,同時是 Claude 5 家族中唯一不受美國出口管制的成員。1

Sonnet 4.6 → 5:全面進步,沒有明顯短板

Sonnet 4.6 在 2026 年 2 月讓「Opus 級能力平民化」,Sonnet 5 則是把這條路線走得更遠——在每一個公開測試項目上都贏過前代,沒有出現「A 項變強、B 項變弱」的取捨。4

  • 自主規劃能力——能夠制定計畫、呼叫瀏覽器與終端機等工具,並在多步驟任務中自主執行到接近完成的程度,這在幾個月前還需要更大、更貴的模型才能做到
  • 自動檢查輸出——不需要明確指示,模型會主動驗證自己的輸出是否合理
  • 幻覺率與溝通品質改善——技術領域的可靠性進一步提升
  • 安全性提升——「不當行為」(如配合濫用請求、欺騙)的比率低於 Sonnet 4.6,更擅長拒絕惡意請求、抵禦 prompt injection 劫持攻擊
  • 1M context window 從 beta 轉正——Sonnet 4.6 標準預設是 200K tokens,1M 只是限量開放的 beta 功能。Sonnet 5 直接把 1M tokens 設為所有付費方案的預設值,不用另外申請開通;最大輸出維持 128K tokens8

Benchmark:逼近 Opus 4.8 的關鍵一步

測試 Sonnet 4.6 Sonnet 5 Opus 4.8 意義
SWE-bench Pro 58.1% 63.2% 69.2% 差距從 11.1 分縮小到 6 分
Terminal-Bench 2.1 67.0% 80.4% 🏆 單項最大躍進,終端機操作大幅進化
OSWorld-Verified 78.5% 81.2% 電腦操作持續進步
Humanity's Last Exam (tools) 46.8% 57.4% 57.9% 幾乎追平 Opus
GDPval-AA v2(知識工作) 1,618 🏆 1,615 知識工作任務超越 Opus

幾個值得注意的點:2

  • Terminal-Bench 2.1 從 67% 到 80.4% 是這次升級中最戲劇性的進步,代表模型操作終端機、串接指令、處理複雜 shell 工作流的能力大幅提升——這正是 AI Agent 執行真實開發任務時最常用到的能力。
  • GDPval-AA v2 超越 Opus 4.8——延續 Sonnet 4.6 的傳統,在辦公室、知識工作類任務上,中階模型再次贏過自家旗艦,暗示 Anthropic 持續針對「白領工作流程」進行專門調優。
  • SWE-bench Pro 差距縮小——雖然仍落後 Opus 4.8 約 6 個百分點,但已比 Sonnet 4.6 時代的 11 分差距明顯拉近。

定價:推廣期比 Opus 4.8 便宜 60%

模型 輸入價格 輸出價格 定位
Sonnet 5(推廣期,至 2026-08-31) $2 / 1M tokens $10 / 1M tokens 日常主力,代理引擎
Sonnet 5(標準價,2026-09-01 起) $3 / 1M tokens $15 / 1M tokens 與 Sonnet 4.6 相同價位
Opus 4.8 $5 / 1M tokens $25 / 1M tokens 旗艦推理,精準度優先
Haiku 4.5 $0.80 / 1M tokens $4 / 1M tokens 大量呼叫,延遲敏感

值得注意:搭配 prompt caching 可再省最多 90% 成本,batch processing 則可省 50%。另外,若工作負載需要限定在美國境內運算,US-only inference 選項會加收 1.1 倍費用。3

現在是 Claude 免費版與 Pro 的預設模型

跟 Sonnet 4.6 當初的模式一樣,Sonnet 5 已經取代前代,成為 claude.ai 免費版和 Pro 訂閱的預設模型,並同步在 Anthropic API、Amazon Bedrock、GitHub Copilot 等平台上線。1 5

  • 免費與 Pro 用戶不需要任何設定,自動使用新模型
  • GitHub Copilot 已將 Sonnet 5 列為正式支援(GA)模型6
  • Claude Code 中可用 /model 指令切換,或直接指定 claude --model claude-sonnet-5

Sonnet 5 vs Opus 4.8:什麼時候用哪個?

場景 推薦 原因
日常 Agentic Coding Sonnet 5 Terminal-Bench 大幅進步,成本只要 Opus 的 40%
工具串接 / 瀏覽器操作 Sonnet 5 OSWorld、HLE(tools) 都逼近 Opus 水準
知識工作 / 辦公任務 Sonnet 5 GDPval-AA v2 實際超越 Opus 4.8
大量 API 呼叫 Sonnet 5 推廣價期間成本優勢明顯,適合 24/7 代理
精準度要求極高的任務 Opus 4.8 SWE-bench Pro 仍領先約 6 分
最高強度推理(max effort) 視情況 業界分析指出:拉到最高 effort 時,Sonnet 5 成本可能反超 Opus 4.8,此時該直接選 Opus2

💡 路由建議

簡化原則:Sonnet 5 處理大多數 agentic coding、工具使用與知識工作;Opus 4.8 留給精準度要求最高的任務;Haiku 4.5 負責高流量、延遲敏感的操作。低到中等 effort 等級下 Sonnet 5 的性價比最清楚,但拉滿 effort 時要留意成本可能超過 Opus 4.8 反而不划算。

Claude 5 家族中唯一「全球通行」的成員

值得一提的背景:Claude 5 家族目前有四名成員——Opus 4.8、Sonnet 5、Haiku 4.5,以及頂級的 Fable 5(Mythos-class)。其中 Fable 5 在 2026 年 6 月中旬一度因美國出口管制被限制,非美國開發者無法使用,直到 2026 年 7 月 1 日才因安全對齊完成而解除。7

相較之下,Sonnet 5 從發布之初就沒有這類限制,全球開發者都能正常存取——這也是為什麼它適合作為多數團隊的預設選擇:不用擔心地緣政治風險,只需要專注在成本與效能的權衡上。

總結

Sonnet 5 延續了 Anthropic「旗艦能力平民化」的策略:不追求單一項目的絕對第一,而是在 Agentic Coding、工具使用、知識工作等實用場景上全面貼近 Opus 4.8,同時維持遠低於旗艦的價格。Terminal-Bench 2.1 從 67% 跳到 80.4% 是這次升級中最值得關注的進步——這代表 AI Agent 在真實開發環境中的可靠度又往前跨了一大步。

🎯 對不同用戶的建議

  • 免費/Pro 用戶:不用做任何事,已自動升級。可以感受一下終端機/工具操作任務的明顯進步。
  • 開發者:如果現有代理系統還在用 Sonnet 4.6,直接切換到 Sonnet 5,API 相容性沒有問題。
  • 企業:把握推廣價期間(至 2026-08-31)的 $2/$10 定價,評估是否能把更多工作負載從 Opus 4.8 遷移過來。
  • 需要高精準度的團隊:SWE-bench Pro 上 Opus 4.8 仍領先約 6 分,關鍵任務建議保留 Opus。

References 參考文獻

  1. Anthropic - Introducing Claude Sonnet 5
    https://www.anthropic.com/news/claude-sonnet-5
  2. MarkTechPost - Anthropic Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Agentic Coding Benchmarks, API Pricing, and Cost-Performance Tradeoffs Compared
    https://www.marktechpost.com/2026/06/30/anthropic-claude-sonnet-5-vs-sonnet-4-6-vs-opus-4-8-agentic-coding-benchmarks-api-pricing-and-cost-performance-tradeoffs-compared/
  3. Claude Platform Docs - Pricing
    https://platform.claude.com/docs/en/about-claude/pricing
  4. TechCrunch - Anthropic launches Claude Sonnet 5 as a cheaper way to run agents
    https://techcrunch.com/2026/06/30/anthropic-launches-claude-sonnet-5-as-a-cheaper-way-to-run-agents/
  5. AWS Machine Learning Blog - Introducing Claude Sonnet 5 on AWS
    https://aws.amazon.com/blogs/machine-learning/introducing-claude-sonnet-5-on-aws-anthropics-most-capable-sonnet-model/
  6. GitHub Changelog - Claude Sonnet 5 is generally available for GitHub Copilot
    https://github.blog/changelog/2026-06-30-claude-sonnet-5-is-generally-available-for-github-copilot/
  7. oao-web AI 知識庫 - Claude Fable 5 出口管制事件
    /ai-knowledge/claude-fable-5.html
  8. Claude Platform Docs - What's new in Claude Sonnet 5
    https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5