Claude Sonnet 4.6:Opus 級推理能力,1/5 的價格,所有人的預設模型 重大更新

重點摘要:Anthropic 於 2026 年 2 月 17 日發布 Claude Sonnet 4.6,距離 Opus 4.6 僅兩週。以 Sonnet 4.5 相同價格($3/$15 per 1M tokens)帶來接近 Opus 級的推理能力:SWE-Bench 79.6%(同級新紀錄)、OS World 72.5%(電腦操作新紀錄)、ARC-AGI-2 60.4%(中階模型首破 60%)。配備 1M tokens 上下文視窗(beta),電腦操作能力大幅升級——支援多步驟跨分頁協調。最重要的是:已成為免費版和 Pro 的預設模型,數百萬用戶自動升級。1

Sonnet 4.5 → 4.6:不只是更聰明,而是能「工作」

Sonnet 4.5 是一個出色的程式碼模型。Sonnet 4.6 則是一個出色的工作者

這次升級的核心不在於「知道更多」,而在於「做到更多」。Anthropic 將 Sonnet 4.6 重新定位為端到端的任務執行引擎——它不只是完成文字,而是完成工作流程。具體改進包括:

  • 代理架構最佳化 — 針對長期任務(long-horizon tasks)重新設計,能自主規劃多步驟執行
  • 幻覺率降低約 40% — 在技術領域的可靠性顯著提升
  • 延遲不變 — 儘管更聰明,推理速度與 Sonnet 4.5 幾乎相同,歸功於改良的注意力機制
  • 指令遵循 — 即使在大量上下文中也能維持指令一致性,不會「被雜訊干擾」

Benchmark:中階模型的里程碑

測試 Sonnet 4.6 Opus 4.6 GPT-5.2 意義
ARC-AGI-2 60.4% 64.1% 62.8% 中階模型首破 60%
SWE-Bench 79.6% 🏆 同級新紀錄
OS World 72.5% 🏆 72.7% 電腦操作新紀錄,幾乎追平 Opus
GDBval-AA-Elo 1633 🏆 1606 辦公/行政任務竟超越 Opus
Finance Agent 63.3% 🏆 所有模型中最高分

幾個值得注意的點:

  • ARC-AGI-2 60.4% 意味著 Sonnet 4.6 是第一個突破 60% 門檻的「中階」模型。以前這個水準只有旗艦模型(Opus、GPT-5)才能達到。
  • GDBval-AA-Elo 超越 Opus — 在辦公和行政任務上,Sonnet 4.6 竟然比自家旗艦更強。這暗示 Anthropic 針對「白領工作流程」進行了大量的 RLHF 調優。
  • OS World 72.5% — 代表它能處理約 7 成的複雜 GUI 任務(如「找到郵件中的收據並登入記帳系統」),而且能從錯誤中自我恢復。

1M Tokens 上下文視窗

Sonnet 4.6 配備與 Opus 4.6 相同的 1M tokens 上下文視窗(beta),是先前 Sonnet 最大容量的 2 倍。Anthropic 表示這足以在單一請求中容納「整個程式碼庫、長篇合約,或數十篇研究論文」。1

實測數據:

  • Needle-in-a-haystack 準確度:800K tokens 以下 99.8%,滿 1M 時 99.1%
  • 相較 Sonnet 4.5,即使上下文塞滿無關內容,指令遵循度也不會明顯下降

電腦操作:從「能用」到「好用」

Sonnet 4.6 的電腦操作能力(Computer Use)是這次升級最具實用價值的部分:2

多步驟操作

OS World 72.5% 的成績代表模型能從錯誤中恢復。網頁載入失敗?它會重新整理。按鈕位置改變?它會重新搜索元素。不再是遇到意外就整個流程崩潰。

跨分頁協調

能可靠地從一個分頁的 PDF 複製資料到另一個分頁的表單,中途不會「忘記」資料結構。這對真實的辦公場景至關重要。

更自然的互動

滑鼠移動更接近人類操作模式,降低了觸發網站反機器人機制的機率。

💡 實際應用場景

  • 自動填寫多頁表單(政府、保險、銀行)
  • 從郵件提取資訊並登入對應系統
  • 跨系統資料同步——ERP、CRM、試算表之間的搬運工作
  • 批量處理網頁操作——下載報表、更新狀態、發送通知

定價:加量不加價

模型 輸入價格 輸出價格 定位
Sonnet 4.6 $3 / 1M tokens $15 / 1M tokens 日常主力,代理引擎
Opus 4.6 $15 / 1M tokens $75 / 1M tokens 旗艦推理,深度研究
Haiku 4.5 $0.80 / 1M tokens $4 / 1M tokens 輕量快速,大量處理

換句話說:Sonnet 4.6 的推理能力已超越 2025 年的 Opus 3.5(當時定價 $15/$75),但價格只要 1/5。這是「智慧單位成本」的一個重要轉折點。

現在是所有人的預設模型

這可能是影響最廣泛的變化:Sonnet 4.6 已取代 Sonnet 4.5,成為 claude.ai 免費版和 Pro 訂閱的預設模型1

這意味著:

  • 數百萬用戶自動升級——不需要做任何設定
  • 免費用戶首次獲得 60%+ ARC-AGI-2 的推理能力
  • Pro 用戶的日常體驗會明顯提升,特別是長上下文和指令遵循

Sonnet 4.6 vs Opus 4.6:什麼時候用哪個?

場景 推薦 原因
日常程式設計 Sonnet 4.6 SWE-Bench 紀錄,速度更快,成本低 5 倍
辦公自動化 Sonnet 4.6 GDBval-AA 竟超越 Opus,專為白領工作流調優
電腦操作/代理 Sonnet 4.6 OS World 幾乎追平 Opus,但成本低 5 倍
大量 API 呼叫 Sonnet 4.6 價格允許 24/7 運行數千個代理
深度科學研究 Opus 4.6 更高的 ARC-AGI-2,更深的推理鏈
長篇創意寫作 Opus 4.6 在細膩度和原創性上仍有優勢
高度模糊的策略規劃 Opus 4.6 Agent Teams 16 並行代理,適合無明確路徑的探索

簡單規則:80% 的情況用 Sonnet,20% 的「深水區」用 Opus

Anthropic 二月攻勢的完整拼圖

回顧 Anthropic 在 2026 年 2 月的三次發布,策略布局非常清晰:

日期 產品 定位 目標用戶
2/5 Opus 4.6 旗艦引擎——Agent Teams、超大上下文 企業、研究者
2/10 Cowork Windows 桌面代理——AI 員工的執行平台 知識工作者
2/17 Sonnet 4.6 全民升級——Opus 級能力平民化 所有人

邏輯很明確:先用 Opus 4.6 展示技術天花板,用 Cowork 提供執行平台,再用 Sonnet 4.6 把能力以低成本普及到所有用戶。引擎 → 平台 → 普及,一個月內完成完整的產品線布局。

展望:Haiku 4.6 即將到來?

按照 Anthropic 的更新節奏,Haiku 4.6 預計在 2026 年 3 月推出。如果 Haiku 4.6 能達到 Sonnet 3.5 級別的效能,以 Haiku 的超低價格($0.25/$1.25 per 1M tokens),將會對本地部署的開源模型(如 Llama 3 70B)構成嚴重威脅——畢竟自己跑 GPU 的電費可能比 API 還貴。

總結

Claude Sonnet 4.6 可能不像 Opus 4.6 那樣有「Agent Teams」或「C 編譯器」這樣的震撼故事,但它的影響範圍更大。原因很簡單:它是預設模型

當旗艦模型的能力以 1/5 的價格成為所有人的日常體驗,這比任何 benchmark 紀錄都更有意義。Opus 4.6 定義了技術前沿,但 Sonnet 4.6 定義了大多數人實際使用的 AI 水準

🎯 對不同用戶的建議

  • 免費/Pro 用戶:什麼都不用做。你的 Claude 已經自動升級了。試試長上下文任務(貼入整份文件、程式碼庫),感受 1M tokens 的威力。
  • 開發者:API 價格不變,但能力大幅提升。如果你的代理系統還在用 Sonnet 4.5,直接切換到 4.6,不會有相容性問題。
  • 企業:Sonnet 4.6 的「智慧單位成本」已達臨界點。以 $3/$15 的價格 24/7 運行 AI 代理,現在是經濟上可行的。
  • Max 訂閱者:你仍然可以用 Opus 4.6 處理最困難的任務,但日常工作切到 Sonnet 4.6 可以節省大量配額。

References 參考文獻

  1. TechCrunch - Anthropic releases Sonnet 4.6
    https://techcrunch.com/2026/02/17/anthropic-releases-sonnet-4-6/
  2. Bloomberg - Anthropic says new AI model is better at using computers
    https://www.bloomberg.com/news/articles/2026-02-17/anthropic-says-new-ai-model-is-better-at-using-computers
  3. IT Pro - Anthropic promises 'Opus-level' reasoning with new Claude Sonnet 4.6 model
    https://www.itpro.com/technology/artificial-intelligence/anthropic-promises-opus-level-reasoning-claude-sonnet-4-6-model-at-lower-cost
  4. Gizmodo - Anthropic Launches New Model That Spots Zero Days
    https://gizmodo.com/anthropic-launches-new-model-that-spots-zero-days-makes-wall-street-traders-lose-their-minds-2000718648
  5. CNBC - Anthropic Claude Opus 4.6 'vibe working' era
    https://www.cnbc.com/2026/02/05/anthropic-claude-opus-4-6-vibe-working.html
  6. Anthropic Release Notes - February 2026
    https://releasebot.io/updates/anthropic