Sonnet 4.5 → 4.6:不只是更聰明,而是能「工作」
Sonnet 4.5 是一個出色的程式碼模型。Sonnet 4.6 則是一個出色的工作者。
這次升級的核心不在於「知道更多」,而在於「做到更多」。Anthropic 將 Sonnet 4.6 重新定位為端到端的任務執行引擎——它不只是完成文字,而是完成工作流程。具體改進包括:
- 代理架構最佳化 — 針對長期任務(long-horizon tasks)重新設計,能自主規劃多步驟執行
- 幻覺率降低約 40% — 在技術領域的可靠性顯著提升
- 延遲不變 — 儘管更聰明,推理速度與 Sonnet 4.5 幾乎相同,歸功於改良的注意力機制
- 指令遵循 — 即使在大量上下文中也能維持指令一致性,不會「被雜訊干擾」
Benchmark:中階模型的里程碑
| 測試 | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | 意義 |
|---|---|---|---|---|
| ARC-AGI-2 | 60.4% | 64.1% | 62.8% | 中階模型首破 60% |
| SWE-Bench | 79.6% 🏆 | — | — | 同級新紀錄 |
| OS World | 72.5% 🏆 | 72.7% | — | 電腦操作新紀錄,幾乎追平 Opus |
| GDBval-AA-Elo | 1633 🏆 | 1606 | — | 辦公/行政任務竟超越 Opus |
| Finance Agent | 63.3% 🏆 | — | — | 所有模型中最高分 |
幾個值得注意的點:
- ARC-AGI-2 60.4% 意味著 Sonnet 4.6 是第一個突破 60% 門檻的「中階」模型。以前這個水準只有旗艦模型(Opus、GPT-5)才能達到。
- GDBval-AA-Elo 超越 Opus — 在辦公和行政任務上,Sonnet 4.6 竟然比自家旗艦更強。這暗示 Anthropic 針對「白領工作流程」進行了大量的 RLHF 調優。
- OS World 72.5% — 代表它能處理約 7 成的複雜 GUI 任務(如「找到郵件中的收據並登入記帳系統」),而且能從錯誤中自我恢復。
1M Tokens 上下文視窗
Sonnet 4.6 配備與 Opus 4.6 相同的 1M tokens 上下文視窗(beta),是先前 Sonnet 最大容量的 2 倍。Anthropic 表示這足以在單一請求中容納「整個程式碼庫、長篇合約,或數十篇研究論文」。1
實測數據:
- Needle-in-a-haystack 準確度:800K tokens 以下 99.8%,滿 1M 時 99.1%
- 相較 Sonnet 4.5,即使上下文塞滿無關內容,指令遵循度也不會明顯下降
電腦操作:從「能用」到「好用」
Sonnet 4.6 的電腦操作能力(Computer Use)是這次升級最具實用價值的部分:2
多步驟操作
OS World 72.5% 的成績代表模型能從錯誤中恢復。網頁載入失敗?它會重新整理。按鈕位置改變?它會重新搜索元素。不再是遇到意外就整個流程崩潰。
跨分頁協調
能可靠地從一個分頁的 PDF 複製資料到另一個分頁的表單,中途不會「忘記」資料結構。這對真實的辦公場景至關重要。
更自然的互動
滑鼠移動更接近人類操作模式,降低了觸發網站反機器人機制的機率。
💡 實際應用場景
- 自動填寫多頁表單(政府、保險、銀行)
- 從郵件提取資訊並登入對應系統
- 跨系統資料同步——ERP、CRM、試算表之間的搬運工作
- 批量處理網頁操作——下載報表、更新狀態、發送通知
定價:加量不加價
| 模型 | 輸入價格 | 輸出價格 | 定位 |
|---|---|---|---|
| Sonnet 4.6 | $3 / 1M tokens | $15 / 1M tokens | 日常主力,代理引擎 |
| Opus 4.6 | $15 / 1M tokens | $75 / 1M tokens | 旗艦推理,深度研究 |
| Haiku 4.5 | $0.80 / 1M tokens | $4 / 1M tokens | 輕量快速,大量處理 |
換句話說:Sonnet 4.6 的推理能力已超越 2025 年的 Opus 3.5(當時定價 $15/$75),但價格只要 1/5。這是「智慧單位成本」的一個重要轉折點。
現在是所有人的預設模型
這可能是影響最廣泛的變化:Sonnet 4.6 已取代 Sonnet 4.5,成為 claude.ai 免費版和 Pro 訂閱的預設模型。1
這意味著:
- 數百萬用戶自動升級——不需要做任何設定
- 免費用戶首次獲得 60%+ ARC-AGI-2 的推理能力
- Pro 用戶的日常體驗會明顯提升,特別是長上下文和指令遵循
Sonnet 4.6 vs Opus 4.6:什麼時候用哪個?
| 場景 | 推薦 | 原因 |
|---|---|---|
| 日常程式設計 | Sonnet 4.6 | SWE-Bench 紀錄,速度更快,成本低 5 倍 |
| 辦公自動化 | Sonnet 4.6 | GDBval-AA 竟超越 Opus,專為白領工作流調優 |
| 電腦操作/代理 | Sonnet 4.6 | OS World 幾乎追平 Opus,但成本低 5 倍 |
| 大量 API 呼叫 | Sonnet 4.6 | 價格允許 24/7 運行數千個代理 |
| 深度科學研究 | Opus 4.6 | 更高的 ARC-AGI-2,更深的推理鏈 |
| 長篇創意寫作 | Opus 4.6 | 在細膩度和原創性上仍有優勢 |
| 高度模糊的策略規劃 | Opus 4.6 | Agent Teams 16 並行代理,適合無明確路徑的探索 |
簡單規則:80% 的情況用 Sonnet,20% 的「深水區」用 Opus。
Anthropic 二月攻勢的完整拼圖
回顧 Anthropic 在 2026 年 2 月的三次發布,策略布局非常清晰:
| 日期 | 產品 | 定位 | 目標用戶 |
|---|---|---|---|
| 2/5 | Opus 4.6 | 旗艦引擎——Agent Teams、超大上下文 | 企業、研究者 |
| 2/10 | Cowork Windows | 桌面代理——AI 員工的執行平台 | 知識工作者 |
| 2/17 | Sonnet 4.6 | 全民升級——Opus 級能力平民化 | 所有人 |
邏輯很明確:先用 Opus 4.6 展示技術天花板,用 Cowork 提供執行平台,再用 Sonnet 4.6 把能力以低成本普及到所有用戶。引擎 → 平台 → 普及,一個月內完成完整的產品線布局。
展望:Haiku 4.6 即將到來?
按照 Anthropic 的更新節奏,Haiku 4.6 預計在 2026 年 3 月推出。如果 Haiku 4.6 能達到 Sonnet 3.5 級別的效能,以 Haiku 的超低價格($0.25/$1.25 per 1M tokens),將會對本地部署的開源模型(如 Llama 3 70B)構成嚴重威脅——畢竟自己跑 GPU 的電費可能比 API 還貴。
總結
Claude Sonnet 4.6 可能不像 Opus 4.6 那樣有「Agent Teams」或「C 編譯器」這樣的震撼故事,但它的影響範圍更大。原因很簡單:它是預設模型。
當旗艦模型的能力以 1/5 的價格成為所有人的日常體驗,這比任何 benchmark 紀錄都更有意義。Opus 4.6 定義了技術前沿,但 Sonnet 4.6 定義了大多數人實際使用的 AI 水準。
🎯 對不同用戶的建議
- 免費/Pro 用戶:什麼都不用做。你的 Claude 已經自動升級了。試試長上下文任務(貼入整份文件、程式碼庫),感受 1M tokens 的威力。
- 開發者:API 價格不變,但能力大幅提升。如果你的代理系統還在用 Sonnet 4.5,直接切換到 4.6,不會有相容性問題。
- 企業:Sonnet 4.6 的「智慧單位成本」已達臨界點。以 $3/$15 的價格 24/7 運行 AI 代理,現在是經濟上可行的。
- Max 訂閱者:你仍然可以用 Opus 4.6 處理最困難的任務,但日常工作切到 Sonnet 4.6 可以節省大量配額。
References 參考文獻
- TechCrunch - Anthropic releases Sonnet 4.6
https://techcrunch.com/2026/02/17/anthropic-releases-sonnet-4-6/ - Bloomberg - Anthropic says new AI model is better at using computers
https://www.bloomberg.com/news/articles/2026-02-17/anthropic-says-new-ai-model-is-better-at-using-computers - IT Pro - Anthropic promises 'Opus-level' reasoning with new Claude Sonnet 4.6 model
https://www.itpro.com/technology/artificial-intelligence/anthropic-promises-opus-level-reasoning-claude-sonnet-4-6-model-at-lower-cost - Gizmodo - Anthropic Launches New Model That Spots Zero Days
https://gizmodo.com/anthropic-launches-new-model-that-spots-zero-days-makes-wall-street-traders-lose-their-minds-2000718648 - CNBC - Anthropic Claude Opus 4.6 'vibe working' era
https://www.cnbc.com/2026/02/05/anthropic-claude-opus-4-6-vibe-working.html - Anthropic Release Notes - February 2026
https://releasebot.io/updates/anthropic