這次最重要的突破是什麼?
GPT-5.4 不是「又一個更強的模型」——它的核心突破是把三件原本分散的事情整合進一個模型:
- Computer Use(原本要靠 Claude Cowork 或 OpenClaw 的能力)
- Coding(原本是 GPT-5.3-Codex 的獨家能力)
- 知識工作(文件、試算表、簡報的專業產出)
以前你得搞清楚「這個任務要用哪個 OpenAI 模型」。現在的答案是:GPT-5.4。
Computer Use:第一個超越人類的通用模型
GPT-5.4 是 OpenAI 發布的第一個原生支援 Computer Use 的通用模型(不是特化版)。
它有兩種操作電腦的方式:
- 寫程式碼透過 Playwright 等 library 操作(開發者友好)
- 截圖 → 分析畫面 → 發出滑鼠和鍵盤指令(更接近人類操作方式)
Benchmark 成績:
| Benchmark | GPT-5.4 | GPT-5.2 | 人類均值 |
|---|---|---|---|
| OSWorld-Verified(桌面環境操作) | 75.0% | 47.3% | 72.4% |
| WebArena-Verified(瀏覽器操作) | 67.3% | 65.4% | — |
| Online-Mind2Web(純截圖瀏覽器操作) | 92.8% | 70.9%(Atlas Agent Mode) | — |
OSWorld 的 75% 超越人類均值 72.4%,是 Computer Use 領域的里程碑。
開發者可以透過 confirmation policies 設定模型的安全行為——調整不同風險容忍度下的確認機制,針對不同使用場景客製化。
知識工作:83% GDPval
GDPval 是 OpenAI 設計的 benchmark,測試 AI 在 44 種職業中的真實工作能力,涵蓋美國 GDP 前 9 大產業,包含:銷售簡報、會計試算表、急診室班表、製造流程圖、短影片等實際工作產出。
| 模型 | GDPval 成績 |
|---|---|
| GPT-5.4 | 83.0%(超越人類專業人員) |
| GPT-5.2 | 70.9% |
其他知識工作相關數字:
- 試算表建模(初級投資銀行分析師等級):GPT-5.4 87.3% vs GPT-5.2 68.4%
- 簡報評比:人類評審 68% 偏好 GPT-5.4(視覺多樣性、圖片運用更佳)
- BigLaw Bench(法律文件):91%
- 幻覺降低:個別聲明錯誤率比 GPT-5.2 少 33%,整體回應含錯率少 18%
其他 Benchmark
| Benchmark | GPT-5.4 | 競品 |
|---|---|---|
| BrowseComp(資訊檢索) | 89.3% | 超越 Gemini 3.1 Pro、Claude Opus 4.6 |
| SWE-Bench Pro(Coding) | 57.7% | Gemini 3.1 Pro 54.2% |
| MMMU-Pro(視覺理解) | 81.2% | GPT-5.2 79.5% |
技術規格
| 項目 | GPT-5.4 | GPT-5.2(對比) |
|---|---|---|
| Context window | 1M tokens | — |
| Token 效率 | 比 GPT-5.2 省 47% | 基準 |
| Computer Use | 原生支援(Playwright + 截圖) | 不支援 |
| Tool Search | 支援(大型工具生態中自動找最適合的) | 不支援 |
| 影像輸入 | 最高 10.24M 像素 / 6000px 最大邊長(full-fidelity) | 較低 |
ChatGPT Thinking:中途調整輸出方向
在 ChatGPT 中,GPT-5.4 以 GPT-5.4 Thinking 模式呈現,新增了一個重要的使用者體驗改進:
思考計劃先行 — 模型會先列出它的思考計劃,使用者可以在它還在處理時介入調整方向,不用等到輸出完成才發現走偏。
這個設計解決了一個常見痛點:推理模型思考很久,輸出結果跟你要的不一樣,只能整個重來。
ChatGPT for Excel:今天同步推出
同天推出的 ChatGPT for Excel(Beta)是最直接的應用場景展示:
- 在 Excel 工作簿內直接建立、更新、分析財務模型
- 整合金融數據來源
- 使用 GPT-5.4 Thinking 驅動財務工作流
- 目前開放:美國、加拿大、澳洲商業方案
定價
| 方案 | GPT-5.4 | GPT-5.2(對比) |
|---|---|---|
| API Input(標準) | $2.50 / 1M tokens | $1.75 / 1M tokens |
| API Input(超過 272K 後) | $5.00 / 1M tokens | — |
| API Output | $15.00 / 1M tokens | $14.00 / 1M tokens |
| ChatGPT Plus($20/月) | GPT-5.4 Thinking,80 則 / 3 小時 | — |
| ChatGPT Pro($200/月) | GPT-5.4 Pro 無限量 + 專屬 GPU | — |
API 定價比 GPT-5.2 略貴,但考量 47% 的 token 節省,實際成本可能持平甚至更低,取決於任務類型。
跟 Claude Opus 4.6 比較
| 項目 | GPT-5.4 | Claude Opus 4.6 |
|---|---|---|
| Computer Use | 原生支援(OSWorld 75%) | 透過 Claude Cowork(OSWorld 72.5%) |
| BrowseComp | 89.3%(領先) | 被 GPT-5.4 超越 |
| Context | 1M tokens | 1M tokens |
| API Input 定價 | $2.50 / 1M | $5.00 / 1M |
| Coding(SWE-Bench) | 57.7% | Claude Sonnet 4.6 79.6%(不同 benchmark) |
| 多代理協作 | 透過 Codex 生態 | Agent Teams(原生 16 代理並行) |
結語
GPT-5.4 最值得記住的一句話:第一個在桌面操作上超越人類的通用模型。
這不是刷 benchmark 的數字遊戲——OSWorld 測的是「截圖 → 理解畫面 → 發出鍵盤滑鼠指令」這套真實的電腦操作流程。75% 超越人類 72.4%,代表它在大多數日常電腦任務上,確實比一般人更準確。
加上整合了 GPT-5.3-Codex 的 coding 能力、1M context、更省 token,GPT-5.4 是 OpenAI 今年以來最完整的一次整合性更新。
Anthropic 目前在 coding 能力(Claude Sonnet 4.6 SWE-Bench 79.6%)和 Agent Teams 架構上仍有優勢,接下來怎麼回應值得關注。
- 官方發布:openai.com/index/gpt-5-4
- VentureBeat 報導:OpenAI launches GPT-5.4
- 定價詳情:GPT-5.4 Pricing & Benchmarks