GPT-5.4:第一個超越人類桌面操作的通用模型 產品發布

重點摘要:OpenAI 於 2026 年 3 月 5 日發布 GPT-5.4,最大亮點是成為首個原生支援 Computer Use 的通用模型——在 OSWorld 桌面操作測試達到 75%,超越人類均值 72.4%。同時整合 GPT-5.3-Codex 的 coding 能力、1M tokens context、比 GPT-5.2 省 47% token。API 定價 $2.50/1M input、$15/1M output。ChatGPT Plus($20/月)可用,Pro($200/月)無限使用。

這次最重要的突破是什麼?

GPT-5.4 不是「又一個更強的模型」——它的核心突破是把三件原本分散的事情整合進一個模型

  1. Computer Use(原本要靠 Claude Cowork 或 OpenClaw 的能力)
  2. Coding(原本是 GPT-5.3-Codex 的獨家能力)
  3. 知識工作(文件、試算表、簡報的專業產出)

以前你得搞清楚「這個任務要用哪個 OpenAI 模型」。現在的答案是:GPT-5.4

Computer Use:第一個超越人類的通用模型

GPT-5.4 是 OpenAI 發布的第一個原生支援 Computer Use 的通用模型(不是特化版)。

它有兩種操作電腦的方式:

  • 寫程式碼透過 Playwright 等 library 操作(開發者友好)
  • 截圖 → 分析畫面 → 發出滑鼠和鍵盤指令(更接近人類操作方式)

Benchmark 成績:

Benchmark GPT-5.4 GPT-5.2 人類均值
OSWorld-Verified(桌面環境操作) 75.0% 47.3% 72.4%
WebArena-Verified(瀏覽器操作) 67.3% 65.4%
Online-Mind2Web(純截圖瀏覽器操作) 92.8% 70.9%(Atlas Agent Mode)

OSWorld 的 75% 超越人類均值 72.4%,是 Computer Use 領域的里程碑。

開發者可以透過 confirmation policies 設定模型的安全行為——調整不同風險容忍度下的確認機制,針對不同使用場景客製化。

知識工作:83% GDPval

GDPval 是 OpenAI 設計的 benchmark,測試 AI 在 44 種職業中的真實工作能力,涵蓋美國 GDP 前 9 大產業,包含:銷售簡報、會計試算表、急診室班表、製造流程圖、短影片等實際工作產出。

模型 GDPval 成績
GPT-5.4 83.0%(超越人類專業人員)
GPT-5.2 70.9%

其他知識工作相關數字:

  • 試算表建模(初級投資銀行分析師等級):GPT-5.4 87.3% vs GPT-5.2 68.4%
  • 簡報評比:人類評審 68% 偏好 GPT-5.4(視覺多樣性、圖片運用更佳)
  • BigLaw Bench(法律文件):91%
  • 幻覺降低:個別聲明錯誤率比 GPT-5.2 少 33%,整體回應含錯率少 18%

其他 Benchmark

Benchmark GPT-5.4 競品
BrowseComp(資訊檢索) 89.3% 超越 Gemini 3.1 Pro、Claude Opus 4.6
SWE-Bench Pro(Coding) 57.7% Gemini 3.1 Pro 54.2%
MMMU-Pro(視覺理解) 81.2% GPT-5.2 79.5%

技術規格

項目 GPT-5.4 GPT-5.2(對比)
Context window 1M tokens
Token 效率 比 GPT-5.2 省 47% 基準
Computer Use 原生支援(Playwright + 截圖) 不支援
Tool Search 支援(大型工具生態中自動找最適合的) 不支援
影像輸入 最高 10.24M 像素 / 6000px 最大邊長(full-fidelity) 較低

ChatGPT Thinking:中途調整輸出方向

在 ChatGPT 中,GPT-5.4 以 GPT-5.4 Thinking 模式呈現,新增了一個重要的使用者體驗改進:

思考計劃先行 — 模型會先列出它的思考計劃,使用者可以在它還在處理時介入調整方向,不用等到輸出完成才發現走偏。

這個設計解決了一個常見痛點:推理模型思考很久,輸出結果跟你要的不一樣,只能整個重來。

ChatGPT for Excel:今天同步推出

同天推出的 ChatGPT for Excel(Beta)是最直接的應用場景展示:

  • 在 Excel 工作簿內直接建立、更新、分析財務模型
  • 整合金融數據來源
  • 使用 GPT-5.4 Thinking 驅動財務工作流
  • 目前開放:美國、加拿大、澳洲商業方案

定價

方案 GPT-5.4 GPT-5.2(對比)
API Input(標準) $2.50 / 1M tokens $1.75 / 1M tokens
API Input(超過 272K 後) $5.00 / 1M tokens
API Output $15.00 / 1M tokens $14.00 / 1M tokens
ChatGPT Plus($20/月) GPT-5.4 Thinking,80 則 / 3 小時
ChatGPT Pro($200/月) GPT-5.4 Pro 無限量 + 專屬 GPU

API 定價比 GPT-5.2 略貴,但考量 47% 的 token 節省,實際成本可能持平甚至更低,取決於任務類型。

跟 Claude Opus 4.6 比較

項目 GPT-5.4 Claude Opus 4.6
Computer Use 原生支援(OSWorld 75%) 透過 Claude Cowork(OSWorld 72.5%)
BrowseComp 89.3%(領先) 被 GPT-5.4 超越
Context 1M tokens 1M tokens
API Input 定價 $2.50 / 1M $5.00 / 1M
Coding(SWE-Bench) 57.7% Claude Sonnet 4.6 79.6%(不同 benchmark)
多代理協作 透過 Codex 生態 Agent Teams(原生 16 代理並行)

結語

GPT-5.4 最值得記住的一句話:第一個在桌面操作上超越人類的通用模型

這不是刷 benchmark 的數字遊戲——OSWorld 測的是「截圖 → 理解畫面 → 發出鍵盤滑鼠指令」這套真實的電腦操作流程。75% 超越人類 72.4%,代表它在大多數日常電腦任務上,確實比一般人更準確。

加上整合了 GPT-5.3-Codex 的 coding 能力、1M context、更省 token,GPT-5.4 是 OpenAI 今年以來最完整的一次整合性更新。

Anthropic 目前在 coding 能力(Claude Sonnet 4.6 SWE-Bench 79.6%)和 Agent Teams 架構上仍有優勢,接下來怎麼回應值得關注。

相關資源: