1000 Tokens/Sec 的代價:Codex Spark × Cerebras 的效能革命與安全枷鎖 深度分析

重點摘要:OpenAI 在 2026 年 2 月密集推出三大更新。2/2 發布 Codex macOS App;2/5 發布 GPT-5.3-Codex——OpenAI 首個被內部評為網安「高風險」的模型;2/12 發布 GPT-5.3-Codex-Spark,由 Cerebras WSE-3 晶片驅動,達到 1000+ tokens/sec(標準版的 15 倍),但代價是準確率下降(Terminal-Bench 58.4% vs 77.3%)。與此同時,自動安全分類器將大量正常開發者標記為「高風險網路活動」並強制降級,引發社群激烈反彈。1

2 月時間軸:三波攻勢

OpenAI 在短短兩週內連續發布三個重大產品更新,節奏之快即使在 AI 軍備競賽的背景下也十分罕見:

日期 發布項目 定位
2/2 Codex macOS App 獨立桌面應用,整合 agentic coding 工作流
2/5 GPT-5.3-Codex 最強 agentic coding 模型,首個「高風險」評級
2/12 GPT-5.3-Codex-Spark 即時編碼模型,Cerebras 晶片驅動,1000+ tok/s

同一天(2/5),Anthropic 也發布了 Claude Sonnet 4.6。兩家公司幾乎同時推出新模型,AI 編碼工具的競爭白熱化。2

GPT-5.3-Codex-Spark:即時編碼的極限追求

Codex-Spark 是 OpenAI 第一個專門為「即時編碼」設計的模型。它的核心理念很簡單:在開發者打字的間隙就完成回饋

速度 vs 智能的取捨

指標 Codex-Spark GPT-5.3-Codex 差異
推理速度 1,000+ tok/s ~65 tok/s 15 倍提升
首 token 延遲 降低 50%
SWE-Bench Pro 耗時 2-3 分鐘 15-17 分鐘 5-8 倍快
SWE-Bench Pro 準確率 ~56% 較高 接近但較低
Terminal-Bench 2.0 58.4% 77.3% -18.9%
Context Window 128K 128K 相同
多模態 純文字 支援視覺 Spark 較受限

Terminal-Bench 2.0 的 18.9% 準確率差距乍看驚人,但 OpenAI 的賭注是:在即時編輯場景中,「極速回饋循環」比「一次就對」更重要。開發者可以透過快速迭代來補足精確度的不足——看到結果不對,立刻修正,整個循環可能只要 3 秒。

Cerebras 官方的說法更直接:「Agentic coding 改變了軟體開發,但也讓開發者感覺被排除在外——等待時間太長,缺乏引導機會。Codex-Spark 就是要把開發者重新放回駕駛座。」3

使用情境指南

Spark(速度優先):即時程式碼編輯、Live pair programming、快速 bug fix、UI 調整與預覽、程式碼審查標註

Full Codex(深度優先):跨檔案大規模重構、架構設計決策、安全審計、Legacy 系統遷移、複雜多步驟 PR

Cerebras WSE-3:巨型晶片的推理革命

Codex-Spark 的速度來源不是軟體魔法,而是硬體革命。它背後是 Cerebras 的 Wafer Scale Engine 3——人類史上最大的 AI 晶片。

規格 Nvidia H100 Cerebras WSE-3 倍數
晶片面積 814 mm² 46,225 mm² 56.8 倍
電晶體數 800 億 4 兆 50 倍
AI 核心數 16,896 CUDA 900,000 53 倍
記憶體 80 GB HBM3 44 GB SRAM(片上) SRAM 零延遲
AI 算力 ~4.5 PFLOPS 125 PFLOPS 28 倍
設計理念 通用(訓練 + 推理) 推理最佳化

WSE-3 的關鍵優勢在於「記憶體牆」的消除。傳統 GPU 推理瓶頸是資料在 HBM(高頻寬記憶體)和計算核心之間的傳輸延遲。WSE-3 把 44GB SRAM 直接整合在晶粒上,消除了片外記憶體存取——這就是它能做到 1000+ tok/s 的根本原因。

戰略意義:脫離 Nvidia 依賴

這是 OpenAI 首次在生產環境中使用非 Nvidia 晶片執行推理。Sachin Katti(OpenAI 工業計算負責人)明確表示:「將 wafer-scale 計算引入生產,為我們在延遲敏感的工作場景提供了一種全新的計算方式。」3

這個合作於 2026 年 1 月宣布,Codex-Spark 是第一個落地產品。Cerebras 也宣布將在 2026 年將超快推理能力擴展到最大的前沿模型——暗示未來 GPT-5.3 甚至更大的模型都可能跑在 WSE-3 上。

這對產業的啟示:推理專用晶片時代正式開始。訓練和推理正在分離成兩個獨立的硬體棧。Nvidia 在訓練市場的主導地位依然穩固,但推理市場正被 Cerebras、Groq 等專用晶片廠商蠶食。

GPT-5.3-Codex:第一個「高風險」模型

如果 Spark 代表了速度的極限,那麼完整版 GPT-5.3-Codex 代表的是能力的邊界——以及這個邊界帶來的恐懼。

這是 OpenAI 第一個在內部 Preparedness Framework 被評為網路安全「高風險」的模型。根據 Fortune 報導,OpenAI 承認該模型的編碼能力已經強到可能被用於自動化網路攻擊,儘管尚無「確定性證據」。4

OpenAI 的安全措施

  • Lockdown Mode — 給高安全需求用戶(企業安全團隊、高管)的進階防護選項
  • Elevated Risk 標籤 — 在 ChatGPT、Atlas、Codex 中標記高風險功能
  • 自動行為監控 — 分類器即時偵測可疑的網路安全活動
  • Trusted Access for Cyber — 身份驗證框架,確保進階功能給「對的人」
  • $1,000 萬 API 額度 — 提供給開發防禦性網安工具的開發者

高風險誤判:安全分類器的反噬

然而,這些安全措施很快就產生了嚴重的副作用。

2 月中旬開始,大量開發者在 Reddit 和 GitHub Issues 上回報:正常的編碼活動被自動分類器標記為「potentially high-risk cyber activity」,帳號被強制降級到 GPT-5.2。5

開發者收到的訊息:「Your account was flagged for potentially high-risk cyber activity and this request was routed to gpt-5.2 as a fallback」

被標記的操作包括:更新 Codex 設定檔、正常的程式碼生成、滲透測試學習(CTF)、甚至只是修改 CI/CD pipeline。

這揭示了一個殘酷的現實:AI 安全分類器的智慧,嚴重落後於它試圖監管的生成模型。

GitHub Issues 上的討論顯示,被標記的用戶需要申請 OpenAI 的「Trusted Access for Cyber」計劃才能恢復完整存取——但這個流程緩慢且不透明。有人質疑這本質上是「付費解鎖」的另一種形式,因為只有 ChatGPT Pro($200/月)用戶才有可能獲得完整的 5.3 存取權。6

安全 vs 體驗的兩難

OpenAI 面臨的是一個真正的兩難困境:

  • 放鬆安全 → 如果 5.3-Codex 真的被用於自動化攻擊,後果不堪設想
  • 收緊安全 → 大量假陽性(false positives)摧毀了開發者體驗,用戶流向競爭對手

這可能是 AI 產業第一次面臨「模型能力即威脅」的部署困境。當你的模型強到連自己都害怕,部署策略就不再只是工程問題,而是政策問題。

Codex macOS App + CLI v0.104.0

在模型層之外,OpenAI 也在產品層面下了重注。2/2 發布的獨立 macOS App 和持續更新的 CLI,目標是將 AI 編碼從「對話框」拉入「工作流底層」。

CLI v0.100-0.104 重點更新

  • JavaScript REPL — 實驗性有狀態 JS 運行環境,直接在 Codex 中執行和迭代
  • 記憶管理指令/m_update/m_drop 手動管理 Agent 記憶
  • WebSocket Proxy — 支援 WS_PROXY/WSS_PROXY 環境變數,企業防火牆友善
  • 併發 Shell 命令 — 直接在 Agent 執行中同時運行 Shell 指令
  • Apps SDK — ChatGPT connector 支援,打通聊天與編碼的邊界
  • 可配置沙盒 — 自定讀取存取政策,平衡安全與彈性

從 v0.92 到 v0.104,僅兩週就跳了 12 個版本。這個更新速度本身就說明了 OpenAI 對 Codex 產品線的重視程度。

競爭格局:三強鼎立

2026 年 2 月的 AI 編碼工具市場,三大平台各有殺手鐗:

維度 OpenAI Codex Anthropic Claude Code Google Gemini
速度王牌 Spark 1000+ tok/s Haiku 4.5 ~200 tok/s Flash ~300 tok/s
深度推理 GPT-5.3-Codex Opus 4.6 Deep Think
Context Window 128K 1M (beta) 2M+
硬體策略 Nvidia + Cerebras Nvidia / AWS 自研 TPU
安全哲學 Lockdown + 分類器 Constitutional AI Google 內部審查
產品形態 App + CLI + VS Code CLI + IDE 整合 CLI + IDE + Cloud
價格門檻 Pro $200/月(Spark) Max $100/月 免費 / Pro

三家的策略差異鮮明:

  • OpenAI 走「硬體 + 速度」路線——用專用晶片打造不可複製的推理速度優勢
  • Anthropic 走「安全 + 深度」路線——Constitutional AI 避免了誤判爭議,Opus 4.6 在推理深度上仍然領先
  • Google 走「規模 + 整合」路線——2M+ context window 和自研 TPU 的垂直整合優勢

開發者生態的三個轉變

1. 即時 AI 編碼成為新標準

1000 tok/s 意味著 AI 的回饋速度已經超越了人類的閱讀速度。當 AI 能在開發者打完一行程式碼之前就給出建議,「Copilot」這個隱喻終於成為現實——不再是事後建議,而是即時協作。

2. 開發者角色的再定義

當 Codex 能在 2-3 分鐘內完成 SWE-Bench Pro 級別的任務(人類平均需要數小時),開發者的角色正從「寫程式碼」轉向「驗證和導航 AI 的輸出」。Spark 的設計哲學——快速但不完美——實際上強化了人類的角色:你需要在場,需要即時判斷,需要引導方向。

3. 安全成為產品差異化因素

OpenAI 的誤判事件證明:AI 安全不只是道德議題,更是產品競爭力。當你的安全系統把付費用戶踢出去,他們會直接轉向 Claude Code。安全做得好是護城河,做得差是自毀城牆。

結論:效能革命的代價帳單

2026 年 2 月是 OpenAI Codex 歷史上最密集的一個月。三個重大發布勾勒出一個野心勃勃的藍圖:

  • Spark + Cerebras — 用專用晶片打破推理速度的物理限制
  • Full Codex 5.3 — 追求 agentic coding 的能力極限
  • macOS App + CLI — 從對話框深入到開發者的工作流底層

但每一項突破都附帶著代價:

  • Spark 的速度以準確率為代價(Terminal-Bench -18.9%)
  • 5.3 的能力以「高風險」評級為代價(安全管控的壓力)
  • 安全分類器的部署以開發者體驗為代價(假陽性風暴)

這就是 AI 編碼工具在 2026 年的真實面貌:不是簡單的「越來越好」,而是在速度、智能、安全三者之間不斷尋找動態平衡。OpenAI 選擇了激進的三線並進策略,這讓它跑在最前面,但也讓它最先撞上每一面牆。

參考資料

  1. OpenAI, "Introducing GPT-5.3-Codex-Spark", 2026-02-12
  2. TechCrunch, "OpenAI launches new agentic coding model only minutes after Anthropic drops its own", 2026-02-05
  3. Cerebras, "OpenAI GPT-5.3-Codex-Spark Powered by Cerebras", 2026-02-12
  4. Fortune, "OpenAI's new model leaps ahead in coding capabilities—but raises unprecedented cybersecurity risks", 2026-02-05
  5. GitHub Issues, "False-positive high-risk cyber activity flag blocks gpt-5.3-codex", 2026-02
  6. GitHub Issues, "Flagged accounts - larger concerns", 2026-02
  7. TechCrunch, "A new version of OpenAI's Codex is powered by a new dedicated chip", 2026-02-12
  8. TechCrunch, "OpenAI launches new macOS app for agentic coding", 2026-02-02
  9. ServeTheHome, "OpenAI GPT-5.3-Codex-Spark Now Running at 1K Tokens Per Second on BIG Cerebras Chips", 2026-02