2 月時間軸:三波攻勢
OpenAI 在短短兩週內連續發布三個重大產品更新,節奏之快即使在 AI 軍備競賽的背景下也十分罕見:
| 日期 | 發布項目 | 定位 |
|---|---|---|
| 2/2 | Codex macOS App | 獨立桌面應用,整合 agentic coding 工作流 |
| 2/5 | GPT-5.3-Codex | 最強 agentic coding 模型,首個「高風險」評級 |
| 2/12 | GPT-5.3-Codex-Spark | 即時編碼模型,Cerebras 晶片驅動,1000+ tok/s |
同一天(2/5),Anthropic 也發布了 Claude Sonnet 4.6。兩家公司幾乎同時推出新模型,AI 編碼工具的競爭白熱化。2
GPT-5.3-Codex-Spark:即時編碼的極限追求
Codex-Spark 是 OpenAI 第一個專門為「即時編碼」設計的模型。它的核心理念很簡單:在開發者打字的間隙就完成回饋。
速度 vs 智能的取捨
| 指標 | Codex-Spark | GPT-5.3-Codex | 差異 |
|---|---|---|---|
| 推理速度 | 1,000+ tok/s | ~65 tok/s | 15 倍提升 |
| 首 token 延遲 | — | — | 降低 50% |
| SWE-Bench Pro 耗時 | 2-3 分鐘 | 15-17 分鐘 | 5-8 倍快 |
| SWE-Bench Pro 準確率 | ~56% | 較高 | 接近但較低 |
| Terminal-Bench 2.0 | 58.4% | 77.3% | -18.9% |
| Context Window | 128K | 128K | 相同 |
| 多模態 | 純文字 | 支援視覺 | Spark 較受限 |
Terminal-Bench 2.0 的 18.9% 準確率差距乍看驚人,但 OpenAI 的賭注是:在即時編輯場景中,「極速回饋循環」比「一次就對」更重要。開發者可以透過快速迭代來補足精確度的不足——看到結果不對,立刻修正,整個循環可能只要 3 秒。
Cerebras 官方的說法更直接:「Agentic coding 改變了軟體開發,但也讓開發者感覺被排除在外——等待時間太長,缺乏引導機會。Codex-Spark 就是要把開發者重新放回駕駛座。」3
使用情境指南
Full Codex(深度優先):跨檔案大規模重構、架構設計決策、安全審計、Legacy 系統遷移、複雜多步驟 PR
Cerebras WSE-3:巨型晶片的推理革命
Codex-Spark 的速度來源不是軟體魔法,而是硬體革命。它背後是 Cerebras 的 Wafer Scale Engine 3——人類史上最大的 AI 晶片。
| 規格 | Nvidia H100 | Cerebras WSE-3 | 倍數 |
|---|---|---|---|
| 晶片面積 | 814 mm² | 46,225 mm² | 56.8 倍 |
| 電晶體數 | 800 億 | 4 兆 | 50 倍 |
| AI 核心數 | 16,896 CUDA | 900,000 | 53 倍 |
| 記憶體 | 80 GB HBM3 | 44 GB SRAM(片上) | SRAM 零延遲 |
| AI 算力 | ~4.5 PFLOPS | 125 PFLOPS | 28 倍 |
| 設計理念 | 通用(訓練 + 推理) | 推理最佳化 | — |
WSE-3 的關鍵優勢在於「記憶體牆」的消除。傳統 GPU 推理瓶頸是資料在 HBM(高頻寬記憶體)和計算核心之間的傳輸延遲。WSE-3 把 44GB SRAM 直接整合在晶粒上,消除了片外記憶體存取——這就是它能做到 1000+ tok/s 的根本原因。
戰略意義:脫離 Nvidia 依賴
這是 OpenAI 首次在生產環境中使用非 Nvidia 晶片執行推理。Sachin Katti(OpenAI 工業計算負責人)明確表示:「將 wafer-scale 計算引入生產,為我們在延遲敏感的工作場景提供了一種全新的計算方式。」3
這個合作於 2026 年 1 月宣布,Codex-Spark 是第一個落地產品。Cerebras 也宣布將在 2026 年將超快推理能力擴展到最大的前沿模型——暗示未來 GPT-5.3 甚至更大的模型都可能跑在 WSE-3 上。
這對產業的啟示:推理專用晶片時代正式開始。訓練和推理正在分離成兩個獨立的硬體棧。Nvidia 在訓練市場的主導地位依然穩固,但推理市場正被 Cerebras、Groq 等專用晶片廠商蠶食。
GPT-5.3-Codex:第一個「高風險」模型
如果 Spark 代表了速度的極限,那麼完整版 GPT-5.3-Codex 代表的是能力的邊界——以及這個邊界帶來的恐懼。
這是 OpenAI 第一個在內部 Preparedness Framework 被評為網路安全「高風險」的模型。根據 Fortune 報導,OpenAI 承認該模型的編碼能力已經強到可能被用於自動化網路攻擊,儘管尚無「確定性證據」。4
OpenAI 的安全措施
- Lockdown Mode — 給高安全需求用戶(企業安全團隊、高管)的進階防護選項
- Elevated Risk 標籤 — 在 ChatGPT、Atlas、Codex 中標記高風險功能
- 自動行為監控 — 分類器即時偵測可疑的網路安全活動
- Trusted Access for Cyber — 身份驗證框架,確保進階功能給「對的人」
- $1,000 萬 API 額度 — 提供給開發防禦性網安工具的開發者
高風險誤判:安全分類器的反噬
然而,這些安全措施很快就產生了嚴重的副作用。
2 月中旬開始,大量開發者在 Reddit 和 GitHub Issues 上回報:正常的編碼活動被自動分類器標記為「potentially high-risk cyber activity」,帳號被強制降級到 GPT-5.2。5
被標記的操作包括:更新 Codex 設定檔、正常的程式碼生成、滲透測試學習(CTF)、甚至只是修改 CI/CD pipeline。
這揭示了一個殘酷的現實:AI 安全分類器的智慧,嚴重落後於它試圖監管的生成模型。
GitHub Issues 上的討論顯示,被標記的用戶需要申請 OpenAI 的「Trusted Access for Cyber」計劃才能恢復完整存取——但這個流程緩慢且不透明。有人質疑這本質上是「付費解鎖」的另一種形式,因為只有 ChatGPT Pro($200/月)用戶才有可能獲得完整的 5.3 存取權。6
安全 vs 體驗的兩難
OpenAI 面臨的是一個真正的兩難困境:
- 放鬆安全 → 如果 5.3-Codex 真的被用於自動化攻擊,後果不堪設想
- 收緊安全 → 大量假陽性(false positives)摧毀了開發者體驗,用戶流向競爭對手
這可能是 AI 產業第一次面臨「模型能力即威脅」的部署困境。當你的模型強到連自己都害怕,部署策略就不再只是工程問題,而是政策問題。
Codex macOS App + CLI v0.104.0
在模型層之外,OpenAI 也在產品層面下了重注。2/2 發布的獨立 macOS App 和持續更新的 CLI,目標是將 AI 編碼從「對話框」拉入「工作流底層」。
CLI v0.100-0.104 重點更新
- JavaScript REPL — 實驗性有狀態 JS 運行環境,直接在 Codex 中執行和迭代
- 記憶管理指令 —
/m_update、/m_drop手動管理 Agent 記憶 - WebSocket Proxy — 支援 WS_PROXY/WSS_PROXY 環境變數,企業防火牆友善
- 併發 Shell 命令 — 直接在 Agent 執行中同時運行 Shell 指令
- Apps SDK — ChatGPT connector 支援,打通聊天與編碼的邊界
- 可配置沙盒 — 自定讀取存取政策,平衡安全與彈性
從 v0.92 到 v0.104,僅兩週就跳了 12 個版本。這個更新速度本身就說明了 OpenAI 對 Codex 產品線的重視程度。
競爭格局:三強鼎立
2026 年 2 月的 AI 編碼工具市場,三大平台各有殺手鐗:
| 維度 | OpenAI Codex | Anthropic Claude Code | Google Gemini |
|---|---|---|---|
| 速度王牌 | Spark 1000+ tok/s | Haiku 4.5 ~200 tok/s | Flash ~300 tok/s |
| 深度推理 | GPT-5.3-Codex | Opus 4.6 | Deep Think |
| Context Window | 128K | 1M (beta) | 2M+ |
| 硬體策略 | Nvidia + Cerebras | Nvidia / AWS | 自研 TPU |
| 安全哲學 | Lockdown + 分類器 | Constitutional AI | Google 內部審查 |
| 產品形態 | App + CLI + VS Code | CLI + IDE 整合 | CLI + IDE + Cloud |
| 價格門檻 | Pro $200/月(Spark) | Max $100/月 | 免費 / Pro |
三家的策略差異鮮明:
- OpenAI 走「硬體 + 速度」路線——用專用晶片打造不可複製的推理速度優勢
- Anthropic 走「安全 + 深度」路線——Constitutional AI 避免了誤判爭議,Opus 4.6 在推理深度上仍然領先
- Google 走「規模 + 整合」路線——2M+ context window 和自研 TPU 的垂直整合優勢
開發者生態的三個轉變
1. 即時 AI 編碼成為新標準
1000 tok/s 意味著 AI 的回饋速度已經超越了人類的閱讀速度。當 AI 能在開發者打完一行程式碼之前就給出建議,「Copilot」這個隱喻終於成為現實——不再是事後建議,而是即時協作。
2. 開發者角色的再定義
當 Codex 能在 2-3 分鐘內完成 SWE-Bench Pro 級別的任務(人類平均需要數小時),開發者的角色正從「寫程式碼」轉向「驗證和導航 AI 的輸出」。Spark 的設計哲學——快速但不完美——實際上強化了人類的角色:你需要在場,需要即時判斷,需要引導方向。
3. 安全成為產品差異化因素
OpenAI 的誤判事件證明:AI 安全不只是道德議題,更是產品競爭力。當你的安全系統把付費用戶踢出去,他們會直接轉向 Claude Code。安全做得好是護城河,做得差是自毀城牆。
結論:效能革命的代價帳單
2026 年 2 月是 OpenAI Codex 歷史上最密集的一個月。三個重大發布勾勒出一個野心勃勃的藍圖:
- Spark + Cerebras — 用專用晶片打破推理速度的物理限制
- Full Codex 5.3 — 追求 agentic coding 的能力極限
- macOS App + CLI — 從對話框深入到開發者的工作流底層
但每一項突破都附帶著代價:
- Spark 的速度以準確率為代價(Terminal-Bench -18.9%)
- 5.3 的能力以「高風險」評級為代價(安全管控的壓力)
- 安全分類器的部署以開發者體驗為代價(假陽性風暴)
這就是 AI 編碼工具在 2026 年的真實面貌:不是簡單的「越來越好」,而是在速度、智能、安全三者之間不斷尋找動態平衡。OpenAI 選擇了激進的三線並進策略,這讓它跑在最前面,但也讓它最先撞上每一面牆。
參考資料
- OpenAI, "Introducing GPT-5.3-Codex-Spark", 2026-02-12
- TechCrunch, "OpenAI launches new agentic coding model only minutes after Anthropic drops its own", 2026-02-05
- Cerebras, "OpenAI GPT-5.3-Codex-Spark Powered by Cerebras", 2026-02-12
- Fortune, "OpenAI's new model leaps ahead in coding capabilities—but raises unprecedented cybersecurity risks", 2026-02-05
- GitHub Issues, "False-positive high-risk cyber activity flag blocks gpt-5.3-codex", 2026-02
- GitHub Issues, "Flagged accounts - larger concerns", 2026-02
- TechCrunch, "A new version of OpenAI's Codex is powered by a new dedicated chip", 2026-02-12
- TechCrunch, "OpenAI launches new macOS app for agentic coding", 2026-02-02
- ServeTheHome, "OpenAI GPT-5.3-Codex-Spark Now Running at 1K Tokens Per Second on BIG Cerebras Chips", 2026-02