Overview

語音 AI 終於不再只是 demo

過去兩年的語音 AI,給人感覺像「會議上很炫的功能」——延遲高、長對話容易迷路、翻譯能用但不能信。OpenAI 這次三件套同步發布,把語音流程拆成三個專門模型,各自處理一段。

更重要的是 Realtime API 同步從 beta 進入正式 GA(generally available)。這代表這套服務從「實驗中、別放生產」變成「可以簽 SLA 上線」。

三個模型不是替代關係,是 pipeline 關係:Whisper 聽、Translate 翻、Realtime-2 對話與行動。要做即時字幕用 Whisper、要做跨語言客服用 Translate、要做語音 agent 用 Realtime-2。

The Trio

三個模型分頭吃下三條主線

01 · Realtime-2

語音對話旗艦

原生 speech-to-speech,OpenAI 自家標榜「GPT-5 級推理」。支援工具呼叫、被打斷後能接著講、長對話也不會走鐘。Context 從上一代 32K 跳到 128K,可以撐住很長的工作流。

02 · Translate

即時語音翻譯

支援 70 + 種輸入語言、13 種輸出語言。直接從聲音翻到聲音,不需要中間轉成文字再 TTS。延遲低,適合做跨語言會議、客服、現場翻譯。

03 · Whisper

低延遲串流轉錄

Whisper 系列的 Realtime 版本,把整段轉錄變成串流——說一句出一句,不用等使用者停下來。適合直播字幕、會議筆記、長時間語音監聽。

Realtime-2 highlights

Realtime-2 是這次的主角

三個裡面最值得單獨講的是 GPT-Realtime-2。它解決了上一代語音模型最常被詬病的幾個問題:

128K
上下文 token 數(上一代 32K)
原生工具呼叫與 action
被打斷後能接著講

對開發語音 agent 的團隊意義最大的,是「被打斷後能接著講」這件事。過去的語音模型一旦被使用者中途插話,就會迷失上下文;Realtime-2 把這當成核心特性處理。對客服、教學、語音助理這類「使用者會中途打斷」的場景,可用性差很多。

Pricing

定價

三個模型的計價單位不同——Realtime-2 用 token、另外兩個用分鐘。

模型
輸入
輸出
GPT-Realtime-2
$32 / 1M token
cached $0.40
$64 / 1M token
Realtime-Translate
$0.034 / 分鐘
含輸出
Realtime-Whisper
$0.017 / 分鐘
含輸出

Translate 和 Whisper 用「每分鐘」計費,對成本估算非常友善——一場一小時的會議就是 $2 翻譯或 $1 轉錄,數字直觀。Realtime-2 因為要做完整 reasoning + action,價格高很多,但 cached input 的 $0.40 讓重複系統提示這類場景成本可控。

Get started

怎麼開始用

即日起
三個模型都已開放 API。在 OpenAI Playground 可以直接測試,不需要寫一行 code。
整合方式
透過 Realtime API(WebSocket 或 WebRTC)。Realtime-2 適合做語音 agent;另外兩個可以單獨用,也可以串成 pipeline。
SLA
Realtime API 同步進 GA,代表可以簽 SLA。對企業整合是個 unblock。
Context

為什麼這次三件套同時推

語音 AI 過去一年大家都在補課:Google 在 Gemini 2 加 native 語音、Anthropic 把 Claude 接到 ElevenLabs、xAI 推 Grok Voice。OpenAI 雖然 Realtime API 出得早,但 beta 卡很久、能力不全。這次一次拉齊。

另一個訊號是「拆分專門模型」這個策略。OpenAI 沒有做一個「萬能語音模型」,而是把對話、翻譯、轉錄拆成三個各自最佳化的模型。對應到價格也分層——便宜的事情用便宜的模型做,省下來。這跟整個 LLM 業界從「one big model」往「task-specific models」走的趨勢一致。

對台灣的開發者來說,最直接相關的是 Translate 那條——70 + 種輸入語言包含繁體中文、客語、台語等小語種覆蓋的程度值得實測。OpenAI 沒明列完整語言清單,得自己跑 Playground 驗證。