摘要與核心重點
摘要
最後更新日期:2026-07-14 發布日期:2026-07-10
Prompt Caching(提示詞快取)讓開發者對重複出現的長前綴(系統提示、產品手冊、大量範例)只需付一次完整處理費,之後重複讀取可享大幅折扣。Claude(Anthropic)、GPT-5.6(OpenAI)、Gemini(Google)三家的邏輯有一個共同點:讀取都便宜,寫入或存放要額外付錢,差別在怎麼收這筆額外的錢。Claude 和 GPT-5.6 是一次性寫入費,依你選的存活時間(TTL)分級:Claude 預設 5 分鐘收 1.25×、手動設 1 小時收 2×;GPT-5.6 固定收 1.25×,換來保底 30 分鐘的存活時間——這是 GPT-5.6 相對 GPT-5.5 以前最大的改變:快取寫入從完全免費變成要收費,代價是行為變得明確可預期。Gemini 則分兩種模式:implicit(隱式)從 2.5 版起預設自動開啟,零操作零額外成本;explicit(顯式)由使用者手動指定要快取的內容,代價是三家裡唯一的一筆按小時持續計算的存放費(Pro 模型 $4.50/1M tokens/小時,Flash 系列 $1.00)。三家的讀取折扣都落在 0.1×(約省 90%)附近,這是三家的共同基準線;真正決定總成本的變數,是你的使用情境有沒有讓寫入或存放的額外費用被重複讀取的節省打平。
讀取/寫入是什麼?跟 input/output 有什麼關係?
先釐清一個容易搞混的地方
API 原本的計價只有兩種:input(你送進去的內容)和 output(模型回你的內容)。Cache 的「讀取」「寫入」不是新增一組跟 input/output 平行的收費項目,而是把 input 這一塊再拆成兩種情況——output(模型的回覆)從頭到尾都是原價,完全不受快取影響。
拆開來看,input 現在分三種:
- 一般 input:這段內容第一次出現、之後也不會重複用 → 原價
- cache 寫入(write):你標記「這段內容以後可能會重複用」,系統要多花力氣把它存起來、建立索引 → 通常比原價貴一點(Claude 1.25×~2×,GPT-5.6 固定 1.25×)
- cache 讀取(read/hit):這段內容之前存過,這次直接命中,不用重新處理 → 大幅打折(三家都約打 1 折,省 90%)
打個比方:影印店幫你印文件。內容每次都不一樣,就照正常價現印(=一般 input)。如果文件前 50 頁是固定不變的公司模板,你可以先把它「寄放」在店裡的專用檔案夾——這個寄放動作要多收一筆整理費,就是寫入;之後每次直接從檔案夾抽出來印,比重新排版便宜很多,就是讀取;印出來交給你的成品(模型的回答)則是 output,價格從頭到尾沒變過。Gemini 的 explicit caching 另外多一筆「檔案夾月租費」(按小時計算的存放費)——不管你有沒有去調用,東西還放在裡面就持續扣錢,這是三家裡唯一跟讀寫次數無關的收費項目。
三家「何時開始收費」不是同一個時間點
寫入收費的時間軸,三家完全不同步
容易誤會的地方:三家不是同時從「免費」變成「收費」,各自的起點跟走向都不一樣。
| 供應商 | 快取上線時間 | 寫入是否曾經免費 |
|---|---|---|
| Claude(Anthropic) | 2024-08-14 公測上線 | 從未免費,上線第一天就是 1.25×(5 分鐘)/2×(1 小時) |
| GPT(OpenAI) | GPT-5.5 及更早版本 | 曾經免費,GPT-5.6 才改成收 1.25× |
| Gemini(Google,implicit) | Gemini 2.5 起預設開啟 | 一直免費、自動,至今沒變過 |
換句話說,「以前無腦用、現在要算一下」這句話只精準套用在 GPT 身上——它是三家裡唯一真的經歷過「免費 → 收費」轉折的。Claude 的寫入費從 2024 年上線就存在,沒有「以前免費」的階段;Gemini 的 implicit 模式則從頭到尾都是免費自動,不受這次 GPT-5.6 改版影響。
三家一次看:讀取折扣、寫入成本、存放方式
| 供應商 | 讀取折扣 | 寫入成本 | 存放方式 |
|---|---|---|---|
| Claude(Anthropic) | 0.1×(省 90%) | 5 分鐘 TTL:1.25× 1 小時 TTL:2× |
預設只存 5 分鐘,可手動設 1 小時;到期即消失,不額外收存放費 |
| GPT(OpenAI,GPT-5.6) | 0.1×(省 90%,各模型一致) | 1.25×(GPT-5.5 以前免費) | 保底存活 30 分鐘(可能更久),不額外收存放費 |
| Gemini(Google) | implicit 自動省約 90%;explicit 依模型定價 | 依讀取單價計算,無獨立寫入倍率 | 按小時計費:Pro 模型 $4.50 / 1M tokens / 小時,Flash 系列 $1.00 / 1M tokens / 小時,放越久越貴 |
GPT-5.6:寫入從免費變收費,換來更長的保鮮期
這是三家裡最新、最明確的一次計價調整。GPT-5.5 以前,快取寫入完全不收費,代價是保存時間短且不穩定(幾分鐘到最多 1 小時,行為不保證)。GPT-5.6 把規則改乾淨:寫入固定收 1.25×,換來明確的保底 30 分鐘存活時間,還新增了「explicit cache breakpoint」——可以手動標記哪段前綴要快取,一次請求最多標 4 個新斷點,系統會往回看最近 50 個斷點做讀取比對。
GPT-5.6 分級定價
| GPT-5.6 分級 | Input | Cached Input | Output |
|---|---|---|---|
| Sol | $5.00 / 1M | $0.50 / 1M | $30.00 / 1M |
| Terra | $2.50 / 1M | $0.25 / 1M | $15.00 / 1M |
| Luna | $1.00 / 1M | $0.10 / 1M | $6.00 / 1M |
三個分級的 cached input 都精準落在 input 價格的 10%——讀取折扣固定 90%,這點跟 Claude 一致。真正的變化在寫入端:以前免費,現在多一筆 1.25× 的成本,但總體換算下來,只要同一段前綴會被重複讀取超過一兩次,寫入的額外成本很快就會被讀取省下的錢打平。
實際算給你看:用兩次跟用五次,差在哪
把 input 單價設為 1,方便比較
完全不用快取,同一段內容送兩次請求:每次都是原價 1,兩次總共 1 + 1 = 2。
用快取,同一段內容送兩次請求:第一次是寫入(1.25),第二次命中快取變成讀取(0.1),兩次總共 1.25 + 0.1 = 1.35——已經比不用快取便宜,從第二次命中就開始回本。
同一段內容重複用到第五次:不用快取要付 1 × 5 = 5;用快取只要付 1.25 + 0.1 × 4 = 1.65——用得越多次,省得越多。
反過來說,如果你標記了快取、但這段內容其實只用過一次、之後再也沒重複出現,你就白付了那 0.25 的寫入加價,沒有後續讀取幫你打平。所以快取適合放「確定會重複用」的固定內容(系統提示詞、產品手冊),不適合每次都不一樣的臨時內容。
Claude:TTL 分兩檔,越想存久越貴
Claude 的邏輯最直白——讀取固定 0.1×,寫入依你選的存活時間分兩檔:預設 5 分鐘 TTL 收 1.25×,手動指定 1 小時 TTL 收 2×。用白話講:越想讓快取活久一點,寫入就越貴,這是用「多付一點錢換保鮮期」的思路,跟 GPT-5.6 的新規則本質上是同一套算法,只是 Claude 早就這樣算了。
需要留意的是可快取的最小前綴長度依模型而異——新一代 Opus/Haiku 系列要 4096 tokens 以上才吃得到快取,短於門檻不會報錯,只是靜默不生效(讀取統計直接顯示 0)。
Claude 快取定價結構
Gemini:唯一收「倉租」的一家
Gemini 的兩種快取模式定位不同。Implicit(隱式)從 Gemini 2.5 起預設開啟,完全自動,命中就折扣,不用做任何設定,也沒有額外的寫入或存放費——這是三家裡唯一「零操作、零額外成本」的快取形式。Explicit(顯式)則是你自己決定要快取哪段內容、存多久,代價是要另外付一筆按小時持續計算的存放費,這是 Claude 和 GPT 都沒有的收費項目:
| 模型 | Input(Standard) | 存放費 / 小時 |
|---|---|---|
| Gemini 3.1 Pro Preview | $0.20–0.40 / 1M | $4.50 / 1M tokens |
| Gemini 2.5 Pro | $0.125–0.25 / 1M | $4.50 / 1M tokens |
| Gemini 2.5 / 3.5 Flash | $0.03–0.15 / 1M | $1.00 / 1M tokens |
| Gemini 2.5 / 3.1 Flash-Lite | $0.01–0.025 / 1M | $1.00 / 1M tokens |
倉租式計費適合「同一段大型上下文會被重複用上千次、放整個小時」的場景(例如客服機器人共用一份產品手冊),單次讀取成本可以壓到極低;但如果只是短暫對話用一下就丟,explicit caching 的倉租費反而不划算,這時候讓 implicit caching 自動處理就好,不用手動介入。
對開發者的實際意義
- 短對話、一次性任務:Claude 預設 5 分鐘 TTL 或 GPT-5.6 保底 30 分鐘通常夠用,不需要手動拉長 TTL 多付錢
- 長期共用的大型上下文(系統提示、產品手冊、大量範例):Claude 選 1 小時 TTL、GPT-5.6 用 explicit breakpoint、Gemini 用 explicit caching,三家都有對應機制,但重複讀取次數要夠多才划算
- 完全不想管的懶人選項:Gemini 的 implicit caching 是三家裡唯一不用寫任何快取邏輯就自動省錢的做法——如果專案剛好用 Gemini,這是白撿的折扣
- 驗證快取有沒有真的生效:三家都會在回應的 usage 欄位回報快取讀寫的 token 數(Claude 的
cache_read_input_tokens、OpenAI 的cached_tokens、Gemini 的total_cached_tokens),數字持續是 0 就代表某個地方(時間戳記、亂序 JSON、動態 tool 清單)悄悄把前綴弄髒了,快取根本沒對上
常見問題(更新日期:2026-07-14)
Prompt Caching 是免費的嗎?三家最便宜的是誰?
都不是免費的,三家都要為快取多付一筆錢,差別在收費項目:Claude 和 GPT-5.6 是一次性寫入費(依 TTL 長短分級,Claude 1.25×~2×,GPT-5.6 固定 1.25×),Gemini 的 explicit caching 則是按小時持續計算的存放費(Pro 模型 $4.50/1M tokens/小時,Flash 系列 $1.00)。三家的讀取折扣都固定在 90%(0.1×)左右,這部分是三家共同點。沒有絕對「最便宜」的答案,取決於使用情境:短暫對話 GPT-5.6 或 Claude 的一次性寫入費通常較划算;完全不想手動管理,Gemini 的 implicit caching 是唯一零操作、零額外成本的做法。
三家的 Prompt Caching 怎麼開始用?
Claude:直接在 API 請求中對想快取的內容加上 cache_control 標記,預設 TTL 5 分鐘,可手動指定 1 小時。GPT-5.6:系統自動快取重複的前綴,也可用「explicit cache breakpoint」手動標記,一次請求最多標 4 個新斷點。Gemini:2.5 以後的模型預設開啟 implicit caching,完全自動不需設定;若要用 explicit caching(按小時計費),需另外呼叫 API 建立快取物件並指定存活時間。三家都不需要額外付費申請,是 API 呼叫時的參數設定。
怎麼確認快取真的有生效?
三家都會在回應的 usage 欄位回報快取讀寫的 token 數:Claude 的 cache_read_input_tokens、OpenAI 的 cached_tokens、Gemini 的 total_cached_tokens。如果這個數字持續是 0,代表請求裡某個地方(例如變動的時間戳記、順序不固定的 JSON、動態變化的 tool 清單)悄悄把前綴內容弄髒了,導致快取始終對不上、沒有真正命中。
哪家的快取存活時間(TTL)最長?
純以「可設定的存活時間」來看,Claude 最長可手動指定到 1 小時(2× 寫入費);GPT-5.6 保底 30 分鐘、可能更久,但不可手動延長;Gemini 的 explicit caching 存活時間由使用者自訂,但存放期間會持續按小時收費,放越久越貴,沒有免費的「久放」選項。三家都沒有無限期保存快取的機制。
結論
三大供應商的 prompt cache 計價邏輯已經在 2026 年趨於一致:讀取都便宜(約省 90%),差別在寫入或存放這筆額外費用怎麼收。整理成一份檢查清單:
- 三家讀取折扣都在 0.1× 附近,這部分不用比較,都差不多划算
- GPT-5.6 已把快取寫入從免費改為收費(1.25×),跟 Claude 的分級寫入費站到同一套邏輯
- Claude 用 TTL 長短分兩檔(1.25×/2×),越想存久越貴
- Gemini 是唯一有「按小時持續計算」存放費的一家,適合超高重複讀取量的固定上下文
- Gemini 的 implicit caching 是三家裡唯一零操作、零額外成本的自動折扣
- 驗證快取是否生效,務必檢查各家回應中的 cache token 欄位,不要假設有設定就一定生效