重點摘要:2026 年 3 月,OpenAI 和 Google 幾乎同時推出新一代小模型。GPT-5.4 Mini/Nano(3/17)和 Gemini 3.1 Flash-Lite(3/3)都不是給人直接用的——它們是設計來被 agent 架構中的旗艦模型「指派任務」的 subagent。速度快 2 倍以上,成本低 8-16 倍,coding benchmark 逼近旗艦。AI agent 的帳單,大部分會付給這些小模型。
為什麼突然都在做小模型?
因為 agent 架構改變了模型的使用方式。
傳統用法:人類發一個 prompt → 旗艦模型回一個答案。成本固定,一問一答。
Agent 用法:旗艦模型負責規劃和判斷,然後把具體工作分派給一堆 subagent 並行執行——搜尋 codebase、審查檔案、處理資料、呼叫工具。一個任務可能觸發 10-50 次 subagent 呼叫。
旗艦模型(GPT-5.4 / Gemini 3.1 Pro)
規劃 → 分派 → 最終判斷
├──▶ subagent 1:搜尋 codebase ← Mini/Flash-Lite
├──▶ subagent 2:審查 PR 檔案 ← Mini/Flash-Lite
├──▶ subagent 3:跑測試分析 ← Mini/Flash-Lite
├──▶ subagent 4:資料分類萃取 ← Nano
└──▶ subagent 5:工具呼叫 ← Nano
旗艦模型跑 1 次,小模型跑 10-50 次
帳單的 80% 付給小模型
如果 subagent 每次都用旗艦模型,成本會爆炸。所以小模型不是降級版——它們是 agent 時代的經濟基礎。
三個新模型一覽
GPT-5.4 Mini
$0.75 / $4.50 per 1M tokens(輸入/輸出)
- 400K context window
- 文字 + 圖片輸入
- SWE-bench Pro: 54.38%
- OSWorld: 72.13%
- 速度:比 GPT-5.4 快 2 倍+
- Codex 中僅消耗 30% 配額
- API + ChatGPT + Codex
GPT-5.4 Nano
$0.20 / $1.25 per 1M tokens(輸入/輸出)
- OpenAI 目前最便宜的模型
- 分類、萃取、排序、輕量 coding
- 工具呼叫可靠度高
- OSWorld: 39.01%
- 僅 API
- 適合高頻低複雜度任務
Gemini 3.1 Flash-Lite
$0.25 / $1.50 per 1M tokens(輸入/輸出)
- 1M context window
- 原生多模態
- GPQA Diamond: 86.9%
- Arena Elo: 1432
- 輸出速度:235.6 t/s
- 比 Gemini 2.5 Flash 快 2.5 倍
- 比 Pro 便宜 8-16 倍
正面比較
| GPT-5.4 Mini | GPT-5.4 Nano | Gemini 3.1 Flash-Lite | |
|---|---|---|---|
| 輸入成本 | $0.75/M | $0.20/M | $0.25/M |
| 輸出成本 | $4.50/M | $1.25/M | $1.50/M |
| Context Window | 400K | 400K | 1M |
| 輸出速度 | ~150 t/s | ~200 t/s | 235.6 t/s |
| Coding 能力 | SWE-bench 54.38% | 低於 Mini | 未公佈 SWE-bench |
| Computer Use | OSWorld 72.13% | OSWorld 39.01% | N/A |
| 推理能力 | 接近旗艦 | 基本推理 | GPQA 86.9% |
| 多模態 | 文字 + 圖片 | 文字為主 | 原生多模態 |
| 最佳場景 | Coding subagent | 高頻工具呼叫 | 翻譯、分類、長上下文 |
Anthropic 呢?
Anthropic 的對應產品是 Claude 4.5 Haiku,定位同樣是輕量 agent 任務。但 Haiku 的更新節奏比 OpenAI 和 Google 慢一拍,目前在 coding benchmark 上略遜 GPT-5.4 Mini。
三家的策略一致:旗艦模型賣品牌,小模型賺流量。真正的 API 帳單大頭,是這些跑在底層的 subagent 模型。
對開發者的影響
如果你在建 agent 系統,選模型的邏輯變了:
- 規劃層:用旗艦(GPT-5.4 / Gemini 3.1 Pro / Claude Opus),一個任務呼叫一次
- 執行層:用 Mini / Flash-Lite,並行跑 subagent,成本壓到 1/8
- 工具層:用 Nano,分類、萃取、routing,成本壓到 1/16
Notion AI 工程主管的說法很到位:「直到最近,只有最貴的模型才能可靠地處理 agentic tool calling。今天,Mini 和 Nano 輕鬆做到了。」
成本試算
假設一個 coding agent 任務:旗艦規劃 1 次 + subagent 執行 20 次,每次平均 2000 token 輸入 + 1000 token 輸出:
| 方案 | 旗艦成本 | Subagent 成本 (x20) | 總計 |
|---|---|---|---|
| 全用旗艦 | — | — | $0.189 |
| 旗艦 + GPT-5.4 Mini | $0.009 | $0.120 | $0.129(-32%) |
| 旗艦 + Gemini Flash-Lite | $0.007 | $0.040 | $0.047(-75%) |
| 旗艦 + GPT-5.4 Nano | $0.009 | $0.033 | $0.042(-78%) |
規模放大到每天 1000 個任務:全用旗艦 $189/天,用 Nano 只要 $42/天。一個月省 $4,410。
結論
小模型才是 Agent 時代的主力
- 要 coding subagent → GPT-5.4 Mini(SWE-bench 逼近旗艦,OSWorld 72%)
- 要最便宜的工具呼叫 → GPT-5.4 Nano($0.20/M 輸入,OpenAI 最便宜)
- 要長上下文 + 速度 → Gemini 3.1 Flash-Lite(1M window,235 t/s)
- 要混用生態系 → 規劃用 A 家旗艦,執行用 B 家小模型,沒人規定要忠誠
旗艦模型是門面,小模型是印鈔機。三大廠都想讓你把 subagent 的流量導到自己的小模型上——這才是 2026 年 AI 定價戰的真正戰場。