GPT-5.4 Mini/Nano vs Gemini 3.1 Flash-Lite:Agent 時代的真正主力是小模型 產品分析

重點摘要:2026 年 3 月,OpenAI 和 Google 幾乎同時推出新一代小模型。GPT-5.4 Mini/Nano(3/17)和 Gemini 3.1 Flash-Lite(3/3)都不是給人直接用的——它們是設計來被 agent 架構中的旗艦模型「指派任務」的 subagent。速度快 2 倍以上,成本低 8-16 倍,coding benchmark 逼近旗艦。AI agent 的帳單,大部分會付給這些小模型。

為什麼突然都在做小模型?

因為 agent 架構改變了模型的使用方式。

傳統用法:人類發一個 prompt → 旗艦模型回一個答案。成本固定,一問一答。

Agent 用法:旗艦模型負責規劃和判斷,然後把具體工作分派給一堆 subagent 並行執行——搜尋 codebase、審查檔案、處理資料、呼叫工具。一個任務可能觸發 10-50 次 subagent 呼叫。

旗艦模型(GPT-5.4 / Gemini 3.1 Pro)
規劃 → 分派 → 最終判斷
├──▶ subagent 1:搜尋 codebase ← Mini/Flash-Lite
├──▶ subagent 2:審查 PR 檔案 ← Mini/Flash-Lite
├──▶ subagent 3:跑測試分析 ← Mini/Flash-Lite
├──▶ subagent 4:資料分類萃取 ← Nano
└──▶ subagent 5:工具呼叫 ← Nano
旗艦模型跑 1 次,小模型跑 10-50 次
帳單的 80% 付給小模型

如果 subagent 每次都用旗艦模型,成本會爆炸。所以小模型不是降級版——它們是 agent 時代的經濟基礎

三個新模型一覽

GPT-5.4 Mini

$0.75 / $4.50 per 1M tokens(輸入/輸出)
  • 400K context window
  • 文字 + 圖片輸入
  • SWE-bench Pro: 54.38%
  • OSWorld: 72.13%
  • 速度:比 GPT-5.4 快 2 倍+
  • Codex 中僅消耗 30% 配額
  • API + ChatGPT + Codex

GPT-5.4 Nano

$0.20 / $1.25 per 1M tokens(輸入/輸出)
  • OpenAI 目前最便宜的模型
  • 分類、萃取、排序、輕量 coding
  • 工具呼叫可靠度高
  • OSWorld: 39.01%
  • 僅 API
  • 適合高頻低複雜度任務

Gemini 3.1 Flash-Lite

$0.25 / $1.50 per 1M tokens(輸入/輸出)
  • 1M context window
  • 原生多模態
  • GPQA Diamond: 86.9%
  • Arena Elo: 1432
  • 輸出速度:235.6 t/s
  • 比 Gemini 2.5 Flash 快 2.5 倍
  • 比 Pro 便宜 8-16 倍

正面比較

GPT-5.4 Mini GPT-5.4 Nano Gemini 3.1 Flash-Lite
輸入成本 $0.75/M $0.20/M $0.25/M
輸出成本 $4.50/M $1.25/M $1.50/M
Context Window 400K 400K 1M
輸出速度 ~150 t/s ~200 t/s 235.6 t/s
Coding 能力 SWE-bench 54.38% 低於 Mini 未公佈 SWE-bench
Computer Use OSWorld 72.13% OSWorld 39.01% N/A
推理能力 接近旗艦 基本推理 GPQA 86.9%
多模態 文字 + 圖片 文字為主 原生多模態
最佳場景 Coding subagent 高頻工具呼叫 翻譯、分類、長上下文

Anthropic 呢?

Anthropic 的對應產品是 Claude 4.5 Haiku,定位同樣是輕量 agent 任務。但 Haiku 的更新節奏比 OpenAI 和 Google 慢一拍,目前在 coding benchmark 上略遜 GPT-5.4 Mini。

三家的策略一致:旗艦模型賣品牌,小模型賺流量。真正的 API 帳單大頭,是這些跑在底層的 subagent 模型。

對開發者的影響

如果你在建 agent 系統,選模型的邏輯變了:

  • 規劃層:用旗艦(GPT-5.4 / Gemini 3.1 Pro / Claude Opus),一個任務呼叫一次
  • 執行層:用 Mini / Flash-Lite,並行跑 subagent,成本壓到 1/8
  • 工具層:用 Nano,分類、萃取、routing,成本壓到 1/16

Notion AI 工程主管的說法很到位:「直到最近,只有最貴的模型才能可靠地處理 agentic tool calling。今天,Mini 和 Nano 輕鬆做到了。」

成本試算

假設一個 coding agent 任務:旗艦規劃 1 次 + subagent 執行 20 次,每次平均 2000 token 輸入 + 1000 token 輸出:

方案 旗艦成本 Subagent 成本 (x20) 總計
全用旗艦 $0.189
旗艦 + GPT-5.4 Mini $0.009 $0.120 $0.129(-32%)
旗艦 + Gemini Flash-Lite $0.007 $0.040 $0.047(-75%)
旗艦 + GPT-5.4 Nano $0.009 $0.033 $0.042(-78%)

規模放大到每天 1000 個任務:全用旗艦 $189/天,用 Nano 只要 $42/天。一個月省 $4,410

結論

小模型才是 Agent 時代的主力

  • 要 coding subagent → GPT-5.4 Mini(SWE-bench 逼近旗艦,OSWorld 72%)
  • 要最便宜的工具呼叫 → GPT-5.4 Nano($0.20/M 輸入,OpenAI 最便宜)
  • 要長上下文 + 速度 → Gemini 3.1 Flash-Lite(1M window,235 t/s)
  • 要混用生態系 → 規劃用 A 家旗艦,執行用 B 家小模型,沒人規定要忠誠

旗艦模型是門面,小模型是印鈔機。三大廠都想讓你把 subagent 的流量導到自己的小模型上——這才是 2026 年 AI 定價戰的真正戰場。

返回 AI 知識庫