什麼是 Deep Think?跟一般 Gemini 有什麼不同?
要理解 Deep Think 的重要性,首先要區分 Google 的三個 Gemini 3 層級:
| 模型 | 思維模式 | 定位 | 速度 |
|---|---|---|---|
| Gemini 3 Flash | System 1(直覺式) | 日常任務、摘要、快速回應 | 極快 |
| Gemini 3 Pro | System 1+(增強直覺) | 平衡型,適合多數工作場景 | 快 |
| Gemini 3 Deep Think | System 2(深思熟慮) | 科學研究、數學證明、複雜推理 | 慢(10-60 秒) |
心理學家 Daniel Kahneman 在《快思慢想》中提出的「System 1 vs System 2」正是 Deep Think 的設計哲學:
- Flash/Pro:像人類的直覺反應——看到問題就立刻回答,速度快但容易犯錯
- Deep Think:像人類的深度思考——不急著回答,先探索多條路徑、自我質疑、排除錯誤,最後才給出答案
技術層面上,Deep Think 不是簡單地「思考更久」。它採用平行推理引擎(Parallel Reasoning Engine),在生成任何輸出之前,會先在內部產生多條「思維軌跡」(thought traces),同時評估不同解法,最後收斂出最佳答案。2
四項破紀錄的 Benchmark 成績
1. ARC-AGI-2:84.6% — 接近人類水準
這是最具爆炸性的成績。ARC(Abstraction and Reasoning Corpus)測試的核心理念是:測量 AI 解決「從未見過的」新問題的能力。
為什麼 ARC-AGI-2 這麼重要?
一般的 AI benchmark 可以靠「背答案」拿高分——如果訓練資料中包含類似題目,模型只需要記住就好。但 ARC 的每道題都是全新的視覺邏輯謎題,完全無法靠記憶取巧。
先前的頂尖模型(包括 Claude Opus 4.5、GPT-5 早期版本)在 ARC-AGI-2 上大多停留在 60-70%。84.6% 已經進入人類平均水準的範圍,代表模型具備了「流體智力」(Fluid Intelligence)——能夠學習如何學習,而非單純檢索知識。
此成績由 ARC Prize Foundation 官方驗證。1
2. Humanity's Last Exam:48.4%
這項測試被設計為「AI 不可能通過的考試」,內容涵蓋跨領域的抽象推理——例如將生物學概念應用到物理問題上。48.4% 的成績(無工具輔助)代表模型能夠在不相關的學科之間建立創造性的連結。3
3. Codeforces:3455 Elo(傳奇大師)
在競程世界中,3455 Elo 將 Deep Think 列入「Legendary Grandmaster」等級——全球僅極少數人類程式設計師能達到這個分數。更重要的是,競程題目需要的不是記住演算法,而是針對全新問題即時發明解法。2
4. IMO 2025:金牌水準
Deep Think 在 2025 年國際數學奧林匹克的題組中解出 6 題中的 5 題,展現了嚴謹的形式化證明能力。這不是「猜答案」,而是完整的數學推導。
核心技術:平行推理引擎
Deep Think 的秘密武器是多假設軌跡搜索(Multi-Hypothesis Trajectory Search),與傳統的鏈式推理有根本性的區別:
| 面向 | 傳統推理(Chain of Thought) | Deep Think 平行推理 |
|---|---|---|
| 路徑 | 線性:A → B → C | 平行:同時探索 5-10 條路徑 |
| 錯誤處理 | 如果 B 錯了,C 也跟著錯 | 自動剪枝失敗路徑,保留成功分支 |
| 自我驗證 | 無 | 模擬各方案結果,交叉驗證 |
| 最終輸出 | 第一個想到的答案 | 多條路徑的洞察合併後的最佳答案 |
這個流程分三個階段:
- 發散(Divergence):針對問題提出 5-10 種不同的解題策略
- 評估(Evaluation):模擬每種策略的結果,預測成功率
- 收斂(Convergence):剪掉死路,將成功分支的洞察合併成最終答案
效果是顯著的:在數學和邏輯推理任務上,Deep Think 的幻覺率(hallucination rate)接近零。
實際應用:不只是跑分
Google 特別強調這次升級是與科學家和研究人員密切合作開發的,目標是解決「缺乏明確答案、數據不完整」的真實研究問題:2
手繪草圖 → 3D 列印
Deep Think 能理解 2D 草圖中的 3D 空間關係,推斷深度、結構和接合力學,直接生成可列印的 STL 檔案。它不只是「辨識圖形」,而是像 CAD 工程師一樣思考立體結構。
科學同儕審查
在一個已發表的案例中,Deep Think 發現了一個通過人類同儕審查的邏輯缺陷。它不是靠查詢資料庫找出問題,而是從頭推導作者的結論,發現推理過程中的不一致。3
化學與物理研究
在化學和物理奧林匹克級的任務中,Deep Think 不僅能平衡化學方程式,還能在全新情境中預測反應結果。物理方面則涵蓋理論領域的複雜數據解讀和物理系統模型建構。
AGI 之辯:84.6% 意味著什麼?
ARC-AGI-2 的 84.6% 引發了 AI 社群最激烈的討論:我們離 AGI 還有多遠?
支持「接近 AGI」的論點:
- ARC 測試的是流體智力——解決從未見過的問題的能力
- 84.6% 已進入人類平均表現範圍
- 如果 AI 能在未知環境中自適應,這就是 AGI 的核心定義之一
反對的論點:
- Humanity's Last Exam 仍只有 48.4%,「超級專家」級別的推理仍有巨大差距
- ARC 是視覺邏輯測試,不能代表所有認知能力
- Deep Think 的推理速度(10-60 秒)與人類的即時反應差距很大
- 模型在簡單任務上會「過度思考」,缺乏人類的「知道何時不需要深想」的元認知
現實可能介於兩者之間:Deep Think 證明了 AI 在特定的深度推理領域已達人類水準,但距離「全面的」通用智能仍有一段路。
與競爭對手的比較
| 面向 | Gemini 3 Deep Think | Claude Opus 4.6 | OpenAI o3/o4 |
|---|---|---|---|
| 推理策略 | 平行搜索(寬度優先) | Adaptive Thinking(動態深度) | 推理計算時間(深度優先) |
| 強項 | 硬科學、數學、空間邏輯 | 長篇推理、哲學、文學分析 | 編程、推理鏈 |
| 特色功能 | 多假設同時驗證 | Agent Teams(16 並行代理) | 推理時間計算擴展 |
| 上下文 | 未公開 | 1M tokens | 128K-256K tokens |
| 延遲 | 10-60 秒 | 中等 | 可變(依推理深度) |
| ARC-AGI-2 | 84.6% | 未公開 | ~75%(估計) |
三家的策略分歧很明確:Google 押注推理寬度(同時探索更多可能性),Anthropic 押注代理協作(Agent Teams 的分工合作),OpenAI 押注推理深度(更長的思考鏈)。誰的路線正確,目前還沒有定論。
可用性與已知限制
誰可以用?
- 消費者:Gemini app 中的 AI Ultra 訂閱者可立即使用
- 開發者:透過 Gemini API(Vertex AI)早期存取,需申請等候名單
- 計費:預計按「推理 token」或計算時間計費,成本比 Flash 高 10-50 倍
已知限制
- 延遲高 — 回應需要 10-60 秒開始串流,不適合即時聊天或語音互動
- 過度思考 — 簡單問題(如「法國的首都是?」)會浪費計算資源去驗證顯而易見的答案
- 成本高 — 推理成本是 Gemini 3 Flash 的 10-50 倍,不適合大量批次處理
- 非通用型 — 專為科學和工程設計,日常對話和創意寫作不是它的強項
總結:推理 AI 的新里程碑
Gemini 3 Deep Think 的這次升級代表了一個重要的分水嶺:AI 首次在「解決未知問題」的能力上達到接近人類的水準。
ARC-AGI-2 的 84.6% 不只是一個數字,它代表 AI 具備了「流體智力」——不靠記憶,而是靠推理來面對全新挑戰。這正是 AGI 研究人員數十年來追求的能力。
🎯 對不同用戶的意義
- 科學研究者:Deep Think 可能是你最強大的研究助手——能同儕審查、推導公式、處理混亂數據。值得申請 API 早期存取。
- 工程師:Codeforces 3455 Elo 代表它能在演算法和系統設計上提供超越大多數人類的建議。
- AI 開發者:注意推理 AI 的三種路線(Google 寬度、Anthropic 代理、OpenAI 深度),選擇最適合你應用場景的策略。
- 一般用戶:日常使用繼續用 Gemini Flash/Pro 即可。Deep Think 是「重型武器」,只在遇到真正困難的問題時才需要。
2026 年 2 月正在成為 AI 歷史上最密集的一個月:Anthropic 的 Opus 4.6(2/5)、OpenAI 的 GPT-5.3-Codex(2/5)、Claude Cowork Windows(2/10)、Google 的 Deep Think 升級(2/12)。三大巨頭在同一個月內各自展示了截然不同的 AI 未來願景。對用戶來說,這是最好的時代——選擇從未如此豐富。
References 參考文獻
- MarkTechPost - Is This AGI? Google's Gemini 3 Deep Think Shatters Humanity's Last Exam And Hits 84.6% On ARC-AGI-2
https://www.marktechpost.com/2026/02/12/is-this-agi-googles-gemini-3-deep-think-shatters-humanitys-last-exam-and-hits-84-6-on-arc-agi-2-performance-today/ - Google Blog - Gemini 3 Deep Think: Advancing science, research and engineering
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/ - 9to5Google - Gemini 3 Deep Think gets 'major upgrade' aimed at practical applications
https://9to5google.com/2026/02/12/gemini-3-deep-think-upgrade/ - Hacker News - Gemini 3 Deep Think(首頁討論)
https://news.ycombinator.com/ - Seeking Alpha - Google upgrades Gemini 3 Deep Think model across science, engineering
https://seekingalpha.com/news/4551249-google-upgrades-gemini-3-deep-think-model-across-science-engineering - Chrome Unboxed - Google's new Gemini 3 Deep Think update pushes the boundaries of AI reasoning
https://chromeunboxed.com/googles-new-gemini-3-deep-think-update-pushes-the-boundaries-of-ai-reasoning/