Gemini 3 Deep Think 重大升級:ARC-AGI-2 達 84.6%,這是 AGI 嗎? 重大更新

重點摘要:Google 於 2026 年 2 月 12 日發布 Gemini 3 Deep Think 重大升級,成績令人震驚:ARC-AGI-2 達 84.6%(由 ARC Prize Foundation 官方驗證,接近人類平均水準)、Codeforces 3455 Elo(傳奇大師級,超越 99.9% 人類程式設計師)、Humanity's Last Exam 48.4%(無工具輔助的新標準)、IMO 2025 金牌水準。核心技術突破在於「平行推理引擎」——同時探索 5-10 條假設路徑,自我批判後收斂至最佳答案。這是否代表我們正在接近 AGI?1

什麼是 Deep Think?跟一般 Gemini 有什麼不同?

要理解 Deep Think 的重要性,首先要區分 Google 的三個 Gemini 3 層級:

模型 思維模式 定位 速度
Gemini 3 Flash System 1(直覺式) 日常任務、摘要、快速回應 極快
Gemini 3 Pro System 1+(增強直覺) 平衡型,適合多數工作場景
Gemini 3 Deep Think System 2(深思熟慮) 科學研究、數學證明、複雜推理 慢(10-60 秒)

心理學家 Daniel Kahneman 在《快思慢想》中提出的「System 1 vs System 2」正是 Deep Think 的設計哲學:

  • Flash/Pro:像人類的直覺反應——看到問題就立刻回答,速度快但容易犯錯
  • Deep Think:像人類的深度思考——不急著回答,先探索多條路徑、自我質疑、排除錯誤,最後才給出答案

技術層面上,Deep Think 不是簡單地「思考更久」。它採用平行推理引擎(Parallel Reasoning Engine),在生成任何輸出之前,會先在內部產生多條「思維軌跡」(thought traces),同時評估不同解法,最後收斂出最佳答案。2

四項破紀錄的 Benchmark 成績

1. ARC-AGI-2:84.6% — 接近人類水準

這是最具爆炸性的成績。ARC(Abstraction and Reasoning Corpus)測試的核心理念是:測量 AI 解決「從未見過的」新問題的能力

為什麼 ARC-AGI-2 這麼重要?

一般的 AI benchmark 可以靠「背答案」拿高分——如果訓練資料中包含類似題目,模型只需要記住就好。但 ARC 的每道題都是全新的視覺邏輯謎題,完全無法靠記憶取巧。

先前的頂尖模型(包括 Claude Opus 4.5、GPT-5 早期版本)在 ARC-AGI-2 上大多停留在 60-70%。84.6% 已經進入人類平均水準的範圍,代表模型具備了「流體智力」(Fluid Intelligence)——能夠學習如何學習,而非單純檢索知識。

此成績由 ARC Prize Foundation 官方驗證。1

2. Humanity's Last Exam:48.4%

這項測試被設計為「AI 不可能通過的考試」,內容涵蓋跨領域的抽象推理——例如將生物學概念應用到物理問題上。48.4% 的成績(無工具輔助)代表模型能夠在不相關的學科之間建立創造性的連結。3

3. Codeforces:3455 Elo(傳奇大師)

在競程世界中,3455 Elo 將 Deep Think 列入「Legendary Grandmaster」等級——全球僅極少數人類程式設計師能達到這個分數。更重要的是,競程題目需要的不是記住演算法,而是針對全新問題即時發明解法。2

4. IMO 2025:金牌水準

Deep Think 在 2025 年國際數學奧林匹克的題組中解出 6 題中的 5 題,展現了嚴謹的形式化證明能力。這不是「猜答案」,而是完整的數學推導。

核心技術:平行推理引擎

Deep Think 的秘密武器是多假設軌跡搜索(Multi-Hypothesis Trajectory Search),與傳統的鏈式推理有根本性的區別:

面向 傳統推理(Chain of Thought) Deep Think 平行推理
路徑 線性:A → B → C 平行:同時探索 5-10 條路徑
錯誤處理 如果 B 錯了,C 也跟著錯 自動剪枝失敗路徑,保留成功分支
自我驗證 模擬各方案結果,交叉驗證
最終輸出 第一個想到的答案 多條路徑的洞察合併後的最佳答案

這個流程分三個階段:

  1. 發散(Divergence):針對問題提出 5-10 種不同的解題策略
  2. 評估(Evaluation):模擬每種策略的結果,預測成功率
  3. 收斂(Convergence):剪掉死路,將成功分支的洞察合併成最終答案

效果是顯著的:在數學和邏輯推理任務上,Deep Think 的幻覺率(hallucination rate)接近零。

實際應用:不只是跑分

Google 特別強調這次升級是與科學家和研究人員密切合作開發的,目標是解決「缺乏明確答案、數據不完整」的真實研究問題:2

手繪草圖 → 3D 列印

Deep Think 能理解 2D 草圖中的 3D 空間關係,推斷深度、結構和接合力學,直接生成可列印的 STL 檔案。它不只是「辨識圖形」,而是像 CAD 工程師一樣思考立體結構。

科學同儕審查

在一個已發表的案例中,Deep Think 發現了一個通過人類同儕審查的邏輯缺陷。它不是靠查詢資料庫找出問題,而是從頭推導作者的結論,發現推理過程中的不一致。3

化學與物理研究

在化學和物理奧林匹克級的任務中,Deep Think 不僅能平衡化學方程式,還能在全新情境中預測反應結果。物理方面則涵蓋理論領域的複雜數據解讀和物理系統模型建構。

AGI 之辯:84.6% 意味著什麼?

ARC-AGI-2 的 84.6% 引發了 AI 社群最激烈的討論:我們離 AGI 還有多遠?

支持「接近 AGI」的論點:

  • ARC 測試的是流體智力——解決從未見過的問題的能力
  • 84.6% 已進入人類平均表現範圍
  • 如果 AI 能在未知環境中自適應,這就是 AGI 的核心定義之一

反對的論點:

  • Humanity's Last Exam 仍只有 48.4%,「超級專家」級別的推理仍有巨大差距
  • ARC 是視覺邏輯測試,不能代表所有認知能力
  • Deep Think 的推理速度(10-60 秒)與人類的即時反應差距很大
  • 模型在簡單任務上會「過度思考」,缺乏人類的「知道何時不需要深想」的元認知

現實可能介於兩者之間:Deep Think 證明了 AI 在特定的深度推理領域已達人類水準,但距離「全面的」通用智能仍有一段路。

與競爭對手的比較

面向 Gemini 3 Deep Think Claude Opus 4.6 OpenAI o3/o4
推理策略 平行搜索(寬度優先) Adaptive Thinking(動態深度) 推理計算時間(深度優先)
強項 硬科學、數學、空間邏輯 長篇推理、哲學、文學分析 編程、推理鏈
特色功能 多假設同時驗證 Agent Teams(16 並行代理) 推理時間計算擴展
上下文 未公開 1M tokens 128K-256K tokens
延遲 10-60 秒 中等 可變(依推理深度)
ARC-AGI-2 84.6% 未公開 ~75%(估計)

三家的策略分歧很明確:Google 押注推理寬度(同時探索更多可能性),Anthropic 押注代理協作(Agent Teams 的分工合作),OpenAI 押注推理深度(更長的思考鏈)。誰的路線正確,目前還沒有定論。

可用性與已知限制

誰可以用?

  • 消費者:Gemini app 中的 AI Ultra 訂閱者可立即使用
  • 開發者:透過 Gemini API(Vertex AI)早期存取,需申請等候名單
  • 計費:預計按「推理 token」或計算時間計費,成本比 Flash 高 10-50 倍

已知限制

  • 延遲高 — 回應需要 10-60 秒開始串流,不適合即時聊天或語音互動
  • 過度思考 — 簡單問題(如「法國的首都是?」)會浪費計算資源去驗證顯而易見的答案
  • 成本高 — 推理成本是 Gemini 3 Flash 的 10-50 倍,不適合大量批次處理
  • 非通用型 — 專為科學和工程設計,日常對話和創意寫作不是它的強項

總結:推理 AI 的新里程碑

Gemini 3 Deep Think 的這次升級代表了一個重要的分水嶺:AI 首次在「解決未知問題」的能力上達到接近人類的水準

ARC-AGI-2 的 84.6% 不只是一個數字,它代表 AI 具備了「流體智力」——不靠記憶,而是靠推理來面對全新挑戰。這正是 AGI 研究人員數十年來追求的能力。

🎯 對不同用戶的意義

  • 科學研究者:Deep Think 可能是你最強大的研究助手——能同儕審查、推導公式、處理混亂數據。值得申請 API 早期存取。
  • 工程師:Codeforces 3455 Elo 代表它能在演算法和系統設計上提供超越大多數人類的建議。
  • AI 開發者:注意推理 AI 的三種路線(Google 寬度、Anthropic 代理、OpenAI 深度),選擇最適合你應用場景的策略。
  • 一般用戶:日常使用繼續用 Gemini Flash/Pro 即可。Deep Think 是「重型武器」,只在遇到真正困難的問題時才需要。

2026 年 2 月正在成為 AI 歷史上最密集的一個月:Anthropic 的 Opus 4.6(2/5)、OpenAI 的 GPT-5.3-Codex(2/5)、Claude Cowork Windows(2/10)、Google 的 Deep Think 升級(2/12)。三大巨頭在同一個月內各自展示了截然不同的 AI 未來願景。對用戶來說,這是最好的時代——選擇從未如此豐富。

References 參考文獻

  1. MarkTechPost - Is This AGI? Google's Gemini 3 Deep Think Shatters Humanity's Last Exam And Hits 84.6% On ARC-AGI-2
    https://www.marktechpost.com/2026/02/12/is-this-agi-googles-gemini-3-deep-think-shatters-humanitys-last-exam-and-hits-84-6-on-arc-agi-2-performance-today/
  2. Google Blog - Gemini 3 Deep Think: Advancing science, research and engineering
    https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/
  3. 9to5Google - Gemini 3 Deep Think gets 'major upgrade' aimed at practical applications
    https://9to5google.com/2026/02/12/gemini-3-deep-think-upgrade/
  4. Hacker News - Gemini 3 Deep Think(首頁討論)
    https://news.ycombinator.com/
  5. Seeking Alpha - Google upgrades Gemini 3 Deep Think model across science, engineering
    https://seekingalpha.com/news/4551249-google-upgrades-gemini-3-deep-think-model-across-science-engineering
  6. Chrome Unboxed - Google's new Gemini 3 Deep Think update pushes the boundaries of AI reasoning
    https://chromeunboxed.com/googles-new-gemini-3-deep-think-update-pushes-the-boundaries-of-ai-reasoning/