Gemma 4:3.8B 參數打天下,Google 用 Apache 2.0 重寫開源 AI 規則 產品分析

重點摘要:Google DeepMind 發布 Gemma 4,基於 Gemini 3 技術的開源模型家族。四款模型從手機到工作站全覆蓋。核心亮點:26B MoE 模型每次推理只啟用 3.8B 參數,在消費級 GPU 上跑出全球開源第 6 的成績。授權從限制性條款改為 Apache 2.0。AIME 數學跑分從 Gemma 3 的 20% 躍升至 89%。這不是漸進式升級——這是重新定義「開源 AI 能做什麼」。
3.8B
26B 模型的
實際活躍參數
89%
AIME 2026
數學推理
#3
31B 全球開源
Arena AI 排名
4 億+
Gemma 系列
累計下載次數

四款模型,各司其職

Gemma 4 不是「一個模型」,而是一個針對不同硬體精確定位的家族。從你口袋裡的手機,到桌上的筆電,到書房的 GPU,到機房的伺服器——每一層都有對應的選擇。

E2B

Dense (PLE) · ~2B 活躍參數 · 128K context

手機、IoT、Raspberry Pi。體積最小,支援文字 + 圖片 + 音訊輸入。離線跑,零延遲。

手機端首選

E4B

Dense (PLE) · ~4B 活躍參數 · 128K context

筆電、輕量 GPU。比 E2B 更強的推理能力,同樣支援多模態 + 音訊。適合本地開發和實驗。

筆電甜蜜點

26B A4B(MoE)

128 專家 · 3.8B 活躍參數 · 256K context

消費級 GPU(24GB)。只啟用 3.8B 參數就達到 26B 的智力。原生 function calling,第一個在消費硬體上真正可用的 Agent 模型。

Agent 核心

31B Dense

Dense · 31B 全量參數 · 256K context

工作站、伺服器(80GB H100)。全球開源第 3。最大原始品質,微調的最佳基底。

品質天花板

所有模型都支援:圖片/影片輸入、function calling、結構化 JSON 輸出、可切換的思維鏈(thinking mode)、原生系統指令、140+ 語言。E2B 和 E4B 額外支援音訊輸入——在這個大小的模型裡非常罕見。

MoE 的魔法:為什麼 3.8B 能打 26B?

傳統模型是「全員出動」——每次推理,所有參數都要跑一遍。26B 的模型就要付 26B 的運算成本。但 Gemma 4 的 26B A4B 不是這樣。

Mixture of Experts(MoE)怎麼運作

1
128 個小專家。模型內部有 128 個「專家」模組,每個專精不同的知識領域。
2
每次只叫 8+1 個。每個 token 經過一個路由器(router),選出 8 個最相關的專家,再加 1 個共用專家。其餘 119 個「休息」。
3
結果:26B 的知識,3.8B 的成本。模型在推理時只用 3.8B 的運算量,但它「知道」的東西是 26B 的量級——因為不同的問題會喚醒不同的專家組合。

這就像一間有 128 位專科醫師的醫院。病人來了不需要 128 位同時看診——路由器判斷症狀,叫 8 位最相關的會診就好。醫院的「知識」是 128 位的總和,但每次看診的「成本」只有 8 位。

為什麼這次特別重要?

MoE 不是新技術(Mixtral 早就在用了),但 Gemma 4 的突破在於效率和品質的平衡點。以往 MoE 模型在消費級硬體上要嘛太慢、要嘛推理品質不穩。Gemma 4 26B A4B 用 Q4 量化可以跑在 24GB GPU 上,Arena AI 分數 1441(全球第 6),而且多步驟推理不會「跑題」——這是之前本地模型的痛點。社群的說法是:「第一次覺得本地 AI Agent 真的能用。」

跑分暴漲:不是漸進,是跨代

Gemma 3 已經是優秀的開源模型。但 Gemma 4 的提升不是「好一點」,而是「換了一個等級」:

Benchmark Gemma 3 27B Gemma 4 31B Gemma 4 26B MoE
Arena AI(文字) 1365 1452 1441
AIME 2026(數學) 20.8% 89.2% ↑ 88.3% ↑
LiveCodeBench v6(程式) 29.1% 80.0% ↑ 77.1% ↑
GPQA Diamond(科學) 42.4% 84.3% 82.3%
MMLU 多語言(問答) 67.6% 85.2% 82.6%
τ2-bench(Agent 工具使用) 6.6% 86.4% ↑ 85.5% ↑

注意最後一行——Agent 工具使用(τ2-bench):從 6.6% 到 86.4%。這意味著 Gemma 3 幾乎不會使用工具,而 Gemma 4 已經能可靠地在工作流中呼叫函式、操作 API。這是「能不能跑 Agent」的分水嶺。

另一個驚人的數字是 AIME 數學,從 20% 到 89%。這不是同一個等級的模型——Gemma 3 在數學上大約是「高中生」,Gemma 4 接近「競賽選手」。

Apache 2.0:比跑分更重要的改變

很多人關注跑分,但 VentureBeat 說得好:「授權的改變可能比跑分更重要。」

Gemma 3(舊授權)

  • Google 自訂條款
  • 商用需額外審核
  • 部分用途受限
  • 企業法務需逐條評估
  • 不符 OSI 開源定義

Gemma 4(Apache 2.0)

  • 業界標準開源授權
  • 完全自由商用
  • 可修改、再分發
  • 企業法務一看就懂
  • 符合數位主權要求

為什麼這很重要?三個原因:

Apache 2.0 的戰略意義

1
企業採用門檻歸零。之前 Gemma 的自訂授權讓很多企業法務部門卻步。Apache 2.0 是最被理解、最被信任的開源授權之一。企業可以直接用,不用找律師。
2
數位主權。歐盟、各國政府越來越要求 AI 模型的「數據主權」和「模型可控性」。Apache 2.0 意味著你可以完全控制模型——在自己的硬體上跑、用自己的數據微調、部署在自己的基礎設施上。INSAIT 已經用 Gemma 建了保加利亞語言模型 BgGPT。
3
生態系護城河。Google 的策略不是靠模型本身賺錢,而是靠生態系。Gemma 已經有超過 10 萬個社群變體、4 億次下載。Apache 2.0 會進一步加速這個飛輪——更多人用 Gemma,更多人在 Google Cloud 上跑 Gemma,更多人用 Google 的工具鏈。

Google 的真正對手不是 OpenAI

在開源賽道上,Google 的對手是 Meta(Llama)、Mistral、DeepSeek。Meta 的 Llama 用的是自訂授權(有商用限制),Mistral 的模型授權條件也在收緊。Google 選擇 Apache 2.0,是在說:「我們比任何人都開放。」這是一場搶奪開發者心智的戰爭——誰的模型被最多人用、最多人微調、最多人部署,誰就贏了。

本地 AI Agent:從「能跑」到「能用」

每隔幾個月就有人說「這個模型可以在本地跑了!」然後細看:需要 80GB VRAM,或者每秒只能吐 2 個 token,風扇聲像起飛。

Gemma 4 26B A4B 不一樣。消費級 24GB GPU + Q4 量化,就能得到:

  • 原生 function calling——結構化 JSON 輸出,直接接你的 API
  • 可切換的 thinking mode——需要深思熟慮時開,需要速度時關
  • 256K context window——可以把整個 repo 丟進去
  • 多步驟推理穩定——不會在第三步開始亂講
  • Day-1 生態支援——Ollama、LM Studio、llama.cpp、MLX 都能直接跑

社群的反饋很有意思。有人在 M5 MacBook 上跑 26B-A4B + Opencode,說「actually good」——在本地 AI 的世界裡,這幾乎是最高評價了。不是「還行」,不是「堪用」,而是「真的好用」。

社群反應:讚嘆與翻車並存

Gemma 4 發布後 24 小時的社群反應很有代表性——既展現了開源 AI 的力量,也暴露了它的脆弱:

正面反應

  • Arena AI 文字排名全球開源第 3/第 6
  • M5 MacBook 跑 26B-A4B 效果好
  • 「第一次覺得本地 Agent 能用」
  • Apache 2.0 讓企業採用無障礙
  • 多模態在小模型上表現驚人
vs

問題與爭議

  • Unsloth + llama.cpp 相容性壞掉
  • 安全防護 90 分鐘內被 Heretic ARA 破解
  • 趨勢媒體指出落後中國競爭對手
  • 跑分來自論文,實際使用需驗證
  • E2B/E4B 複雜推理仍有明顯上限

90 分鐘破解安全防護

Gemma 4 發布後不到 90 分鐘,Heretic 團隊就用新的 ARA(Adversarial Robustness Assessment)方法突破了模型的安全對齊。這不是 Gemma 特有的問題——幾乎所有開源模型都面臨同樣的困境。但它再次提醒:開源模型的安全防護本質上是「君子鎖」,擋得住意外,擋不住蓄意。

誰該關注?

按身份對號入座

1
獨立開發者 / Maker。26B A4B 是你的首選。在自己的 GPU 上跑一個能用的 Agent,接 API、操作工具、多步推理。不用付 API 費用,不用擔心速率限制。用 Ollama 或 LM Studio 幾分鐘就能跑起來。
2
企業 / 新創。Apache 2.0 讓你可以放心把 Gemma 4 整合到產品裡。31B 用來微調做垂直場景(醫療、法律、金融),26B MoE 用來跑成本敏感的推理服務。不需要依賴任何一家 API 供應商。
3
研究者。31B Dense 是微調和實驗的理想基底。256K context、多模態、thinking mode——這些都是開箱即用的。Yale 已經用 Gemma 做癌症治療路徑的研究。
4
行動開發者。E2B/E4B 專為手機和邊緣設備設計。Android 開發者可以在 AICore Developer Preview 中使用,為未來的 Gemini Nano 4 做準備。離線 AI、零延遲、電池友善。

結語:開源 AI 的 iPhone 時刻?

過度吹捧很容易,所以讓我們誠實地說:

Gemma 4 不是最強的 AI 模型——Claude Opus、GPT-5 在絕對能力上仍然領先。
Gemma 4 不是完美的——安全防護脆弱、部分工具鏈相容性問題、小模型仍有推理上限。

但 Gemma 4 做到了一件前所未有的事:讓「在自己的硬體上跑一個真正能用的 AI Agent」從願景變成現實。

三個值得記住的數字

3.8B——一個 26B 模型只用 3.8B 參數就能跑出全球第 6 的成績。MoE 讓智力和成本脫鉤。

89%——AIME 數學從 20% 到 89%。這不是同一代產品,這是跨世代的躍升。

Apache 2.0——從限制性授權到完全開源。當 Meta 和 Mistral 在授權上越來越保守,Google 選擇了相反的方向。這可能是比跑分更深遠的決定。

Google 說 Gemma 的社群已經有超過 10 萬個模型變體。Gemma 4 + Apache 2.0,這個數字只會加速增長。

開源 AI 的遊戲規則,正在被重寫。

← 返回 AI 知識庫