實際活躍參數
數學推理
Arena AI 排名
累計下載次數
四款模型,各司其職
Gemma 4 不是「一個模型」,而是一個針對不同硬體精確定位的家族。從你口袋裡的手機,到桌上的筆電,到書房的 GPU,到機房的伺服器——每一層都有對應的選擇。
E2B
手機、IoT、Raspberry Pi。體積最小,支援文字 + 圖片 + 音訊輸入。離線跑,零延遲。
E4B
筆電、輕量 GPU。比 E2B 更強的推理能力,同樣支援多模態 + 音訊。適合本地開發和實驗。
26B A4B(MoE)
消費級 GPU(24GB)。只啟用 3.8B 參數就達到 26B 的智力。原生 function calling,第一個在消費硬體上真正可用的 Agent 模型。
31B Dense
工作站、伺服器(80GB H100)。全球開源第 3。最大原始品質,微調的最佳基底。
所有模型都支援:圖片/影片輸入、function calling、結構化 JSON 輸出、可切換的思維鏈(thinking mode)、原生系統指令、140+ 語言。E2B 和 E4B 額外支援音訊輸入——在這個大小的模型裡非常罕見。
MoE 的魔法:為什麼 3.8B 能打 26B?
傳統模型是「全員出動」——每次推理,所有參數都要跑一遍。26B 的模型就要付 26B 的運算成本。但 Gemma 4 的 26B A4B 不是這樣。
Mixture of Experts(MoE)怎麼運作
這就像一間有 128 位專科醫師的醫院。病人來了不需要 128 位同時看診——路由器判斷症狀,叫 8 位最相關的會診就好。醫院的「知識」是 128 位的總和,但每次看診的「成本」只有 8 位。
為什麼這次特別重要?
MoE 不是新技術(Mixtral 早就在用了),但 Gemma 4 的突破在於效率和品質的平衡點。以往 MoE 模型在消費級硬體上要嘛太慢、要嘛推理品質不穩。Gemma 4 26B A4B 用 Q4 量化可以跑在 24GB GPU 上,Arena AI 分數 1441(全球第 6),而且多步驟推理不會「跑題」——這是之前本地模型的痛點。社群的說法是:「第一次覺得本地 AI Agent 真的能用。」
跑分暴漲:不是漸進,是跨代
Gemma 3 已經是優秀的開源模型。但 Gemma 4 的提升不是「好一點」,而是「換了一個等級」:
| Benchmark | Gemma 3 27B | Gemma 4 31B | Gemma 4 26B MoE |
|---|---|---|---|
| Arena AI(文字) | 1365 | 1452 | 1441 |
| AIME 2026(數學) | 20.8% | 89.2% ↑ | 88.3% ↑ |
| LiveCodeBench v6(程式) | 29.1% | 80.0% ↑ | 77.1% ↑ |
| GPQA Diamond(科學) | 42.4% | 84.3% | 82.3% |
| MMLU 多語言(問答) | 67.6% | 85.2% | 82.6% |
| τ2-bench(Agent 工具使用) | 6.6% | 86.4% ↑ | 85.5% ↑ |
注意最後一行——Agent 工具使用(τ2-bench):從 6.6% 到 86.4%。這意味著 Gemma 3 幾乎不會使用工具,而 Gemma 4 已經能可靠地在工作流中呼叫函式、操作 API。這是「能不能跑 Agent」的分水嶺。
另一個驚人的數字是 AIME 數學,從 20% 到 89%。這不是同一個等級的模型——Gemma 3 在數學上大約是「高中生」,Gemma 4 接近「競賽選手」。
Apache 2.0:比跑分更重要的改變
很多人關注跑分,但 VentureBeat 說得好:「授權的改變可能比跑分更重要。」
Gemma 3(舊授權)
- Google 自訂條款
- 商用需額外審核
- 部分用途受限
- 企業法務需逐條評估
- 不符 OSI 開源定義
Gemma 4(Apache 2.0)
- 業界標準開源授權
- 完全自由商用
- 可修改、再分發
- 企業法務一看就懂
- 符合數位主權要求
為什麼這很重要?三個原因:
Apache 2.0 的戰略意義
Google 的真正對手不是 OpenAI
在開源賽道上,Google 的對手是 Meta(Llama)、Mistral、DeepSeek。Meta 的 Llama 用的是自訂授權(有商用限制),Mistral 的模型授權條件也在收緊。Google 選擇 Apache 2.0,是在說:「我們比任何人都開放。」這是一場搶奪開發者心智的戰爭——誰的模型被最多人用、最多人微調、最多人部署,誰就贏了。
本地 AI Agent:從「能跑」到「能用」
每隔幾個月就有人說「這個模型可以在本地跑了!」然後細看:需要 80GB VRAM,或者每秒只能吐 2 個 token,風扇聲像起飛。
Gemma 4 26B A4B 不一樣。消費級 24GB GPU + Q4 量化,就能得到:
- 原生 function calling——結構化 JSON 輸出,直接接你的 API
- 可切換的 thinking mode——需要深思熟慮時開,需要速度時關
- 256K context window——可以把整個 repo 丟進去
- 多步驟推理穩定——不會在第三步開始亂講
- Day-1 生態支援——Ollama、LM Studio、llama.cpp、MLX 都能直接跑
社群的反饋很有意思。有人在 M5 MacBook 上跑 26B-A4B + Opencode,說「actually good」——在本地 AI 的世界裡,這幾乎是最高評價了。不是「還行」,不是「堪用」,而是「真的好用」。
社群反應:讚嘆與翻車並存
Gemma 4 發布後 24 小時的社群反應很有代表性——既展現了開源 AI 的力量,也暴露了它的脆弱:
正面反應
- Arena AI 文字排名全球開源第 3/第 6
- M5 MacBook 跑 26B-A4B 效果好
- 「第一次覺得本地 Agent 能用」
- Apache 2.0 讓企業採用無障礙
- 多模態在小模型上表現驚人
問題與爭議
- Unsloth + llama.cpp 相容性壞掉
- 安全防護 90 分鐘內被 Heretic ARA 破解
- 趨勢媒體指出落後中國競爭對手
- 跑分來自論文,實際使用需驗證
- E2B/E4B 複雜推理仍有明顯上限
90 分鐘破解安全防護
Gemma 4 發布後不到 90 分鐘,Heretic 團隊就用新的 ARA(Adversarial Robustness Assessment)方法突破了模型的安全對齊。這不是 Gemma 特有的問題——幾乎所有開源模型都面臨同樣的困境。但它再次提醒:開源模型的安全防護本質上是「君子鎖」,擋得住意外,擋不住蓄意。
誰該關注?
按身份對號入座
結語:開源 AI 的 iPhone 時刻?
過度吹捧很容易,所以讓我們誠實地說:
Gemma 4 不是最強的 AI 模型——Claude Opus、GPT-5 在絕對能力上仍然領先。
Gemma 4 不是完美的——安全防護脆弱、部分工具鏈相容性問題、小模型仍有推理上限。
但 Gemma 4 做到了一件前所未有的事:讓「在自己的硬體上跑一個真正能用的 AI Agent」從願景變成現實。
三個值得記住的數字
3.8B——一個 26B 模型只用 3.8B 參數就能跑出全球第 6 的成績。MoE 讓智力和成本脫鉤。
89%——AIME 數學從 20% 到 89%。這不是同一代產品,這是跨世代的躍升。
Apache 2.0——從限制性授權到完全開源。當 Meta 和 Mistral 在授權上越來越保守,Google 選擇了相反的方向。這可能是比跑分更深遠的決定。
Google 說 Gemma 的社群已經有超過 10 萬個模型變體。Gemma 4 + Apache 2.0,這個數字只會加速增長。
開源 AI 的遊戲規則,正在被重寫。