新一代開源權重、原生多模態模型家族 —— 涵蓋 dense(2.3B–31B)與一顆 26B-A4B 的 Mixture-of-Experts,主打運算效率與推理能力。等效 2.3B 的 E2B 在推理題上勝過去年的 Gemma 3 27B;31B dense 模型則登上 LMArena,成為當時領先的 dense 開源模型。
前沿能力持續集中在封閉的巨型模型手上。Gemma 4 的主張是:你可以在「單一模型家族」裡同時做到開源權重、原生多模態、擅長推理,而且小到能塞進手機。
開源社群長期面對一個三難困境:模型不是(a)能力強但封閉,就是(b)開源但只支援文字,或者(c)開源且多模態但推理能力遠遠落後。Gemma 4 想把這個 trade-off 直接打破 —— 讓多模態成為原生設計(而非外掛),透過「thinking mode(思考模式)」推高推理能力,並在每一個尺寸都以「端側部署」為前提做量化感知訓練。
每個尺寸都在同一個堆疊裡處理文字、影像、語音,而不是文字模型外掛 adapter。
回答前先產生推理軌跡,帶來大幅 STEM/coding 提升;31B 在 LMArena 上領先所有 dense 開源模型。
E2B 量化後 <1 GB;整個家族從手機一路涵蓋到單卡伺服器。
核心宣稱:等效參數僅 2.3B 的 E2B 在推理題(AIME 2026、LiveCodeBench)上勝過 Gemma 3 27B —— 即便等效參數約少了 10 倍;而 31B dense 模型在 LMArena 拿到 Elo 1451,是發布當時(2026 年 6 月)領先的 dense 開源模型。
五個 checkpoint 橫跨兩個數量級:兩個為端側而生的「等效」小模型、兩個中大型 dense 模型,以及一顆只啟用一小部分權重的稀疏 MoE。
| 模型 | 等效 | 總參數 | 啟用參數 | 視覺編碼器 | 語音編碼器 |
|---|---|---|---|---|---|
| E2B | 2.3B | 5B | 2.3B | 150M | 305M |
| E4B | 4.5B | 8B | 4.5B | 150M | 305M |
| 12B | 12B | 12B | 12B | 550M | encoder-free |
| 26B-A4B (MoE) | — | 26B | 3.8B | 550M | 305M |
| 31B | 31B | 31B | 31B | 550M | 305M |
「等效」參數(E2B/E4B)沿用 Gemma 3n 的 MatFormer 巢狀模型概念:訓練一個較大的網路(總 5B/8B),但設計成可以「切」出一個較小的子網路(等效 2.3B/4.5B)供端側推理使用。26B-A4B MoE 則儲存 26B 總參數,但每個 token 只路由到總計 3.8B 啟用參數的專家 —— 用小模型的推理成本,換接近前沿的品質。
兩欄數字要分清楚。「總參數」是你要存的量;「啟用參數」是每個 token 實際跑的量。MoE 的賣點是兩者落差大(存 26B、只跑 3.8B);E-系列的賣點則是相反的把戲 —— 同一個 checkpoint 能在推理時被縮小。
decoder-only Transformer,搭配如今標配的 Gemma 堆疊 —— RMSNorm、QK-norm、RoPE、MQA 式 KV 共享 —— 再加上 local/global 交錯注意力來壓小 KV cache,以及輕量的原生視覺/語音編碼器。
Gemma 4 交錯堆疊 local 滑動視窗與 global 注意力層,比例為 E2B 4:1、其他尺寸 5:1 —— 每一層 global 前面搭配四到五層便宜的 local。global 層採用 pp-RoPE(p=0.25)、base 頻率 1M;local 層則用標準 RoPE、頻率 10k。再配合跨層群組的 KV-cache 共享,把 global KV cache 縮小約 37.5% —— 這是壓低長上下文記憶體佔用的主要槓桿。
影像經過 SigLIP 式視覺編碼器(E2B/E4B 為 150M,12B/31B 為 550M),patch size 16,最高解析度輸出最多 1120 個 token(並提供 70/140/280/560/1120 的 token 分級,做成本/品質取捨)。語音採用 USM 式編碼器(2 層降採樣卷積 + 12 層 Conformer),縮小到 305M —— 比 Gemma 3n 的 680M 減少 55%。而 12B 是「encoder-free」:直接把 16 kHz 下的原始 40 ms 音訊片段(以及影像 patch)透過投影餵進模型,完全省掉獨立編碼器。
採用 262k 詞條的 SentencePiece tokenizer(拆分數字、保留空白、byte-level fallback),與 Gemini 系列共用,確保多語言與程式碼的覆蓋度。
在 TPU v5p/v6e 上進行大規模多模態預訓練,接著以類似 Gemma 3 的 post-training 加入「thinking mode」,再用量化感知訓練(QAT)讓釋出的權重能扛住激進的端側量化。
由網頁文件、程式碼、影像、語音組成的大規模多樣化混合資料,知識截止於 2025 年 1 月。資料經過個資、不安全內容與重複項的過濾。
指令微調沿用與 Gemma 3 類似的做法。最關鍵的新增:模型能在回答前先輸出一段推理軌跡,由控制 token(例如 <|think|>)開關 —— 這正是大幅 STEM/coding 提升的來源。
模型被訓練成能容忍量化:行動端用 int2/int4 權重搭配 int8 activation,桌面端用 Q4_0 blockwise —— 這樣小型量化 checkpoint 的品質才不會崩掉。
一個 multi-token-prediction 的 drafter 透過 cross-attention 讀取主模型的 KV cache,不需另外的草稿模型即可加速投機解碼。
| 模型 | TPU | 晶片數 | Data shards | Seq shards | Replicas |
|---|---|---|---|---|---|
| E2B | v6e | 4,096 | 16 | 8 | 32 |
| E4B | v6e | 6,144 | 16 | 16 | 24 |
| 12B | v5p | 12,288 | 16 | 16 | 48 |
| 26B-A4B | v6e | 6,144 | 16 | 16 | 24 |
| 31B | v6e | 10,240 | 16 | 16 | 40 |
揭露不足之處:報告未公開各模型的總訓練 token 數,post-training 也未點名所用的 RL/RLHF 演算法 —— 只指回 Gemma 3 的配方,而非完整重新交代。
以下數字皆為指令微調模型在 thinking mode 下的表現。故事很一致:每個 Gemma 4 尺寸都輾壓對應的 Gemma 3 級別,而推理密集的 benchmark(AIME、Codeforces、GPQA)提升幅度最大。
| Benchmark | 31B | 26B-A4B | 12B | E4B | E2B | Gemma 3 27B |
|---|---|---|---|---|---|---|
| MMLU-Pro | 85.2 | 82.6 | 77.2 | 69.4 | 60.0 | 67.6 |
| AIME 2026(無工具) | 89.2 | 88.3 | 77.5 | 42.5 | 37.5 | 20.8 |
| LiveCodeBench v6 | 80.0 | 77.1 | 72.0 | 52.0 | 44.0 | 29.1 |
| Codeforces(Elo) | 2150 | 1718 | 1659 | 940 | 633 | 110 |
| GPQA Diamond | 84.3 | 82.3 | 78.8 | 58.6 | 43.4 | 42.4 |
| IFEval | 98.9 | 98.5 | 97.2 | 96.7 | 94.6 | 90.4 |
E2B 的故事,講清楚一點:在 MMLU-Pro 上,2.3B 的 E2B(60.0)其實仍輸給 Gemma 3 27B(67.6)。但在推理上 —— AIME 37.5 對 20.8、LiveCodeBench 44.0 對 29.1、Codeforces 633 對 110 —— 這顆小模型壓倒性勝出。真正扛起提升的是 thinking mode,而不是參數規模。
| Benchmark | 31B | 26B-A4B | 12B | E4B | E2B |
|---|---|---|---|---|---|
| MMMU-Pro | 76.9 | 73.8 | 69.1 | 52.6 | 44.2 |
| MATH-Vision | 85.6 | 82.4 | 79.7 | 59.5 | 52.4 |
| InfographicVQA | 92.0 | 89.3 | 88.4 | 70.0 | 63.9 |
38.2
平均 CorpusBLEU 翻譯 · 較 Gemma 3n +10%
35.4
平均 CorpusBLEU · 較 Gemma 3n +12%
0.075
12 語言平均 WER · 越低越好(E2B 為 0.090)
encoder-free 的 12B 把語音再往前推 —— CoVoST 約 ~43 CorpusBLEU、FLEURS 約 ~0.061 WER —— 顯示拿掉專屬語音編碼器並沒有犧牲準確度。
| Benchmark | 上下文 | 31B | 26B-A4B | 12B | E4B |
|---|---|---|---|---|---|
| RULER | 32k | 96.8 | 97.3 | 96.4 | 95.2 |
| RULER | 128k | 96.4 | 89.8 | 91.2 | 86.6 |
| LOFT 文字檢索 | 128k | 79.5 | 66.3 | 66.4 | 58.5 |
RULER 在 32k 時各尺寸都接近滿分。到了 128k,dense 31B 撐得最好(96.4),較小與稀疏模型退化較明顯 —— 而 128k 的 LOFT 檢索正是尺寸差距拉最開的地方。
1451
Elo ±8 · 排名 #43 · 領先的 dense 開源模型(2026 年 6 月)
1438
Elo · 排名 #61 · 僅 3.8B 啟用參數就有前沿品質
「為端側而共同設計」是貫穿全篇的主軸:QAT 量化後的 checkpoint 小到 E2B 能塞進 1 GB 以內,整個家族從手機一路擴展到單張加速卡。
| 模型 | bf16 | 量化後 | + KV cache |
|---|---|---|---|
| E2B | 4.6 | 0.8 † | +0.05 |
| E4B | 9.0 | 2.3 † | +0.14 |
| 12B | 24.0 | 7.65 ‡ | +0.28 |
| 31B | 64.0 | 19.2 ‡ | +1.10 |
† 行動端量化(int2/int4 權重,int8 activation) ‡ Q4_0 blockwise,32k 上下文
端側的關鍵句:QAT 的 E2B checkpoint 是 0.8 GB 權重 + 0.05 GB KV cache —— 一個具推理能力的多模態模型,能舒服地放進手機 RAM。而在頂端,31B 從 64 GB(bf16)量化到 19.2 GB,落入單卡的記憶體範圍。
報告對於「哪些沒揭露」相當坦白,並在釋出的同時附上號稱優於 Gemma 3 的安全評估。
訓練細節不足:未公開各模型的總預訓練 token 數,post-training 也只指回 Gemma 3、未點名 RL 演算法或 thinking-mode 訓練流程 —— 因此僅憑報告本身無法精確重現。
小模型的退化:thinking mode 在推理上的提升很戲劇化,但 E-系列在廣泛知識(MMLU-Pro)上仍落後,且在 128k 長上下文檢索(LOFT)相較 31B 掉得很快。
知識截止:2025 年 1 月的知識截止,意味著模型對該日期之後的事件沒有原生知識。
團隊表示安全評估是在未加過濾器的情況下進行,針對移除 CSAM、危險/露骨內容、仇恨言論與騷擾,並過濾個資與敏感資料。他們的主打結論:Gemma 4 在安全指標上顯著優於 Gemma 3/3n,定位為在開放性與可預見風險之間取得平衡。模型以開源權重形式、採 Apache 2.0 授權釋出。
為什麼重要:Gemma 4 是「開源三難困境正在鬆動」的一個數據點 —— 手機尺寸的模型如今能推理,單卡的 dense 模型能在開源人類偏好榜上領先。它打開的有趣前沿是「小模型的 thinking mode」:這裡的大部分提升來自推理軌跡,而非單純把規模堆大。