Technical Report · 2026 · Google DeepMind · 論文導讀

Gemma 4

新一代開源權重、原生多模態模型家族 —— 涵蓋 dense(2.3B–31B)與一顆 26B-A4B 的 Mixture-of-Experts,主打運算效率與推理能力。等效 2.3B 的 E2B 在推理題上勝過去年的 Gemma 3 27B;31B dense 模型則登上 LMArena,成為當時領先的 dense 開源模型。

開源權重 原生多模態 MoE 26B-A4B Thinking Mode 端側 QAT 量化 文字 · 影像 · 語音

Gemma Team, Google DeepMind · arXiv:2607.02770 · 17 頁技術報告,2026 年 7 月 2 日投稿

SECTION 01

問題定義 —— 開源、多模態、又要小巧

前沿能力持續集中在封閉的巨型模型手上。Gemma 4 的主張是:你可以在「單一模型家族」裡同時做到開源權重、原生多模態、擅長推理,而且小到能塞進手機。

開源社群長期面對一個三難困境:模型不是(a)能力強但封閉,就是(b)開源但只支援文字,或者(c)開源且多模態但推理能力遠遠落後。Gemma 4 想把這個 trade-off 直接打破 —— 讓多模態成為原生設計(而非外掛),透過「thinking mode(思考模式)」推高推理能力,並在每一個尺寸都以「端側部署」為前提做量化感知訓練。

原生多模態

每個尺寸都在同一個堆疊裡處理文字、影像、語音,而不是文字模型外掛 adapter。

推理躍進

回答前先產生推理軌跡,帶來大幅 STEM/coding 提升;31B 在 LMArena 上領先所有 dense 開源模型。

到處都能跑

E2B 量化後 <1 GB;整個家族從手機一路涵蓋到單卡伺服器。

核心宣稱:等效參數僅 2.3B 的 E2B 在推理題(AIME 2026、LiveCodeBench)上勝過 Gemma 3 27B —— 即便等效參數約少了 10 倍;而 31B dense 模型在 LMArena 拿到 Elo 1451,是發布當時(2026 年 6 月)領先的 dense 開源模型。

SECTION 02

模型家族

五個 checkpoint 橫跨兩個數量級:兩個為端側而生的「等效」小模型、兩個中大型 dense 模型,以及一顆只啟用一小部分權重的稀疏 MoE。

Table 1 · Gemma 4 模型家族(參數、啟用量、編碼器)
模型等效總參數啟用參數視覺編碼器語音編碼器
E2B2.3B5B2.3B150M305M
E4B4.5B8B4.5B150M305M
12B12B12B12B550Mencoder-free
26B-A4B (MoE)26B3.8B550M305M
31B31B31B31B550M305M

「等效」參數(E2B/E4B)沿用 Gemma 3n 的 MatFormer 巢狀模型概念:訓練一個較大的網路(總 5B/8B),但設計成可以「切」出一個較小的子網路(等效 2.3B/4.5B)供端側推理使用。26B-A4B MoE 則儲存 26B 總參數,但每個 token 只路由到總計 3.8B 啟用參數的專家 —— 用小模型的推理成本,換接近前沿的品質。

兩欄數字要分清楚。「總參數」是你要存的量;「啟用參數」是每個 token 實際跑的量。MoE 的賣點是兩者落差大(存 26B、只跑 3.8B);E-系列的賣點則是相反的把戲 —— 同一個 checkpoint 能在推理時被縮小

SECTION 03

架構

decoder-only Transformer,搭配如今標配的 Gemma 堆疊 —— RMSNorm、QK-norm、RoPE、MQA 式 KV 共享 —— 再加上 local/global 交錯注意力來壓小 KV cache,以及輕量的原生視覺/語音編碼器。

注意力:以 local 為主的交錯設計

Gemma 4 交錯堆疊 local 滑動視窗global 注意力層,比例為 E2B 4:1其他尺寸 5:1 —— 每一層 global 前面搭配四到五層便宜的 local。global 層採用 pp-RoPE(p=0.25)、base 頻率 1M;local 層則用標準 RoPE、頻率 10k。再配合跨層群組的 KV-cache 共享,把 global KV cache 縮小約 37.5% —— 這是壓低長上下文記憶體佔用的主要槓桿。

一個重複區塊(5:1 範例): Local RoPE 10k Local Local Local Local Global pp-RoPE 1M local 群組共享 KV cache → global KV cache 縮小約 37.5% 每個 global 層前,4(E2B)或 5 層 local 共享 KV
圖 1 · local/global 交錯注意力區塊(示意,依架構章節重繪)

原生編碼器 —— 視覺與語音

影像經過 SigLIP 式視覺編碼器(E2B/E4B 為 150M,12B/31B 為 550M),patch size 16,最高解析度輸出最多 1120 個 token(並提供 70/140/280/560/1120 的 token 分級,做成本/品質取捨)。語音採用 USM 式編碼器(2 層降採樣卷積 + 12 層 Conformer),縮小到 305M —— 比 Gemma 3n 的 680M 減少 55%。而 12B 是「encoder-free」:直接把 16 kHz 下的原始 40 ms 音訊片段(以及影像 patch)透過投影餵進模型,完全省掉獨立編碼器。

Tokenizer

採用 262k 詞條的 SentencePiece tokenizer(拆分數字、保留空白、byte-level fallback),與 Gemini 系列共用,確保多語言與程式碼的覆蓋度。

SECTION 04

訓練配方

在 TPU v5p/v6e 上進行大規模多模態預訓練,接著以類似 Gemma 3 的 post-training 加入「thinking mode」,再用量化感知訓練(QAT)讓釋出的權重能扛住激進的端側量化。

多模態預訓練

由網頁文件、程式碼、影像、語音組成的大規模多樣化混合資料,知識截止於 2025 年 1 月。資料經過個資、不安全內容與重複項的過濾。

Post-training + thinking mode

指令微調沿用與 Gemma 3 類似的做法。最關鍵的新增:模型能在回答前先輸出一段推理軌跡,由控制 token(例如 <|think|>)開關 —— 這正是大幅 STEM/coding 提升的來源。

量化感知訓練(QAT)

模型被訓練成能容忍量化:行動端用 int2/int4 權重搭配 int8 activation,桌面端用 Q4_0 blockwise —— 這樣小型量化 checkpoint 的品質才不會崩掉。

MTP drafter 做投機解碼

一個 multi-token-prediction 的 drafter 透過 cross-attention 讀取主模型的 KV cache,不需另外的草稿模型即可加速投機解碼。

Table 2 · 訓練基礎設施(TPU 世代與晶片數)
模型TPU晶片數Data shardsSeq shardsReplicas
E2Bv6e4,09616832
E4Bv6e6,144161624
12Bv5p12,288161648
26B-A4Bv6e6,144161624
31Bv6e10,240161640

揭露不足之處:報告未公開各模型的總訓練 token 數,post-training 也未點名所用的 RL/RLHF 演算法 —— 只指回 Gemma 3 的配方,而非完整重新交代。

SECTION 05

實驗結果

以下數字皆為指令微調模型在 thinking mode 下的表現。故事很一致:每個 Gemma 4 尺寸都輾壓對應的 Gemma 3 級別,而推理密集的 benchmark(AIME、Codeforces、GPQA)提升幅度最大。

文字與推理

Table 5 · 文字 benchmark —— Gemma 4(thinking)vs Gemma 3 27B
Benchmark31B26B-A4B12BE4BE2BGemma 3 27B
MMLU-Pro85.282.677.269.460.067.6
AIME 2026(無工具)89.288.377.542.537.520.8
LiveCodeBench v680.077.172.052.044.029.1
Codeforces(Elo)215017181659940633110
GPQA Diamond84.382.378.858.643.442.4
IFEval98.998.597.296.794.690.4

E2B 的故事,講清楚一點:在 MMLU-Pro 上,2.3B 的 E2B(60.0)其實仍輸給 Gemma 3 27B(67.6)。但在推理上 —— AIME 37.5 對 20.8、LiveCodeBench 44.0 對 29.1、Codeforces 633 對 110 —— 這顆小模型壓倒性勝出。真正扛起提升的是 thinking mode,而不是參數規模。

視覺

Table 6 · 視覺 benchmark(最高 1120 影像 token)
Benchmark31B26B-A4B12BE4BE2B
MMMU-Pro76.973.869.152.644.2
MATH-Vision85.682.479.759.552.4
InfographicVQA92.089.388.470.063.9

語音

CoVoST(E4B)

38.2

平均 CorpusBLEU 翻譯 · 較 Gemma 3n +10%

CoVoST(E2B)

35.4

平均 CorpusBLEU · 較 Gemma 3n +12%

FLEURS ASR(E4B)

0.075

12 語言平均 WER · 越低越好(E2B 為 0.090)

encoder-free 的 12B 把語音再往前推 —— CoVoST 約 ~43 CorpusBLEU、FLEURS 約 ~0.061 WER —— 顯示拿掉專屬語音編碼器並沒有犧牲準確度。

長上下文

Table 9 · 長上下文(不使用 thinking)
Benchmark上下文31B26B-A4B12BE4B
RULER32k96.897.396.495.2
RULER128k96.489.891.286.6
LOFT 文字檢索128k79.566.366.458.5

RULER 在 32k 時各尺寸都接近滿分。到了 128k,dense 31B 撐得最好(96.4),較小與稀疏模型退化較明顯 —— 而 128k 的 LOFT 檢索正是尺寸差距拉最開的地方。

人類偏好(LMArena)

Gemma 4 31B

1451

Elo ±8 · 排名 #43 · 領先的 dense 開源模型(2026 年 6 月)

Gemma 4 26B-A4B

1438

Elo · 排名 #61 · 僅 3.8B 啟用參數就有前沿品質

SECTION 06

效率與部署

「為端側而共同設計」是貫穿全篇的主軸:QAT 量化後的 checkpoint 小到 E2B 能塞進 1 GB 以內,整個家族從手機一路擴展到單張加速卡。

Table 3 · 記憶體佔用(GB)—— bf16 vs 量化,再加 KV cache
模型bf16量化後+ KV cache
E2B4.60.8 †+0.05
E4B9.02.3 †+0.14
12B24.07.65 ‡+0.28
31B64.019.2 ‡+1.10

† 行動端量化(int2/int4 權重,int8 activation)  ‡ Q4_0 blockwise,32k 上下文

端側的關鍵句:QAT 的 E2B checkpoint 是 0.8 GB 權重 + 0.05 GB KV cache —— 一個具推理能力的多模態模型,能舒服地放進手機 RAM。而在頂端,31B 從 64 GB(bf16)量化到 19.2 GB,落入單卡的記憶體範圍。

SECTION 07

限制與安全

報告對於「哪些沒揭露」相當坦白,並在釋出的同時附上號稱優於 Gemma 3 的安全評估。

訓練細節不足:未公開各模型的總預訓練 token 數,post-training 也只指回 Gemma 3、未點名 RL 演算法或 thinking-mode 訓練流程 —— 因此僅憑報告本身無法精確重現。

小模型的退化:thinking mode 在推理上的提升很戲劇化,但 E-系列在廣泛知識(MMLU-Pro)上仍落後,且在 128k 長上下文檢索(LOFT)相較 31B 掉得很快。

知識截止:2025 年 1 月的知識截止,意味著模型對該日期之後的事件沒有原生知識。

安全與責任

團隊表示安全評估是在未加過濾器的情況下進行,針對移除 CSAM、危險/露骨內容、仇恨言論與騷擾,並過濾個資與敏感資料。他們的主打結論:Gemma 4 在安全指標上顯著優於 Gemma 3/3n,定位為在開放性與可預見風險之間取得平衡。模型以開源權重形式、採 Apache 2.0 授權釋出。

為什麼重要:Gemma 4 是「開源三難困境正在鬆動」的一個數據點 —— 手機尺寸的模型如今能推理,單卡的 dense 模型能在開源人類偏好榜上領先。它打開的有趣前沿是「小模型的 thinking mode」:這裡的大部分提升來自推理軌跡,而非單純把規模堆大。