Google 為 Gemma 4 推出 MTP drafters!推論最高加速 3 倍且不犧牲品質

Google 為 Gemma 4 推出 Multi-Token Prediction MTP drafters

Google 近日為 Gemma 4 模型家族推出 Multi-Token Prediction(MTP)drafters,主打在不犧牲輸出品質與推理準確度的前提下,讓文字生成推論速度最高提升 3 倍。根據 AlternativeTo 與 Google 官方說明,這項更新鎖定大型語言模型常見的「一次生成一個 token」瓶頸,透過較小的 drafter model 先預測多個後續 token,再由主要模型一次驗證,藉此降低延遲並提高硬體利用率。

Gemma 4 MTP speculative decoding 推論加速架構

MTP 讓小模型先草擬,多個 token 一次驗證

傳統自回歸生成通常必須逐 token 前進,每一步都要重新讀取大量模型權重,容易受到記憶體頻寬限制。Google 這次採用的 MTP 可視為更高效率的 speculative decoding:輕量 drafter 先提出數個候選 token,Gemma 4 目標模型再以單次 forward pass 進行並行驗證。若候選內容正確,就能一次接受多個 token;若其中某個 token 被拒絕,目標模型仍會產生該位置的正確 token,讓流程繼續推進。

官方強調品質不變,但實際加速仍看硬體與批次

Google AI for Developers 文件指出,Gemma 4 的 drafter 並非完全獨立的小模型,而是共享目標模型的 input embedding table,並建立在目標模型最後一層 activations 之上,因此可在保證與標準自回歸生成相同品質的情況下提高解碼速度。不過,這不代表所有環境都能固定達到 3 倍。文件也提醒,像 Gemma 4 26B A4B 這類 Mixture of Experts(MoE)模型,在 batch size 1 或硬體平行度不足時,可能因專家權重載入成本而抵銷部分收益;較高 batch size 則較容易重用權重並展現加速效果。

對本機 AI 與低延遲應用更有吸引力

這項更新對本機 AI、邊緣裝置與互動式應用特別重要。Google 官方部落格提到,MTP drafters 可支援 near real-time chat、語音互動、agentic workflows,以及 consumer GPU 或手機端部署。對使用者而言,生成速度提升代表聊天、摘要、程式碼輔助與即時助理體驗更接近「立即回應」;對開發者而言,若同樣硬體能處理更多 token 或更多請求,也可能降低雲端推論成本。

開放權重與生態系支援是關鍵

Google 表示,Gemma 4 MTP drafters 以 Apache 2.0 license 釋出,權重可在 Hugging Face 與 Kaggle 取得,並支援 transformers、MLX、vLLM、SGLang 與 Ollama 等工具鏈。這讓開發者能依照硬體條件選擇部署方式,而不只停留在研究展示。MarkTechPost 與 The Decoder 也都指出,這次更新的意義不只是「模型變快」,而是把 speculative decoding 這類推論最佳化方法包裝成較容易採用的開放權重元件。

速度提升讓開放模型更接近產品化需求

整體來看,Gemma 4 MTP drafters 反映開放模型競爭已不只比參數量、基準分數或上下文長度,推論延遲與部署效率同樣成為產品化關鍵。若 Google 能持續把這類最佳化帶到不同尺寸與不同硬體平台,Gemma 4 對需要低延遲、可控成本與本機部署的開發團隊會更具吸引力。不過,實際採用前仍應依照模型尺寸、batch size、硬體平行度與應用延遲需求進行測試,而不是直接把最高 3 倍視為所有情境的保證值。

Gemma 4 MTP drafters 本機 AI 與低延遲部署應用

新聞資料來源

https://alternativeto.net/news/2026/5/google-brings-multi-token-prediction-drafters-to-gemma-4-3x-speedup-without-quality-loss/
https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
https://ai.google.dev/gemma/docs/mtp/overview
https://www.marktechpost.com/2026/05/06/google-ai-releases-multi-token-prediction-mtp-drafters-for-gemma-4-delivering-up-to-3x-faster-inference-without-quality-loss/
https://the-decoder.com/google-speeds-up-gemma-4-threefold-with-multi-token-prediction/

返回頂端