Google 發表 DiffusionGemma!以文字擴散技術帶來最高 4 倍 GPU 推論速度

Google DiffusionGemma 以 text diffusion 技術加速文字生成推論

Google 發布實驗性開放模型 DiffusionGemma,主打以 text diffusion 技術加速文字生成。不同於傳統大型語言模型逐 token 輸出,DiffusionGemma 可同時生成整段文字區塊,並在反覆去噪與自我修正中完成內容。Google 表示,在 dedicated GPUs 上,它最高可帶來 4 倍文字生成速度提升,顯示文字擴散模型正在成為傳統 autoregressive LLM 之外的另一條路線。

DiffusionGemma

速度是 DiffusionGemma 的最大賣點

官方數據指出,DiffusionGemma 在單張 NVIDIA H100 上可超過 1,000 tokens/s,在 NVIDIA GeForce RTX 5090 上也可超過 700 tokens/s。模型採用 26B Mixture of Experts 設計,但推論時只啟用 3.8B 參數;量化後可在 18 GB VRAM 的高階消費級 GPU 上運作。這種設計讓它更適合本地互動式場景,例如快速改寫、inline editing、code infilling 與需要低延遲回饋的開發工作流。

文字擴散模型適合哪些任務?

DiffusionGemma 支援 256 tokens parallel generation,並具備 bi-directional attention,代表它可以在生成過程中同時考慮前後文。Google 特別提到,它適合非線性文字結構、程式碼補全、胺基酸序列與數學圖形等任務。The New Stack 也指出,這類模型已可搭配 Hugging Face、Unsloth、量化版本與本地推論工具使用,未來若 llama.cpp 等工具成熟,會更容易進入一般開發者桌面環境。

仍不是最高品質模型的替代品

需要注意的是,Google 仍把 DiffusionGemma 定位為 experimental open model。如果應用最重視最高輸出品質,官方仍建議使用標準 Gemma 4。換言之,DiffusionGemma 目前更像是面向速度敏感、互動式與本地推論場景的技術預覽,而不是要立即取代所有主流 LLM。不過它已讓文字擴散生成從研究概念更接近可用工具。

Google 發表 DiffusionGemma

新聞資料來源

https://alternativeto.net/news/2026/6/google-unveils-diffusiongemma-delivering-up-to-4x-faster-inference-on-dedicated-gpus/
https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/
https://thenewstack.io/google-diffusiongemma-text-diffusion/

返回頂端