
Ollama 0.30 已正式推出,這次更新的重點放在更快的 NVIDIA GPU 效能、更廣泛的硬體支援,以及更完整的 GGUF 模型相容性。對於習慣在本機部署大型語言模型的使用者來說,Ollama 0.30 不只是一般版本更新,而是讓更多模型能以更少設定在不同電腦上直接執行的重要一步。

NVIDIA GPU 輸出效能最高提升 20%
Ollama 官方部落格指出,Ollama 0.30 在 NVIDIA 硬體上的效能最高可提升 20%,這項最佳化來自 NVIDIA 與 llama.cpp 團隊的貢獻。官方測試使用 Gemma 4 26B 模型、NVIDIA RTX 5090 與 Q4_K_M quantization,並以 output throughput(tokens / sec)作為比較指標。這代表在相同硬體條件下,使用者執行大型模型時可能取得更高輸出速度,尤其適合需要長文生成、程式輔助或本機 AI 助理的工作流。
Vulkan 預設啟用,AMD 與 Intel 使用者更容易受惠
另一個關鍵變化是 Vulkan GPU acceleration 現在預設啟用。這讓 Ollama 的 GPU 加速不再只集中於特定供應商環境,而是能擴展到 AMD 與 Intel 裝置。官方說明提到,更多使用者可以在不安裝 vendor-specific libraries 的情況下,直接透過 GPU 執行模型。對於使用非 NVIDIA 顯示卡,或想在不同平台上維持相近體驗的本機 AI 使用者來說,這會降低安裝與設定門檻。
GGUF 相容性擴大,更多 Hugging Face 模型可直接跑
Ollama 0.30 也透過 llama.cpp 擴大 GGUF 生態支援。官方表示,這次更新讓更多模型能開箱即用,包括 LFM、Prism,以及 Unsloth 發布的 fine-tuned models。使用者可以下載 GGUF 檔案或包含 GGUF 檔案的資料夾,再透過 Modelfile 的 FROM 指令指向檔案路徑,接著使用 ollama create 與 ollama run 建立並執行模型。這讓 Hugging Face 上的大量 GGUF 模型更容易被整合到 Ollama 的本機環境。
工具呼叫能力可延續到 coding agents 與 assistants
官方也特別提到,如果模型本身支援 tool calling,這項能力可以延續到 Ollama。使用者能透過單一指令,把模型搭配 Claude Code、Hermes Agent 或 OpenClaw 等 coding agents 與 personal assistants 使用。這點對開發者相當重要,因為本機模型不再只是聊天或文字生成工具,而是可以逐步成為可連接代理工作流的基礎執行環境。

新聞資料來源
https://alternativeto.net/news/2026/6/ollama-0-30-delivers-faster-nvidia-gpu-performance-and-wider-hardware-support/
https://ollama.com/blog/improved-performance-and-model-support-with-gguf
https://github.com/ollama/ollama/releases/tag/v0.30.0
