官方發布開源模型 / 地端 AI

Google 推出 Gemma 4 12B:免獨立編碼器的多模態開源模型,首個原生支援音訊的中型 Gemma

Gemma 4 12B 以單一 decoder-only 架構直接處理文字、影像與音訊,可在 16GB VRAM 或統一記憶體的設備上本機執行,並支援 vLLM、SGLang 等推論框架。

重點答案

Gemma 4 12B 是 Google 於 2026 年 6 月 3 日發布的 120 億參數開源多模態模型,採用免獨立編碼器的統一架構,原生接收文字、影像與音訊,Gemma 版本紀錄列出最高 256K context;它的意義在於地端與本機部署也能用單一中型模型處理語音、影像與文字,不必拼接多個專用模型。

Google 在 2026 年 6 月 3 日於 Google Developers Blog 發布 Gemma 4 12B 開發者指南。這是一個 120 億參數的稠密多模態模型,採用與 Gemma 4 31B Dense 相同的單一 decoder-only transformer 結構,以「統一、免編碼器」的方式直接處理原始 48x48 像素影像區塊與 16 kHz 音訊訊號,視覺嵌入層只有約 3,500 萬參數。

官方指出,過去 Gemma 家族的音訊輸入只限於 E4B 這類小型邊緣架構,Gemma 4 12B 是第一個能原生接收音訊的中型模型,用途包括語音辨識、說話者分段(diarization)、影片理解、agentic 推理與 coding,並可用每秒 1 幀搭配同步音訊處理數分鐘長的影片。Gemma 版本紀錄將它列為「Gemma 4 12B Unified」,支援最高 256K context。

部署面,官方表示它小到可以在具 16GB VRAM 或統一記憶體的 GPU 筆電上本機執行,並針對 macOS 的 Apple Silicon 做了最佳化,另提供 multi-token prediction 版本以加快本機推論。模型可從 Hugging Face、Kaggle、LM Studio、Ollama 等管道取得,相容 Hugging Face Transformers、llama.cpp、MLX、vLLM、SGLang,以及用於微調的 Unsloth。

需要保留的地方:這篇開發者指南沒有提供量化後的基準分數,能力描述以官方說法為主;Gemma 4 系列依 Google 開源部落格的 Gemma 4 公告以 Apache 2.0 授權發布。16GB 可執行也不代表在長 context、多路併發下的吞吐足以支撐團隊使用。

對地端部署團隊,可依官方資訊列出評估清單:授權方面,Gemma 4 系列依 Google 開源部落格的 Gemma 4 公告以 Apache 2.0 授權發布,可先確認內部法遵流程;推論框架方面,優先在 vLLM 或 SGLang 上測試文字、影像與 16 kHz 音訊輸入是否都能正常服務;容量方面,從官方的 16GB VRAM 起點往上量測長 context 與多路併發下的記憶體占用與吞吐;效能方面,比較一般版與 multi-token prediction 版本的延遲差異;最後再以自家語音轉寫、文件影像與客服對話資料做品質驗證,決定它是否取代現有的多個專用模型。

接下來值得觀察的是:vLLM 與 SGLang 對其音訊與影片輸入的支援成熟度、在 256K context 下的實際記憶體需求,以及社群量化版本與微調變體的品質。這些條件決定它能否從本機展示走進企業地端推論服務。

X Cube 觀點

對在 DGX Spark / GB10 這類地端節點上提供開源模型的企業平台而言,Gemma 4 12B 代表可以用單一中型模型同時涵蓋語音轉寫、影像與文字理解,減少多個專用模型的部署與維運;但在納入正式模型目錄前,應先以 vLLM 或 SGLang 在自家硬體上驗證多模態輸入支援、長 context 記憶體占用與併發吞吐。