---
title: "Google 推出 Gemma 4 12B：免獨立編碼器的多模態開源模型，首個原生支援音訊的中型 Gemma"
url: https://xcube.enlightcorp.com.tw/zh/news/google-gemma-4-12b-unified-open-model-native-audio
category: "開源模型 / 地端 AI"
source_type: official
published: 2026-06-03
updated: 2026-06-03
lang: zh-TW
---

# Google 推出 Gemma 4 12B：免獨立編碼器的多模態開源模型，首個原生支援音訊的中型 Gemma

發布 2026-06-03 · 更新 2026-06-03 · 官方發布 · 來源: [Google Developers Blog](https://developers.googleblog.com/gemma-4-12b-the-developer-guide/)

**重點答案:** Gemma 4 12B 是 Google 於 2026 年 6 月 3 日發布的 120 億參數開源多模態模型，採用免獨立編碼器的統一架構，原生接收文字、影像與音訊，Gemma 版本紀錄列出最高 256K context；它的意義在於地端與本機部署也能用單一中型模型處理語音、影像與文字，不必拼接多個專用模型。

Google 在 2026 年 6 月 3 日於 Google Developers Blog 發布 Gemma 4 12B 開發者指南。這是一個 120 億參數的稠密多模態模型，採用與 Gemma 4 31B Dense 相同的單一 decoder-only transformer 結構，以「統一、免編碼器」的方式直接處理原始 48x48 像素影像區塊與 16 kHz 音訊訊號，視覺嵌入層只有約 3,500 萬參數。

官方指出，過去 Gemma 家族的音訊輸入只限於 E4B 這類小型邊緣架構，Gemma 4 12B 是第一個能原生接收音訊的中型模型，用途包括語音辨識、說話者分段（diarization）、影片理解、agentic 推理與 coding，並可用每秒 1 幀搭配同步音訊處理數分鐘長的影片。Gemma 版本紀錄將它列為「Gemma 4 12B Unified」，支援最高 256K context。

部署面，官方表示它小到可以在具 16GB VRAM 或統一記憶體的 GPU 筆電上本機執行，並針對 macOS 的 Apple Silicon 做了最佳化，另提供 multi-token prediction 版本以加快本機推論。模型可從 Hugging Face、Kaggle、LM Studio、Ollama 等管道取得，相容 Hugging Face Transformers、llama.cpp、MLX、vLLM、SGLang，以及用於微調的 Unsloth。

需要保留的地方：這篇開發者指南沒有提供量化後的基準分數，能力描述以官方說法為主；Gemma 4 系列依 Google 開源部落格的 Gemma 4 公告以 Apache 2.0 授權發布。16GB 可執行也不代表在長 context、多路併發下的吞吐足以支撐團隊使用。

對地端部署團隊，可依官方資訊列出評估清單：授權方面，Gemma 4 系列依 Google 開源部落格的 Gemma 4 公告以 Apache 2.0 授權發布，可先確認內部法遵流程；推論框架方面，優先在 vLLM 或 SGLang 上測試文字、影像與 16 kHz 音訊輸入是否都能正常服務；容量方面，從官方的 16GB VRAM 起點往上量測長 context 與多路併發下的記憶體占用與吞吐；效能方面，比較一般版與 multi-token prediction 版本的延遲差異；最後再以自家語音轉寫、文件影像與客服對話資料做品質驗證，決定它是否取代現有的多個專用模型。

接下來值得觀察的是：vLLM 與 SGLang 對其音訊與影片輸入的支援成熟度、在 256K context 下的實際記憶體需求，以及社群量化版本與微調變體的品質。這些條件決定它能否從本機展示走進企業地端推論服務。

## X Cube 觀點

對在 DGX Spark / GB10 這類地端節點上提供開源模型的企業平台而言，Gemma 4 12B 代表可以用單一中型模型同時涵蓋語音轉寫、影像與文字理解，減少多個專用模型的部署與維運；但在納入正式模型目錄前，應先以 vLLM 或 SGLang 在自家硬體上驗證多模態輸入支援、長 context 記憶體占用與併發吞吐。

Tags: Gemma, Open Models, Local AI, Multimodal, On-Prem AI, Google, Gemma 4 12B, Gemma 4, vLLM, SGLang, Hugging Face
