Google 推出 Gemini 3.6 Flash 與 3.5 Flash-Lite:輸出 token 少 17%,Flash-Lite 定位高用量 subagent
Gemini 3.6 Flash 強調 token 效率與 coding、agent 規劃能力,3.5 Flash-Lite 則以低延遲、低成本鎖定高用量自動化;同時 Gemini API 開始棄用 temperature 等取樣參數。
Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 是 Google 於 2026 年 7 月 21 日推出的兩款模型:3.6 Flash 比 3.5 Flash 少用 17% 輸出 token,3.5 Flash-Lite 以每百萬輸入 0.30 美元的價格定位為高用量 subagent;它們代表雲端模型的競爭重點正從單一分數轉向每個任務實際消耗的 token 與成本。
Google 在 2026 年 7 月 21 日由產品管理資深總監 Tulsee Doshi 代表 Gemini 團隊,發表 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash Cyber。3.6 Flash 的重點是 token 效率:依 Artificial Analysis Index,輸出 token 用量比 3.5 Flash 減少 17%,同時改善 coding、知識工作與多模態表現。
官方公布的 3.6 Flash 對比 3.5 Flash 成績包括:DeepSWE 49% 對 37%、MLE Bench 63.9% 對 49.7%、OSWorld-Verified 83.0% 對 78.4%。價格為每百萬輸入 token 1.50 美元、輸出 7.50 美元,可透過 Gemini API(Google AI Studio、Android Studio)、Google Antigravity、Gemini Enterprise Agent Platform 與 Gemini app 使用。
3.5 Flash-Lite 定位為低延遲、高性價比的 subagent 選項,適合高用量自動化。官方引述 Artificial Analysis 每秒約 350 個輸出 token,Terminal-Bench 2.1 為 54%(3.1 Flash-Lite 為 31%)、SWE-Bench Pro 為 54.2%(3 Flash 為 49.6%)。價格為每百萬輸入 0.30 美元、輸出 2.50 美元,可透過 Gemini API、Gemini Enterprise Agent Platform 使用,也導入 Gemini app 與 Google 搜尋。資安版 3.5 Flash Cyber 則僅以限量試行方式提供給政府與受信任夥伴;3.5 Pro 仍在與合作夥伴測試中。
對工程團隊影響較直接的是 API 行為改變:Gemini API 更新日誌同日註明,temperature、top_p 與 top_k 取樣參數已被列為棄用。既有應用若依賴這些參數控制輸出風格或可重現性,需要重新驗證行為。此外,官方的效能數字都是自家或 Artificial Analysis 的測量,實際 token 節省幅度仍取決於提示與任務類型。
實務上,模型閘道團隊可以先做幾項檢查:盤點既有呼叫中帶有 temperature、top_p、top_k 的請求,確認改接 Gemini 3.6 Flash 或 3.5 Flash-Lite 時這些參數會被如何處理;把主力模型(3.6 Flash,每百萬輸入 1.50 美元、輸出 7.50 美元)與 subagent 模型(3.5 Flash-Lite,輸入 0.30 美元、輸出 2.50 美元)分成不同路由與配額;並用同一批真實任務量測輸出 token 數,驗證官方宣稱的 17% 節省在自家提示上是否成立。這些數字會直接影響多 agent 架構的總成本。
這次發布之後,Google 在 8 月與 9 月又接連推出 3.7 Flash 與 3.8 Flash,Flash 系列的更新頻率明顯加快。值得觀察的是 Flash-Lite 這類低價模型在多 agent 架構中作為 subagent 的實際品質,以及取樣參數棄用是否成為其他供應商跟進的方向。
當供應商開始棄用 temperature 等取樣參數,OpenAI 相容 API 或模型閘道就不能假設所有模型都接受同一組參數;企業需要在閘道層記錄並處理各模型支援的參數差異,並以「每個任務的總 token 成本」而不是單價來比較主力模型與 subagent 模型。


