GeminiAI模型產業

Google Gemini 3.6 Flash 與 3.5 Flash-Lite 正式推出,鎖定低延遲代理工作

Google Gemini 3.6 Flash 與 3.5 Flash-Lite 正式推出,鎖定低延遲代理工作 能源, AI, 產業

Google 7 月 21 日宣布 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 正式推出,兩個模型都可透過 Gemini API 使用。Gemini 3.6 Flash 針對程式撰寫、知識工作與多模態推理,3.5 Flash-Lite 則針對高流量資料處理、文件擷取與代理工作流程。

Google AI 開發者文件把兩者列為穩定版本,輸入 context window 都達 1,048,576 tokens,最大輸出為 65,536 tokens。這個規模適合一次帶入長文件或多步驟工作資料,但實際成本仍取決於輸入、輸出與快取 token 數量。

Gemini 3.6 Flash 以模型效率與代理程式任務為主

Google 將 Gemini 3.6 Flash 定位為處理複雜程式與代理工作流程的主力模型,API 支援程式執行、函式呼叫、搜尋 grounding、URL context 與 Computer Use 預覽功能。這些工具讓模型能在多步驟任務中取得外部資料或操作指定環境,但仍需要開發者設定權限與確認流程。

Google 引用 Artificial Analysis Index 表示,Gemini 3.6 Flash 相較 Gemini 3.5 Flash 可減少 17% 的輸出 token 使用量;這是 Google 援引的外部評測結果,並不代表每一種工作負載都會得到相同節省。Gemini API 的標準價格為每 100 萬輸入 token 1.50 美元、輸出 token 7.50 美元。

Gemini 3.5 Flash-Lite 以每秒 350 tokens 與低價處理高流量

Gemini 3.5 Flash-Lite 是這次發布中偏向速度與大量執行的版本,Google 以文件分析、代理搜尋與結構化資料擷取作為使用情境。Google 引用 Artificial Analysis 的測量,指模型輸出速度可達每秒 350 tokens。

3.5 Flash-Lite 的 Gemini API 標準價格為每 100 萬輸入 token 0.30 美元、輸出 token 2.50 美元。對需要大量短回覆或批次處理的服務,價格與吞吐量會直接影響單次任務的執行成本。

Google AI API 將 Gemini 3.6 Flash 與 3.5 Flash-Lite 列為 GA

Google 的模型指南把 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 列為 stable 模型,模型 ID 分別是 `gemini-3.6-flash` 與 `gemini-3.5-flash-lite`。兩者都支援 thinking、快取與內建工具,開發者可依推理深度、延遲、吞吐量與費用選擇版本。

Google 也表示,Gemini 3.6 Flash 已成為 Gemini Managed Agents 中 Antigravity agent 的預設模型。這個預設值可以透過模型設定變更,並不表示所有 Google 服務都會同步改用同一版本。

Google Gemini 3.5 Pro 與 Gemini 4 仍處於後續開發階段

Google 在同一份模型公告中表示,Gemini 3.5 Pro 正與合作夥伴測試,Gemini 4 的下一次預訓練工作也已開始。公司尚未在這次公告中給出 Gemini 3.5 Pro 正式開放或 Gemini 4 發布的確定日期。

消息來源:Google|3.6 Flash、3.5 Flash-Lite 與 3.5 Flash CyberGoogle AI for Developers|Gemini 3.6 Flash 模型頁Google AI for Developers|Gemini API pricing

延伸閱讀
Vultr 米蘭區域上線並攜手 SUSE、NVIDIA,歐洲企業 AI 雲端節點再增加
文章・雲端基礎設施
華為 MatePad 11.5 雲晰柔光屏初體驗:忘記它的存在?這就對了
文章・鴻蒙
Google Nano Banana 2 正式上線:更快、更便宜,一樣好用
文章・頭條
Written by
黃郁棋

《科技人》站長,在科技業打滾十年的老屁股,每天都覺得自己要被新技術取代了,完了完了。

打賞科技人|祝您有個美好的一天

科技人原創 BGM

音樂目錄載入中

預設暫停,等你按下播放

0:00 0:00