摘要

  • Google 今日推出 Gemini 3.6 Flash 和 3.5 Flash-Lite,效率更高、成本更低,但 Gemini 3.5 Pro 在內部編碼測試未達標後仍在測試中,該模型原定於 2026 年 I/O 大會承諾的六月交付。
  • 3.6 Flash 的輸出 token 比 3.5 Flash 減少 17%,同時輸出價格從每百萬 token 9 美元降至 7.50 美元,使大規模運行 AI 代理更便宜。
  • Google 確認已開始預訓練 Gemini 4,稱其為「我們迄今為止最雄心勃勃的預訓練運行」。

Google 今日推出三款新 AI 模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。這並非大多數人所預期的。

在五月Google I/O 2026 上推出 Gemini 3.5 Flash 並承諾一個月內推出 Pro 版本後,Google 悄然錯過了自己的截止日期。Gemini 3.5 Pro 被推遲,因為它在內部目標上未達標,據 彭博社報導,特別是在編碼任務上。六月底嘗試通過更新訓練數據(模型學習所用的大量數據集)來修復,但結果令人失望。Alphabet 股價因此報告下跌約 4.4%,單日市值蒸發約 2000 億美元。

Google 上次推出的 Pro 級模型是Gemini 3 的後繼者 Gemini 3.1 Pro,時間是二月。

Flash 系列是 Google 的速度優化模型系列——快速、經濟高效,專為 AI 代理設計,這些代理是半自主運行的程序,用於處理管理文檔、處理數據管道或瀏覽網頁等任務,無需人類逐一點擊。Pro 模型則是重型模型:速度較慢、價格較高,專為需要原始算力而非速度的複雜推理而設計。

每個 AI 模型的功能及其目標用戶

Gemini 3.6 Flash 是主要發布版本。根據 Artificial Analysis Index,它的輸出 token 比 3.5 Flash 減少 17%——token 是 AI 處理的基本單位,約為單詞的四分之三。它也更便宜:每百萬輸入 token 1.50 美元,每百萬輸出 token 7.50 美元,而 3.5 Flash 的輸出價格為 9 美元。對於大規模運行代理的企業來說,這種差異會迅速累積。

在基準測試中——標準化測試,通過正確完成任務的百分比來評分 AI——3.6 Flash 在 DeepSWE v1.1 上達到 49%,該測試測試長期軟體工程,如構建和調試完整代碼庫,而 3.5 Flash 為 37%。在機器學習工程測試 MLE-Bench 上,它得分 63.9%,而 3.5 Flash 為 49.7%。在 OSWorld-Verified 測試中——AI 控制電腦屏幕完成真實任務的測試——它以 83.0% 位居榜首,領先於 Claude Sonnet 5(81.2%)和 GPT-5.6 Luna(72.6%)。

同一類別的競爭對手在其他領域仍領先:GPT-5.6 Luna 在 DeepSWE 上得分 67%,在 Terminal-Bench 2.1(測試代理終端編碼)上得分 84.7%。Claude Sonnet 5 在 GDPval-AA v2(一項基於國際象棋 Elo 評分系統的基準測試,分數越高表示真實世界任務表現越好)上以 1607 分領先知識工作,而 3.6 Flash 為 1421 分。

我們嘗試用該模型進行編碼,結果……至少可以說令人失望。
我們的簡單編碼測試最終得到了一個無法使用的檔案。HTML 格式不正確,元素未能正確渲染。後續嘗試用 vibe coding 解決問題的努力也未成功。

我們要求 Deepseek 透過簡單修復錯誤,將第一個模型變成可玩的遊戲。它識別了 11 個錯誤並實施了 8 項關鍵修復,最終產生了一個不錯的遊戲。

Deepseek 的小調整修復了遊戲,這意味著 Gemini 的核心思路是正確的,但細節和不準確之處使得結果無法使用。如果你假裝使用該模型進行長時間的 vibe coding 會話,請準備好使用一個便宜但性能較差的模型。

Google 發布的第二個模型 Gemini 3.5 Flash-Lite 純粹為處理量而設計:每秒 350 個輸出 token,每百萬輸入 token 0.30 美元,每百萬輸出 token 2.50 美元。它針對高吞吐量管道——例如大規模文件處理或代理搜索系統——並且在關鍵編碼任務上優於舊版 3 Flash,包括 Terminal-Bench 2.1(54% 對比 31%),儘管價格顯著更低。

對於依賴 Hermes 和 Openclaw 的人來說,它也可能是一個很好的會話壓縮器(分析長會話並提取關鍵元素,使你的代理不會因噪音而崩潰)。

第三個模型 Gemini 3.5 Flash Cyber 將不會公開提供。Google 將其限制於需要查找和修復軟體漏洞的政府和經過審查的合作夥伴——這是一種雙重用途能力,公司不願廣泛發布。

與此同時,Google 的 DeepMind 團隊已經在繼續前進。Google 在官方公告中確認,已經開始「我們迄今為止最雄心勃勃的預訓練運行,用於 Gemini 4」,團隊已經在為此造勢。

預訓練是基礎階段,模型在針對特定任務進行微調之前從大量數據集中學習——這意味著 Gemini 4 正在構建中,而非計劃中。

3.6 Flash 和 3.5 Flash-Lite 今天都在 Gemini 應用程式、Google AI Studio 以及透過 API 上線。根據 Google 的說法,Gemini 3.5 Pro 將「在準備好時」推出,無論那是何時。