概要

  • 谷歌今天发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,相比 3.5 Flash 效率更高、成本更低——但原定于 I/O 2026 承诺在 6 月交付的 Gemini 3.5 Pro,因内部编码测试未达标,仍在测试中。
  • 3.6 Flash 的输出 token 比 3.5 Flash 少 17%,同时输出价格从每百万 token 9 美元降至 7.50 美元,使得大规模运行 AI 代理更便宜。
  • 谷歌确认已开始对 Gemini 4 进行预训练,称其为“我们有史以来最雄心勃勃的预训练运行”。

谷歌今天发布了三款新 AI 模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。这并非大多数人所预期的。

在 5 月的Google I/O 2026上发布 Gemini 3.5 Flash 并承诺一个月内推出 Pro 版本后,谷歌悄然错过了自己的截止日期。据彭博社报道,Gemini 3.5 Pro 因未达到内部目标而被推迟,尤其是在编码任务方面。6 月底通过更新训练数据(模型学习所依赖的大规模数据集)来修复问题的尝试结果令人失望。该报道导致 Alphabet 股价下跌约 4.4%,单日市值蒸发约 2000 亿美元。

谷歌上次发布的 Pro 级模型是Gemini 3的继任者 Gemini 3.1 Pro,那是在二月份。

Flash 系列是谷歌的速度优化模型系列——快速、经济高效,专为 AI 代理构建,这些代理是半自主运行的程序,用于处理诸如管理文档、处理数据管道或浏览网页等任务,无需人工逐步点击。Pro 模型则是重型模型:速度较慢、价格较高,专为复杂推理而设计,原始性能比速度更重要。

每个 AI 模型的功能及适用对象

Gemini 3.6 Flash 是主要发布版本。根据 Artificial Analysis Index,它的输出 token 比 3.5 Flash 少 17%——token 是 AI 处理的基本单位,大约相当于四分之三个单词。它也更便宜:每百万输入 token 1.50 美元,每百万输出 token 7.50 美元,而 3.5 Flash 的输出价格为 9 美元。对于大规模运行代理的企业来说,这种差异会迅速累积。

在基准测试中——通过正确完成任务百分比来评分 AI 的标准化测试——3.6 Flash 在 DeepSWE v1.1 上达到 49%,该测试测试长期软件工程,如构建和调试完整代码库,而 3.5 Flash 为 37%。在机器学习工程测试 MLE-Bench 上,它得分为 63.9%,而 3.5 Flash 为 49.7%。在 OSWorld-Verified 测试中——AI 控制电脑屏幕完成真实任务的测试——它以 83.0% 位居榜首,领先于 Claude Sonnet 5(81.2%)和 GPT-5.6 Luna(72.6%)。

同一类别中的竞争对手在其他方面仍处于领先地位:GPT-5.6 Luna 在 DeepSWE 上得分 67%,在 Terminal-Bench 2.1 上得分 84.7%,后者测试的是代理终端编码能力。Claude Sonnet 5 在知识工作方面领先,在 GDPval-AA v2 上得分 1607,而 3.6 Flash 为 1421——该基准采用类似国际象棋的 Elo 评分系统,分数越高代表现实任务表现越好。

我们尝试用该模型进行编码,结果……至少可以说是令人失望。
我们的简单编码测试最终生成了一个无法使用的文件。HTML 格式不正确,元素未能正确渲染。随后尝试通过 vibe coding 方式解决问题也未成功。

我们要求Deepseek通过简单地修复错误,将第一个模型变成可玩的游戏。它识别出11个错误并实施了8项关键修复,最终产生了一个不错的游戏。

Deepseek 的小调整修复了游戏,这意味着 Gemini 的核心思路是正确的,但细节和不准确之处导致结果不可用。如果你打算用这个模型进行长时间的 vibe coding,那就准备好使用一个廉价但性能差的模型吧。

谷歌发布的第二个模型 Gemini 3.5 Flash-Lite 纯粹为高吞吐量而构建:每秒 350 个输出 token,输入每百万 token 0.30 美元,输出每百万 token 2.50 美元。它面向高吞吐量管道——例如大规模文档处理或代理搜索系统——并且在关键编码任务上优于较旧的 3 Flash,包括 Terminal-Bench 2.1(54% 对 31%),尽管价格显著更低。

对于那些依赖 Hermes 和 Openclaw 的用户来说,它也可能是一个很好的会话压缩器(分析长会话并提取关键元素,使您的代理不会因噪音而崩溃)。

第三个模型 Gemini 3.5 Flash Cyber 将不会公开提供。谷歌将其限制于政府和经过审查的合作伙伴,这些合作伙伴需要发现和修复软件漏洞——这是一种双重用途的能力,公司不愿广泛发布。

与此同时,谷歌的 DeepMind 团队已经在推进下一步。谷歌在官方公告中确认,已开始“我们迄今为止最雄心勃勃的预训练运行,为 Gemini 4 做准备”,并且团队已经在为其造势。

预训练是基础阶段,模型在针对特定任务进行微调之前从大规模数据集中学习——这意味着 Gemini 4 正在构建中,而非计划中。

3.6 Flash 和 3.5 Flash-Lite 今天都在 Gemini 应用、Google AI Studio 以及通过 API 上线。据 Google 称,Gemini 3.5 Pro 将“在准备好后立即”发布,具体时间待定。