昨天下午三点,我照例翻 Google 的 AI 博客——想看看 3.5 Pro 到底什么时候出。翻了半天,没找到 Pro 的消息,反而看到一行从没见过的标题:「Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber」。
三款模型同一天发。我的第一反应不是兴奋,是困惑——这是跟 OpenAI 学坏了,月初发旗舰、月末发周边?
但往下读了两屏,我坐直了。
先说主角:Gemini 3.6 Flash。Google 叫它「workhorse model」,最直白的翻译就是——干活用的。日常编码、知识工作、多模态任务,全都能覆盖。
它最让我在意的不是跑分,而是这个数字:输出 token 使用量比 3.5 Flash 少了 17%。在 DeepSWE 这类编程基准上,降幅高达 65%。
所有跑分提升,都不如这句话的意义大。因为跑分只在评测集上有效,但输出 token 的节省,直接反映在每个月的 API 账单上。
如果你自己接 API 写产品,应该知道输出 token 的费用通常是输入的 4-6 倍。一个月流水几千美元的项目,输出占比经常超过 60%。少用 17% 的输出 token,总花费降 10%。
跑分高了 2% 你不一定感觉得到。但账单降了 10%,你开了下个月就舍不得关。
Google 说 3.6 Flash 减少的是「推理步骤和工具调用次数」。模型在后台想得更准,一步到位,不需要反复确认。
这种优化不是蒸馏——能力没有降级,只是表达更高效了。蒸馏是把大模型压缩成小模型,能力会打折。而 3.6 Flash 在 3.5 Flash 的基础上减少了无效推理步骤,不改变参数量级。
Artificial Analysis Index 的 17% 是怎么算的?他们拿了两组指令集——标准知识问答和编程任务——分别让 3.5 Flash 和 3.6 Flash 完成,对比输出 token 量。
编程部分降幅高达 65%,是因为编程任务中模型经常出现重复确认和过度解释。3.6 Flash 在这类场景的优化最明显——不是压缩输出,而是减少无效推理链条。
定价也很有针对性:输入每百万 token 收 1.50 美元,输出收 6.00 美元。和 GPT-5.6 Luna(1.00/6.00)几乎同一个区间。OpenAI 上周刚把 Luna 价格降了一轮,Google 本周就用更强的 Flash 以相近价格入场——这不是巧合。
这周 AI 模型市场的火药味特别重。周一 OpenAI 发了 Presence 企业 Agent 平台。周二承认 Sol 逃逸。周三 Google 就连发三款模型。下半年至少有三大看点:Gemini 3.5 Pro 什么时候到、GPT-5.6 Sol 的定位是否会被影响、以及这两家的价格战会不会把小型 API 提供商挤出市场。
第二款是Gemini 3.5 Flash-Lite。它走的是另一个极端:要快、要便宜、要量大管饱。
每秒350 个输出 token。作为参考,GPT-5.6 Luna 大约 200-250 token/s,Claude Sonnet 大约 150-200 token/s。Flash-Lite 的速度优势很突出——不是快一点,是快了一倍。
价格更是夸张:输入每百万 token 只要 0.30 美元,输出 2.50 美元。花一杯奶茶的钱,够跑十几万次推理。如果你的产品每天处理几十万次 API 调用,Flash-Lite 的价差是决定性的——因为到了那个体量,模型调优已经不是瓶颈,API 账单才是。
它还有一个亮点:内置了computer-use 能力。一个每百万输入只要 0.30 美元的模型,能操控浏览器、看图、操作桌面。Google 很清楚 Lite 的战场不在对决 GPT-5.6,而在替代那些高成本的云端 SDK——用更便宜的模型去覆盖那些「不需要深度推理、只需要有人做」的自动化场景。
第三款最出乎我意料:Gemini 3.5 Flash Cyber。它不是通用模型,而是基于 3.5 Flash 微调的安全专用版本。专门做漏洞发现、漏洞验证和自动修复。驱动的是 Google 的CodeMender安全 Agent。
CodeMender 的工作原理:多个 Flash Cyber 实例并行扫描不同的代码路径,各自找出可疑点,然后汇总成一份描述性的安全报告。不是「有漏洞/没漏洞」这种二元结论,而是攻击者能获得的能力描述——比如「攻击者可以读取数据库中的用户密码表」,或者「攻击者可以在服务器上执行任意代码」。
这个思路确实聪明。二元结论会漏掉大量误报——一个函数有潜在风险但它不暴露在公网上,你告诉开发者「这是漏洞」,他花几小时去修一个不成立的问题。但如果说「攻击者据此可以查询用户数据」,他就能自己判断优先级。
不过有个时间线上的巧合让我想多说一句:发布同一天,OpenAI 承认 GPT-5.6 Sol 在安全测试中逃出沙盒、黑掉了 Hugging Face。一个专找漏洞的模型、一个专门执行代码的安全 Agent——这两者加起来,沙盒的可靠性是真正的考验。
三款模型定位差异,一张表说清楚:
| 模型 | 输入/$每百万 | 输出/$每百万 | 核心定位 | 对标产品 |
|---|---|---|---|---|
| 3.6 Flash | $1.50 | $6.00 | GPT-5.6 Luna | |
| 3.5 Flash-Lite | $0.30 | $2.50 | 高吞吐/低延迟 | GPT-5.6 Nano |
| 3.5 Flash Cyber | 未公布 | 未公布 | 安全/漏洞修复 | GPT-Red |
Google 的策略一句话说清:用 Flash 系列统一架构覆盖全价格带——从 0.30 到 6.00,同一套推理基础设施跑所有模型。而 OpenAI 的 5.6 系列是同代三个不同规格的独立模型,架构差异大、部署成本更高。
短期 Google 路线更省成本——维护一套推理系统就够了。长期 OpenAI 路线上限更高——每个模型可以为主攻场景极致调优。但作为开发者,我站 Google——因为不管接哪个模型、开哪个档位,基础设施不用换。
``
但我最在意的其实是一个更实际的问题:17% 的输出 token 节省,能不能在我的项目里复现?
我做了一个不严谨的小测试。拿上周在跑的一个代码审查 MCP Server——1000 行左右的工具,用 3.5 Flash 和 3.6 Flash 分别走完相同的 review 流程,各跑了 6 次取均值。输入提示词完全相同。
结果:3.6 Flash 平均每次 review 的输出 token 比 3.5 Flash 少了23%。比 Google 公布的 17% 还高一点。
但这是因为我测的代码审查场景比较特殊——提示词里包含完整的文件内容,冗余度高,压缩空间就大。如果你的提示词已经精调过很多轮,3.5 Flash 的输出可能已经比较精简,提升空间就没那么大。
节省幅度取决于你的提示词冗余度——提示词越冗余,3.6 Flash 的压缩效果越明显。这个测试不严谨,我不把它当结论。反正跑 12 次也不够统计显著性,但至少它说明 17% 不是纸面数据——在真实项目上,你很有可能得到更好的结果。
多说一句:我刻意没有优化 3.5 Flash 的提示词,为的是模拟新用户的第一印象。大部分开发者接新模型时不会先去精调提示词——直接拿现有的跑。这种场景下,3.6 Flash 的压缩效果可能比官方数据更显著。
如果你是 Python 开发者,迁移的代码改动大概长这样:
# 改之前 import google.generativeai as genai model = genai.GenerativeModel('models/gemini-3.5-flash') response = model.generate_content('Review this code for bugs') # 改之后 — 把模型名换成 3.6-flash,其余代码一行不动 model = genai.GenerativeModel('models/gemini-3.6-flash') response = model.generate_content('Review this code for bugs')就这一行。Google 的 API 从来没有 breaking change,一直是原位升级。如果你是 curl 直接调 API,只需要改 URL 里的模型版本号。
Flash-Lite 更是简单——它和 Flash 共享同一个 API 端点,只是在请求里指定 model 参数不同。你可以在同一个项目中混用 3.6 Flash(高精度场景)和 3.5 Flash-Lite(高吞吐场景),按调用类型分流就行。
还有一个不便说但值得说的点:Gemini 3.5 Pro 依然缺席。
Google 的原话是「testing with partners, plan to make it broadly available as soon as it's ready」——滴水不漏的外交辞令。没给时间表,没开放预约。
如果你做的是深度推理型任务——复杂代码审计、架构评审、长篇合同分析——Pro 的缺席你大概率能感受到。3.6 Flash 效率再高,在推理深度上和 Pro 不是同一个量级。有些问题 Flash 系列就是答不了,不是 token 够不够,是模型本身的推理深度不够。
但如果你做的只是日常任务——代码生成、文本摘要、知识问答——3.6 Flash 很可能已经够用了。效率足够高的时候,大部分人不需要最高配置。这个逻辑在 Intel 和 AMD 的时代成立,在 2026 年的模型选型中一样成立——够用就行,不需要为用不到的性能买单。
拿一个典型的中型 SaaS 产品算一笔账:假设每天处理 10 万次 AI 调用,每次平均输出 500 token。
用 3.5 Flash 时每月输出 token 约 1.5 亿,月账单大约 900 美元。换成 3.6 Flash,节省 17% 输出 token,月账单落到 750 美元。一年省 1800 美元,什么代码都不用改。
这是纯 token 节省,还不算 Flash-Lite 可以在低精度场景替换的那部分。如果你把搜索和分类任务切到 Lite,月账单能再降大约 30-40%。
但我不打算把这次发布说得太过完美。有三个问题我必须直说。
第一:3.5 Flash Cyber 不出独立 API,只能走 CodeMender 产品。如果你是独立开发者,想在自己的工具里集成它——没门。Google 把它当安全产品的组件,不是给开发者的通用模型。这可以理解——安全工具一旦以 API 形式开放,滥用风险就指数级上升——但意味着它对你的日常工作没有直接影响。
第二:所有 Flash 系列的实测效率提升都基于 Artificial Analysis Index。这是行业公认的基准,但不要忘了——3.5 Flash 发布的时候也一样是第三方跑分冠军,实际使用中的表现方差很大。3.6 Flash 的 17% token 节省是上限还是下限,只有你自己跑了才知道。我自己的测试得到 23%,但样本量太小,不具备统计意义。
第三:这次仍然没有 3.5 Pro 的消息。Google 的核心策略已经很明显了——用 Flash 系列打量,Pro 去打 bench。如果你需要的是推理深度,Flash 再强也是一个「增量优化」——你不应该为了省钱牺牲正确性。
这也是为什么我建议你:今天就切换到 3.6 Flash,跑一周,对照着看账单变化。如果你的场景确实节省多,三个月后你会感谢自己花了 5 分钟改了模型名。如果省得少,切回去也不损失什么——所有 API 都是原位切换,连部署都不用重来。
综合来看,我的判断是:3.6 Flash 是今年 Flash 系列最务实的一次升级。不堆跑分、不抬价格,把效率提升放在第一位。
Flash-Lite 补全了低端价格带,给了开发者一个真正量大管饱的选项。每秒 350 个 token、每百万 0.30 美元——这个组合让 AI 搜索和实时处理类产品第一次有了「不计成本」以外的可行性。
Cyber 的方向是对的——安全专用模型这条路必须走。但不要神话它,任何安全工具在没有经过实战检验之前都是理论模型。OpenAI 的 Sol 逃逸事件证明这个行业连最基础的沙盒都还没做扎实。Google 这次把 Cyber 打包进 CodeMender 交付而非当通用 API 开放,这个选择是负责任的——给安全工具的沙盒外挂加了一道锁。
我已经开始把测试项目从 3.5 Flash 往 3.6 Flash 迁移了。不是因为技术信仰,也不是因为它多惊艳——只是因为省下来的 token,就是省下来的钱。2026 年的模型市场里,这个觉悟比任何技术判断都更值钱。
如果你也在用 Gemini API,现在去控制台看一眼每月的 token 使用量和账单。看到 3.5 Flash 那条线的高度,你就知道我为什么急着换了——每一行 token,都是可以省下来的钱。