Gemini 3.7 Flash 在 8 月 13 日突然上线,过去这一天多,AI 编程圈基本在吵三件事:编程能力到底涨了多少、半价是不是真的、以及要不要换。
我把官方发布材料、model card 和 benchmarks 表读完,又翻了一遍知乎、微博、B站的实测和争论,先给结论:半价是真,但限时;涨分也是真,但没涨在你以为的地方;而且谷歌同日把 3.6 Flash 也调到了同价,这次决策的本质不是"新的更便宜",而是"新的能不能更稳地把活干完"。
涨分涨在"长任务",不是日常写代码
先看官方成绩单。几个主要涨幅:DeepSWE(生产代码)从 48.6% 到 65.3%,一次跳了 16.7 个百分点;FrontierCode 从 34.4% 到 43.6%;Terminal-bench 3.0(通用 agent 能力)从 5.4% 到 14.9%,接近三倍;AutomationBench(企业工作流)从 17.0% 到 30.4%;GDP.pdf(复杂 PDF 理解)从 22.0% 到 34.0%。36氪
这些基准的共同点是,全部是"跑通一整条链路"的多步长任务评测:终端操作、工具调用、屏幕操作、长文档理解;而普通知识推理方面,3.7 相比 3.6 没什么突破。谷歌自己的定位也印证了这一点——3.7 Flash 是"迄今为止最智能的编码与 Agent 主力模型",强调的是在一个任务里连续执行。Google官方博客 便宜档集体往 Agent 能力上使劲的原因很现实:Agent 任务的 token 消耗和聊天不是一个量级,让它操作一遍网页、跑一轮命令、处理一份 PDF 再回填表单,中间要拆解、试错、重试,消耗是指数级往上走的。知乎

社区实测的体感也印证了这一点。知乎有人拿真实仓库的修 bug 任务跑了对比:3.6 Flash High 耗时 147 秒,最后想歪了;3.7 耗时明显更长、320 秒,但拿到了正确答案。知乎 翻译一下:3.5 拼速度、3.6 拼成本,3.7 押的是"能把长任务做完",哪怕慢一点。
不过三盆冷水也得泼。第一,这一串分数全部来自厂商发布材料,AutomationBench 还是 private set,没有独立复现;第二,官方口径自己都不统一:博客正文把 3.6 的 DeepSWE 写成 49.0%,详细表和 model card 写成 48.6%;第三,Terminal-bench 3.0 就算 14.9%,也还没追上同表里 GPT-5.6 Terra 的 20.8%,"最强 Agent"还谈不上。知乎专栏
半价里藏着两个窗口
这次降价值得单独说。到 12 月 31 日之前,3.7 Flash 的促销价是每百万输入 token 0.75 美元、输出 3.75 美元,正好是 3.6 Flash 原价的一半。微博 更关键的是,谷歌同日把 3.6 Flash 也调到了同一促销价,对存量用户来说,促销期内两代价差为零。知乎专栏

也就是说,决策的性质变了。对正在用 3.6 Flash 的团队,这不是新旧比价的题,而是一个免费 A/B 窗口:同价之下,拿自己的真实任务集跑新模型,看质量、重试率和延迟是不是真的变好。而元旦之后恢复 1.5/7.5 美元的原价,窗口随之关闭。Google官方博客
再静态算一笔账。按每月 2000 万输入、200 万输出 token 的中型用量:促销期 22.5 美元,常规价 45 美元;同样用量按 GPT-5.6 Terra 的 2 美元输入、12 美元输出算是 64 美元。知乎专栏 但交过 AI 编程账单的人都清楚,token 单价只是账单的入口:thinking 档位决定输出长度,重试和缓存命中又会把最终成本翻来覆去——要比的,是每个合格结果的总成本。
四类人,四种打法
结合这两天社区里的讨论,大致可以对号入座:
正在用 3.6 Flash API 的人:现在就可以试,但按灰度走。 价差为零,公开分数已经足够支持开跑。切之前锁定几件事:thinking 档位固定(low/medium/high 三档、默认 medium,A/B 两边档位不一致,比的就是档位不是模型);功能列表别只看名字,caching、function calling、code execution 都用自己的 harness 过一遍回归。
把便宜模型焊死在 Agent 链路里的人:进候选池,别全量换。 这条路最贵的不是 token 价,是重构成本。3.7 Flash 的长任务稳定性确实是链路型产品最需要的东西,但模型可以灰度换,业务逻辑别焊死在任何一家的定价表上。
订阅制工具用户(Claude Code、Cursor 等):先观望。 目前确认的渠道是 Gemini API、Antigravity、Spark 和企业平台,第三方 harness 接入需要时间,不用 FOMO。
想尝鲜的人:AI Studio 直接上。 100 万 token 上下文,文字、图片、视频、音频、PDF 能一起塞,思考强度三档可调。但区域问题要有心理准备——这两天"地区不支持"的反馈不少,先搞定环境再开玩。
还有三件事值得盯着
一是半价会不会续期。官方口径是年底截止、一月恢复原价,想把长期成本模型建立在 0.75/3.75 美元上的,先等官宣。二是 3.5 Pro 的去向。Pro 线还停在 3.1,旗舰缺席三个月,也有搁置传闻;这是 Koray 接掌 DeepMind 后的第一张牌,Flash 若继续以这个节奏抢 Pro 的活,Gemini 整条产品线都要重排。36氪
三是同一时间线上,DeepSeek 的峰谷定价 8 月 17 日生效:V4 Pro 高峰输出到 27 元/百万 token,较旧价涨 350%。微博 一边谷歌砍半、一边 DeepSeek 涨价,便宜档模型的地图这个月正在重画,廉价模型用量大的人,这两笔账值得持续盯着。

一句话带走:促销期价差为零,先拿自己的任务灰度;谁更稳地把活干完,谁配接流量。