北京时间8月14日凌晨,谷歌把Gemini 3.7 Flash扔了出来,距离上一代3.6 Flash发布只隔了三周,谷歌给它的定位是"迄今最智能的主力模型",主打编程和Agent。36氪发布当天,它就已经进了Cursor、Devin、GitHub Copilot这些第三方编程工具。知乎但真正值得你停下三分钟的,不是跑分表,而是藏在表底下的两行小字:这次"半价"是有保质期的,而你等了半年的3.5 Pro,大概率永远不会来了。
这一次,Flash真的在扛旗舰的活
先说能力。在衡量生产级代码质量的FrontierCode 1.1 Main上,3.7 Flash拿到43.6%,压过了Claude Sonnet 5的42.7%和GPT-5.6 Terra的41.3%;三周前3.6 Flash在这里还只有34.4%。在Artificial Analysis综合智力指数上,3.7 Flash得56分,比Sonnet 5的55分和DeepSeek V4 Pro的53分都高,只比GPT-5.6 Terra低1分。36氪

网页开发是另一个亮点。Code Arena WebDev榜上,3.7 Flash的Elo从1538涨到1588,排名从第19位跳到第8位,同一张榜上Sonnet 5排第16、3.6 Flash还在第19,国产的Qwen3.8 Max高居第3。知乎

但反证也要摆出来:在更难的Terminal-bench 3.0上,3.7 Flash只有14.9%,GPT-5.6 Terra是20.8%;DeepSWE长周期软件工程65.3%对Terra的69.6%,也还没翻过身。知乎所以"追平旗舰"这句话只在编程、网页开发和Agent自动化这几栏里成立,不是全面越级。对一个定价不到Sonnet 5四成的中杯模型来说,这个"局部越级"已经足够改变选型顺序了。
"三周"的意义,比跑分更大
把发布时间线拉长看,这次更新不是孤立事件。8月5日,Hassabis卸任Google DeepMind CEO,转任董事长和Alphabet首席科学家,CTO Koray Kavukcuoglu接管日常管理,直接向Pichai汇报。36氪八天后,3.7 Flash发布。路透还披露了更深的背景:今年4月Sergey Brin就在内部全员会上要求DeepMind"加快速度",Gemini 3.5 Pro更是一再跳票,据传内部已经放弃、团队转向Gemini 4预训练;旗舰版在编程等关键指标上继续落后于竞争对手,发布时间被迫推迟两个月。知乎

人才也在出走。Jeff Dean、Sanjay Ghemawat、Oriol Vinyals和Quoc Le离职创办Discovery Loop,Noam Shazeer去了OpenAI,AlphaFold核心研究者John Jumper加入Anthropic。36氪而产品线上,Pro系列至今还停留在半年前的Gemini 3.1 Pro,下一代3.5 Pro到现在没有一点影子。知乎X上有人一句话总结得很狠:“DeepMind能保持独立,说到底只是太平日子里的"特权"罢了。”
社区里的调侃更扎心。有网友说,谷歌一直在做Pro版本,但每次做出来都达不到当前的TOP水平,就一直改名Flash发出来。知乎这句话未必公平,但它点破了一个事实:Flash的三周一迭代,本质是换帅后的DeepMind用节奏换时间。旗舰没就位之前,先用中杯模型把Coding和Agent的工作负载抢住。所以看3.7 Flash,不能只看它"又多强了一点",要看它正在从"轻量补充"被推上"实际主力"的位置。
把价格账算清楚:半价是限时票
这次最猛的不是跑分,是价格。年底前介绍期价格为输入0.75美元/百万Token、输出3.75美元/百万Token,谷歌自己说这相当于3.6 Flash最初价格的一半。36氪

但模型卡 footnote 写得很清楚:2027年1月1日起,价格恢复至输入1.5美元、输出7.5美元,上下文缓存也从0.075美元涨回0.15美元。也就是说,半价是到12月31日为止的尝鲜票,不是永久降价。
横向比一下就知道这张票的含金量:Claude Sonnet 5是2美元/10美元,GPT-5.6 Terra是2美元/12美元,Grok 4.6是2美元/6美元。知乎刚在8月17日涨价生效的DeepSeek V4 Pro,高峰时段输出4.01美元,比3.7 Flash的3.75美元还贵,只有空闲时段的2.01美元仍是最便宜选项。知乎对国内开发者来说,这个交叉点很微妙:你之前因为DeepSeek便宜而选的路线,现在要重新比一次了。
还有一句容易被忽略的话:发布当天,谷歌把3.6 Flash也调到了同一促销价。这意味着 promo 期内3.7和3.6价差为零,现有用户做A/B几乎零成本——这其实是谷歌在请你免费帮它验证新模型。而"半价"的另一层意思,是用低价先把第一批重度Agent用户的工作流锁进来,等明年恢复原价时,你的架构已经定型了。
谁该迁,谁别动
先说结论:值得灰度,不值得只凭这次发布就全量迁移。知乎适合现在就上车的是这几类:跑编程Agent和后台自动化的团队——AutomationBench上3.7 Flash的30.4%高于同表的Terra和Sonnet 5,企业工作流自动化是它赢得最干脆的一栏;能在年底前完成真实任务验证的团队,promo期就是免费试验窗口;以及Google AI Pro/Ultra订阅用户,Spark个人Agent发布当天就换上了3.7 Flash,订户属于被动受益。

三类人先别动:需要私有化部署或数据物理隔离的,3.7 Flash没有开放权重,直接排除;硬核算理和复杂终端任务,Terminal-bench 3.0的14.9%说明它还扛不动最重的活;以及模型卡里仍列着幻觉、偶发缓慢或超时,知识截止标为2026年3月,需要最新事实的任务照样要接检索。知乎
真要迁,姿势比决心重要。promo期内3.7和3.6同价,正好用同一批真实任务做A/B;注意3.7支持low/medium/high三档thinking、默认medium,A/B时两边档位必须锁一致;从3.5 Flash或3.1 Pro迁过来的团队,官方要求移除temperature、top_p、top_k等采样参数。知乎最后记住,别只比每百万Token单价,要比每个合格结果的总成本——单价低的模型如果重试多、人工修补多,账单优势会被吃掉。
接下来盯三个信号
一是3.5 Pro还会不会出现。路透8月13日的报道没有给出任何Pro模型的新时间表,如果年底前跳票成常态,Flash就得从"轻量补充"升级成"实际主力",用中杯扛企业级需求,那时候的成本账要重算。知乎
二是年底前会不会再来一个3.8 Flash。按三周一迭代的节奏,这个可能性不小,届时定价策略是否调整完全是未知数,现在all-in半价票的人要想清楚续期价。
三是价格战的连锁反应。DeepSeek V4 Pro正式版发布公告在发布不足24小时后被撤回,涨价却照常生效;Grok 4.6顶着6美元的输出价入场。知乎Agent时代的模型竞争,比的已经不是谁第一次回答得好,而是谁能让一个足够聪明的模型,以最低成本跑完几十步任务。谷歌这次用半价买的就是这个验证窗口——你可以借它的票上车,但别把窗口当成终点。