这周 AI 编程模型圈是真的热闹。8 月 13 日谷歌发布 Gemini 3.7 Flash,主打编程和 Agent,API 价格直接打对折。36氪四天后的 17 日零点,DeepSeek V4 系列新定价生效,高峰时段输出价格涨了 3.5 倍。知乎一个降价,一个涨价,最纠结的就是自费买 token 的写代码人群:负载到底迁不迁?
先把谷歌这次端上来的东西说清楚。
官方数据上,Gemini 3.7 Flash 在 DeepSWE 上从前代的 49% 左右冲到 65.3%,测"让模型自主操作软件完成多步任务"的 AutomationBench 从 17.0% 提到 30.4%。知乎官方定位是"最智能的工作型模型",主打长时软件工程和多步骤任务。价格是最大卖点:今年年底前,输入 0.75 美元/百万 token、输出 3.75 美元/百万 token,正好是上一代 3.6 Flash 原价的一半。36氪

注意"限时"两个字。2027 年起恢复 1.5 美元和 7.5 美元。知乎这不是永久降价,是一个年底到期的促销窗口。现在指望它长期省钱的话,半年后的账单会提醒你这笔账没那么划算。
跑分归跑分,社区实测口碑到底怎么样?我翻了一圈最近的实测反馈,发现口碑明显分成了两派。
正方相当能打。B站一条 21 赞的评论说,“和 DeepSeek V4 Flash 鏖战一个下午没完成的功能,它一轮对话就完成了,完成度非常高,几乎不用修改”。哔哩哔哩还有人说"小任务现在全丢给 Gemini,又快又好"。大家公认的是速度夸张,“一秒三页根本看不完”。
反方也不含糊。一条 8 赞的评论直言:“速度确实很夸张,但本质没有改变……喜欢报喜,实际全是错的”。哔哩哔哩还有人反馈"简单代码还行,涉及复杂逻辑能出一堆 bug"“经常干一会就抽风,根本用不了”。哔哩哔哩通过第三方框架接入时"没有思维链,表现拉完了"。
两边放在一起,实测结论其实很清晰:这是一个"小任务加速器"——高频轻量编码、前端页面、快速迭代场景,性价比突出;复杂系统工程、对正确性要求苛刻的活,它还不是旗舰替代品。谷歌自己也默认了这一点:真正的旗舰 Gemini 3.5 Pro 至今延期,没有明确上线时间。36氪

然后是三笔账,决定你要不要迁。
第一笔,价格账。Gemini 3.7 Flash 限时价是输入 0.75 美元、输出 3.75 美元每百万 token,全天平价。DeepSeek V4 Pro 涨价后,高峰时段(9:00–12:00、14:00–18:00)缓存未命中输入 9 元、输出 27 元每百万 token,闲时半价。知乎两者量级相近,真正的差别在节奏:一个全天无峰谷,一个要掐着时间段安排任务。如果你的调用集中在白天工作时段、又没法挪到闲时,"全天同价"本身就是隐性折扣。

第二笔,能力账。DeepSWE 从 49% 到 65.3% 的跃升是真的,但 AutomationBench 30.4% 也提醒你:让模型自主干活的多步任务测试里,十道题它目前只能解三道。跑分决定下限,实测决定上限,你日常跑的永远是后者。
第三笔,迁移账。换模型不是改一行配置。社区已经有工程师总结:Agent 迁移要重测思考预算、会话状态和成本,接入方式不同结果差异很大。知乎再加上海外支付和网络环境的门槛,迁移成本不是零。
所以谁适合迁?三类人可以试:任务小且频的个人开发者、受不了高峰价格波动想对冲成本的、想跑长时 Agent 任务的。三类人建议等:复杂逻辑重的生产环境、对稳定性和合规要求严格的、不想折腾海外账号支付的。
最后留三个观察信号:Gemini 3.5 Pro 年内能不能落地,决定 Flash 系列能不能守住高端;12 月 31 日半价到期后会不会续期;DeepSeek 涨价、GLM-5.3 发布之后,国产模型会不会跟一轮降价。这三个信号任何一个动了,下半年编程模型这道题的答案可能都会变。