9月第一周,模型圈像集中放榜:9月1日Anthropic发Claude Fable 5.1,9月2日Google的Gemini 3.8 Flash和Meta的Muse Spark 1.3同日上线,9月4日OpenAI甩出GPT-6 Astra,顺带喊出"AGI时代来了"。知乎密集发布里如果只盯一个,我建议盯哈基米——就是Gemini,社区给它起的诨名。不是因为它跑分最高,而是它这一周口碑坐了趟过山车,而且这次发布暴露出的"标价和账单"的分裂,对每一个花钱用AI的人都值得算一遍。
发布当天被喷成"美国豆包",三天后风向反转
9月2日凌晨,Google发布Gemini 3.8 Flash。这是六周里的第三个Flash:7月的3.6、8月的3.7、9月的3.8,三周一版,上一代的热度还没散。
发布当天的舆情相当难看。"谷歌这波拉完了"成了评论区热词,梗图连夜做好,“美国豆包"这个老绰号被贴得更牢——三条猛龙配一条呆龙的表情包模板里,Gemini永远是呆的那条。B站一条相关视频的热评是"依旧吊打 依旧颠覆 依旧一条流口水的闪电”,收了483个赞。哔哩哔哩
三天后风向变了。翻完榜单的人发现,这模型在几个硬核测试里悄悄爬到了第一,"美国豆包站起来了"成了新标题。UP主神烦老狗的实测视频标题很直白:“矮子里拔将军,居然还真能用?”,5.5万播放、369条评论吵成一片。有条50赞的评论把这一周总结透了:“模型圈已经饭圈化了……互联网的造神与毁神,在这个你追我赶的AI时代,将会体现得更加淋漓尽致”。哔哩哔哩
吵归吵,两边手里都有真数据。下面把三笔账摊开。
第一笔账:七分之一价格,专项跑分咬住旗舰
先看硬数字。价格:每百万token输入0.75美元、输出3.75美元,和上一代3.7一分没涨;对比Claude Opus 5的5美元/25美元,差价约七倍。知乎
这笔钱买到了什么:
软件工程基准DeepSWE v1.1:73.7%,上一代3.7是65.3%;而贵七倍的Opus 5是74.0%——只差0.3个百分点。
Agent终端编码Terminal-bench 2.1:89.4%,全场第一,压过Opus 5的89.1%。
B站UP主王郁的"大模型高考"(75个模型、6门高考真题、累计测6400多次):3.8 Flash考了702分,比上代暴涨33分,跻身700分俱乐部第三位,22分钟交卷,全套卷子成本6块3。哔哩哔哩
第三方机构Artificial Analysis(AA)的智能指数:High档59分,够到GPT-5.6 Sol最高档的同一水平;AA总榜第22位,Flash级别里排第一。知乎

同步发布的还有个Gemini 3.8 Flash Cyber,安全方向更猛:覆盖20种语言的漏洞发现测试拿71.0%,上代58.9%、上上代46.6%,一年涨了24个点。知乎但先别激动——Cyber版不走公开API,只面向政府、关键基础设施和可信安全厂商(Fairwind计划,官方称全球650多个伙伴),普通开发者碰不到。
不过还有个更隐蔽的反向信号。Arena的Code Arena WebDev榜单——用户盲测投票的第三方擂台——上,Gemini 3.8 Flash(High档)以1567分排在第18位,反而低于上一代3.7 Flash的1587分,离榜首的Qwen3.8-Max(1691分)、Claude Opus 5 Max(1687分)也有差距。出题人给的考分和群众投的推荐票,出现了分裂——这本身就是这周争议的一部分。

只看第一笔账,"站起来了"不像玩笑。但急着换模型的人先按住,坑在第二笔。
第二笔账:单价没涨,每个任务贵了四成
AA在发布当天出的评测快照,给"同价同速"泼了盆冷水:
同样跑一个综合任务,3.8 Flash的High档平均消耗4.8万token,上一代约3.7万,多了近三成;
单任务实际成本从0.40美元涨到0.58美元,贵了四成还多。知乎
首字延迟平均13.3秒,同类模型中位数是2.99秒,慢了四倍多。知乎
单价一分没动,账单为什么变大?Google自己在文档里给了答案:3.8 Flash遇到复杂任务会"works harder"——反复跑思维链、多次调工具、发现错误就推翻重来。翻译成账单语言:反复推理,每一轮都是真金白银的输出token;多次调工具,每调一次都要把上下文重读一遍,输入token跟着翻倍;自我纠错,前面烧掉的token全算你的。知乎作者田小橙那篇复盘说得直白:“勤奋是好事,我认。但勤奋的 token,记在你头上”。知乎于是这次发布有个容易被新闻稿跳过的细节:3.8 Flash支持low、medium、high三档思考等级,开发者可以按任务调"脑力消耗"——写个简单邮件别开高档,分析大型代码库再让它多烧token。知乎AA测试里Low档单任务均价0.24美元,不到High档0.58美元的一半——但Low档的能力不能和High档划等号,选哪档取决于任务能不能顺利完成。官方文档也说得直白:更看重算力效率的开发者,建议用Low档,或者干脆留在3.7。知乎
已经有开发者把Low/High两档拉进Docker隔离环境跑了真实模块验收:Low档首稿直接通过全部行为测试和TypeScript检查,High档反而在两轮交付里先后遇到空响应和输出截断,需要人工介入。知乎

看明白了吗?跑分第一的姿势,是High档烧钱换来的;不想烧钱,官方自己给了两条退路。"价格不变"是标价,"账单贵四成"是成交价——这是这次发布的第一个分裂点。
还有个时间边界值得留意。目前的0.75/3.75美元是introductory pricing(首发优惠价),持续到2026年12月31日;从2027年1月1日起,标准价调整为输入1.50、输出7.50美元——正好翻倍。知乎知乎这是两份独立拆解给出的同一结论,Google官方定价页的截图里,现价旁边也标着1.50/7.50美元的regular原价。换句话说,所谓性价比窗口期,只剩不到四个月。

第三笔账:专项尖子生,不是全能选手
第三个分裂点最有意思:同一个模型,在不同测试里像两个模型。
前面那些跑分都是"专项"。换到通用任务上:
Terminal-bench 4.0(通用长任务):3.8 Flash只有19.1%,Opus 5是51.8%,差出一倍多;
OSWorld-2.0(真实电脑操作):59.0%对75.4%。知乎
实测口碑也印证。302.AI基准实验室的结论是"跑分挑战旗舰级,体验仍是Flash级":速度快、搭Demo利落,动态SVG画得比同场的Qwen3.8-Flash好,但"很容易停留在完成任务而非打磨结果",网页复刻的还原度明显输给Qwen。知乎有开发者用Cursor起了三个子项目(3D动画短片、3D烟花仿真、Markdown图床),分别14分钟、11分钟、5分钟做完,总成本30块钱左右——他的评价却是"有点失望",前端全是浓浓的AI味儿。知乎另一位开发者拿40道编程题横测GPT-6 Astra、Opus 5和3.8 Flash:基础题3.8 Flash毫无压力,但异步状态机这类困难题只过了四分之一,工具调用挂了一半,有两题甚至把函数调用的JSON当成普通文本直接输出了。知乎
不过"慢"和"糙"的另一面,是轻场景里它是真的快。那份40题横测里,3.8 Flash做代码补全的P50首字延迟只有210毫秒,几乎无感;AA的输出速度榜上它以302 tokens/s排到全场第二;而前面那个13.3秒的首字延迟,出现在High档复杂Agent任务里。知乎快和慢都是真的,就看你拿哪档干哪活。

到这里可以给"美国豆包"公案结案了:喷它的人没错——重活它确实干不动,通用长任务和复杂状态机是硬伤;夸它的人也没错——七分之一的价格,专项成绩咬住旗舰,日常轻中度任务性价比碾压。它不是旗舰平替,是专项尖子生。或者用知乎作者"出海有道"的比喻:Google这次不想当"最强模型",它想当AI世界里的丰田卡罗拉。知乎
B站一条27赞的评论把战略看穿了:“很简单,因为谷歌有手机,有一堆软件要使用。最强不重要,重要的是快,用谷歌手机 你输入语音或者文字几秒之内AI给出不来答案,用户还会继续使用吗”。哔哩哔哩另一条补得更狠:“其实速度快是不小的优势,模型能力越接近,就会发现时间成本也是成本。”
三类人,三种打法
掏API费、用编程工具的开发者(Cursor、Cline、Antigravity用户):
分档用是最优解:日常修复、规则清晰且有自动化验收的任务,先跑Low档(单任务0.24美元量级);探索性强、多步骤的复杂任务再开High档。那份40题横测作者的工作流可以直接抄:日常默认挂3.8 Flash,碰到复杂状态机、多服务编排,手动切Opus 5。
拿它干擅长的:快速Demo、原型验证、高频批量调用、文档图表处理。别拿它干不擅长的:开放式长任务、连续Agent流水线、要细节打磨的交付级前端。
神烦老狗评论区那条86赞的教训值得裱起来:"别让gemini整大项目,我之前让他只读,上个厕所回来给我重构了。"它勤奋,但权限管理得你自己来。哔哩哔哩
国内访问是硬门槛:Gemini国内无法直连,常见路径是API中转或Antigravity这类工具(评论区有人做了客户端汉化补丁)。中转站要挑,老司机们最怕的就是"降智"。
日常办公、白嫖党:
别为跑分掏钱。Gemini App和网页端的免费档,写文案、做总结、处理文档够用,3.8 Flash的能力升级不改变"免费档够用"这个事实。
评论区流传的低价Pro路径(学生认证、硬件附赠,有人晒"十块钱十八个月pro,他出现幻觉我都要夸想象力丰富")确实存在,但本质是地区差价和身份核验,有合规和封号风险,自己掂量。哔哩哔哩
不想折腾访问的:国内直连的免费替代这周也在更新,千问刚推了新版Qwen3.8 Max,日常办公场景不缺选择。哔哩哔哩
手里的3.7用户和Opus用户:
3.7用户:除非你的任务正好卡在3.8的专项强项上(编程Agent、文档图表、多模态),官方自己都承认留在3.7更划算。不用怕错过——三周一版Flash,FOMO是Google的商业模式。
Opus 5用户:不用整体换。重活(复杂重构、长任务、交付级打磨)继续留给Opus,轻中度任务外包给3.8 Flash,账单能省下一大截。
接下来值得盯的信号
优惠期会不会如期结束、甚至延长。标准价翻倍到1.50/7.50美元不是小事,2027年的定价会重写竞争格局——年底前盯紧Google官方定价页。
Gemini 4:有爆料称Pro档内测已经启动,可能10月公开,Flash lite本月内也会来。哔哩哔哩Pro线如果10月真回归,"Flash连发、Pro跳票"这个策略就要重新评估。
Meta的Muse Spark 1.3:同日上线、开源免费,官方口径编程基准超过GPT-5.6 Sol,发布几小时就刷新了部分榜单。同价位的开源对闭源,好戏刚开场。
Flash线三周一版本身就是信号:DeepSWE榜单上,四代Flash的得分轨迹一路陡升到74%,代价是3.8 Flash的平均Agent步数冲到全场最多的166步——有解读认为Google在用小模型线跑"递归自我改进"(RSI),DeepMind研究员姚顺宇一句"对 RSI 是巨大飞跃"被有心人截了图。知乎这条线目前属于猜测,先别当决策依据。
最可靠的永远是你自己的账单:AA在9月4日已经更新到v4.2榜单,9月2日那份快照只是特定环境的样本,"贵四成"别直接外推到你自己的任务上。

最后问一句:你踩过"跑分很高、用起来账单爆炸"的坑吗?哪个模型、什么任务,评论区帮大家避避雷。