美东时间9月2日凌晨,谷歌和Meta前后脚把新模型推上线;往前数24小时,Anthropic刚发布Claude Fable 5.1和Mythos 5.1,主打编码、知识工作和长时间Agent任务。36氪同一天,OpenAI官宣下一代模型Astra达到网络安全能力的最高等级门槛,照例宣布最高级能力受限开放。知乎48小时,四家头部集体出手,微博话题#AI竞赛时间单位从季度压缩到周#挂了上去,知乎“Gemini的模型是不是快被淘汰了”冲到百万级浏览。微博
如果你是自己掏钱调API、或者同时养着好几家订阅的重度用户,这轮轰炸真正的问题不是“谁赢了”,而是本周的手往哪个模型上放。四本账,一笔一笔对。
第一本账:3.8 Flash到底升级了什么——不是换了脑子,是更卖力
先看节奏:7月21日3.6,8月13日3.7,9月2日3.8,六周第三更,5月以来第四款Flash。知乎据多家科技媒体报道,3.8和3.7共用同一块基座,增益来自后训练和谷歌自己那句“works harder”:复杂任务上执行更多推理步骤、反复调用工具、边干边自我校验。知乎
配置是硬货:100万Token上下文、最高64K输出、LOW/MEDIUM/HIGH三档思考强度(默认MEDIUM),全模态输入。知乎
分数分两头看。官方口径里,长程工程测试DeepSWE v1.1从3.7的65.3%拉到73.7%,Claude Opus 5是74.0%,只差0.3分。知乎第三方机构Artificial Analysis给的综合智能指数是59分,比3.7高3分,但前一天发布的Claude Fable 5.1 max拿了66分排第一,Opus 5 max 63分。知乎说人话:综合能力还在第二梯队,干活科目跳进了第一梯队。
把官方与第三方公布的十科成绩压成一张表(Gemini 3.8 Flash vs Claude Opus 5,数据截至9月3日):
科目 | 3.8 Flash | Opus 5 | 差距 |
|---|---|---|---|
长视频理解 LVBench | 87.8% | 75.4% | +12.4 |
法律Agent Harvey | 10.0% | 6.7% | +3.3 |
金融Agent Vals v2 | 61.4% | 58.6% | +2.8 |
图表推理 CharXiv | 86.2% | 83.7% | +2.5 |
生物科研 LABBench2 | 86.2% | 84.2% | +2.0 |
通用推理 HLE | 54.9% | 54.4% | +0.5 |
终端操作 TB 2.1 | 89.4% | 89.1% | +0.3 |
长程编码 DeepSWE | 73.7% | 74.0% | -0.3 |
电脑操作 OSWorld 2.0 | 59.0% | 75.4% | -16.4 |
难版终端 TB 4.0 | 19.1% | 51.8% | -32.7 |
第三方机构Datacurve的验证更直接:两者通过率打平,但Flash每个任务花2.36美元,Opus 5要11.84美元,差5倍。知乎

所以“平替旗舰”这话对一半:在部分科目上,它用旗舰零头的价格干出接近的活;但综合知识工作(GDPVal 1545 Elo vs 1824)和操作电脑这种通用活,还差得明显。它是牛马,不是全能顾问。
第二本账:三个裂缝,踩哪个取决于你怎么用它
裂缝一:背题嫌疑。 同一个终端考场,旧题卷拿89.4分、反超旗舰,换一批新题的4.0版本只剩19.1%,而Opus 5稳稳停在51.8%。知乎像模考次次满分、一换新题就露馅的学生。如果你的业务恰好是“新场景、没见过的题”,这32个百分点就是给你的提醒。
裂缝二:官方演示的配置你拿不到。 官博那个精致的3D城堡,是在自家Antigravity平台里反复迭代、还调用了生图模型做出来的;媒体用同样提示词在通用环境复现,得到的是“漏水的火山口”。知乎跑分考的是“模型+工具+循环迭代”整套系统,不是裸模型单打独斗——你迁移时带走的只有模型,系统带不走。
裂缝三:单价没涨,账单涨了。 第三方测评机构Artificial Analysis的跟踪数据显示,3.8的单任务成本比3.7高约四成——不是因为涨价,是因为它“更努力”,输出Token变多了。知乎谷歌自己也很坦诚:算力效率优先的负载,可以调低思考强度,或者干脆继续用3.7,后者仍获完整支持。36氪这可能是第一次,厂商在新模型发布当天公开劝你“先别急着换”。
第三本账:价格窗口只有四个月,别只看0.75,要看1.50
首发单价确实没动:每百万Token输入0.75美元、输出3.75美元,和3.7一样。36氪但这个价只到2026年12月31日,2027年1月1日起,输入价涨至1.50美元、输出价涨至7.50美元,正好翻倍——白纸黑字写在官方发布说明里。知乎
算个静态例子:一次输入20万Token、输出2万Token的任务,按首发价计算约为0.225美元,按2027年标准价计算约为0.45美元,还没算缓存、工具调用和失败重试。知乎翻倍之后,3.8 Flash会落进中国头部模型的定价带,“便宜”这个标签能挂到什么时候,要看你对比的是谁。
低价当噱头、日历定生意,所以“迁不迁”的真正问题是道截止日题:要么在12月31日前用低价把负载绑上Gemini生态、同时接受四个月后成本翻倍;要么这四个月根本别动。中间态不存在。

第四本账:谷歌为什么急,Meta为什么骚话多
3.8的发布节奏,一半是产品策略,一半是叙事压力。旗舰Gemini 3.5 Pro原定6月发,因代码生成能力未达内部预期而延期数月;7月中旬彭博社报道后,Alphabet股价单日下跌约4.4%,截至9月初自5月底以来累计跌幅接近20%。知乎9月初,谷歌股价才结束2015年以来最长的连续四个月月度收跌。微博
人员上,据多家外媒报道,Transformer论文联合作者之一转投OpenAI、AlphaFold之父加入Anthropic。知乎
但谷歌不是没钱:其一季度财报营收同比增长22%至1099亿美元,谷歌云增长63%至200亿美元,云积压订单约4600亿美元。知乎中端六周三连更,是在旗舰归位之前用节奏守住开发者生态的存在感。最近谷歌Gemini 3.8 Flash带火了“RSI飞轮启动”的说法,DeepMind研究人员一句“每三周一次重大迭代”,被不少人解读成递归自我改进的复利效应已经转起来了,网友直接吐槽这是“左脚踩右脚就能上天”的玄学。微博同一块基座加后训练堆Token的升级方式说明,这个节奏更接近产品运营,不是智能爆炸。
Meta这边是另一种打法。Muse Spark 1.3距离1.2发布才一个月,卖点不是刷分而是效率:Meta工程师称同类任务工具调用次数减少约20%、Token使用量减少约25%,已上线MuseCode和Meta Model API,此前提供的推理模式现已开放,更高强度的Max Reasoning模式将在完成额外安全测试后推出。首席AI官Alexandr Wang照例下场拉踩:“我真不想这么说,但是……Gemini是谁?”。36氪同日消息,当地时间9月2日Meta发布最新人工智能模型,并上调2026年AI资本支出下限。微博当日Meta股价收涨3.23%,创7月22日以来新高。微博社区的判断更冷静:Meta真正的棋局是“开源引流+API收费+云变现”,模型声量是给后面三件事导流的。

插一段:Cyber版你摸不到,但这个信号值得所有做产品的人看懂
与3.8 Flash同场的还有个网络安全专用版3.8 Flash Cyber:CyberGym漏洞挖掘86.2%、略高于GPT-5.5-Cyber的85.6%;CWE-Bench自动修补pass@1 47.2%、与领先前沿模型的47.8%非常接近,分数没有赢,但单任务成本明显更低,落在成本-准确率的Pareto前沿上(注意:Pareto前沿不等于“修补能力第一”)。36氪倒是prompt injection测试Gray Swan IPI上,Cyber版6.0%的攻击成功率还没赢过基础版的5.5%,“全能安全”的说法得收着信。知乎

更直接的例子来自真实使用:Chrome安全团队发现,3.8 Flash Cyber生成的正确漏洞补丁数量,是体量更大的商业模型中最佳结果的2.6倍。36氪Wiz的内部渗透测试基准也称其召回率高出7.5至9.7个百分点、成本低2.3至5.2倍——但这两组都是合作方口径、缺少完整公开样本,只能说明合作方看到了价值,不能替代可复现的外部评测。
重点不在这几个分:它不公开发售。想用它,得通过Fairwind计划接受背景审查、禁止转售,对象锁定政府、关键基础设施与软件维护者。知乎同一周,OpenAI的Astra跨越关键网安红线、ExploitBench拿满分,同样宣布最高能力受限开放。知乎两家头部一周之内做了同一个动作:能力照发,入口按对象分层。攻防两用模型的“资格题”时代开始了——安全团队采购的第一步不再是比模型,而是证明自己是“可信防御者”。
对号入座:本周你的手该放哪
跑长程编码、多步Agent(金融/法律/科研流程)的开发者:值得把3.8放进自己的评测集试一轮。但别只比最终答案,同时记录四项:成功率、延迟、每任务Token消耗、失败重试次数。官方跑分赢在“模型+工具+迭代”,你要验的是裸接到你的系统里还剩几成。
吃日常问答、短文本、低延迟的负载:留3.7,或者把思考强度调到LOW/MEDIUM。这是谷歌官方建议,不丢人,还能躲开那40%的账单涨幅。
业务押在新场景泛化上的(自动操作电脑、没见过的工具链):19.1% vs 51.8%这组数字先泼冷水,“越级打旗舰”的兴奋留给旧题考场。
纯C端订阅用户:综合榜上Fable 5.1(66分)还在第一,3.8 Flash(59分)在第二梯队;单科爆冷改变不了你日常体验的排序,别被一条“暴打Opus”的标题推着换订阅。
要做生态绑定的企业:要么在12月31日前完成迁移验证、把翻倍写进明年预算,要么现在就不启动。低价窗口期是机会,也是合同。
接下来盯四个信号
Gemini 3.5 Pro什么时候官宣归位——再拖,“中端闪电战是拖延战术”的叙事就会坐实;
12月31日翻倍是否如期执行,还是用延期换用户留存;
Meta的Max Reasoning档、以及国内阵营的节奏(社区已在传阿里发布Qwen3.8-Max-0902,但官方参数表尚未见到,建议等官宣再下判断)会不会跟进“三周一更”;
Fairwind式分层开放被几家跟进——如果成了标配,“最强能力人人可用”的日子比我们以为的结束得更早。
这轮48小时轰炸,最值得带走的一条不是谁又赢了哪门考试,而是竞争轴已经换了:从“谁回答得更聪明”,变成“谁能把活干完、干得久、还干得起”。分数表之外,价格表和日历(12月31日)已经先一步摆到桌面上——你只需要回答一个问题:你的任务,配不配得上“更努力”这三个字。