当前位置:
AIGC文章详情

Claude认了降智,GPT连着翻车,Gemini口碑"被动回升":AI干活党换家前,先把"双保险"这笔账算清

源自79位全网作者

03:05

这两天,AI干活党的心态有点崩。先是开发者发现,Claude Code在一个没有任何公告的实验里,把"high"档推理程度读成了10 out of 100,而Anthropic把Claude Code 2.1.236及以上版本的Fable 5会话,纳入了一个「压缩effort数值刻度」的实验。知乎被网友追着问了一圈后,Anthropic工程师公开承认,Opus5是个「表现很不稳定」的模型,忽高忽低,不稳定。36氪同一时间,知乎上冒出"GPT5.6大规模降智什么时候能恢复"的提问,用户抱怨Codex里的模型"降智我忍了,连续降是不是有点说不过去了",话题标签里直接挂着"集体降智"。知乎于是熟悉的讨论又来了:要不要换家?换成谁?而被点名最多的名字,是前阵子还在被唱衰的Gemini。

Gemini这波口碑回升,手里确实有牌

先说为什么是它。8月14日发布的Gemini 3.7 Flash,正好踩在一个罕见的窗口上:官方直接宣布年底前价格腰斩,每百万token输入0.75美元、输出3.75美元,费用只有上一代的一半,比Grok 4.6也便宜一大截。36氪而且这不是单纯降价换量,官方给它的定位是"迄今为止最智能的编码和Agent主力模型",强调工具使用、调试和多步骤执行能力。

Claude认了降智,GPT连着翻车,Gemini口碑

跑分也在跟着涨:编码基准DeepSWE从约49%升到65.3%,FrontierCode从34.4%涨到43.6%,WebDev Arena的Elo分从1538拉到1588,复杂PDF理解这类知识型任务从22%涨到34%。知乎

Claude认了降智,GPT连着翻车,Gemini口碑

第三方评测也在帮腔。在模拟真实企业工作流的AutomationBench上,3.7 Flash从17.0%来到了30.4%。36氪Artificial Analysis的AA-AnalystAgent测试(80个任务各跑5次的全对率)里,Gemini 3.7 Flash(high)以60.0%排第一,压过Claude Opus 5(max)的53.8%和GPT-5.5(xhigh)的50.0%。知乎知乎还有用户拿Antigravity跑了一整套真实工作流,一次搞定,没有返工。

Claude认了降智,GPT连着翻车,Gemini口碑

社区的感知更直接。有知乎用户的说法很有代表性:现在觉得Gemini牛,是因为某两家公司疯狂降智开倒车,“居然轮到gemini给gpt擦屁股”。知乎

但先泼盆冷水:这波有多少是"同行衬托"

这句吐槽其实点破了关键——Gemini的口碑回升,一半是自己挣的,一半是对手送的。把对手犯错带来的相对优势,误当成绝对实力,是这波讨论里最容易踩的坑。

先说几个必须说的事实:7月,多家权威评测机构更新的全球大模型综合排行榜显示,谷歌旗下最重要的AI产品Gemini,已经跌出全球前十;ArtificialAnalysis最新智能指数排行榜中,谷歌没有任何一款模型进入前十。钛媒体

旗舰的缺位也没解决:三个月时间,谷歌接连推出三款Flash,反观另一边Pro系列仍然停在3.1;被寄予厚望的3.5Pro,据权威研究机构SemiAnalysis的报告,已被取消,而这段时间OpenAI、Anthropic、DeepSeek都陆续发布了新旗舰。36氪钛媒体

还有那9.5亿月活,也被指出很大程度上得益于Android预装和搜索入口的强行导流,不等于9.5亿人主动选择用它。钛媒体再往前翻,Gemini自己也有过降智史,这个兴趣下此前已经做过场景复盘。所以结论不是"别用",而是"别把它当唯一"。

双保险怎么配:三档预算,各取所需

我的建议很朴素:日常搬砖层压到Gemini 3.7 Flash上,吃满半价窗口;攻坚层保留你现在用得最顺手的旗舰模型,两边都不All in。

零成本档:学生党走官方学生通道,能免费领一年Google AI Pro,入口是gemini.google/students/,资格验证流程网上教程很多。知乎领过的注意检查自动续费,没学生资格的别硬上灰色认证,翻车成本比会员费高。轻量需求直接用App内免费额度加Antigravity的免费额度,足够试出水温。

会员档:已经在订Google AI Pro的,8月15日起,Gemini 3.7 Flash已开始向Gemini聊天中的Google AI Pro和Ultra用户开放,不用额外花钱,直接在App里把主力模型切过去试一周。知乎

API档:这是半价窗口最值钱的人群。2026年底前,每百万输入token 0.75美元、每百万输出token 3.75美元,差不多是上一代原价的一半。知乎轻中度调用按一天100万输入加20万输出估算,成本约1.5美元,一个月300元人民币出头。官方举的例子更直观:同样的机器人训练任务,3.7 Flash花1.46美元,Grok 4.6要花11.22美元,推理时间还只有对方的十分之一。36氪

三个坑提前标出来。第一,半价活动只到年底,明年一月都将有所回升,回升后的价格已经公示:输入1.5美元、输出7.5美元,别按今年的价格规划明年预算。36氪第二,国内直连不顺,有用户实测"国内Ip不能直连,又得转api还得挂vpn代理",网络成本要算进总账。知乎第三,别拿单一榜单当信仰,AA-AnalystAgent第一只是Agent场景的一个切面,综合榜单它还没完全打回来。

接下来值得盯的三个信号

这波窗口值不值得长待,看三件事:一是年底前Gemini旗舰(3.5 Pro的后继)到底发不发,发了才说明牌桌坐稳了;二是明年一月价格回升的幅度,决定双保险方案的长期成本;三是Anthropic什么时候把Opus 5修明白——Claude一旦回稳,这波"难民红利"会缩水,Gemini的相对优势要重新估。

一句话收尾:这波Gemini值得上车,但姿势是"低成本加仓",不是"清仓换家"。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章