Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

源自359位全网作者

09-27 21:32

Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

如果你这两天混AI圈,大概率刷到过这样的标题:「谷歌绝地反击!Gemini 4曝光」「泄露模型吊打Opus 5.5,OpenAI危」。热闹归热闹,先把最值钱的那句话挑出来——这一次,不是营销号自嗨,谷歌高管真的亲口认了。

这篇不替谷歌吹,也不跟着踩。我们把官方口径、社区灰测、财经信号分开摆,最后给你一张「等不等、换不换、买不买」的分人群对照表。

先把事实层和泄露层分开

官方说了什么(事实层):本周,谷歌DeepMind新掌门Koray Kavukcuoglu首次对媒体确认,Gemini 4已经进入后训练早期,目标就一个词:快。原话的意思很直白——「看到效果很兴奋,要在尽可能短的时间内实现最大的学习速度」,能早发,绝不晚发。IT之家9月24日的报道口径则是:新一代旗舰「有望不用等到年底」。量子位IT之家

被按下暂停键的3.5 Pro:这次官宣里还有个容易被忽略的细节。原本按计划,今年6月谷歌应该先等来Gemini 3.5 Pro,皮查伊甚至在5月I/O开发者大会上提前预告过,结果没发。Koray这次解释,是团队中途「稍微暂缓」,把精力挪去了Flash系列。翻译一下:3.5 Pro大概率被战略性放弃,全队的注意力已经押在4代上。量子位

不过旗舰跳票,不代表谷歌在躺平——3.x小步一直没停。9月初刚发的Gemini 3.8 Flash,在官方公布的金融Agent基准(Vals Finance Agent V2)上拿到61.4%、压过Claude Opus 5的58.6%,专业Agent测试整体超过上一代。36氪

Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

社区在传什么(泄露层):X上的测试账号Lumina放出了一组「鹈鹕骑自行车」对比图——同一个提示词,Gemini 4 Pro前后两个检查点,直接画出了两种完全不同的风格,后训练的痕迹肉眼可见。与此同时,据网友在Arena(大模型盲测竞技场)的追踪,谷歌正以“gemini-3.8-flash”的马甲测试最强模型,内部开发代号Argon——跑分对着Opus 5.5、GPT-6去打,B站相关信息视频动辄几百上千条评论。量子位IT之家

「吊打Opus 5.5」的跑分图,先别急着当真

泄露榜单可信吗?我们的判断是:方向大概率真,幅度先存疑。三个理由。

第一,社区自己就在打假。相关实测视频评论区里,有用户直言「Gemini 4 Pro的benchmark图好像是AI生成的」——截图造一张榜单,现在比谁都容易。哔哩哔哩

第二,Arena盲测赢的是「上线第一周」,输的是「上线第三十天」。谷歌在这事上有过前科:去年Gemini 3 Pro发布时确实风光过,OpenAI一度进入「红色警戒」,但随后谷歌自己在旗舰节奏上慢了半拍。社区总结的口诀更难听但更真实——「day1王者归来,day7降智砍账号,day30咕咕嘎嘎」。灰测表现和正式发布后的稳定性、限流政策、API实际能力,是三件事。哔哩哔哩

Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

第三,榜单任务和你的真实任务不是一回事,不同赛道各有胜负:Gemini 3.8 Flash Cyber在行业标准漏洞发现基准CyberGym上达到前沿水平、超过了上一代和更大的模型,但官方口径也仅限于此。36氪

Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

更现实的是日常体验。翻Gemini现在的用户吐槽就能看出来:「网页chat也限量,开pro订阅聊一个小时就得强制等五小时」。这些是产品策略和接入层的问题,不是换个新模型代号就能自动解决的。模型换代 ≠ 体验换代,去年Gemini 3已经演示过一次了。

谷歌为什么这次踩油门:三个跨领域的信号叠在一起

单个角度看这只是条模型新闻,把财务、算力、组织三条线拼起来看,才能看懂「快」字背后的压力。

资本市场需要新故事。知乎上9月底的热门讨论摆着两个扎眼的数字:一边是巴菲特「退休」前Q3加速抛苹果、首次建仓谷歌,被解读为把他当AI时代的基础设施公司来买。另一边是谷歌2026年二季度自由现金流约-59亿美元,2004年上市以来第一次转负。烧钱创新高、要靠借钱维持资本开支的公司,需要旗舰模型及时交作业——这不只是技术时间表,也是财报时间表(两处数字均为社区引用口径,请以正式财报为准)。知乎知乎

自研芯片给了它喊「快」的底气。第三方用16块谷歌TPUv7跑月之暗面的Kimi K3,每秒跑出709个Token,比英伟达GB200快了57%,用的还是DeepSeek的推理框架。做这个成绩的既不是造Kimi的也不是造TPU的,这比任何发布会PPT都更能说明TPU的推理性价比。第三方成本-性能散点图上,Gemini 3.x系列长期贴着「最省钱」的那条前沿线走:模型+芯片一体,才敢承诺更激进的推理价格。至于同一周官宣的Suncatcher算力卫星(10月1日搭乘SpaceX猎鹰9发射),按谷歌说法芯片在太空中大约可以运行15分钟,之后就需要关闭以冷却——建议当工程验证看,而不是当数据中心看。量子位量子位

Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

组织内部的刹车声也在响。前Mozilla工程师、后来加入DeepMind负责硬件芯片设计工具的Robert O’Callahan本周宣布辞职,理由竟不是嫌弃谷歌AI发展太慢,而是「太快了」;他想转去一个不加速AI的岗位,没转成,于是走人。一家想躺平的公司不会有人因为跑太快而离职——这是「谷歌这次是认真的」的最强侧面证据。量子位

你该怎么动:分人群对照表

已经买了Google AI Pro/Ultra的:不用为4代抢跑做任何操作,也别急着退订。真正要盯的是发布后第一个月的限流政策和「降智」投诉密度,那才是你这份订阅续不续的依据。

用着竞品(GPT-6/Claude系)、在犹豫要不要跳船的:不为泄露榜单跳。等三个东西出现再看:①Arena里代号转正为官方模型;②至少一家第三方跑过长程代码/文件处理类任务的实测(不是聊天类);③API定价和免费额度。三样齐了再决策,通常比追首发只晚一到两周,但踩坑概率低一大截。

价格敏感、指望谷歌「便宜大碗」的:Gemini现在就已经是全场景里最舍得让利的旗舰线之一——3.8 Flash支持100万Token上下文,输入价格每百万Token 0.75美元、输出3.75美元。评论区那句「一年5块钱Pro可以斩杀全部AI」是调侃,但等Gemini 4用同样价格把能力拉到旗舰位,才是它对普通人最大的杀伤力。看这类对比图别看单科状元,看智能指数和单任务成本的帕累托前沿:谁在「同样聪明、更便宜」的象限里,一目了然。36氪

Gemini 4官宣提速:那份「吊打Opus 5.5」的泄露榜单,看完分层再决定等不等

纯看热闹的:10月是个关键窗口。如果10月底还没动静,参考3.5 Pro跳票史,这条线可以降到「月度观察」。

一句话收束

这次值得肯定的不是「Gemini 4有多强」——它还没发布,任何说它已经强的结论都超出了证据范围。真正改变的是:谷歌把旗舰模型、自研芯片、资本市场和组织节奏四件事绑成了一列提速的火车,而且没有再给自己留跳票的余地。对普通用户来说,它值得你把它放进10月的待办清单,但不值得你现在就为任何一张泄露跑分图换订阅。

灰测归灰测,官宣归官宣。等正式命名、等条款、等第三方长任务实测——三个信号齐了,我们再聊值不值得掏钱。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章