北京时间10月1日凌晨,谷歌把 Gemini 4 Argon 发了出来。这是 Gemini 4 系列的第一款旗舰——上一代旗舰 Gemini 3 还是2025年11月的事,中间将近一年,谷歌只更新了 Flash 系列,旗舰位一直空着。DeepTech深科技
消息传到国内是今天早上,标题基本一个画风:「18项基准领先12项」「重返AI前沿」「Token价只要GPT-6的1/5」。OpenResty 作者 agentzh 发微博说:「又要忙着跑我司的内部评测了……我的那一大堆Google token看来不难花掉了」。小红书上「谷歌仓位70%,就等Gemini 4」的帖子收了117个赞、68条评论,评论区一半人在聊模型,一半人在聊股价。微博小红书
但刷屏里最容易被忽略的细节是:这款「杀回榜首」的模型,没有出现在任何一个普通用户的 Gemini 界面里——第一批用上它的人,是网络安全防御方。麻省理工科技评论
如果你正盘算着退掉手里的 ChatGPT 或 Claude 订阅换阵营,或者想把 API 迁过去,建议先把下面三个数字、两个价格坑和一份开放时间表看完再说。
一、跑分先别上头,三个数字帮你去噪
第一个数字:12/18,但要看清是谁在数。 谷歌官方对比表里,Argon 在18项评测中单独领先12项、并列第一1项;GPT-6 Astra 领先3项,Claude Opus 5.5 领先2项。数字本身不假,但华尔街见闻提醒了一个方法论问题:以 Argon 得分最高的 DeepSWE v1.1(77.9%,长流程软件工程)为例,谷歌用的是自家的 mini-swe agent 框架跑分,而竞争对手的分数来自公开榜单和各家自报——口径并不统一,直接比数字要留个心眼。DeepTech深科技华尔街见闻
社区里的判断相对中肯。知乎答主 Kitt在进化 认为「这benchmark并不水,Gemini没有拿一些被刷到烂大街的榜凸显高分」。另一位答主 SUNNY99 则提醒,这些 Benchmark 的 harness、推理预算、测试环境未必完全一致,厂商发布模型肯定会展示自己表现比较好的项目。知乎知乎

第二个数字:53分——第三方榜单上,它没登顶。 微博科技博主 0xAI 整理了 Artificial Analysis 的智力指数:Argon 拿53分,和 GPT-6 Astra 一模一样,而榜首的 Claude Opus 5.5 是58分。换句话说,「一觉睡醒 Gemini 登顶」的说法,在独立第三方口径下并不成立——Argon 是追平了第二梯队头部,距离第一还差5分。微博
第三个数字:-10.5个百分点——它也有明显短板。 在 FrontierSWE v2 上,Argon 得分55.0%,落后 Astra 的65.5%整整10.5个百分点;Terminal-bench 4.0 上57.4%,落后 Opus 5.5 的66.4%约9个百分点。所以准确的说法不是「全面碾压」,而是「优势在广度」:知识工作、金融法律、自动化任务这些企业场景领先,部分硬核代码和科学推理场景仍然落后。华尔街见闻
那真正的亮点是什么?我认为是这两处:
输出上限从6.4万 token 直接拉到100万。 注意,是单轮输出上限,不是上下文窗口,很多自媒体把这两个概念混着写。知乎答主 SUNNY99 的解释很到位:现在 Agent 跑长任务靠的是「模型→工具→压缩上下文」循环,跑几小时后早期信息被摘要了好几轮;Argon 的思路是暴力拉长单条轨迹,理论上一次执行就能容纳几十万 token 的思考、工具调用和代码修改。当然他也补了一句大实话:「能输出 1M ≠ 输出到 80 万 token 以后还知道自己在干什么」。知乎
企业级基准的领先幅度确实夸张。 Harvey 法律智能体基准上 Argon 拿19.6%,Astra 只有5.4%、Opus 5.5 是3.8%;Zapier 的 AutomationBench(端到端业务自动化)51.3%对42.5%和41.4%;长视频理解 LVBench 91.7% 是目前最高分。谷歌内部已经在拿它干重活:智能体团队重写了视频解码库 libgav1 的3.2万行 SIMD 代码,成品比之前的 Rust 移植版快2.7倍;另一组智能体分析数据中心遥测数据,释放了超过300TiB内存;量子计算团队的一个子程序优化,Argon 几分钟内给出比已发表基线高40%的方案。DeepTech深科技
二、两个价格坑:「便宜一半」和「1/5」都有前提
先上四家旗舰的 API 对比(美元/百万 token):
模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
Gemini 4 Argon(推广期) | $2 | $10 | 缓存输入再打95折,约$0.10 |
Gemini 4 Argon(推广期后) | $4 | $20 | 官方未公布截止时间 |
Claude Opus 5.5 | $4 | $20 | 与 Argon 正式价持平 |
GPT-6 Astra | $10 | $50 | 目前最贵 |
GPT-6.1 Sol | $2 | $10 | 与 Argon 推广价同价位 |
Gemini 3.8 Flash | $0.75 | $3.75 | 谷歌自家便宜档 |

坑一:「便宜一半」只在推广期成立。 $2/$10 是首发推广价,推广期结束后翻倍到 $4/$20——刚好和 Claude Opus 5.5 一个价,只是 GPT-6 Astra 的四成。而谷歌至今没说推广期到哪天截止。SUNNY99 把这个定价策略概括得很直白:「首发按 Sol 的价格卖,正式价格按 Opus 5.5 卖」——一头狙击 OpenAI 刚发的 GPT-6.1 Sol,一头贴住 Anthropic,钳形攻势。DeepTech深科技知乎
坑二:「1/5价格」的对比对象挑过了。 拿推广价对 Astra 的标准价,确实是1/5;但同价位的 GPT-6.1 Sol(同样 $2/$10)没有出现在谷歌的对比表里,两款同价模型的实际质量差异,得等市场自己检验。另外别忘了谷歌自家的 3.8 Flash 只要 $0.75/$3.75——如果你的任务吃不满旗舰能力,便宜档才是性价比之王。华尔街见闻
不过有一个优惠是真金白银:缓存输入95折,折合约 $0.10/百万 token。对反复喂同一批文档、跑长流程 Agent 的用户,这一条比标价降幅更实在。0xAI 给了个单任务成本的粗算:同样跑一次任务,Opus 5.5 大概六七美元,GPT-6 约四美元,Argon 只要一到两美元。DeepTech深科技微博
三、一份开放时间表:第一批用户里没有你
这次发布是分阶段的,路径写得很清楚:
现在:只有 Fairwind 计划的受信网络安全防御方 + 谷歌内部(数千名员工)能用,大多数人还摸不到。因为 Argon 能自主发现、验证并修补软件漏洞,谷歌先给防御方发的是不带网络安全护栏的版本,让他们抢在攻击者前面修洞。旗下安全公司 Wiz 已经用它做公益扫描,发现了一个全球多家医院所用医疗软件中的严重漏洞,此前多款前沿模型都没查出来。麻省理工科技评论华尔街见闻
下一步:付费 API 客户 + Google AI Ultra 订阅者优先开放。谷歌同时在走美国政府的发布前自愿审查流程,这一步的节奏不受谷歌单方面控制。DeepTech深科技
再之后:才轮到普通开发者、企业和消费者。免费用户、Gemini App 普通界面什么时候能看到 Argon,官方没有给日期。

知乎上相关问题的热度今早已经冲到9000+浏览,高赞回答的结尾是所有人的共同心声:「所以现在最大的问题还是:没得玩」。知乎
而国内用户还多一重现实:Gemini 本来就不对内地正式开放。我翻了翻最近一周的社区讨论,国内用户访问 Gemini 的路子和坑大致是这几条——B站一条「中国银行万事达借记卡可绑定 Gemini、谷歌商店」的视频播放量近1.9万,走的是合规办卡+海外支付路线;留学生可以用学校邮箱认证领一年 Gemini 套餐;灰产路线是闲鱼几块钱代买账号、第三方中转 API,但这两个都有账号安全和数据风险。更值得注意的是两个老坑。有知乎用户实测发现,Gemini 免费版配额用完会「静默降级」,回答变短变糊且全程没有任何提示,被戏称「越用越笨」。还有人真金白银买了 Gemini 年会员,结果反复报 Eligibility check failed(资格校验失败)。这些坑在 Argon 开放前只会更多,不会更少。知乎
四、四类人,现在各自该干嘛
正在付 ChatGPT / Claude 会员的普通用户:别退订。 Argon 短期内不会出现在消费级界面,你能用到的还是现有模型;而且即便开放,它的正式价和 Opus 5.5 同档,智力指数上 Opus 还领先5分。现在退订换阵营,是拿确定的损失赌不确定的收益。
API 开发者、Agent 重度用户:值得排队,但别预支预算。 推广价+缓存折扣+1M输出上限,对长流程任务是真利好。动作建议:盯 Google AI Studio / Vertex AI 的模型列表,开放当天先用自己的真实任务跑 benchmark——尤其要测「丢一个大型 Repo 让它连续工作六个小时」还能不能保持目标、持续推进,这是1M输出的试金石。同价位记得拉 GPT-6.1 Sol 一起对比,别只看谷歌的对比表。知乎
国内轻度用户(聊天、写文档、生图):按兵不动,捂紧钱包。 Argon 和国内能用的 Gemini 免费界面短期内没关系。凡是现在打着「Gemini 4 会员」「Argon 账号」旗号收溢价、拉你代充的,直接当割韭菜处理——官方渠道都还没开放,哪来的账号。日常需求用现有 Flash 档或国产模型足够。
行业观察者、持有谷歌股票的:看商业化,别看跑分。 这次发布背后是谷歌憋了11个月的一次反击:今年5月 I/O 大会上承诺6月推出的 Gemini 3.5 Pro 最终被放弃,评测机构 Vals AI 的分析是它性能已追不上对手,谷歌索性跳级发 Gemini 4。8月 DeepMind 还经历了一轮高层地震——Hassabis 转任 Alphabet 董事长兼首席科学家,Jeff Dean 离职创业,Koray Kavukcuoglu 接掌 DeepMind 直接向皮查伊汇报。纸面成绩已经交出,接下来要看企业客户是否买账:定价、速率限制、数据治理条款、在 Workspace 和 Google Cloud 里的集成深度。去年11月 Gemini 3 短暂登顶时,OpenAI 内部拉响过「红色警报」;这次轮到谷歌证明,它能把榜单优势变成生产环境里的稳定表现。华尔街见闻DeepTech深科技

最后,留一份观察清单
这件事还没完,以下几个信号出现时值得回来看一眼:
谷歌官宣付费 API / AI Ultra 的具体开放日期,以及推广价截止时间;
Artificial Analysis、LMArena 等第三方评测能否复现官方跑分——目前智力指数上它还没超过 Opus 5.5;
开放后第一批长任务实测:丢一个大型代码仓库让它连续干6小时,看1M输出是真能力还是参数表装饰;
免费版和低价档会不会再次出现「静默降智」——这是 Gemini 的老毛病,社区盯得很紧;
OpenAI 和 Anthropic 的应对:Anthropic 刚递交 IPO 招股书,OpenAI 的 $500 Pro 档刚调整完额度,价格战大概率还有下一轮。
一句话总结:Argon 是谷歌11个月来最硬气的一次出牌,跑分有水分但底子是真的,价格有诚意但优惠有期限——只是这张牌暂时还没发到普通用户手上。别急着为「登顶」二字掏钱,等开放、等实测、等价格尘埃落定,该来的都会来。
校验提示文案
校验提示文案