如果你这个月正好要续 Claude Code 或 Cursor 的订阅,谷歌这周的操作值得你多看两眼。
9 月 30 日国庆第一天凌晨,Google DeepMind 突然发布 Gemini 4 系列首款模型 Argon;10 月 7 日,它的计费条目悄悄出现在谷歌云后台,部分 Pro 用户收到小范围灰测;再到这两天,谷歌 Gemini 网页版被翻出隐藏的 Argon 字符串、Ultra 档位上线在即。投资界微博转述海外科技圈爆料:下一代模型已现身多平台、获部分 Pro 用户开放,内部系统上线发布卡片,最快本周发布。B 站上一条灰测视频更直接:“反重力(Antigravity)Gemini 4 Argon 灰测了,你看到的 3.8 Flash 可能就是 4 Argon”——当然,这句目前还是传闻。知乎微博哔哩哔哩
社区最会玩的概括来自微博段子:"Claude:推出 Opus 5.5。谷歌:我们即将推出 Gemini 4 Argon。Claude:推出 Sonnet 5.5、Haiku 5.5。谷歌:我们即将推出 Gemini 4 Argon。“吐槽它"永远即将”,但这一次,它是真的到门口了。
那么问题来了:要不要等?要不要把你的工作流搬过去?先别动,这事的账要分三笔算。
第一笔账:纸面赢在哪、输在哪,题型完全不同
谷歌官方放出的对比表覆盖 19 项基准,对手是 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5,结果 13 项第一、1 项并列、5 项落后。拆开看,赢面高度集中在一类题上——长周期、多文档、多步骤的知识工作:知乎
DeepSWE v1.1(软件工程):77.9% 对 Opus 5.5 的 74.2%,官方称之为现行纪录;
Harvey 法律智能体基准:Argon 19.6%,第二名 Fable 5.1 只有 6.7%,Opus 5.5 只有 3.8%。四家绝对分都低,说明这题接近当前模型的能力边界,Argon 是在边界附近多走了近三倍;
Zapier AutomationBench(商业流程端到端执行):51.3% 对 42.5%;
GraphWalks 长上下文(25.6 万到 100 万 token 区间):84.2% 对 Astra 的 71.8%。

而输掉的两项,恰恰是 AI 编程用户最吃的:
FrontierSWE v2(丢给你整个仓库 + 一处复杂改动):Astra 65.5%,Argon 55.0%,差 10.5 个百分点;
Terminal-Bench 4.0(终端里连做一长串操作,中间哪步歪了后面全歪):Opus 5.5 66.4%,Argon 57.4%。
这几项测试的差别不在难度,在题型。DeepSWE 考的是"把一处问题改对",FrontierSWE 和 Terminal-Bench 考的是"自己把一整件事做完"。天天挂 Claude Code 干活的人都清楚,你的日常依赖的恰恰是后者。B 站有条视频标题把这事说得很到位:《哈基米回到第一梯队,但你现在还用不上》。哔哩哔哩

规格上还有两处值得单独记:
一是单次输出上限从 6.4 万 token 抬到 100 万,而对比的三家全部停在 12.8 万。思维链按输出计费,一条长轨迹动辄几十万 token,12.8 万的上限意味着复杂任务必须切段重入,100 万意味着单次轨迹能装下一整个大型重构。公告里 libgav1 的案例就是智能体一口气重写 3.2 万行 SIMD 代码,产出的安全 Rust 解码器比原移植版快 2.7 倍。谷歌内部还在用它推进 Fuchsia Zircon 内核 80 余万行 C/C++ 到 Rust 的迁移,一组数据中心智能体已经释放了超过 300TiB 存储。知乎
二是价格:推广期输入每百万 token 2 美元、输出 10 美元,推广期后 4 美元/20 美元,缓存输入再打 95 折。同期 GPT-6 Astra 和 Fable 5.1 挂在 10/50,Opus 5.5 是 4/20。算一笔具体的:10 万无缓存输入加 1 万输出,Argon 推广期 0.30 美元,Opus 5.5 要 0.60 美元,Astra 要 1.50 美元。用五分之一的价格触碰旗舰档性能,这是谷歌历次旗舰发布里定价最激进的一次。36氪
但要留意独立口径:Artificial Analysis 的智能指数上,Argon(high)是 53 分,与 GPT-6 Astra、Fable 5.1 打平,榜首仍然是 Opus 5.5 的 58 分。而谷歌当前能买到的最强模型 3.8 Flash,只有 41 分。官方表的"13 项第一"和第三方指数的"并列第五"并不矛盾——官方表全部成绩出自谷歌自己的评测管线,完整基准还没有可交叉的第三方复现。两个口径你至少都该知道。哔哩哔哩
第二笔账:现在买不到的 Argon,是期货
这是本次发布最非常规的安排:第一批拿到 Argon 的不是付费开发者,而是 Fairwind 计划里经过审查的政府机构和网络安全防御伙伴,官方还为他们直接移除了网络安全防护栏。谷歌的解释是,Argon 挂的是"防御性"定位,滥用防范、提示注入抵抗、行为监控和沙箱四项加固尚未完成。36氪
安全方向的数据确实硬:覆盖 20 种编程语言的真实漏洞发现率 85.8%(前代 71.0%),Wiz 黑盒渗透测试 70.9%(前代 58.2%);Gray Swan 的间接提示注入测试里,Argon 在攻击者至多尝试 15 次的设定下攻击成功率只有 0.7%,全部参测模型最低——对比 Astra 的 8.5%、Kimi K3 高达 52.7%。

但对普通开发者,现实是:Gemini API 的模型列表里查不到 Argon 的模型 ID,付费 API 客户和 Google AI Ultra 订阅者在排队,时间表没给,皮查伊此前把正式亮相窗口指向 11 到 12 月。官宣当天买不到的东西,收入为零——四季度的 Argon 是期货属性。彭博近期的报道还补了个人性化细节:谷歌内部有员工认为公司已处技术前沿,也有员工担心继续落后于 Anthropic 和 OpenAI,谷歌否认。内部尚且分歧,你更该把"跑分的 Argon"和"能买到、用顺手的 Argon"分开记账。知乎
第三笔账:模型和产品是两回事,Antigravity 有前科
产品侧承接 Argon 的是谷歌的 Antigravity(桌面 IDE + CLI,antigravity.google 可下载)。这条线在中文社区不算无声无息,但口碑相当复杂:
能玩出花:有人拿它接 BlenderMCP 做 3D 智慧仓储数字孪生,有人用它驱动 ChatCut 剪视频,走"高速模型当大脑、token 消耗低"的路线;GitHub 上的 AntigravityAwesomeSkills 技能库号称收录 1527+ 可安装技能,通吃 Claude Code、Cursor、Codex。知乎
坑也真实:3.8 Flash 这一代的幻觉和"偷懒"在社区抱怨很多,用常驻提示词压制是普遍操作;小红书有用户吐槽扩展商店的 token 统计都没做好,Altimeter 只统计当前会话、AntigravityTokenMonitor 统计不准,最后干脆让 Gemini 自己写了个统计工具。国内用户还横着一道网络门槛,这两天知乎连出两篇 Antigravity SSH Proxy、Proxifier 配置教程。小红书
产品线前科:就在 Argon 宣布前两周,谷歌刚砍掉 3.5 Pro、全线押注 3.8 Flash,半年数变。知乎高赞回答点破了要害:能力榜与产品体验之间的落差,正是过去一年谷歌模型"发布时惊艳、用起来别扭"印象的来源。知乎

到底谁值得动?分人群说
Claude Code / Cursor 订阅正在续费周期的你:别为 Argon 改计划。 它输的两项恰好是你最依赖的终端实战和整仓改动,而且现在根本买不到。但谷歌这波确实把竞争逼出了牌——同一周里 Haiku 5.5 发布、Claude Max/Team 开始附赠每月 API 额度、GPT-6.1 Sol Ultrafast 上线 500 美元加急档。竞争红利落在续费的人头上,续订前把各家新条款翻一遍,比研究 Argon 更实惠。哔哩哔哩
API 重度用户、活是"长文档、长程、一口气输出"型的你:把 Argon 放进候选名单,等上架再压测。 大规模重构、跨文档知识工作、商业流程自动化正好踩在它的强区,推广价还便宜。但流程里若要求终端多步任务稳稳跑完全程,先记住 Terminal-Bench 那个 57.4%,别指望它一步到位。
想尝鲜 Antigravity 的你:真实成本在网络配置和产品细节的耐心上。 灰测传闻没官方确认之前,别把主力工作流押上去;跟着那两篇代理教程能跑通,再谈体验。
企业用户:注意 10 月 9 日凌晨发布的 Gemini Agent 是另一条线。 这个由 Google Cloud CEO Thomas Kurian 署名的办公智能体支持多模型编排,能按任务在效果和成本之间自动路由,甚至调用 Anthropic 的 Claude——连谷歌自己都不坚持非用 Gemini。评估时把"Argon 模型"和"Gemini Agent 产品"分开看,别混在一个决策里。知乎
接下来盯这四个信号,比刷爆料有用
Gemini API 模型列表出现 Argon 的模型 ID——期货变现货的唯一标志;
Artificial Analysis 等第三方指数是否把 53 分往上修——官方口径和独立口径的对决;
Ultra 档位与网页版 Argon 官宣——"最快今日发布"这个标题已经飞了两天;
11-12 月窗口是否兑现,以及 Antigravity 换上 Argon 后的真实体验反馈。
一句话收尾:Argon 的纸面优势是真的,价格激进也是真的;但"买不到"“编码实战落后”"产品层有前科"三件事同样是真的。谷歌这次最大的贡献,是逼着整个 AI 编程市场同时重写价格表和能力榜。你的工作流不用急着搬家,订阅决策留在续费日,把上面四个信号放进收藏夹——等它能买到、能被第三方验证的那天,再来算这笔账不迟。