北京时间10月1日凌晨,Google DeepMind 发布 Gemini 4 Argon。这是谷歌7个月来第一款高于Flash级别的闭源模型,多项评测拿了第一,API单价压到 GPT-6 Astra 的五分之一。新智元智东西
但你现在打开 Gemini、Vertex,或者任何一个接了它家API的客户端,都用不到它。机器之心
这不是发布节奏上的小失误。把三件事拆开看——它到底强在哪、账单怎么算、你什么时候真能用上——这次发布真正想说的,和推送标题写的不太一样。
结论先放这儿:现在别换工作流,也别为它开新订阅。账单是促销价,开放时间没排定,跑分能不能落到你手上那类活儿,还要再看。
一、能力账:它是最不编答案的那个,不是最能答对的那个
官方口径下,Argon 的成绩确实漂亮:软件工程评测 DeepSWE v1.1 拿了 77.9%,当前最高;覆盖金融、编程、法律、税务的企业知识工作评测排第一;漏洞修复 CWE-bench v1 以 68% 并列第一。长视频理解、企业自动化这些单项也都在榜一那一档。机器之心智东西
第三方也承认它回了第一梯队。Artificial Analysis 的智能指数是一套能力测试的综合成绩,这轮第一梯队全挤在 50 分上下:Argon 53 分,追平 GPT-6 Astra 和 Claude Fable 5.1,比 GPT-6.1 Sol 高 1 分。注意这是并列,不是碾压——而且比上一款非 Flash 模型 Gemini 3.1 Pro Preview 整整高了 23 分,说明是补课式的跃升。新智元

真正决定你要不要用它的,是同一套评测里另外两组数。
幻觉率 15%,是这套指数里 45 分以上模型最低的——Astra 是 51%,Sol 是 54%。它更愿意承认不知道。新智元
而同一项测试里,它的准确率是 50%,比 Astra 的 63% 低 13 个百分点,甚至比上一代 Gemini 3.1 Pro Preview 还低 5 个百分点。新智元
少编答案,和多答对题,是两件事。对要拿它做核对、做研究、写材料的人来说,这决定了你省下的是查证时间,还是返工时间。

还有一个细节值得记:在考察"按要求交付"的评测里,它满足评分细则的比例是测到的最高值,但分析深度和呈现质量偏低。能按要求交活,不等于交出一份透彻清楚的成果。新智元
彭博社还援引知情人士称,谷歌内部对 Gemini 4 在编码等关键任务上的表现仍有疑问:行业基准亮眼,员工真正用起来,部分编码任务依然难以稳定完成。已经有开发者提到,Argon 对提示词格外敏感,默认风格不佳;在生成细节丰富的 3D 场景上,也还没到 Opus 5 的水平。机器之心智东西
一句话:跑分是真的,跑分能覆盖你手上那类活儿,是另一回事。
二、账单账:单价只有 1/5,任务账单却要付六成
这是这次最容易被读错的一组数。
API 首发价格是每百万输入 Token 2 美元、输出 10 美元,缓存输入在输入价基础上再降 95%。按单价算,它确实是 Astra 的 1/5、Opus 5.5 的一半,"Token 价只要 1/5"这个说法没错。机器之心新智元
但你付的是整张账单。
同一套评测口径下,Argon 平均每个任务输出 6.2 万 Token,Astra 只用 2.7 万。草稿纸每页便宜,架不住写得长。折算到每任务成本:新智元
模型 | 每任务成本 |
|---|---|
GPT-6.1 Sol | 0.72 美元 |
Gemini 4 Argon | 1.99 美元 |
GPT-6 Astra | 3.26 美元 |
Claude Opus 5.5 | 5.98 美元 |
Claude Fable 5.1 | 7.63 美元 |
Argon 确实只有 Astra 的六成,但它是 Sol 的 2.7 倍。新智元
更要命的是第三层:2 美元和 10 美元是首发五折促销,谷歌至今没公布结束日期。恢复到 4 美元、20 美元的标准价后,按同一口径,单任务成本会变成 3.98 美元,约为 Astra 的 1.2 倍——单价便宜五倍,任务账单反而反超。新智元
社区里有句话说得挺准:优惠期是 Sol 和 Sonnet 的水平,原价是 Opus 的水平,而这还是谷歌这一批的顶模。知乎
最后一条前提别漏掉。1.99 美元是这套评测里的平均任务成本,不是统一报价。你让模型改代码、查材料,输入多长、输出多少、能吃上多少缓存,账单都会变。打算长期接入的人,得拿自己真实的任务去试算,把用量和折扣条件一起算进去。新智元

三、时间表账:这次发布,本来就不是发给你用的
发布会两天了,公开可用渠道还是没有。谷歌给的顺序是:先通过 Fairwind Program(一个只对受信任网络安全防御团队开放的早期通道)提供给安全研究者,然后是付费 API 客户,再是 Google AI Ultra 订阅者,最后才逐步向开发者、企业和消费者开放。机器之心
谷歌的解释是想先收集早期反馈、完善安全护栏。皮查伊的说法是,外界对下一代模型讨论很多,所以希望尽早展示。智东西
社区的读法直接得多。有人在知乎说,真正有底气的模型恨不得所有人都能用上,吹了五轮,发完告诉开发者还是没得用。也有人把 Gemini 一贯的消费级人设摆出来——便宜大碗、免费额度足、优惠渠道多、老号几乎不封——然后问:这还是那个 Gemini 吗?知乎知乎
这正是这次发布最值得记下的变化。Argon 被定位成面向复杂、长周期任务的企业与安全模型:软件工程、法律金融、网络安全。它要抢的不是"聊天好不好用",是"能不能把大库代码迁完、能不能把漏洞修对"。谷歌举的内部案例也是这一类:帮量子研究优化算法、给数据中心释放超过 300 TiB 内存、把开源解码器里约 3.2 万行底层代码重写成更快的新版本。至于那笔 80 万行代码迁移,官方也承认仍在推进、要过审计和测试——那是进行中的工程,不是已经上线的成果。机器之心
顺带拆一个容易混的数:这次宣传的"100 万 Token"是单次输出上限(此前是 6.4 万),跟上下文窗口是两个指标。前者决定它一次任务能连续写多长,后者决定它一次能读进多少材料。上限更长,解决的是能不能连续干下去,不是最后做得对不对。机器之心

四、三类人,三个动作
已经在用 Claude 或 GPT 干活、按任务成本控预算的开发者
先别迁。拿手上的真实任务在现有模型上跑一遍,记下输入长度、输出长度和缓存命中,再按上面那张表估 Argon 的价,注意促销价和标准价要分两套算。等它真的开放了,先试跑一周再决定。
在等 Google AI Ultra、或者犹豫要不要为它开订阅的用户
不建议为这一个模型开。它还不是你能用的主力,而"谷歌发布后降智"是社区反复提过的老账:Gemini 3.1 Pro 发布时惊艳,后面掉得很快,更早的版本也一样。知乎上有个说法挺实在——看一个模型的能力,最好看它发布一个月后的实际用户情况。现在下结论,等于拿发布会当天的表做全年预算。知乎
只是刷到"谷歌重回第一"的普通用户
可以不换任何东西。如果想提前准备,记住一条就够:官方和正规第三方渠道之外的"代充、共享、低价 Gemini 账号"风险很高。小红书上关于闲鱼买号的吐槽很集中——秒封、卖家跑路、隐私泄露都有人踩过,Google 明确禁止账号交易,虚拟物品在平台也难维权。想用,就等官方渠道。小红书
最后:接下来盯这几件事
五折什么时候结束。这是账单里唯一确定会变的变量。
开放顺序有没有提速。从安全团队到普通用户,中间每一档的时间差,决定了它什么时候才算真的"发布"。
一个月后的实测口碑,尤其是复杂专业文档处理和研究级推理。这两项是材料里主动承认的短板,也是社区最担心"高分低能"的地方。
对手的下一轮。10月2日的行业动态里,Anthropic 的 Fable 5.5 已被曝在给 Fable 5.1 做隐身路由(新模型悄悄接管旧模型的请求),xAI 的 Grok 4.8 也现身代码工具服务端。这张对照表的有效期,可能比你想象的短。哔哩哔哩
跑分洗牌是真事,账单变薄也是真事。但"它对你有什么用"这个问题,答案还在路上。