10月1日凌晨,国内AI圈集体失眠:谷歌官宣新旗舰模型 Gemini 4 Argon。几个小时内,知乎"如何评价10月1号发布的Gemini 4 Argon"的问题播放量冲过8.7万,B站刷屏一排速报视频。
爆的原因简单粗暴:18项基准测试拿了13项第一或并列第一,API推广期价格只有顶级竞品的1/5,单次输出上限从6.4万token直接拉到100万。华尔街见闻
但对普通用户来说,最关键的事实藏在刷屏的转发里:这个模型,你现在花钱也用不上。
今天这篇,把这次发布拆成几笔普通人能看懂的账:门槛在哪、价格窗口在哪、跑分哪里赢了哪里输了,以及不同用法的人,各自该干什么。
一次"跳级"发布:224天,谷歌憋了个大招
先交代背景。从上一代旗舰 Gemini 3.1 Pro 到这次的 4 Argon,中间只隔了224天——但按知乎网友统计,这224天里全行业发布了超过30个新模型,从GPT-6 Astra到Claude Opus 5.5再到DeepSeek V4 Pro,评论区高赞的感慨是"天上一天,人间一年"。知乎
更能说明问题的是:谷歌今年5月的I/O大会上还宣布要做 Gemini 3.5 Pro,这次直接放弃、跳级发4代。评测机构Vals AI的分析很直白——3.5 Pro 已经追不上竞争对手了,与其小修小补,不如推倒重来。去年11月谷歌曾靠新模型短暂登顶、逼得OpenAI内部拉响"红色警报",这次能不能守住,就看Argon了。华尔街见闻
顺带一提,Argon就是元素周期表里的"氩",此前泄露的Gemini 4 Pro内部代号,这次算是实锤。AI信息Gap
跑分账:13项第一是真的,3项惨败也是真的
先看赢的。综合经济影响力基准 Vals Index,Argon 拿68.9%,压过Opus 5.5的67.0%;法律代理基准 Harvey’s Legal Agent Benchmark,19.6%对第二名Claude Fable 5.1的6.7%,接近三倍,碾压级;编程基准 DeepSWE v1.1,77.9%排第一,领先GPT-6 Astra和Opus 5.5约3-4个百分点;办公流程自动化 AutomationBench,51.3%对Astra的41.4%、Opus 5.5的42.5%;长视频理解 LVBench,91.7%,SOTA。哔哩哔哩

再看输的,这部分刷屏文章里基本看不到:FrontierSWE v2 编程测试,Argon只有55.0%,落后Astra的65.5%整整10.5个百分点;Terminal-bench 4.0,57.4%,落后Opus 5.5的66.4%近9个百分点。华尔街见闻
更要紧的是跑分本身的"水分"提醒。华尔街见闻点出一个细节:谷歌对比表里Argon的DeepSWE成绩,用的是自家mini-swe agent框架跑的,而竞品数据来自公开排行榜和各家自报——测试框架、推理预算、环境未必一致,“直接的数字比较需要审慎解读”。知乎一位36赞答主的说法更接地气:“benchmark分数有些肯定是有水分的,但跑分都跑不赢,那肯定也不是啥好模型”。知乎

所以跑分账的结论是:Argon确实回到了第一梯队,尤其强在办公自动化、知识型工作和多模态(长视频理解);但纯编程场景,Astra和Opus 5.5该赢的还是赢。
技术账:100万token输出,是给Agent准备的
参数表上最扎眼的一项:输出上限从6.4万token提到100万,翻了约16倍,业界最高。注意,这是输出上限,不是上下文长度。AI信息Gap
它解决什么问题?现在Agent跑长任务的流程是"模型→工具→压缩上下文→模型→再压缩",跑几个小时之后,前面的记忆已经被摘要了好几轮。Argon的思路很暴力:让单条执行轨迹足够长,理论上可以在一次运行里塞下几十万token的思考、工具调用、代码修改和重新规划。
谷歌内部已经用上了:数据中心内存优化释放超300 TiB;Fuchsia操作系统内核80多万行C/C++代码正在迁移到Rust;给视频解码库libgav1替换3.2万行代码后,新版比旧移植版快2.7倍。华尔街见闻
但知乎那位答主也说出了大家的心声:能输出100万,不等于输出到80万token时还知道自己在干什么。“我现在最想看的不是benchmark,而是等它开放以后,真的丢一个大型代码仓库给它,让它连续工作六个小时”。这个验证,目前谁也做不了——因为还没开放。知乎
价格账:推广期1/5价,但截止时间没说
这是最实在的一笔账。API定价:
推广期:输入2美元/百万token,输出10美元/百万token;缓存输入打0.5折(约0.1美元/百万)
推广期结束后:翻倍到输入4美元、输出20美元——谷歌没说优惠到什么时候截止
对比一下就明白为什么叫"掀桌子":GPT-6 Astra和Claude Fable 5.1的标准价都是输入10美元/输出50美元,Argon推广期价格只有它们的1/5,便宜80%;Claude Opus 5.5是4美元/20美元,等于Argon推广期结束后的正式价。AI信息Gap

但别急着喊"真香",有两个同价位对手被刷屏文章忽略了:一个是OpenAI前一天DevDay刚发布的GPT-6.1 Sol,主打性价比,定价2美元/10美元,和Argon推广期一模一样——而谷歌的对比表里没有Sol,同价位谁强,还得市场检验;另一个是谷歌自家的Gemini 3.8 Flash,0.75美元/3.75美元,更便宜。所以"1/5价"对标的是最贵旗舰,不是所有选择。华尔街见闻
一句话总结价格定位:首发按Sol的价格卖,正式价按Opus 5.5卖,能力瞄准的是Astra。
门槛账:为什么你暂时用不上
这是和普通用户关系最大、却被"跑分第一"标题淹没的部分。
Argon的开放顺序是三梯队:第一梯队只有专注网络安全防御的特定公司和组织(Fairwind Program受信参与方),甚至能拿到不带网络安全护栏的原始模型,用于真实防御任务;第二梯队是付费API用户和Google AI Ultra订阅用户;第三梯队才是更广泛的开放,时间未定。知乎
为什么这么谨慎?谷歌官方的说法是:新模型能力强到能自主发现、验证并修补软件漏洞,得先让防御方修补完被发现的漏洞,再放开。旗下安全公司Wiz已经用它扫出了一个全球多家医院医疗软件里的严重漏洞,此前多款前沿模型都没发现。华尔街见闻

另一个背景不言自明:最近几周,OpenAI刚因为智能体越界事件第二次暂停新模型训练,央视都报道了。谷歌这次专门写了四层防线——防网络/核生化滥用、防间接提示注入、实时监控模型的推理和行为、必要时直接终止执行;甚至规定训练中发现的异常行为不喂回模型,免得模型学会规避监控。“先给安全机构、逐步放开”,就是这个气氛下的产物。微博知乎
所以对国内普通用户还有一层现实:Gemini App本身就未在国内正式落地,Argon的开放节奏对我们更是"新闻里的热闹"。
不同人怎么办:五个清单
把上面几笔账合起来,按人群给建议:
1. 免费聊天党(Gemini App、豆包、元宝用户):不用做任何事。Argon短期内不会上免费版,日常问答、写作、翻译,现在的免费Flash档模型完全够。这条新闻对你的价值是谈资,不是行动。
2. 想订Google AI Ultra的人:先按住钱包。Argon确实会优先开放给Ultra用户,但没有明确时间表。为一个"即将上线"付月费,不如等谷歌官宣Argon上架Ultra、且你能正常访问服务之后再决定。
3. API开发者:这是唯一现在就能吃到红利的人群,但记住三条——推广期2美元/10美元的价格窗口截止时间未公布,长期成本模型要按4美元/20美元算,不然账单会给你惊喜;跑分条件不统一,先在自家任务上小规模评测再决定迁移;如果你跑的是长任务Agent或长视频理解,100万输出上限值得第一批试。
4. 编程党(Claude Code、Codex用户):不急着搬家。FrontierSWE落后Astra 10.5个百分点、Terminal-bench落后Opus近9个百分点,编程主力场景Argon目前不是最优解,DeepSWE那个第一还是谷歌自家框架跑出来的。
5. 所有人:接下来盯四个信号——推广期截止时间公布、API和Ultra的实际开放日期、第三方长任务实测(连续工作数小时还稳不稳)、同价位的GPT-6.1 Sol对比评测。这四个信号齐了,再下结论不迟。
最后说两句
这次发布最耐人寻味的,不是13项第一,而是"发布了,但你用不上"正在成为前沿模型的发布传统——前有OpenAI的dots只给500美元档用户,现有Argon先交给付费安全机构。模型越强,厂商越谨慎;能力与安全的那根弦,绷得比一年前紧多了。
对普通用户,这反而是好事:你有了旁观期。跑分、价格、门槛这三笔账今天已经算清,剩下的,等它真正开放,用实测说话。