在沉寂了整整七个多月后,谷歌于 10 月 1 日凌晨突然发布了新一代旗舰大模型 Gemini 4 Argon。这是谷歌 DeepMind 在跳过此前规划的 3.5 Pro 之后直接端出的重磅产品。代号“Argon(氩)”的出现,标志着谷歌重新杀回了全球人工智能实验室的最顶尖梯队,与 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5 形成了三强鼎立的竞争格局。
从技术参数来看,Gemini 4 Argon 最瞩目的突破在于将单次输出上限从此前的 6.4 万 Token 直接拉升至行业罕见的 100 万 Token。这项升级改变了过去大模型生成长代码或深度报告时容易中断的痛点,使模型能够在单次推理轨迹中进行连续思考,独立完成长达数十万字的长流程复杂任务。同时,该模型支持文本、图像、视频和语音的多模态输入,并在控制幻觉方面表现亮眼。在第三方评测中,其幻觉率仅为 15%,在顶级前沿模型中处于最低水平,这意味着它在面对不确定的问题时更倾向于承认“不知道”,而不是虚构答案。
在性能跑分方面,官方公布的 18 项基准测试中,Gemini 4 Argon 独占或并列第一的达 13 项。在第三方机构 Artificial Analysis 的综合智能指数上,它拿到 53 分,追平了 GPT-6 Astra。特别是在衡量真实长周期软件工程能力的 DeepSWE v1.1 测试中,它以 77.9% 的成绩刷新了行业纪录;在企业知识工作测试 Vals Index、长视频理解测试 LVBench 以及自动化流程测试 AutomationBench 中均高居榜首。不过,它的表现也呈现出一定的分化,在终端命令行操作、网页前端开发等偏向实际操作的 Agent 场景中,其排名有所下滑,未能在所有领域实现全面领先。
与单纯的跑分相比,谷歌披露的内部落地案例更具工程参考价值。目前,谷歌内部已有数千名员工将 Argon 投入生产实战。在数据中心运维中,Argon 组成的智能体自主分析集群遥测数据,成功实施了内存优化,部署后已释放超过 300 TiB 内存;在大规模代码迁移工作中,它正在主导将 Fuchsia Zircon 内核等超过 80 万行的 C/C++ 底层代码改写为内存安全的 Rust 语言,并在开源视频解码库的优化中将运行速度提升了 2.7 倍;此外,它还在短短数分钟内将量子计算研究中的算法性能提升了 40%。
在开放节奏与商业定价上,谷歌这次显得相当谨慎且具有针对性。出于网络安全防御和防止模型越界行为的考虑,Argon 并未直接向公众开放,而是首先通过 Fairwind 计划提供给受信任的网络安全机构,并在参与监管审查后,逐步向 Google AI Ultra 订阅用户和付费 API 开发者推送。价格方面,首发促销价定为每百万输入 Token 2 美元、输出 10 美元,配合高达 95% 的缓存折扣,极具性价比。但需要注意的是,由于 Argon 在处理任务时倾向于生成更长的思维链和输出内容,其单个任务的实际账单并不像单价看起来那样低廉;且促销期结束后价格将翻倍,届时的综合使用成本将回到主流旗舰模型的区间。
Gemini 4 Argon 的发布引发了行业的高度关注,但也伴随着部分争议。有报道指出,部分谷歌内部员工对其真实表现持保留态度,认为模型在标准题库上得分虽高,但在面对复杂多变的真实编程和前端设计任务时仍显得不够稳定,存在一定的“跑分内卷”痕迹。尽管谷歌官方对此予以否认,但这一现象也折射出大模型从测试集领先到生产力落地的实际鸿沟。Gemini 4 Argon 凭借超长输出、强劲的深度推理和严密的安全防护,成功让谷歌重回前沿大模型的绝对第一梯队,也将行业竞争引向了复杂长流程交付的新阶段。至于它能否真正战胜竞争对手,仍有待后续全面公开发布后,由广大开发者的真实手感来给出最终答案。