Gemini 4 Argon测评:百万输出领跑长程智能体

源自43位全网作者

07:29

Google DeepMind正式发布了新一代旗舰大模型Gemini 4 Argon,标志着其在沉寂数月后重新回到了全球大模型竞争的最前线。作为谷歌直接跨过3.5版本推出的代号“Argon”的新一代模型,它与OpenAI的GPT-6 Astra以及Anthropic的Claude Opus 5.5共同构成了当前顶级AI模型的三角格局。不同于偏重通用复杂推理或特定代码补全的同类产品,Gemini 4 Argon的定位更加聚焦于超长程智能体(Agent)工作流、企业级自动化、复杂软件工程以及网络安全防御。

在技术规格上,Gemini 4 Argon最引人注目的突破是将单次输出Token上限从此前的6.4万大幅提升至100万(1M)。相比市场上主流模型普遍128K的输出限制,这一变化意味着模型可以在单次推理过程中维持极长的连贯思考与生成,消除了编写大型软件或生成深度报告时的代码截断和分段提示问题。在价格策略上,谷歌给出了极具竞争力的首发推介价,输入与输出分别为每百万Token 2美元和10美元,同时上下文缓存输入享受高达95%的折扣。虽然优惠期过后价格将恢复至4美元与20美元,但整体性价比依然处于行业前沿。第三方机构Artificial Analysis评估显示,虽然Argon在完成单一任务时平均生成的Token数量较多,但得益于较低的单价,其综合任务成本仅为GPT-6 Astra的60%左右。

从基准测评表现来看,Gemini 4 Argon呈现出“强于复杂长流程与专业知识,但在部分命令行与特定研发任务中各有短板”的特点。在官方公布的基准测试中,Argon在真实长流程软件工程基准DeepSWE v1.1中取得了77.9%的得分,刷新了该项测试的纪录;在企业业务自动化榜单AutomationBench中以51.3%的成绩登顶;在长视频理解LVBench以及法律、金融专业知识评估Vals Index中也处于领先地位。而在第三方人工智力指数(Artificial Analysis Intelligence Index)测评中,Argon获得53分,追平了GPT-6 Astra。其突出优势在于低幻觉率(约15%),作答表现更为审慎。不过在FrontierSWE v2以及考察终端命令行操作的Terminal-Bench 4.0等测试中,Argon则落后于Astra和Opus 5.5,这表明其在自动化部署和终端操控细分领域仍有提升空间。

除了标准的学术与工业基准,谷歌还披露了Argon在自身业务中的深度落地案例。在数据中心管理中,Argon Agent通过分析遥测数据自主优化内存,已帮助内部服务器集群释放超过300 TiB的内存;在底层软件重构方面,Argon参与了将C/C++代码向Rust语言的大规模迁移工程,覆盖了核心库及超过80万行的Fuchsia操作系统内核代码,并在视频解码库的优化中实现了相比原Rust移植版2.7倍的性能提升;在科研领域,它还在数分钟内将量子计算子程序的资源消耗优化了40%。这些实操案例展示了Argon在处理大型工程项目时的长程推理与闭环交付能力。

网络安全防御是Gemini 4 Argon本次发布的另一大核心卖点。模型经过专门训练,具备自主定位、验证和修补软件安全漏洞的能力。在评估漏洞修复能力的CWE-bench v1测试中,Argon获得了68%的成绩,与GPT-6 Astra并列第一。为了确保高能力模型的安全性,谷歌为Argon部署了四层防护机制,包括严控高风险滥用、防范间接提示词注入、监控模型思维链与行为以防止执行越界,以及高风险训练的隔离沙箱环境。

尽管纸面数据与实测案例表现抢眼,但可访问性依然是Argon目前面临的主要短板。出于安全评估考虑,谷歌采取了分阶段开放的策略,首批仅向Fairwind计划中的可信网络安全机构开放,并参与政府发布前审查,后续才会逐步扩展至付费API客户、Google AI Ultra订阅用户及普通消费者。此外,针对业内关于“模型跑分与实际上手体验差距”的讨论,谷歌回应澄清了相关怀疑,但真实的工程效能仍有待全面开放后的市场检验。Gemini 4 Argon凭借百万级的输出容量、强悍的智能体长程推理能力以及激进的价格策略,帮助谷歌重新站稳了大模型第一梯队,也预示着AI大模型的竞争正在从单纯的对话交互,全面迈向能真正落地解决复杂工程问题的智能体时代。

内容由AI生成

精选参考来源

1. Google Gemini 4 Argon 发布!

Google Gemini 4 Argon 发布! Gemini 4 Argon 于 9 月 30 日发布! 与 GPT-6 Astra、Claude Opus 5.5 同属当前旗舰模型。 Arg

2. Gemini 4 Argon杀疯!文本重回第一,前端超强

Gemini 4 Argon杀疯!文本重回第一,前端超强 大家好,我是荒岛书生 codedoctor。这个假期,又又又有新模型放出来了,大佬们是不用休假的吗🤔 今天是Gemini 4 Argon预

3. 憋了这么久,Gemini 4终于让谷歌重新上桌了

憋了这么久,Gemini 4终于让谷歌重新上桌了 谷歌这次确实憋了挺久,Gemini 4 总算发布了。 不过这次不叫 Gemini 4 Pro,而是叫 Gemini 4 Argon。Argon 就是“

4. Gemini 4 发布:单次吐百万Token

Gemini 4 发布:单次吐百万Token 🤖 每天拆解一个AI产品 Day 37 📌 今日产品:Gemini 4(代号 Argon,Google 出品) 🏷 一句话:跳过3.5直接王炸!单次狂

5. 时隔7个月谷歌终于发布Gemini 4

时隔7个月谷歌终于发布Gemini 4 上一款旗舰过去7个月,谷歌终于端出新东西了 美国时间9月30日,DeepMind正式发布 Gemini 4 Argon 【三个关键数字】 ✅ 输出上限:

6. 聊聊刚发布的 Google Gemini 4 Argon:重点

聊聊刚发布的 Google Gemini 4 Argon:重点 Google 刚刚发布了新一代前沿模型 Gemini 4 Argon。官方定位是面向复杂长流程、真实软件工程与企业级知识工作的深度推理模

7. 还得是谷歌,Gemini 4 发布,猛的离谱。。。

还得是谷歌,Gemini 4 发布,猛的离谱。。。 还得是谷歌,Gemini 4 发布,猛的离谱。。。人人都是产品经理1790821256 谷歌凌晨突袭发布 Gemini 4 Argon,18 项基准

8. Google的Gemini 4 Argon在评分方面并不稳定

Google的Gemini 4 Argon在评分方面并不稳定 Google 今天凌晨刚发的 Gemini 4 Argon,自家跑分表 18 项里独占 12 个第一。结果换到第三方 Arena 的写网页

9. 谷歌最前沿AI模型:Gemini 4 Argon登场,长周期代码工程测试超Opus 5.5

谷歌最前沿AI模型:Gemini 4 Argon登场,长周期代码工程测试超Opus 5.5 谷歌最前沿AI模型:Gemini 4 Argon登场,长周期代码工程测试超Opus 5.5IT之家17908

10. 🚨Google重磅!Gemini 4 Argon发布

🚨Google重磅!Gemini 4 Argon发布 刚刚!Google 正式发布新一代前沿模型Gemini 4 Argon! 亮点: ✅ 输出Token上限从64K直接拉到1M(百万级) ✅ 编码、

11. 谷歌发布新一代旗舰模型 Gemini 4 Argon。谷歌在跑分表里拿它和 OpenAI 的 GPT-6 Astra、A...

谷歌发布新一代旗舰模型 Gemini 4 Argon。谷歌在跑分表里拿它和 OpenAI 的 GPT-6 Astra、A... 谷歌发布新一代旗舰模型 Gemini 4 Argon。谷歌在跑分表里拿它

12. Google Gemini 4来了,但先不让你玩

Google Gemini 4来了,但先不让你玩 从 评测数据看,Gemini 4 Argon在知识工作、长程软件工程、超长上下文和多模态理解上明显领先,并在网络安全上并列第一;短板主要集中在部分终端

13. 谷歌新模型刚发布,内部员工就出来打脸了

谷歌新模型刚发布,内部员工就出来打脸了 谷歌昨天发布了 Gemini 4,代号 Argon,号称"史上最强 Gemini"。 先看官方数据,很唬人: 🔹 输出长度从 6.4 万 token 直接拉到

14. 谷歌放大招:Gemini 4 Argon来了

谷歌放大招:Gemini 4 Argon来了 谷歌这次不是单纯拼跑分,而是直接把重点放在了超长任务、专业工作和网络安全。 1️⃣ 百万 Token 输出 单次最多输出 100 万 token,上一

15. Gemini4 Argon发布!一口气写7本书?

Gemini4 Argon发布!一口气写7本书? 根据AA最新实测,Gemini4综合智力指数为53,与GPT6-Astra和Fable 5.1持平,仍落后于Opus 5.5(58)和Sonnet 5

16. Gemini 4 Argon

Gemini 4 Argon 从昨天下午开始就被 咕咕嘎嘎4刷屏了,先叠个甲:不看好不代表指差,是指不会像刷屏的那种原子弹爆炸的感觉… 其一,目前公布的跑分优势区间在于科研,金融和法律写作。在agen

17. 谷歌发布Gemini 4 Argon

谷歌发布Gemini 4 Argon **** 谷歌DeepMind今日推出新一代前沿模型Gemini 4 Argon,主打编程、企业知识工作与网络安全防御。新模型支持最高100万token输出,可一

18. 御三家回归,谷歌发布Gemini 4 Argon!

御三家回归,谷歌发布Gemini 4 Argon! 谷歌的新款 Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上与 GPT-6 Ast

19. 谷歌地狱归来,首个Gemini4 模型发布

谷歌地狱归来,首个Gemini4 模型发布 Google 公布了新模型 Gemini 4 Argon,主要面向软件工程、金融与法律等专业工作,以及网络安全防御。 多项跑分均超过 GPT-6 Ast

20. Gemini4发布!大魔王再次登顶!

Gemini4发布!大魔王再次登顶! [火R]沉默了太久,终于爆发了! 谷歌今天正式发布旗舰模型:Gemini 4 Argon 新名字: Argon “氩”,氩是一种惰性气体,可能寓意新模型十分稳定?

21. 首款 Gemini4 模型 AA 排名出炉,重回前三

首款 Gemini4 模型 AA 排名出炉,重回前三 谷歌的新款 Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上与 GPT-6 As

22. 榜一,但没用。谷歌这次又是"跑分狂欢"

榜一,但没用。谷歌这次又是"跑分狂欢" Gemini 4 Argon 昨晚发布,直接空降 LMArena 文本榜第一(1525 分),WebDev 榜第八。 听着挺炸对吧?但我扒了一圈,三件事得给你降

23. 暴涨至第四!Gemini 4 Argon 实测屠榜

暴涨至第四!Gemini 4 Argon 实测屠榜 ​大模型研发界最硬核的“自研能力”榜单出大事了! 关注 AI 奇点进展的都知道 Vals RSI Index(递归自我改进指数)。这个榜单不测大

24. Gemini4 真的来了

Gemini4 真的来了 谷歌于 2026 年 9 月 30 日正式发布了新一代旗舰模型 Gemini 4 Argon。 这次发布的核心亮点与进展包括: 核心定位与命名:谷歌启用了全新的代号命名(首发

25. 谷歌最前沿 AI 模型来了:Gemini 4 Argon

谷歌最前沿 AI 模型来了:Gemini 4 Argon 如果它全面开放以后,实际表现依然接近这些成绩,AI 编程会迎来一次明显变化。开发者面对的对象,可能从“会写代码的聊天机器人”,变成一个可以共同

26. 刚刚,Gemini 4 Argon 发布:多项基测碾压 GPT-6 Astra,已参与谷歌 80 万行内核代码迁移

刚刚,Gemini 4 Argon 发布:多项基测碾压 GPT-6 Astra,已参与谷歌 80 万行内核代码迁移 刚刚,Gemini 4 Argon 发布:多项基测碾压 GPT-6 Astra,已参

27. 谷歌Gemini 4 Argon多指标SOTA!输出上限破百万token,推广期价格仅竞品1/5

谷歌Gemini 4 Argon多指标SOTA!输出上限破百万token,推广期价格仅竞品1/5 谷歌Gemini 4 Argon多指标SOTA!输出上限破百万token,推广期价格仅竞品1/5华尔街

28. 谷歌反击!Gemini 4 Argon性能比肩Astra,成本仅60%

谷歌反击!Gemini 4 Argon性能比肩Astra,成本仅60% 谷歌反击!Gemini 4 Argon性能比肩Astra,成本仅60%36氪1790820672 智东西10月1日消息,今天凌晨

29. Gemini 4 Argon:研发类评测反而落后

Gemini 4 Argon:研发类评测反而落后 Google 9 月 30 日发布 Gemini 4 Argon。官方对比表的 18 项评测里,它有 13 项领先或持平:AutomationBenc

30. 千呼万唤,谷歌Gemini 4终于来了!

千呼万唤,谷歌Gemini 4终于来了! 9月30日,Google 正式公布 Gemini 4 Argon。新一代旗舰瞄准复杂、多步骤任务,重点覆盖软件工程、金融研究、法律工作和网络安全。 先看

31. 王座夺回!谷歌正式发布 Gemini 4 Argon

王座夺回!谷歌正式发布 Gemini 4 Argon 全体起立!沉寂整整 7 个月后,谷歌终于把真正的史诗级前沿旗舰端上桌了! Google 官方正式宣布发布 Gemini 4 Argon,性能在

32. 首发实测谷歌Gemini4

首发实测谷歌Gemini4 首发实测谷歌Gemini4 谷歌今日重磅官宣新一代核心旗舰大模型 Gemini 4 Argon!权威 AI 竞技场第一时间带来全网首发深度实测体验: 🔥 核心实测看点: 1

33. 疑似偷跑!Gemini 4.0 悄悄潜入竞技场盲测

疑似偷跑!Gemini 4.0 悄悄潜入竞技场盲测 社区侦探又立功了!大模型竞技场 Arena.ai 今早突然捕捉到一个极其反常的新模型变体 —— 「gemini-3.8-flash」! 明眼人一

34. Google 推出新一代前沿模型 Gemini 4 Argon

Google 推出新一代前沿模型 Gemini 4 Argon Google 在 9 月 30 日的官方博客上发布了新一代前沿模型 Gemini 4 Argon,主打长时间、多步骤的复杂工作:真实的软

35. Google憋了这么久,终于放了个大招

Google憋了这么久,终于放了个大招 昨天 Google 发布了新一代前沿模型 Gemini 4 Argo 官方给出的 19 项评测里:13 项单独第一,1 项并列第一。对手不是老模型,而是 G

36. Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一

Gemini 4 Pro首测夯爆了!谷歌偷偷杀回第一 谷歌真要彻底翻身了!这几天,一个披着「gemini-3.8-flash」马甲的神秘模型,在大模型竞技场Arena上现身。在多轮盲测中,AI圈瞬间沸

37. 谷歌Gemini4正式发布,王者归来了?

谷歌Gemini4正式发布,王者归来了? AI圈现在发模型的速度,快得有点离谱。 以前OpenAI和Anthropic大概隔十个星期才出一个,现在压缩到了十一天。 谷歌DeepMind也坐不住了,

38. 疑谷歌 Gemini4Pro 「偷跑」上线,网传碾压 GPT-6Astra,如何评价?

疑谷歌 Gemini4Pro 「偷跑」上线,网传碾压 GPT-6Astra,如何评价? 目前看到的灰测以及竞技场里面,都强的离谱。特别是现在的Astra已经降智到几乎不可用的情况下。(这两天有所改善,

39. Gemini 4 终于端出来了,有哪些特点?

Gemini 4 终于端出来了,有哪些特点? 省流,谷歌重回第一梯队,你大爷还是你大爷。Gemini 4 Argon:业务自动化最强,知识回答最保守,在跨应用SaaS流程执行上明显领先,同时对不确定的

40. Gemini 4 Pro:惊天地雷

Gemini 4 Pro:惊天地雷 Gemini 4 Pro 还没发,先漏了一地。9 月 17 日,Arena 盲测平台冒出一个「gemini-3.8-flash」,和 Google 月初上线的正式版

41. 谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让

谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让 谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让量子位1790865727 鹭羽 发自 凹非寺量子位 | 公众号Qbi

42. 谷歌预告:Gemini4,发布或将提前

谷歌预告:Gemini4,发布或将提前 🚨OpenAI、Anthropic接连发力,Google也要亮出Gemini 4了! 这两天,X平台已经出现多名开发者对疑似 Gemini 4 Pro进行实

43. Gemini 4 Pro 泄露,反超 Opus 5.5

Gemini 4 Pro 泄露,反超 Opus 5.5 🚨 谷歌又偷跑了!Arena 里冒出一个叫 Barium-B 的新检查点,披着「Gemini 3.8 Flash」的皮,实际就是 Gemini
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章