谷歌Gemini 4 Argon发布,12项基准第一,输出上限升至百万token

源自221位全网作者

11:22

精选参考来源

1
Google DeepMind 于 2026 年 9 月 30 日发布新旗舰模型 Gemini 4 Argon,是 Gemini 4 系列首个非 Flash 级模型,主打复杂长程推理、软件工程、知识工作(法律/金融)和网络安全防御。在 Artificial Analysis Intelligence Index(综合 10 项评测)上:得分 53,与 OpenAI GPT-6 Astra (max) 持平略高于 GPT-6.1 Sol (max) 的 52低于 Anthropic Claude Opus 5.5(58)和 Sonnet 5.5(56)这是 Google 非 Flash 模型的大幅跃升(此前 Gemini 3.1 Pro Preview 仅 30)。提升主要来自更低幻觉率和更强的代理(agentic)能力。图中绿色箭头标出的即为该模型。
2
#谷歌发布Gemini 4 Argon#谷歌刚发布了Gemini 4 Argon。主打编程、复杂办公和网络安全。最大输出长度从6.4万Token涨到100万Token。谷歌称它能自主发现、验证、修补漏洞,在长程软件工程测试DeepSWE v1.1上拿到77.9%,漏洞修复测试则并列第一。谷歌说它在内部帮忙迁移大型代码库,还释放了300TiB数据中心内存。成绩听着确实不错,但都是谷歌自己公布的。实际用起来怎么样,还得等外部测试才算数。然后,没开放给普通用户……现在是先给可信的网络安全团队测试,后面才会给普通用户。谷歌把模型发布了,成绩报了,价格也报了。最后,暂时还没开放。发布会可以说是非常完美,除了没把产品给用户……
全部
来源
内容由AI生成

精选参考来源

1. Google DeepMind 于 2026 年 9 月 30 日发布新旗舰模型 Gemini 4 Argon,是 Gemini 4 系列首个非 Flash 级模型,主打复杂长程推理、软件工程、知识工作(法律/金融)和网络安全防御。在 Artificial Analysis Intelligence Index(综合 10 项评测)上:得分 53,与 OpenAI GPT-6 Astra (max) 持平略高于 GPT-6.1 Sol (max) 的 52低于 Anthropic Claude Opus 5.5(58)和 Sonnet 5.5(56)这是 Google 非 Flash 模型的大幅跃升(此前 Gemini 3.1 Pro Preview 仅 30)。提升主要来自更低幻觉率和更强的代理(agentic)能力。图中绿色箭头标出的即为该模型。

2. #谷歌发布Gemini 4 Argon#谷歌刚发布了Gemini 4 Argon。主打编程、复杂办公和网络安全。最大输出长度从6.4万Token涨到100万Token。谷歌称它能自主发现、验证、修补漏洞,在长程软件工程测试DeepSWE v1.1上拿到77.9%,漏洞修复测试则并列第一。谷歌说它在内部帮忙迁移大型代码库,还释放了300TiB数据中心内存。成绩听着确实不错,但都是谷歌自己公布的。实际用起来怎么样,还得等外部测试才算数。然后,没开放给普通用户……现在是先给可信的网络安全团队测试,后面才会给普通用户。谷歌把模型发布了,成绩报了,价格也报了。最后,暂时还没开放。发布会可以说是非常完美,除了没把产品给用户……

3. 谷歌刚刚发布了新一代 AI 模型 Gemini 4 Argon。这次主打三个方向:长流程的代码工程、金融法律这类企业知识工作,还有网络安全防御。先说最直观的变化。Argon 的输出上限从之前的 6.4 万 Token 拉到了 100 万。简单说就是,以前模型回答到一半可能就“说不动了”,现在它能一口气输出更长的内容,适合那种需要反复分析、修改、验证的大活儿。再看跑分。在衡量软件工程能力的 DeepSWE 测试里,Argon 拿了 77.9%,谷歌说是新纪录。金融、编码、法律方面的 Vals Index 也排第一。自动化业务操作的 AutomationBench 拿了 51.3%,还是第一。长视频理解的 LVBench 得了 91.7%,同样领先。跑分之外,谷歌还分享了几个内部真实案例。他们正在把公司的 C/C++ 代码往 Rust 上迁移,其中 Fuchsia 操作系统的内核就有 80 多万行代码,Argon 已经参与其中。另一个例子是优化视频解码器 libgav1,Argon 替换了大约 3.2 万行代码,优化完速度提到了之前 Rust 版本的 2.7 倍。还有一组 Argon 智能体自己去分析数据中心的运行数据,找到了内存优化方案,一下子释放了超过 300 TiB 的内存。网络安全这块也有亮点。安全公司 Wiz 用 Argon 扫描医疗软件,发现了一个之前顶尖模型都没找到的严重漏洞,会泄露病人的个人信息。在修复漏洞的 CWE-bench 测试里,Argon 以 68% 的得分并列第一。不过谷歌这次没有直接开放给所有人。它先通过一个叫 Fairwind 的计划,只给了一批网络安全团队用。普通开发者什么时候能上手,没给具体时间。价格倒是公布了:每百万输入 Token 2 美元,输出 10 美元,缓存的输入还能再便宜 95%。这就引来了不少吐槽。有开发者在 X 上直接说:“跑分是领先了,但普通开发者连 API 都用不上,又要排队。”还有人问:“到底怎么才能用上?为什么谷歌总让人用得这么难?”东西看着确实不错,可大多数人暂时还摸不着。#How I AI##科技先锋官#

4. 刚刚,Gemini 4 Pro全新曝光,实测碾压Opus 5.5!

5. Gemini 4 Pro 网传曝光,实测对比 Claude Opus 5.5

6. Gemini 4 Pro 偷跑实测刷屏 但离综合第一还有多远

7. 暴打Opus 5.5!谷歌Gemini 4 Pro模型神秘曝光,16分钟手搓3D空间站

8. Gemini 2.0发布!主打Agent+多模态,性能超1.5 Pro、可直接生成音频、图片

9. Gemini 2.0发布!主打Agent+多模态,性能超1.5 Pro、可直接生成音频、图片

10. OpenAI和Anthropic老板被传唤、谷歌Gemini 4 Pro实测吊打Opus 5.5、苹 - 哔哩哔哩

11. 【双语+中配】🔥谷歌最强语音模型?Gemini 3.8语音克隆实战测评!

12. 注意:谷歌新一代旗舰模型进入后训练,前沿大模型降价潮正在蔓延

13. GPT-6 搭配 Claude、Gemini,多模型横向对比测评

14. Gemini 4 Pro 疑似泄露:Barium B 惊艳超越 Opus 5.5,Pixel Canary 与字节 10 万亿模型曝光

15. Gemini 4"提前发车":谷歌打响AI反击战

16. 谷歌大招!AI数字人:实时对口型、秒切97种语言,客服要下岗?

17. 260926-Gemini 4 Pro 强势来袭!击败 Opus 5.5,Pixel Canary 隐形模型曝光

18. 三周内连发三王炸:Claude Fable 5.1、GPT-6 Astra、Gemini 3.8 Flash怎么选?

19. 谷歌Gemini 3.8语音模型上线,30秒可复刻人声

20. 260926-Gemini 4 Pro 强势登场,性能飞跃引发行业震动

21. 谷歌Gemini 4旗舰模型即将推出,跳过3.5 Pro

22. 谷歌推出Gemini 3.8语音合成模型

23. Gemini 4 Pro近期被开发者发现两个新检查点,实测性能极为强劲

24. 谷歌确认新一代旗舰模型Gemini 4即将推出,

25. 谷歌Gemini 3.8 Flash上线:开发者展示卫星轨道与3D建模案例

26. 谷歌Gemini 4 Pro突围反扑!大模型竞速进入白热化! 谷歌新一代旗舰 Gemini 4 开启提速抢跑,竞技场盲测质感全面升级;另一边 OpenAI 内部更曝出智能体结盟越狱的真实事故。大模型竞速进入深水区,安全与算力的高塔谁能站稳? |#抖音精选App征稿中 #我在抖音学AI #我的长长长假 #抖音前沿科技首发计划

27. 神秘模型 Pixel Canary 评测直接跟 GPT-6打平,还压过 Kimi K3!免费!

28. 97种语言实时数字人进企业:谷歌把视频生成塞进语音模型,开发者拿到24K输出上限和几分钟会话|海盗Sharp 深读 09-25

29. AI大模型:谷歌上线AI“数字分身”,OpenAI加码网络安全

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章