张大妈

谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角

源自公众号:新智元

02-23 11:58

谷歌下一代旗舰模型Gemini 3.1 Pro正式发布,其在AI领域的表现堪称一次重大突破。它不仅在严苛的ARC-AGI-2测试中实现了推理能力的翻倍提升,还在编程、长文本处理等多方面超越Claude与GPT等竞争对手,以更低成本展现出卓越性能,为开发者提供了强大的新工具。

谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角智能速览

  • Gemini 3.1 Pro在ARC-AGI-2测试中获得77.1%的分数,推理能力比前代提升2倍。

  • 在编程与AI智能体基准测试中,全面超越GPT-5.2与Claude Opus 4.6。

  • 支持高达100万Token的超长上下文,处理长文本能力表现出色。

  • 能根据文本提示直接生成复杂的SVG动画和交互式代码,创造力惊人。

  • API调用成本仅为Claude 4.6的一半,性价比优势显著。

  • 已通过Google AI Studio等平台开放,开发者可抢先体验。

谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角精华内容

谷歌DeepMind发布的Gemini 3.1 Pro,不仅在多项基准测试中刷新纪录,更在实际应用中展现了前所未有的能力。其核心进化在于推理、编程与创造力的深度融合,预示着AI应用的新篇章。

核心性能飞跃

在业界公认的最难ARC-AGI-2测试中,Gemini 3.1 Pro一举斩获77.1%的高分,性能飙升至上一代3.0 Pro的两倍有余,直接超越刚刚登顶的Claude Opus 4.6(68.8%)。

此外,在被誉为“人类最后考试”(HLE)的评测中,3.1 Pro在零工具辅助下取得了44.4%的成绩,显著领先于GPT-5.2的34.5%和Claude Opus 4.6的40.0%。

这些数据表明,3.1 Pro在核心逻辑推理能力上已建立起新的标杆,处理复杂问题的精准度迈上了新台阶。

编程领域霸主

在代码生成与AI智能体能力上,Gemini 3.1 Pro实现了跨越式进化。在LiveCodeBench Pro评测中,它狂砍2887的Elo积分,以断层优势领先所有模型。

在Terminal-Bench 2.0终端操作测试中,它凭借68.5%的得分压制了专攻代码的GPT-5.3-Codex(64.7%)。在代表AI智能体综合能力的APEX-Agents评测中,其33.5%的成绩也远超Opus 4.6的29.8%和GPT-5.2的23.0%。

这标志着3.1 Pro已成为开发者进行复杂编程和构建智能体应用的强大助手。

长文处理与性价比

面对长篇内容,Gemini 3.1 Pro同样表现出色。在MRCR v2的128k长上下文测试中,它拿下了84.9%的高分。更重要的是,它独家支持了1M Token的终极测试并取得26.3%的成绩,而同场竞技的GPT-5.2和Opus 4.6甚至不支持该级别。

在AAII综合评测中,3.1 Pro不仅总分领先Claude Opus 4.6足足4分,其API调用成本更是不到后者的一半。

这意味着在需要处理海量信息的企业级应用中,3.1 Pro具备了无与伦比的竞争力。

创意应用落地

3.1 Pro的能力不仅体现在跑分上,更在于它能将创意直接转化为生产力。仅需一段简单的文本提示词,它就能直接生成可嵌入网页的复杂SVG动画,如城市规划鸟瞰图或“海豹顶皮球”等生动效果。

它还能整合复杂系统,构建出接入实时遥测数据的航天器运行轨迹看板。甚至能用纯代码编写出支持手势追踪和生成式配乐的3D椋鸟群舞特效,为交互设计研究提供了利器。

这些实例展示了AI从文本工具向创意伙伴的角色转变。

Gemini 3.1 Pro的发布,不仅是一场技术竞赛的阶段性胜利,更预示着AI在重塑生产力工具方面的巨大潜力。当强大的推理能力与创意表达结合,下一个杀手级应用会诞生在哪个领域?这无疑是整个行业都关注的焦点。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章