Google 正式发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的成绩,性能较上代翻倍。这一更新不仅强化了复杂问题的解决能力,更引发了关于 AI 原生工具如何改变软件行业的深度思考。
智能速览
Gemini 3.1 Pro 推出,ARC-AGI-2 基准得分翻倍至 77.1%。
编程能力显著提升,在 LiveCodeBench Pro 上 Elo 评分达 2887。
运行成本大幅降低,综合测试花费不足竞品 Opus 4.6 的一半。
展示从纯代码生成到实时数据可视化的全链路工作流能力。
Andrej Karpathy 认为,AI 原生生成将终结传统应用商店模式。
精华内容
Google 选择在行业峰会后迅速推出 Gemini 3.1 Pro,意在通过硬核性能展示其在复杂推理领域的领先地位。
推理性能飞跃
在衡量解决全新逻辑模式能力的 ARC-AGI-2 基准测试中,Gemini 3.1 Pro 拿到了 77.1% 的高分。这一成绩是上代 3 Pro(31.1%)的两倍多,也显著超过了 Anthropic 的 Opus 4.6(68.8%)和 OpenAI 的 GPT-5.2(52.9%)。
在 GPQA Diamond 科学知识测试中,该模型更是取得了 94.3% 的优异成绩。不过,在多模态基准 MMMU Pro 和特定工具使用的测试中,3.1 Pro 并未占据绝对优势,上代模型或竞品在个别项目上仍有表现更佳的情况。
编程与性价比
编程能力是此次升级的重点。在竞争性编程基准 LiveCodeBench Pro 中,3.1 Pro 的 Elo 评分达到 2887,超越 3 Pro 的 2439 和 GPT-5.2 的 2393。SWE-Bench Verified 上得分 80.6%,与竞品基本打平。
第三方机构 Artificial Analysis 的评测指出,3.1 Pro 在智能指数中排名第一,且总成本不到 Opus 4.6 的一半。这种“性能更强、成本更低”的组合,为开发者提供了极具吸引力的选择。API 定价方面,分级付费策略与上代保持一致,搜索功能每月前 5000 次免费。
多模态应用实战
官方与社区展示了 3.1 Pro 处理复杂工作流的潜力。模型能够直接根据文字生成动态 SVG 动画,任意缩放不失真;接入遥测数据流后,可实时构建国际空间站轨道追踪仪表盘。
更有创意 demo 将《呼啸山庄》的文学氛围转化为现代个人网站风格,或生成支持手势操控和动态音乐的 3D 椋鸟群模拟。网友生成的“鬼怪猎人”动画及植物生长交互案例,也证明了其在创意可视化上的细腻表现。
原生工具时代
从这些案例中可以看到,模型的角色正从回答者转变为任务执行者。OpenAI 联创 Andrej Karpathy 以自身经历为例,利用 AI 仅用 1 小时就完成了心率追踪仪表盘的开发,而两年前这需要 10 小时。
他认为,这种高度定制化的 300 行代码工具,不应再打包成传统 App 供用户下载搜索。未来将是 AI 原生传感器、执行器与 LLM 编排结合的时代,传统应用商店的模式或将因此走向终结。
Gemini 3.1 Pro 的发布不仅是参数的胜利,更预示着软件开发范式的转移。当 AI 能够低成本、高效率地生成专属工具时,个人创造力将得到前所未有的释放。这是否意味着通用软件的霸权时代正在瓦解?