张大妈

刚刚,Gemini 3.1 Pro 发布!清华姚顺宇站台宣传,Karpathy:应用商店的时代结束了

源自公众号:APPSO

02-21 10:15

Google 正式发布 Gemini 3.1 Pro,在 ARC-AGI-2 基准测试中取得 77.1% 的成绩,性能较上代翻倍。这一更新不仅强化了复杂问题的解决能力,更引发了关于 AI 原生工具如何改变软件行业的深度思考。

刚刚,Gemini 3.1 Pro 发布!清华姚顺宇站台宣传,Karpathy:应用商店的时代结束了智能速览

  • Gemini 3.1 Pro 推出,ARC-AGI-2 基准得分翻倍至 77.1%。

  • 编程能力显著提升,在 LiveCodeBench Pro 上 Elo 评分达 2887。

  • 运行成本大幅降低,综合测试花费不足竞品 Opus 4.6 的一半。

  • 展示从纯代码生成到实时数据可视化的全链路工作流能力。

  • Andrej Karpathy 认为,AI 原生生成将终结传统应用商店模式。

刚刚,Gemini 3.1 Pro 发布!清华姚顺宇站台宣传,Karpathy:应用商店的时代结束了精华内容

Google 选择在行业峰会后迅速推出 Gemini 3.1 Pro,意在通过硬核性能展示其在复杂推理领域的领先地位。

推理性能飞跃

在衡量解决全新逻辑模式能力的 ARC-AGI-2 基准测试中,Gemini 3.1 Pro 拿到了 77.1% 的高分。这一成绩是上代 3 Pro(31.1%)的两倍多,也显著超过了 Anthropic 的 Opus 4.6(68.8%)和 OpenAI 的 GPT-5.2(52.9%)。

在 GPQA Diamond 科学知识测试中,该模型更是取得了 94.3% 的优异成绩。不过,在多模态基准 MMMU Pro 和特定工具使用的测试中,3.1 Pro 并未占据绝对优势,上代模型或竞品在个别项目上仍有表现更佳的情况。

编程与性价比

编程能力是此次升级的重点。在竞争性编程基准 LiveCodeBench Pro 中,3.1 Pro 的 Elo 评分达到 2887,超越 3 Pro 的 2439 和 GPT-5.2 的 2393。SWE-Bench Verified 上得分 80.6%,与竞品基本打平。

第三方机构 Artificial Analysis 的评测指出,3.1 Pro 在智能指数中排名第一,且总成本不到 Opus 4.6 的一半。这种“性能更强、成本更低”的组合,为开发者提供了极具吸引力的选择。API 定价方面,分级付费策略与上代保持一致,搜索功能每月前 5000 次免费。

多模态应用实战

官方与社区展示了 3.1 Pro 处理复杂工作流的潜力。模型能够直接根据文字生成动态 SVG 动画,任意缩放不失真;接入遥测数据流后,可实时构建国际空间站轨道追踪仪表盘。

更有创意 demo 将《呼啸山庄》的文学氛围转化为现代个人网站风格,或生成支持手势操控和动态音乐的 3D 椋鸟群模拟。网友生成的“鬼怪猎人”动画及植物生长交互案例,也证明了其在创意可视化上的细腻表现。

原生工具时代

从这些案例中可以看到,模型的角色正从回答者转变为任务执行者。OpenAI 联创 Andrej Karpathy 以自身经历为例,利用 AI 仅用 1 小时就完成了心率追踪仪表盘的开发,而两年前这需要 10 小时。

他认为,这种高度定制化的 300 行代码工具,不应再打包成传统 App 供用户下载搜索。未来将是 AI 原生传感器、执行器与 LLM 编排结合的时代,传统应用商店的模式或将因此走向终结。

Gemini 3.1 Pro 的发布不仅是参数的胜利,更预示着软件开发范式的转移。当 AI 能够低成本、高效率地生成专属工具时,个人创造力将得到前所未有的释放。这是否意味着通用软件的霸权时代正在瓦解?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章