Google 曝光 Gemini 3.1 Pro 模型,在 ARC-AGI-2 基准测试中得分飙升至 77.1%,较前代实现翻倍增长。最关键的是,此次升级维持原价,相当于为用户免费提升性能。这一举措直接对标 OpenAI 和 Anthropic,标志着 AI 竞争正式进入“推理纪元”。
智能速览
ARC-AGI-2 测试得分 77.1%,推理能力较前代翻倍
维持上一代定价策略,性价比优势显著
医疗与法律任务准确率大幅提升,商业表现优异
性能对标竞品 Opus 4.6,价格却仅为后者一半
支持调节推理预算,灵活平衡速度与准确性
精华内容
在这场没有硝烟的 AI 军备竞赛中,Google 用一份近乎“暴力美学”的成绩单,重新定义了性价比的边界。
推理性能翻倍
Gemini 3.1 Pro 在公认的推理基准测试 ARC-AGI-2 中拿到了 77.1% 的分数,而前代 Gemini 3 Pro 仅为 31.1%。
这并非简单的修补,而是跨越式的进步。JetBrains AI 总监实测后发现,新版本质量提升了 15%,且输出 token 需求更少,效率更高。这种“性能翻倍”的升级,直接解决了以往模型在复杂逻辑处理上的短板。
定价策略反常
Google 选择了近乎“反商业”的定价策略。新模型维持了 Gemini 3 Pro 的价格体系,意味着用户无需额外付费即可获得更强的推理能力。
对比来看,其性能在多数基准上领先于 Anthropic Opus 4.6,但价格仅为后者的一半。这种用规模经济对抗技术溢价的打法,对企业级用户具有极大的吸引力,意在快速抢占市场份额。
场景落地提升
在实际商业场景中,新模型表现同样亮眼。Box AI 的评估数据显示,医疗领域准确性从 47% 跃升至 67%,法律任务从 57% 提升到 74%。
Cartwheel 联合创始人指出,模型对 3D 变换的理解显著提升,解决了动画管道中的旋转顺序问题。这表明新模型已具备处理复杂行业任务的硬实力,不再局限于实验室跑分。
并非全能无缺
当然,新模型并非完美无缺。在衡量真实世界经济任务的 GDPval-AA 基准测试中,Gemini 3.1 Pro 得分为 1317 分,低于 Anthropic Sonnet 4.6 的 1633 分。
这说明在处理某些特定现实经济问题时,其推理能力仍有局限性,距离全知全能尚有距离,用户需根据具体场景谨慎选择。
Gemini 3.1 Pro 的发布,标志着 AI 竞争从单纯的参数比拼转向了推理能力与商业价值的双重较量。Google 用扎实的技术进步和务实的定价,展示了重回巅峰的野心。随着推理纪元的到来,OpenAI 和 Anthropic 必将做出回应,这场好戏才刚刚开始。