谷歌悄然发布了Gemini 3.1 Pro,一款在性能和效率上实现巨大飞跃的AI模型。它在多个权威基准测试中刷新了SOTA,推理能力较前代提升超过一倍,同时保持了极具竞争力的定价。这次升级不仅强化了多模态处理和长文本理解,还在降低幻觉率方面取得显著进展,为开发者和用户提供了更强大、更可靠的AI解决方案。
智能速览
Gemini 3.1 Pro在ARC-AGI-2基准测试中得分77.1%,性能是前代两倍多。
新模型支持百万Token超长上下文,知识截止日期更新至2025年1月。
与Claude Opus 4.6相比,完成同等任务的成本不到其一半,性价比突出。
模型幻觉率降低38%,在不知道答案时更倾向于承认而非编造。
在SVG生成和3D建模等创意任务上,展现出了“王者”级别的视觉生成能力。
精华内容
此次升级的核心在于推理能力的跃升,这不仅是数字的游戏,更体现在实际应用效果的飞跃上,尤其在复杂问题求解和创意生成方面。
性能飞跃
Gemini 3.1 Pro在多项核心测试中展现出压倒性优势。在“人类最后考试”(HLE)中,其零工具辅助得分达到44.4%,显著超越了GPT-5.2的34.5%和Claude Opus 4.6的40%。这表明模型在处理高难度、综合性问题上的能力有了质的提升。
在科学知识领域,GPQA钻石级测试得分高达94.3%,几乎达到专家水平。编程能力同样强劲,在LiveCodeBench Pro上的Elo分数为2887,并在SWE-Bench Verified上取得了80.6%的成绩,证明了其在代码生成与调试方面的卓越实力。
多模态与可靠性
模型的原生全模态输入能力得到了增强,在MMMLU测试中得分92.6%,显示出对图像、文本等混合信息的深刻理解力。同时,它支持高达100万Token的超长上下文窗口,知识库更新至2025年1月,为处理长文档和复杂项目提供了坚实基础。
一个关键的进步是可靠性的提升。Gemini 3.1 Pro的幻觉率相比前代降低了38%。这意味着模型在面对不确定问题时,更倾向于承认未知而非生成错误信息,这对于需要高度准确性的应用场景至关重要。
应用与定价
在应用层面,3.1 Pro的进步尤为直观。其在SVG动画生成和3D建模方面的表现堪称“王者”,能够创造出细节丰富、生动逼真的视觉内容。它甚至可以开发复杂的城市规划应用,或将文学主题转化为可运行的精美代码,展现出强大的创意与实用结合能力。
最具吸引力的是其定价策略。新模型延续了前代每百万Tokens输入2美元、输出12美元的亲民价格。根据Artificial Analysis的测算,其运行成本远低于性能接近的Claude Opus 4.6,性价比优势极为明显,让更多开发者能以更低成本使用顶尖AI技术。
未来展望
谷歌方面透露,目前推出的仅为预览版,未来将在自主工作流等更高级能力上寻求突破。参与研究的清华校友姚顺宇也暗示,后续还会有更强大的模型持续发布,预示着AI技术仍在快速迭代中。
Gemini 3.1 Pro的发布,不仅是性能参数的刷新,更是AI普惠化的重要一步。它在保持价格不变的前提下实现了能力的巨大飞跃,降低了顶尖AI技术的使用门槛。未来,随着自主工作流等能力的加入,AI将如何更深地融入我们的工作与生活?