张大妈

谷歌突发Gemini 3.1 Pro:刷爆全领域SOTA,堪称SVG王者,价格不变,清华姚顺宇参与:后续还会有更好模型!JeffDean:性能不止翻倍

源自公众号:51CTO技术栈

02-20 15:59

谷歌悄然发布了Gemini 3.1 Pro,一款在性能和效率上实现巨大飞跃的AI模型。它在多个权威基准测试中刷新了SOTA,推理能力较前代提升超过一倍,同时保持了极具竞争力的定价。这次升级不仅强化了多模态处理和长文本理解,还在降低幻觉率方面取得显著进展,为开发者和用户提供了更强大、更可靠的AI解决方案。

谷歌突发Gemini 3.1 Pro:刷爆全领域SOTA,堪称SVG王者,价格不变,清华姚顺宇参与:后续还会有更好模型!JeffDean:性能不止翻倍智能速览

  • Gemini 3.1 Pro在ARC-AGI-2基准测试中得分77.1%,性能是前代两倍多。

  • 新模型支持百万Token超长上下文,知识截止日期更新至2025年1月。

  • 与Claude Opus 4.6相比,完成同等任务的成本不到其一半,性价比突出。

  • 模型幻觉率降低38%,在不知道答案时更倾向于承认而非编造。

  • 在SVG生成和3D建模等创意任务上,展现出了“王者”级别的视觉生成能力。

谷歌突发Gemini 3.1 Pro:刷爆全领域SOTA,堪称SVG王者,价格不变,清华姚顺宇参与:后续还会有更好模型!JeffDean:性能不止翻倍精华内容

此次升级的核心在于推理能力的跃升,这不仅是数字的游戏,更体现在实际应用效果的飞跃上,尤其在复杂问题求解和创意生成方面。

性能飞跃

Gemini 3.1 Pro在多项核心测试中展现出压倒性优势。在“人类最后考试”(HLE)中,其零工具辅助得分达到44.4%,显著超越了GPT-5.2的34.5%和Claude Opus 4.6的40%。这表明模型在处理高难度、综合性问题上的能力有了质的提升。

在科学知识领域,GPQA钻石级测试得分高达94.3%,几乎达到专家水平。编程能力同样强劲,在LiveCodeBench Pro上的Elo分数为2887,并在SWE-Bench Verified上取得了80.6%的成绩,证明了其在代码生成与调试方面的卓越实力。

多模态与可靠性

模型的原生全模态输入能力得到了增强,在MMMLU测试中得分92.6%,显示出对图像、文本等混合信息的深刻理解力。同时,它支持高达100万Token的超长上下文窗口,知识库更新至2025年1月,为处理长文档和复杂项目提供了坚实基础。

一个关键的进步是可靠性的提升。Gemini 3.1 Pro的幻觉率相比前代降低了38%。这意味着模型在面对不确定问题时,更倾向于承认未知而非生成错误信息,这对于需要高度准确性的应用场景至关重要。

应用与定价

在应用层面,3.1 Pro的进步尤为直观。其在SVG动画生成和3D建模方面的表现堪称“王者”,能够创造出细节丰富、生动逼真的视觉内容。它甚至可以开发复杂的城市规划应用,或将文学主题转化为可运行的精美代码,展现出强大的创意与实用结合能力。

最具吸引力的是其定价策略。新模型延续了前代每百万Tokens输入2美元、输出12美元的亲民价格。根据Artificial Analysis的测算,其运行成本远低于性能接近的Claude Opus 4.6,性价比优势极为明显,让更多开发者能以更低成本使用顶尖AI技术。

未来展望

谷歌方面透露,目前推出的仅为预览版,未来将在自主工作流等更高级能力上寻求突破。参与研究的清华校友姚顺宇也暗示,后续还会有更强大的模型持续发布,预示着AI技术仍在快速迭代中。

Gemini 3.1 Pro的发布,不仅是性能参数的刷新,更是AI普惠化的重要一步。它在保持价格不变的前提下实现了能力的巨大飞跃,降低了顶尖AI技术的使用门槛。未来,随着自主工作流等能力的加入,AI将如何更深地融入我们的工作与生活?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章