张大妈

姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:仅剩7人捍卫碳基编程

源自今日头条:量子位

02-15 11:20

谷歌最新发布的Gemini 3 Deep Think模型在多项关键基准测试中取得了突破性进展。它不仅在编程竞技平台上达到顶尖人类水平,还在AI推理能力的“图灵测试”中创下新高。此次升级不仅性能强劲,更将推理成本大幅降低,标志着AI在科研与工程领域的应用迈入新阶段。

姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:仅剩7人捍卫碳基编程智能速览

  • Gemini 3 Deep Think在编程竞赛平台取得3455 Elo高分,超越全球绝大多数人类程序员。

  • 在公认的AI推理基准ARC-AGI-2上,该模型创下84.6%的史无前例高分。

  • 新模型推理成本相比初代大幅降低82%,每项任务仅需13.62美元。

  • 在数学、物理、化学等国际奥林匹克竞赛中,Gemini 3 Deep Think均达到金牌水平。

  • 该模型已应用于科研,成功辅助审阅数学论文、优化半导体材料制备。

姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:仅剩7人捍卫碳基编程精华内容

Gemini 3 Deep Think的野心远不止于刷新基准测试分数,它正被设计和应用于解决科学、研究与工程领域的真实挑战。

编程能力登顶

在竞技编程平台Codeforces上,Gemini 3 Deep Think取得了惊人的3455 Elo分数,这一成绩相当于全球顶尖编程选手的第8名,意味着全球仅有7位人类程序员的水平能排在其前。这一分数远超此前一年前o3模型创下的2727 Elo最高分记录,展现了其在编程领域无与伦比的实力。

推理极限突破

被誉为AI界“图灵测试”的ARC-AGI-2基准,是衡量模型处理新颖推理任务的关键。Gemini 3 Deep Think在此取得了前所未有的84.6%高分,而此前最强模型的成绩仅在60%-70%之间徘徊。相比之下,Claude Opus 4.6的成绩为68.8%。从初代Deep Think的45.1%到如今的84.6%,不到三个月时间内,其推理能力实现了跨越式增长。

科研落地应用

新版Deep Think的实力已延伸至真实的科研场景。罗格斯大学的数学家利用其审阅高度专业的数学论文,成功识别出一个此前人工评审均未发现的细微逻辑缺陷。杜克大学的研究团队则借助该模型优化了复杂晶体生长工艺,成功设计了能生长超过100微米薄膜的新方法。此外,它还能通过图片准确计算复杂分子结构。

性能与成本

除了编程与推理,Gemini 3 Deep Think在科学领域也全面开花。它在“人类最后考试”(HLE)中拿下48.4%的新SOTA,并在2025年国际数学、物理、化学奥林匹克竞赛中均达到金牌水平。性能大幅跃升的同时,推理成本却大幅下降82%,从初代的77.16美元/任务降至13.62美元/任务,显著提升了其应用的经济性。

华人核心团队

这款强大模型的背后,是一支星光熠熠的团队。核心成员包括95后华人科学家Yi Tay,他曾是Google Brain的早期大语言模型项目共同领导者,在短暂创业后重返谷歌DeepMind。另一位关键人物是清华物理系传奇特奖得主姚顺宇,他去年9月加入DeepMind,此前曾在Anthropic参与Claude系列模型的强化学习理论构建,此次发布是他在谷歌的首秀。

Gemini 3 Deep Think的出现,不仅是AI模型参数和数据的胜利,更是推理能力深化的体现。它正从虚拟的基准测试走向解决现实世界科学难题的前沿,成为研究人员的强大工具。随着AI在专业领域的深化,人类与智能的协作边界将被推向何方?

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章