Google DeepMind 炸场!Gemini 3 Deep Think 进化:Codeforces 全球第七,全方位碾压 GPT-5.2

源自今日头条:人人都是产品经理

02-17 11:41

谷歌Gemini 3 Deep Think以断崖式进步刷新AI能力边界。从编程竞赛全球第七到科研论文审阅,从草图转3D模型到数学难题证明,它展现了前所未有的推理能力,标志着AI已从辅助工具进化为独立思考者。

Google DeepMind 炸场!Gemini 3 Deep Think 进化:Codeforces 全球第七,全方位碾压 GPT-5.2智能速览

  • Codeforces编程竞赛获3455Elo分数,排名全球第七

  • ARC-AGI-2基准测试得分84.6%,接近榜单饱和

  • 直接从草图生成可3D打印的实体模型

  • 发现人类科学家遗漏的论文逻辑漏洞

  • 在奥赛数理化科目中全部达到金牌水平

  • 将AI物理零部件建模加速十倍

Google DeepMind 炸场!Gemini 3 Deep Think 进化:Codeforces 全球第七,全方位碾压 GPT-5.2精华内容

Gemini 3 Deep Think的强大不仅体现在数字上,更在于它展现出的思考方式和创造力,重新定义了AI的能力边界。

编程能力飞跃

在Codeforces编程竞赛中,Gemini 3 Deep Think获得了3455Elo的惊人分数,直接冲入人类TOP10,排名全球第七。相比之下,一年前被誉为最强的OpenAI o3模型仅获得2727Elo。这一成绩让AI编程能力实现了断层领先。

更令人震撼的是,它在号称AI噩梦的人类最后考试(HLE)上拿下48.4%的成绩,而此前最强模型连及格线的一半都摸不到。

抽象推理突破

ARC-AGI-2基准测试被誉为AI无法逾越的抽象推理长城,但DeepThink以84.6%的得分一骑绝尘。这一分数意味着该榜单已接近饱和,在纯粹的抽象逻辑推理上,它已经没有对手。

在Google官方公布的雷达图中,Gemini 3 Deep Think几乎包围了所有竞争对手,曾经的逻辑之王Claude Opus 4.6在它面前显得反应迟钝。

物理世界理解

最令人震撼的是它对物理世界的理解能力。谷歌VP随手画了一张潦草的笔记本支架草图,DeepThink不仅看懂了,还自动补全物理细节,直接渲染出高保真3D模型,并生成3D打印所需的STL文件。

从草图到实物,全程无需人类建模师参与。一位测试者要求它生成鹈鹕骑自行车的SVG矢量图,结果DeepThink画出了线条流畅、结构合理的图像,展现了出色的审美能力。

Google DeepMind 炸场!Gemini 3 Deep Think 进化:Codeforces 全球第七,全方位碾压 GPT-5.2

科研应用深度

罗格斯大学数学家Lisa Carbone将一篇高深的物理数学论文交给DeepThink审查,它竟发现了连人类同行评审都遗漏的逻辑漏洞。这不仅证明它读懂了论文,更具备了批判性思维。

在杜克大学,DeepThink为优化复杂晶体生长,设计出大于100μm薄膜的全新配方,将物理零部件建模加速十倍。背靠DeepThink的AI数学工具Aletheia已能独立撰写论文,成功证明多个数学难题。

奥赛金牌水平

2025年国际数学奥林匹克、物理奥林匹克、化学奥林匹克,Gemini 3 Deep Think全部具备金牌水平。在高级理论物理的CMT-Benchmark中,它也游刃有余地拿到50.5%。

更令人惊讶的是,它还能为晦涩难懂的时空循环视频Transformer架构创建完美的可视化方案,显示出对复杂概念的深刻理解能力。

Gemini 3 Deep Think的发布标志着AI已从生成工具进化为思考伙伴,在科学研究和工程领域的表现尤其惊艳。当AI开始独立发现知识漏洞、创造新方案时,人类与AI的协作模式将迎来怎样的变革?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章