谷歌Gemini 3 Deep Think全面碾压Claude和GPT,清华校友参与打造,编程能力全球仅7人能超越它

源自今日头条:金融界

02-15 11:01

谷歌全新发布的Gemini 3 Deep Think推理模型,在复杂科学与工程领域实现了突破性进展。该模型不仅在多项基准测试中大幅超越Claude与GPT等顶级对手,更在编程、科研等实战场景中展现出超越人类专家的能力,为解决棘手的现实世界难题提供了全新工具。

谷歌Gemini 3 Deep Think全面碾压Claude和GPT,清华校友参与打造,编程能力全球仅7人能超越它智能速览

  • Deep Think在“人类最后的考试”中得分48.4%,显著领先于Claude和GPT。

  • 在抽象推理测试ARC-AGI-2中,该模型以84.6%的分数刷新纪录。

  • 其编程能力全球排名前八,Codeforces评分高达3455 Elo。

  • 该模型成功发现了一篇专业数学论文中被人类审稿人忽略的逻辑缺陷。

  • 它帮助实验室优化了晶体生长工艺,突破了原有的精度极限。

  • 模型能将手绘草图直接转化为可用于3D打印的工程文件。

谷歌Gemini 3 Deep Think全面碾压Claude和GPT,清华校友参与打造,编程能力全球仅7人能超越它精华内容

Deep Think的突破并非仅仅停留在理论层面,其强大的推理能力已经转化为解决现实科学难题的实战力量,并开始重塑传统的研究范式。

基准测试霸主

在多项权威基准测试中,Deep Think展现了统治级性能。在被誉为“人类最后的考试”的综合能力评估中,Deep Think取得了48.4%的成绩,这一数字远超Claude Opus 4.6的40%和GPT-5.2的34.5%。在更具挑战性的抽象推理测试ARC-AGI-2中,模型得分高达84.6%,经ARC Prize基金会验证,此前最强模型的得分仅为60%至70%,这标志着AI在推理能力上的巨大飞跃。

编程能力超群

Deep Think的编程能力尤为突出。在全球知名的竞技编程平台Codeforces上,该模型获得了3455的Elo评分。根据这一评分,其编程能力相当于全球排名前八的水平,意味着仅有7位人类顶尖程序员能超越它。这不仅体现了其代码生成和调试的准确性,更展示了它在解决复杂算法问题上的卓越逻辑能力。

科研实战突破

该模型的价值已迅速在科研前沿得到验证。罗格斯大学的数学家利用Deep Think审阅一篇高能物理领域的专业论文,模型成功识别出一个此前人工同行评审都未曾发现的细微逻辑缺陷,展现了其作为严谨科研合作者的潜力。此外,杜克大学实验室借助该模型优化晶体生长制备方法,设计出可培育超过100微米薄膜的全新工艺方案,突破了以往方法的精度极限。

工程应用拓展

除了纯理论计算,Deep Think在应用科学领域同样表现出色。它在2025年国际物理和化学奥林匹克竞赛的笔试部分均达到了金牌水平,证明了其深厚的学科知识。在工程实践方面,模型还具备了将手绘草图直接转化为3D打印文件的强大能力,可以自动完成图纸分析、复杂形状建模及文件生成,极大地简化了从设计到制造的流程。

谷歌Deep Think的出现,标志着AI正从辅助工具进化为能独立解决高难度问题的智能伙伴。它不仅在分数上超越人类,更在实战中展现出创造力与严谨性。当AI能发现人类盲点时,我们与智能的关系将如何被重新定义?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章