谷歌最新发布的Gemini 3 Deep Think模型在多项关键基准测试中取得了突破性进展。它不仅在编程竞技平台上达到顶尖人类水平,还在AI推理能力的“图灵测试”中创下新高。此次升级不仅性能强劲,更将推理成本大幅降低,标志着AI在科研与工程领域的应用迈入新阶段。
智能速览
Gemini 3 Deep Think在编程竞赛平台取得3455 Elo高分,超越全球绝大多数人类程序员。
在公认的AI推理基准ARC-AGI-2上,该模型创下84.6%的史无前例高分。
新模型推理成本相比初代大幅降低82%,每项任务仅需13.62美元。
在数学、物理、化学等国际奥林匹克竞赛中,Gemini 3 Deep Think均达到金牌水平。
该模型已应用于科研,成功辅助审阅数学论文、优化半导体材料制备。
精华内容
Gemini 3 Deep Think的野心远不止于刷新基准测试分数,它正被设计和应用于解决科学、研究与工程领域的真实挑战。
编程能力登顶
在竞技编程平台Codeforces上,Gemini 3 Deep Think取得了惊人的3455 Elo分数,这一成绩相当于全球顶尖编程选手的第8名,意味着全球仅有7位人类程序员的水平能排在其前。这一分数远超此前一年前o3模型创下的2727 Elo最高分记录,展现了其在编程领域无与伦比的实力。
推理极限突破
被誉为AI界“图灵测试”的ARC-AGI-2基准,是衡量模型处理新颖推理任务的关键。Gemini 3 Deep Think在此取得了前所未有的84.6%高分,而此前最强模型的成绩仅在60%-70%之间徘徊。相比之下,Claude Opus 4.6的成绩为68.8%。从初代Deep Think的45.1%到如今的84.6%,不到三个月时间内,其推理能力实现了跨越式增长。
科研落地应用
新版Deep Think的实力已延伸至真实的科研场景。罗格斯大学的数学家利用其审阅高度专业的数学论文,成功识别出一个此前人工评审均未发现的细微逻辑缺陷。杜克大学的研究团队则借助该模型优化了复杂晶体生长工艺,成功设计了能生长超过100微米薄膜的新方法。此外,它还能通过图片准确计算复杂分子结构。
性能与成本
除了编程与推理,Gemini 3 Deep Think在科学领域也全面开花。它在“人类最后考试”(HLE)中拿下48.4%的新SOTA,并在2025年国际数学、物理、化学奥林匹克竞赛中均达到金牌水平。性能大幅跃升的同时,推理成本却大幅下降82%,从初代的77.16美元/任务降至13.62美元/任务,显著提升了其应用的经济性。
华人核心团队
这款强大模型的背后,是一支星光熠熠的团队。核心成员包括95后华人科学家Yi Tay,他曾是Google Brain的早期大语言模型项目共同领导者,在短暂创业后重返谷歌DeepMind。另一位关键人物是清华物理系传奇特奖得主姚顺宇,他去年9月加入DeepMind,此前曾在Anthropic参与Claude系列模型的强化学习理论构建,此次发布是他在谷歌的首秀。
Gemini 3 Deep Think的出现,不仅是AI模型参数和数据的胜利,更是推理能力深化的体现。它正从虚拟的基准测试走向解决现实世界科学难题的前沿,成为研究人员的强大工具。随着AI在专业领域的深化,人类与智能的协作边界将被推向何方?