谷歌Gemini 3 Deep Think以断崖式进步刷新AI能力边界。从编程竞赛全球第七到科研论文审阅,从草图转3D模型到数学难题证明,它展现了前所未有的推理能力,标志着AI已从辅助工具进化为独立思考者。
智能速览
Codeforces编程竞赛获3455Elo分数,排名全球第七
ARC-AGI-2基准测试得分84.6%,接近榜单饱和
直接从草图生成可3D打印的实体模型
发现人类科学家遗漏的论文逻辑漏洞
在奥赛数理化科目中全部达到金牌水平
将AI物理零部件建模加速十倍
精华内容
Gemini 3 Deep Think的强大不仅体现在数字上,更在于它展现出的思考方式和创造力,重新定义了AI的能力边界。
编程能力飞跃
在Codeforces编程竞赛中,Gemini 3 Deep Think获得了3455Elo的惊人分数,直接冲入人类TOP10,排名全球第七。相比之下,一年前被誉为最强的OpenAI o3模型仅获得2727Elo。这一成绩让AI编程能力实现了断层领先。
更令人震撼的是,它在号称AI噩梦的人类最后考试(HLE)上拿下48.4%的成绩,而此前最强模型连及格线的一半都摸不到。
抽象推理突破
ARC-AGI-2基准测试被誉为AI无法逾越的抽象推理长城,但DeepThink以84.6%的得分一骑绝尘。这一分数意味着该榜单已接近饱和,在纯粹的抽象逻辑推理上,它已经没有对手。
在Google官方公布的雷达图中,Gemini 3 Deep Think几乎包围了所有竞争对手,曾经的逻辑之王Claude Opus 4.6在它面前显得反应迟钝。
物理世界理解
最令人震撼的是它对物理世界的理解能力。谷歌VP随手画了一张潦草的笔记本支架草图,DeepThink不仅看懂了,还自动补全物理细节,直接渲染出高保真3D模型,并生成3D打印所需的STL文件。
从草图到实物,全程无需人类建模师参与。一位测试者要求它生成鹈鹕骑自行车的SVG矢量图,结果DeepThink画出了线条流畅、结构合理的图像,展现了出色的审美能力。

科研应用深度
罗格斯大学数学家Lisa Carbone将一篇高深的物理数学论文交给DeepThink审查,它竟发现了连人类同行评审都遗漏的逻辑漏洞。这不仅证明它读懂了论文,更具备了批判性思维。
在杜克大学,DeepThink为优化复杂晶体生长,设计出大于100μm薄膜的全新配方,将物理零部件建模加速十倍。背靠DeepThink的AI数学工具Aletheia已能独立撰写论文,成功证明多个数学难题。
奥赛金牌水平
2025年国际数学奥林匹克、物理奥林匹克、化学奥林匹克,Gemini 3 Deep Think全部具备金牌水平。在高级理论物理的CMT-Benchmark中,它也游刃有余地拿到50.5%。
更令人惊讶的是,它还能为晦涩难懂的时空循环视频Transformer架构创建完美的可视化方案,显示出对复杂概念的深刻理解能力。
Gemini 3 Deep Think的发布标志着AI已从生成工具进化为思考伙伴,在科学研究和工程领域的表现尤其惊艳。当AI开始独立发现知识漏洞、创造新方案时,人类与AI的协作模式将迎来怎样的变革?