这不是一次常规升级,而是AI推理能力从‘快答’到‘深思’的结构性突破。它在编程、抽象推理、科研审稿、工程建模等多维度刷新上限,用实测数据与真实案例证明:模型可以真正参与高阶认知劳动。
智能速览
Codeforces编程Elo达3455分,超越人类TOP 10中第七名,较前代OpenAI o3提升27%以上
ARC-AGI-2抽象推理得分84.6%,逼近理论满分,远超Claude Opus 4.6(68.8%)和GPT-5.2(52.9%)
Humanity’s Last Exam(无工具)得分48.4%,首次突破人类及格线(50%)临界点,为当前最高分
可将手绘草图直接转化为结构完整、物理可行的3D模型及STL打印文件,全程无人类建模介入
成功指出高深数学物理论文中的逻辑跳步,并独立设计晶体薄膜生长新配方,实测厚度达100微米以上
支持国际数学、物理、化学奥赛级任务,IntlPhysicsOlympiad 2025得分87.7%,领先第二名超11个百分点
精华内容
当模型不再急于输出答案,而是先确认前提是否稳固、约束是否满足、路径是否自洽,推理就从‘响应式’转向了‘建构式’。
编程即推理
在Codeforces平台实测中,Gemini 3 Deep Think获得3455 Elo分,位列人类选手第七名,超过前代OpenAI o3模型(2727 Elo)达27%。这一分数并非来自代码补全速度,而是源于对算法边界、时间复杂度归约、测试用例反例构造等深层逻辑的准确把握。它能在未提供完整函数签名的情况下,逆向推导出接口契约并完成鲁棒实现,已具备独立参与算法竞赛核心环节的能力。
抽象即具身
ARC-AGI-2测试中,Deep Think以84.6%的得分击穿抽象推理天花板,相较Claude Opus 4.6(68.8%)高出15.8个百分点,接近该基准设定的理论饱和阈值。其优势不在于记忆模式,而在于将符号关系映射为可演算的空间约束——例如在‘缺失中间步骤的因果链’任务中,它能主动补全隐含变量,并验证每一步的可逆性。这种能力使它在无示例提示下,也能稳定处理需多跳归纳的陌生问题。
科研即协作
罗格斯大学数学家Lisa Carbone提交的高阶物理数学论文中,Deep Think定位到一段未闭合的假设链,并生成包含三处反例验证的推理说明。杜克大学Wang Lab使用其优化晶体薄膜生长参数,模型输出的新组合在实验中一次性达成100.3微米厚度,将原本需数周的试错周期压缩至单次运行。物理建模效率提升10倍,意味着研究人员可将更多精力投入结果解释与理论延伸。
设计即执行
谷歌副总裁手绘的潦草笔记本支架草图,被Deep Think解析为含受力分析、材料厚度建议与装配公差的完整工业方案,并直接输出可用于3D打印的STL文件。开发者Simon Willison提出的‘鹈鹕骑自行车SVG’挑战,模型生成的矢量图符合贝塞尔曲线连续性规范,节点数控制在合理范围,且可被主流编辑器无损导入。这表明其图形理解已超越像素识别,进入几何语义与功能意图层面。
Gemini 3 Deep Think的价值不在单项指标登顶,而在于它让‘深度推理’从实验室概念变为可调度的基础设施。当编程、设计、科研等场景中的关键判断环节开始交由模型协同完成,人机分工的重心正从执行层上移至定义层。下一个问题或许是:哪些过去必须由人类闭环完成的认知任务,现在可以安全地开启半自动模式?