清华姚顺宇跳槽谷歌后首秀:Gemini 3 Deep Think重大升级

源自今日头条:DeepTech深科技

02-15 11:44

谷歌推出Gemini 3 Deep Think重大升级,其在多项基准测试中刷新纪录,性能强劲。更重要的是,模型成本大幅降低,仅为OpenAI o3的数百分之一。此次升级的核心在于,AI不再局限于解答有标准答案的问题,而是开始处理信息残缺、边界模糊的真实科研难题,展现出从“学霸”到“科学家”的跨越。

清华姚顺宇跳槽谷歌后首秀:Gemini 3 Deep Think重大升级智能速览

  • Gemini 3 Deep Think在ARC-AGI-2测试中取得84.6%的分数。

  • 其在编程平台Codeforces上获3455分,排名世界第八。

  • 模型每任务成本仅13.62美元,比OpenAI o3低数百倍。

  • 核心突破在于学会处理信息残缺、边界模糊的真实科研难题。

  • 新模型已应用于数学论文审稿和晶体生长工艺优化。

清华姚顺宇跳槽谷歌后首秀:Gemini 3 Deep Think重大升级精华内容

如果将这次升级仅仅看作是跑分的胜利,就完全误解了其深远意义。真正的变革在于,AI开始主动介入创造与验证的闭环,向解决真实世界问题迈出关键一步。

性能断层,成本骤降

在抽象推理试金石ARC-AGI-2测试中,Deep Think取得了84.6%的分数,是一个代际断层的表现。在竞技编程平台Codeforces上,它获得了3455分,该分数已达到世界顶尖水平,且是在不借助任何代码执行工具的情况下取得的。更重要的是,实现如此高性能的成本极低,每项任务仅需13.62美元,比OpenAI o3模型降低了约280至420倍。

跨越混沌,优雅推理

谷歌反复强调“messy or incomplete”是此次升级的关键。现实世界的科研难题,不像奥数题那样提供完美条件。新版Deep Think的核心突破,正是在数据残缺、边界模糊的混沌状态下保持推理的优雅。在“人类最后考试”极限基准测试中,它不借助外部工具拿下48.4%的准确率,首次在数百个尖端学科的长尾难题中逼近人类博士候选人的中位线。

从解题到创造

Deep Think的能力已延伸至具体创造场景。它能够将手绘草图直接生成可用于3D打印的文件,主动补全草图上未明确的受力逻辑与结构设计。此外,罗格斯大学的数学家已用它来审稿,Deep Think成功发现了一处被人类审稿人集体遗漏的逻辑漏洞。这表明AI开始在前沿研究的模糊地带捕捉推理链的断裂,主动介入创造与验证的闭环。

姚顺宇的AI实验

此次升级的背后,站着清华物理系校友姚顺宇。这位曾经的学术天才因不满前东家言论而加入谷歌。他曾在博文中指出,AI研究沉迷于封闭基准,远离了解决真实问题的初心。他将当下的AI比作17世纪的热力学,虽理论混沌,但通过系统实验仍能催生革命。Deep Think的升级,正是他践行这一理念,试图成为AI世界的“波义尔”,构建一个快速进化的科研操作系统。

Gemini 3 Deep Think的升级,标志着AI从一个单纯的模型,向一个能够与物理世界交互、介入科研全流程的“操作系统”演进。它不仅是性能的跃迁,更是AI价值回归的体现。当AI开始主动补全草图、发现论文漏洞,人类与智能的协作边界将如何重新定义?

清华姚顺宇跳槽谷歌后首秀:Gemini 3 Deep Think重大升级关键评论

  • 有网友好奇姚顺宇与腾讯的姚顺雨是否为兄弟关系。

  • 有人对多个同名天才的出现提出疑问,猜测是否存在数字分身。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章